Open WebUI Desktop komplett offline einrichten: So geht's

23. September 2026 · 4 Min. Lesezeit

Dein lokaler KI-Assistent auf einem älteren Laptop soll nicht nur schnell sein, sondern auch absolut datenschutzfreundlich? Wenn du Open WebUI als Desktop-Anwendung nutzt, möchtest du vielleicht sicherstellen, dass absolut keine Daten ins Internet abfließen.

In diesem Artikel zeige ich dir Schritt für Schritt, wie du Open WebUI Desktop komplett offline einrichtest. Wir verbinden das Tool mit deinem lokalen Ollama, klemmen alle unnötigen Cloud-Verbindungen ab und richten eine lokale Suche in deinen eigenen Dokumenten ein.

Warum komplett offline?

Der größte Vorteil lokaler KI auf älterer Hardware ist die volle Kontrolle. Wenn du Open WebUI startest, versucht die Anwendung standardmäßig oft, Verbindungen zu Cloud-Diensten aufzubauen.

Für einen echten Offline-Betrieb auf deinem Laptop wollen wir das unterbinden. So bleibt alles lokal, deine Lüfter bleiben bei älteren Grafikkarten wie der GTX 1050 entspannter und deine Dokumente verlassen niemals das eigene Gerät.

Schritt 1: Ollama verbinden und OpenAI abschalten

Im ersten Schritt sorgen wir dafür, dass Open WebUI ausschließlich mit deinem lokalen Backend spricht.

Öffne in der Open-WebUI-Desktop-App die Einstellungen unter Administrator. Suche nach den Verbindungsoptionen und schalte Ollama ein, während du die OpenAI-API ausschaltest. Die eingebaute llama.cpp-Engine musst du nicht installieren, es reicht völlig, wenn du nur Ollama nutzt.

Trage bei den Verbindungen die lokale Adresse ein:

http://localhost:11434

Wenn keine API-Schlüssel hinterlegt sind und die OpenAI-Integration deaktiviert ist, läuft die Kommunikation rein intern zwischen Open WebUI und Ollama.

Schritt 2: Lokale Einbettungen mit nomic-embed-text

Damit du später deine eigenen Dokumente durchsuchen kannst, brauchst du ein sogenanntes Embedding-Modell. Das wandelt Text in Vektoren um.

Nutze Ollama, um ein kleines, lokales Modell dafür herunterzuladen. Öffne dein Terminal und gib folgenden Befehl ein:

ollama pull nomic-embed-text

Trage dieses Modell anschließend unter Administrator und dem Menüpunkt Dokumente in den Einstellungen von Open WebUI als Einbettungsmodell ein.

Stelle zudem den Parameter Top K auf den Wert 5 ein. Damit greift die KI bei einer Frage auf die fünf relevantesten Textabschnitte deiner Dokumente zu.

Für zusätzliche Rechenersparnis auf älterer Hardware kannst du unter Benutzeroberfläche die Follow-up-, Tag- und Suchanfragen-Generierung ausschalten und das Aufgabenmodell auf llama3.2:3b stellen.

Schritt 3: Eigene KI-Charaktere mit Systemprompts erstellen

Ein großer Spaß an Open WebUI sind eigene Assistenten mit spezifischen Aufgaben. Du kannst dir ganz einfach einen eigenen Charakter anlegen.

Klicke im Menü auf Workspace und erstelle ein neues Modell. Hier kannst du einen Namen vergeben und einen Systemprompt hinterlegen. Ein Systemprompt bestimmt, wie sich die KI verhält.

Ein Beispiel für einen Systemprompt:

Du bist ein präziser technischer Assistent. Antworte kurz, sachlich und auf Deutsch.

Speichere das Modell ab. Jetzt kannst du im Chat jederzeit zwischen verschiedenen Persönlichkeiten wechseln, die alle lokal auf deinem Laptop laufen.

Schritt 4: RAG-Vorlage für strikte Dokumentensuche einrichten

RAG (Retrieval-Augmented Generation) erlaubt es der KI, in deinen eigenen PDFs und Textdateien zu lesen. Das ist extrem praktisch, birgt aber oft die Gefahr, dass das Sprachmodell Dinge erfindet (Halluzinationen).

Das lässt sich in den RAG-Einstellungen von Open WebUI anpassen, indem du eine sehr strenge Vorlage hinterlegst.

Nutze am besten diese konkrete RAG-Vorlage:

### Aufgabe:
Beantworte die Frage des Nutzers ausschließlich mit den Informationen aus dem Kontext unten. Antworte in der Sprache der Frage.

### Regeln:
- Verwende NUR Informationen aus dem Kontext. Nutze KEIN eigenes Wissen, auch wenn du die Antwort kennst.
- Steht die Antwort auf genau diese Frage nicht ausdrücklich im Kontext, antworte nur mit dem Satz "Das steht nicht in den Dokumenten." Nach diesem Satz folgt nichts mehr: keine verwandten Informationen aus dem Kontext, keine Quellenangabe.
- Beantworte nur die aktuell gestellte Frage und antworte knapp. Wiederhole keine früheren Antworten und füge nichts hinzu, wonach nicht gefragt wurde.
- Gib Zahlen, Namen und Begriffe genau so wieder, wie sie im Kontext stehen.
- Belege Aussagen mit der Nummer der Quelle in eckigen Klammern, zum Beispiel [1]. Schreibe nur die Zahl, nie [id="1"]. Nur wenn das <source>-Tag ein id-Attribut hat, sonst keine Quellenangaben.
- Verwende keine XML-Tags in der Antwort.
- Ist der Kontext unleserlich oder unvollständig, sag das.
- Bei Fragen nach einer Definition oder Erklärung gib die vollständige Definition aus dem Kontext wieder, nicht nur ein Beispiel.

<context>
{{CONTEXT}}
</context>

Durch diese strikte Einstellung verhinderst du zuverlässig, dass das Modell bei Wissenslücken frei drauflos raten muss. Das ist besonders bei älteren Grafikkarten mit wenig VRAM nützlich, weil präzise Antworten Rechenzeit sparen.

Fazit

Mit diesen Anpassungen läuft dein Open WebUI Desktop wie gewünscht im reinen Offline-Modus. Du hast die volle Kontrolle über deine Daten, nutzt lokale Embeddings und kannst dank der angepassten RAG-Vorlage sicher sein, dass deine Dokumente auch wirklich korrekt ausgewertet werden.

Probier es aus und richte dir deinen eigenen, isolierten KI-Arbeitsplatz ein.