Qwen2.5-Coder lokal mit Ollama: 3B oder 7B auf alten PCs?

7. Oktober 2026 · 3 Min. Lesezeit

Ein kostenloser Programmier-Assistent, der komplett offline läuft? Mit Ollama und dem Modell Qwen2.5-Coder geht das. Ich habe beide kleinen Varianten auf meinem Gaming-Laptop von 2017 mit 32 GB Arbeitsspeicher getestet.

Installation

In PowerShell reicht ein einziger Befehl. Für die kleinere Variante nutzt du:

ollama pull qwen2.5-coder:3b

Das Modell ist knapp 2 GB groß. Wer die etwas größere Variante ausprobieren möchte, lädt sie mit diesem Befehl herunter (ca. 4,7 GB):

ollama pull qwen2.5-coder:7b

Danach steht das Modell in Open WebUI direkt zur Auswahl. Dort habe ich mir daraus einen eigenen Charakter namens „Qwen - Coder“ gebaut. Dafür habe ich einen festen System-Prompt hinterlegt: Antworten auf Deutsch, immer komplette Dateien ausgeben, keine echten Passwörter im Code verwenden und offen sagen, wenn etwas unsicher ist.

Geschwindigkeit messen

Ein wichtiger Faktor auf älterer Hardware ist die Geschwindigkeit. Mit folgendem Befehl kannst du das testen und gleichzeitig die Leistung im Terminal einsehen:

ollama run qwen2.5-coder:7b --verbose "Deine Frage"

Ollama zeigt unten im Terminal die sogenannte „eval rate“ an, also die erzeugten Tokens pro Sekunde. Mein Laptop — konkret ein MSI GP72M 7RDX von 2017 mit einem Intel Core i7-7700HQ, integrierter Intel HD Graphics 630 und einer NVIDIA GeForce GTX 1050 mit 4 GB Grafikspeicher sowie 32 GB RAM — schafft mit dem 7B-Modell rund 5,5 Tokens pro Sekunde. Ollama nutzt dabei nur die NVIDIA-Karte; da 4 GB Grafikspeicher für das ganze 7B-Modell nicht ausreichen, läuft ein Teil davon auf dem Prozessor.

Das ist langsam, aber noch gut nutzbar: Eine Antwort mit Code dauert etwa eine halbe bis eine Minute. Ab ca. 5 Tokens pro Sekunde empfinde ich das Arbeiten als angenehm, darunter wird es zu zäh. Die noch größere 14B-Version habe ich auf meinem Rechner deshalb gar nicht erst eingesetzt.

Problem 1: Endlosschleifen bei langen Texten

Das 3B-Modell hat sich bei mir einmal bei einer langen Textdatei aufgehängt und stundenlang bzw. ewig dasselbe Wort geschrieben. Die Ursache: Ollama gibt Modellen standardmäßig nur ein kleines Kurzzeitgedächtnis. Lange Eingaben werden abgeschnitten und das Modell verliert den Faden.

In Open WebUI haben mir folgende Einstellungen unter den erweiterten Parametern geholfen, dieses Verhalten zu stoppen:

  1. num_ctx (Kontextlänge): 8192 einstellen, bei einem sehr schwachen Rechner reicht oft auch 4096.
  2. repeat_penalty: Auf 1.1 setzen.
  3. Temperatur: Auf 0.3 stellen statt sehr niedriger Werte.
  4. max_tokens: Auf 2048 begrenzen, damit das Modell bei einer Schleife von selbst abbricht.

Problem 2: Kleine Modelle raten und halluzinieren

Kleine Sprachmodelle neigen dazu, Fakten oder Befehle zu erfinden. Auf meine Testfrage „Wie heiße ich?“ antwortete das 3B-Modell beispielsweise: „Ich bin ein Programmier-Assistent namens Jarvis.“ Es hat hier schlicht Ich und Du verwechselt und sich einen Namen aus einem vorher eingefügten Text geschnappt.

Zudem erfand es in einem Test einen Befehl für ein Skript, das in der Realität gar nicht existierte. Mit dem 7B-Modell kam das deutlich seltener vor.

Einstellungen in Open WebUI

Für einen lokalen Coder in Open WebUI habe ich gezielt Funktionen ein- und ausgeschaltet.

Eingeschaltet habe ich: - Datei-Upload - Datei-Kontext - Code-Interpreter

Ausgeschaltet habe ich: - Bilderkennung (das kann das Modell ohnehin nicht) - Websuche - Terminal-Zugriff - Erinnerungen - Eingebaute Werkzeuge

Kleine Modelle kommen mit automatischen Werkzeugaufrufen meist schlecht klar. Zudem sollte ein lokales Modell niemals ungeprüft Befehle direkt auf dem eigenen Rechner ausführen. Wenn du deinen Laptop aufrüsten willst, hilft 16 GB DDR4 SO-DIMM Arbeitsspeicher oft spürbar bei größeren Modellen.

Mein Fazit

Mit 16 GB RAM oder mehr lohnt sich das 7B-Modell auf jeden Fall. Es ist deutlich klüger und erfindet weniger Fehler. Das 3B-Modell ist zwar schneller, taugt aber eher für kurze Schnipsel zwischendurch.

Für konkrete Aufgaben wie „Schreib eine Funktion, die ...“ oder „Erklär mir diese Fehlermeldung“ ist ein lokaler Coder ein echter Gewinn im Alltag. Für die reine Projektplanung oder das Verstehen langer Dokumente ist er hingegen überfordert. Und ganz wichtig: Übernehme Code von kleinen Modellen niemals blind, sondern teste ihn immer erst, bevor du ihn in echte Projekte einbindest.