Files
Jarvis-Ai/docs/LOCAL_MODEL.md

2.4 KiB

Lokales Modell

Stand: 30.07.2026, erster Windows-Test auf dem Gaming-PC.

Auswahl

  • Laufzeit: Ollama 0.32.5, portable Windows-Version
  • Modell: qwen3:8b
  • Format: GGUF
  • Quantisierung: Q4_K_M
  • Parameter: 8,2 Milliarden
  • Kontext laut Modellmetadaten: 40.960 Token; Ollama-Testkontext: 4.096
  • Downloadgröße laut lokaler Ollama-API: 5.225.388.164 Byte, ungefähr 5,2 GB
  • Lizenz: Apache License 2.0

Ollama wurde gegenüber llama.cpp für diesen ersten Windows-Test gewählt, weil die offizielle portable Laufzeit ohne Build, Installer, PATH-Änderung oder Systemdienst eine stabile lokale HTTP-Schnittstelle bereitstellt. llama.cpp bleibt eine mögliche spätere Alternative, falls auf schwächerer Hardware feinere Kontrolle über Kontext, Offloading oder Quantisierung benötigt wird.

qwen3:8b wurde gewählt, weil die Variante unter 10 GB bleibt, vollständig in den 12-GB-VRAM der RTX 3060 passt, deutschsprachige Antworten liefert und nach dem Download offline über localhost nutzbar ist.

Speicherorte

  • portable Laufzeit: D:\Javis-Tools\ollama
  • Modellablage: D:\Javis-Data\ollama-models
  • Repository: enthält weder Laufzeit noch Modell

Die Ablage wird beim Start des Dienstes über OLLAMA_MODELS nur für diesen Prozess gesetzt. PATH, Registry, Autostart und Windows-Dienste wurden nicht verändert.

Gemessener Test

Hardware: AMD Ryzen 7 9700X, 64 GB RAM, Nvidia RTX 3060 12 GB, Windows 11.

  • Laufzeit-Archiv: 1.457.824.795 Byte
  • verifizierte SHA-256: 7c941ae084569d298062d29f8139163a3187c76dbca0479c70d085e78fd8c7bb
  • kalter deutscher Zweitsatz-Test: 36,19 Sekunden Wandzeit
  • davon Modell-Ladezeit: 17,53 Sekunden
  • Ausgabe: 49 Token mit ungefähr 7,22 Token/Sekunde
  • warmer kurzer Test: 0,56 Sekunden Wandzeit
  • Ausgabe: 19 Token mit ungefähr 55,51 Token/Sekunde
  • GPU-Grundbelegung vor Laden: 1.418 MiB
  • GPU-Belegung bei geladenem Modell/Test: 6.842 MiB
  • beobachtete zusätzliche VRAM-Belegung: ungefähr 5.424 MiB
  • ollama ps: 5,6 GB, 100 % GPU, Kontext 4.096

Die Messwerte sind Momentaufnahmen und hängen von Prompt, Kontext, bereits belegtem VRAM und Warmzustand ab.

Grenze

Dieses Modell ist der bestätigte erste Gaming-PC-Test, nicht automatisch das endgültige Modell für den ASUS-Laptop mit GTX 1050 4 GB. Dort müssen später kleineres Modell, stärkere Quantisierung, teilweises CPU-Offloading und tatsächliche Antwortqualität separat gemessen werden. Ein Laptop-Deployment gehört nicht zu diesem Arbeitspaket.