946 B
ADR-0006: Erste lokale Modelllaufzeit
Status: angenommen am 30.07.2026.
Entscheidung
Der erste Windows-Textchat verwendet die portable Ollama-Laufzeit 0.32.5 und genau
das Modell qwen3:8b in der GGUF-Quantisierung Q4_K_M. Laufzeit und Modell liegen
außerhalb des Repositories. Javis akzeptiert für diesen Provider ausschließlich
eine lokale HTTP-Loopback-Adresse.
Begründung
Ollama stellt ohne Build, Installer oder Systemdienst eine kleine stabile lokale API bereit. Das Modell bleibt unter 10 GB, passt beim bestätigten Test vollständig in die RTX 3060 mit 12 GB und liefert deutsche Antworten.
Folgen
Die Entscheidung gilt für den ersten Gaming-PC-Meilenstein. Sie legt weder die endgültige Modelllaufzeit noch das Modell für den ASUS-Laptop mit GTX 1050 4 GB fest. Ein späterer Vergleich mit llama.cpp bleibt möglich, wenn messbare Anforderungen an Offloading, Quantisierung oder Ressourcensteuerung entstehen.