24 lines
946 B
Markdown
24 lines
946 B
Markdown
# ADR-0006: Erste lokale Modelllaufzeit
|
|
|
|
Status: angenommen am 30.07.2026.
|
|
|
|
## Entscheidung
|
|
|
|
Der erste Windows-Textchat verwendet die portable Ollama-Laufzeit 0.32.5 und genau
|
|
das Modell `qwen3:8b` in der GGUF-Quantisierung Q4_K_M. Laufzeit und Modell liegen
|
|
außerhalb des Repositories. Javis akzeptiert für diesen Provider ausschließlich
|
|
eine lokale HTTP-Loopback-Adresse.
|
|
|
|
## Begründung
|
|
|
|
Ollama stellt ohne Build, Installer oder Systemdienst eine kleine stabile lokale
|
|
API bereit. Das Modell bleibt unter 10 GB, passt beim bestätigten Test vollständig
|
|
in die RTX 3060 mit 12 GB und liefert deutsche Antworten.
|
|
|
|
## Folgen
|
|
|
|
Die Entscheidung gilt für den ersten Gaming-PC-Meilenstein. Sie legt weder die
|
|
endgültige Modelllaufzeit noch das Modell für den ASUS-Laptop mit GTX 1050 4 GB
|
|
fest. Ein späterer Vergleich mit llama.cpp bleibt möglich, wenn messbare
|
|
Anforderungen an Offloading, Quantisierung oder Ressourcensteuerung entstehen.
|