build: document local model runtime
This commit is contained in:
@@ -0,0 +1,61 @@
|
||||
# Lokales Modell
|
||||
|
||||
Stand: 30.07.2026, erster Windows-Test auf dem Gaming-PC.
|
||||
|
||||
## Auswahl
|
||||
|
||||
- Laufzeit: Ollama `0.32.5`, portable Windows-Version
|
||||
- Modell: `qwen3:8b`
|
||||
- Format: GGUF
|
||||
- Quantisierung: `Q4_K_M`
|
||||
- Parameter: 8,2 Milliarden
|
||||
- Kontext laut Modellmetadaten: 40.960 Token; Ollama-Testkontext: 4.096
|
||||
- Downloadgröße laut lokaler Ollama-API: 5.225.388.164 Byte, ungefähr 5,2 GB
|
||||
- Lizenz: Apache License 2.0
|
||||
|
||||
Ollama wurde gegenüber llama.cpp für diesen ersten Windows-Test gewählt, weil die
|
||||
offizielle portable Laufzeit ohne Build, Installer, PATH-Änderung oder Systemdienst
|
||||
eine stabile lokale HTTP-Schnittstelle bereitstellt. llama.cpp bleibt eine mögliche
|
||||
spätere Alternative, falls auf schwächerer Hardware feinere Kontrolle über Kontext,
|
||||
Offloading oder Quantisierung benötigt wird.
|
||||
|
||||
`qwen3:8b` wurde gewählt, weil die Variante unter 10 GB bleibt, vollständig in den
|
||||
12-GB-VRAM der RTX 3060 passt, deutschsprachige Antworten liefert und nach dem
|
||||
Download offline über localhost nutzbar ist.
|
||||
|
||||
## Speicherorte
|
||||
|
||||
- portable Laufzeit: `D:\Javis-Tools\ollama`
|
||||
- Modellablage: `D:\Javis-Data\ollama-models`
|
||||
- Repository: enthält weder Laufzeit noch Modell
|
||||
|
||||
Die Ablage wird beim Start des Dienstes über `OLLAMA_MODELS` nur für diesen Prozess
|
||||
gesetzt. PATH, Registry, Autostart und Windows-Dienste wurden nicht verändert.
|
||||
|
||||
## Gemessener Test
|
||||
|
||||
Hardware: AMD Ryzen 7 9700X, 64 GB RAM, Nvidia RTX 3060 12 GB, Windows 11.
|
||||
|
||||
- Laufzeit-Archiv: 1.457.824.795 Byte
|
||||
- verifizierte SHA-256:
|
||||
`7c941ae084569d298062d29f8139163a3187c76dbca0479c70d085e78fd8c7bb`
|
||||
- kalter deutscher Zweitsatz-Test: 36,19 Sekunden Wandzeit
|
||||
- davon Modell-Ladezeit: 17,53 Sekunden
|
||||
- Ausgabe: 49 Token mit ungefähr 7,22 Token/Sekunde
|
||||
- warmer kurzer Test: 0,56 Sekunden Wandzeit
|
||||
- Ausgabe: 19 Token mit ungefähr 55,51 Token/Sekunde
|
||||
- GPU-Grundbelegung vor Laden: 1.418 MiB
|
||||
- GPU-Belegung bei geladenem Modell/Test: 6.842 MiB
|
||||
- beobachtete zusätzliche VRAM-Belegung: ungefähr 5.424 MiB
|
||||
- `ollama ps`: 5,6 GB, 100 % GPU, Kontext 4.096
|
||||
|
||||
Die Messwerte sind Momentaufnahmen und hängen von Prompt, Kontext, bereits belegtem
|
||||
VRAM und Warmzustand ab.
|
||||
|
||||
## Grenze
|
||||
|
||||
Dieses Modell ist der bestätigte erste Gaming-PC-Test, nicht automatisch das
|
||||
endgültige Modell für den ASUS-Laptop mit GTX 1050 4 GB. Dort müssen später
|
||||
kleineres Modell, stärkere Quantisierung, teilweises CPU-Offloading und tatsächliche
|
||||
Antwortqualität separat gemessen werden. Ein Laptop-Deployment gehört nicht zu
|
||||
diesem Arbeitspaket.
|
||||
Reference in New Issue
Block a user