build: document local model runtime
This commit is contained in:
+30
-9
@@ -53,7 +53,11 @@ Rootserver:
|
||||
- Toolchain eingerichtet: uv 0.11.32 und CPython 3.12.13 isoliert unter `D:\Javis-Tools`; Ruff 0.16.0 in der lokalen `.venv`.
|
||||
- Offizielle VS-Code-Erweiterungen installiert: Python 2026.4.0, Pylance 2026.3.1, Python Environments 1.36.0 und Debugpy 2026.6.0.
|
||||
- Windows-PATH und vorhandene Python-Installationen wurden nicht verändert.
|
||||
- Ollama oder llama.cpp sind noch nicht installiert.
|
||||
- Ollama 0.32.5 ist portabel unter `D:\Javis-Tools\ollama` installiert.
|
||||
- Genau ein Modell ist installiert: `qwen3:8b`, GGUF `Q4_K_M`, 5,2 GB, Apache-2.0.
|
||||
- Modelle liegen außerhalb von Git unter `D:\Javis-Data\ollama-models`.
|
||||
- Der lokale Ollama-Dienst bindet nur an `127.0.0.1:11434`; PATH, Registry,
|
||||
Autostart und Windows-Dienste blieben unverändert.
|
||||
- Kein Obsidian-, Laptop- oder Rootserverzugriff wurde implementiert.
|
||||
- Keine KI-, Sprach-, Mobil- oder Statusfunktion ist implementiert.
|
||||
|
||||
@@ -83,6 +87,11 @@ Rootserver:
|
||||
- Handoff-Verdichtung als Commit `e6eb995` nach `origin/main` gepusht.
|
||||
- Branch `feat/core-chat` von diesem Stand erstellt.
|
||||
- uv, CPython 3.12, lokale `.venv`, Ruff, Lockfile und offizielle VS-Code-Python-Erweiterungen eingerichtet.
|
||||
- Ollama und llama.cpp anhand offizieller Quellen verglichen; Ollama als einfachere
|
||||
erste Windows-Laufzeit gewählt.
|
||||
- Ollama-Archiv gegen die offizielle SHA-256-Prüfsumme verifiziert und portabel installiert.
|
||||
- `qwen3:8b` außerhalb des Repositories geladen und mit zwei echten deutschen
|
||||
Modellantworten auf der RTX 3060 geprüft.
|
||||
- Obsidian, Ubuntu-Laptop und Rootserver blieben unverändert.
|
||||
|
||||
## Aktuelle Tests
|
||||
@@ -99,7 +108,18 @@ Letzter bestätigter Grundgerüststand:
|
||||
- Python in `.venv`: 3.12.13
|
||||
- Ruff in `.venv`: 0.16.0
|
||||
|
||||
Für den Textchat existieren noch keine Funktions- oder Modell-Smoke-Tests.
|
||||
Lokaler Modell-Smoke-Test:
|
||||
|
||||
- Ollama-Version/API: 0.32.5, localhost erreichbar
|
||||
- Modell: 5.225.388.164 Byte, 8,2B, Q4_K_M, Apache-2.0
|
||||
- kalter Aufruf: 36,19 s Wandzeit, davon 17,53 s Laden, ungefähr 7,22 Token/s
|
||||
- warmer kurzer Aufruf: 0,56 s Wandzeit, ungefähr 55,51 Token/s
|
||||
- GPU-Belegung: 1.418 MiB vorher, 6.842 MiB mit geladenem Modell
|
||||
- Ollama meldet 100 % GPU und 5,6 GB Modellbelegung
|
||||
|
||||
Zwölf vorbereitete Unit-Tests für Konfiguration, SQLite, Kern, Provider und CLI
|
||||
laufen in der Arbeitskopie bereits erfolgreich; sie sind noch nicht in den
|
||||
Feature-Branch übernommen.
|
||||
|
||||
## Git-Stand
|
||||
|
||||
@@ -108,7 +128,7 @@ Für den Textchat existieren noch keine Funktions- oder Modell-Smoke-Tests.
|
||||
- Grundgerüstcommit: `6d04171`
|
||||
- letzter Commit vor der Handoff-Verdichtung: `0e82748`
|
||||
- Handoff-Verdichtung auf `main`: `e6eb995`
|
||||
- aktueller Feature-Commit ist über `git log -1 --oneline` zu bestimmen
|
||||
- Python-Entwicklungsumgebung auf dem Feature-Branch: `fa90a5c`
|
||||
- `origin` verwendet HTTPS
|
||||
- kein Force-Push und keine umgeschriebene Historie
|
||||
|
||||
@@ -119,11 +139,12 @@ Für den Textchat existieren noch keine Funktions- oder Modell-Smoke-Tests.
|
||||
- `0e82748`: Werkzeug-, Token- und Handoff-Regeln
|
||||
- `e6eb995`: einmalige Archivierung und Verdichtung des Handoffs
|
||||
- aktuell: isolierte Python-Toolchain und reproduzierbare Entwicklungsumgebung
|
||||
- aktuell: portable Ollama-Laufzeit und `qwen3:8b` außerhalb von Git verifiziert
|
||||
|
||||
## Offene Entscheidungen und Fehler
|
||||
|
||||
- endgültiger Produkt-/Repositoryname bleibt offen
|
||||
- lokale Modelllaufzeit und erstes Modell sind noch nicht installiert oder benchmarked
|
||||
- Startmechanismus für Ollama ist noch bewusst manuell und nur pro Prozess konfiguriert
|
||||
- genauer späterer Obsidian-Schreibbereich ist nicht freigegeben
|
||||
- endgültiger Secret-Provider ist offen; lokale Klartext-XML wäre nur restriktiv geschützt und Git-ignoriert zulässig
|
||||
- Gaming-PC zeigt derzeit nur 8 statt 16 logische CPU-Prozessoren; Ursache ungeklärt
|
||||
@@ -143,10 +164,10 @@ Für den Textchat existieren noch keine Funktions- oder Modell-Smoke-Tests.
|
||||
|
||||
Der genehmigte nächste Meilenstein ist `feat/core-chat`:
|
||||
|
||||
1. Ollama als einfachere Windows-Laufzeit installieren; llama.cpp bleibt dokumentierte Alternative
|
||||
2. genau `qwen3:8b` (`Q4_K_M`, 5,2 GB, Apache-2.0) herunterladen und auf der RTX 3060 messen
|
||||
3. echten lokalen CLI-Chat mit Provider-Schnittstelle und SQLite-Sitzungen implementieren
|
||||
4. Unit-, Ruff-, Persistenz-, Secret- und echten Modell-Smoke-Test ausführen
|
||||
5. nur bei vollständig erfüllter Abnahme nach `main` mergen
|
||||
1. vorbereiteten lokalen CLI-Chat mit Provider-Schnittstelle und SQLite-Sitzungen
|
||||
in den Feature-Branch übernehmen
|
||||
2. Unit-, Ruff-, Persistenz-, Secret- und echten CLI-Modell-Smoke-Test ausführen
|
||||
3. Dokumentation und Handoff auf den tatsächlichen Endstand bringen
|
||||
4. Feature-Branch pushen und nur bei vollständig erfüllter Abnahme nach `main` mergen
|
||||
|
||||
Nicht Teil dieses Meilensteins: Obsidian-Integration, Serverzugriff, Sprache, Mobile Client oder Living-Mind-Code.
|
||||
|
||||
Reference in New Issue
Block a user