feat(local-llm): B0 — GGUF Auto-Download via llama.cpp -hf (kein manuelles Ablegen)
Statt einer manuell abgelegten Datei zieht llama.cpp das Modell beim ersten Start selbst von Hugging Face (-hf Qwen/Qwen3-8B-GGUF:Q4_K_M, offizielles Repo verifiziert) und cached es unter xtts/models (persistent). Modell/Quant via LLM_HF_REPO/LLM_HF_QUANT in der .env wechselbar, kein Code. Diagnostic-Modellauswahl (on-demand laden/aktivieren mehrerer Modelle) als Folge-Baustein B0.5 via llama-swap ins Plan-Doc aufgenommen. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -85,6 +85,33 @@ Das lokale Modell braucht ARIAs Identität, sonst bricht es aus der Rolle
|
||||
Mini-Classifier?
|
||||
3. **Tools lokal:** in v1 bewusst KEINE (alles Tool-artige → Claude) — ok?
|
||||
|
||||
## Folge-Baustein: Modell-Auswahl in ARIA Diagnostic (B0.5)
|
||||
|
||||
Ziel: In Diagnostic ein Modell auswählen; ist es nicht da, lädt der Container
|
||||
es on-demand und aktiviert es. Spiegelt zwei bestehende Muster: den
|
||||
`whisperModel`-Hotswap (RVS-Config-Broadcast → Bridge hot-swapped) und die
|
||||
kuratierte Claude-Tier-Liste aus `models.json`.
|
||||
|
||||
**Kernproblem:** `llama.cpp`-Server serviert **ein** Modell pro Prozess —
|
||||
„anderes aktivieren" = neu laden/swappen.
|
||||
|
||||
**Lösung: `llama-swap`** (Proxy vor llama.cpp): kennt eine Liste von Modellen,
|
||||
lädt bei Anfrage das gewünschte on-demand (Download via `-hf` beim ersten Mal),
|
||||
swappt bei VRAM-Knappheit das alte raus. OpenAI-kompatibel — der llm-adapter
|
||||
zeigt statt auf `llama:8081` auf `llama-swap`.
|
||||
|
||||
**Bausteine:**
|
||||
- `llama-swap`-Service in `xtts/docker-compose.yml` (ersetzt/ergänzt `llama`),
|
||||
Config mit den verfügbaren Modellen (Name → `-hf`-Command).
|
||||
- Kuratierte Liste `local_models.json` (analog `models.json`) — Diagnostic-UI
|
||||
liest sie, zeigt Dropdown „Lokales Modell".
|
||||
- Diagnostic → RVS-Config-Broadcast `localLlmModel` → llm-adapter setzt das
|
||||
`model`-Feld seiner llama-swap-Requests → swap/Download passiert automatisch.
|
||||
- Status zurück an Diagnostic (lädt / bereit / VRAM-OOM), analog whisper-Status.
|
||||
|
||||
Bis dahin: **ein** Modell via `-hf` Auto-Download (B0, erledigt). Erst end-to-end
|
||||
grün, dann dieser Komfort-Layer.
|
||||
|
||||
## Nicht-Ziele
|
||||
|
||||
- Kein echter Gemini-Live-Duplex-Klon (Text-Modell als Hirn).
|
||||
|
||||
Reference in New Issue
Block a user