Files
ARIA-AGENT/xtts/llm-adapter
duffyduckandClaude Opus 4.8 66781d8d90 feat(fleet): Auslastungs-Monitor pro Box — live nvidia-smi + Graphen (Stage E)
Pro Box ein "Auslastung"-Button in der Compute-Flotte → Modal mit live
nvidia-smi (1s), Graphen (GPU-Auslastung + Tokens/Intervall) und Besen-Reset.
Historie liegt auf der Box, Diagnostic holt sie via RVS.

- node_stats.py (identisch in allen 4 Worker-Build-Contexts): Sampler alle 15s
  (nvidia-smi + Token-Delta → Ringpuffer ~500 Punkte, persistent als JSON auf
  der Box), Live-Stream (node_stats, 1s, Auto-Stop 300s), History-Request,
  Reset. nvidia-smi via async subprocess, fail-safe ohne GPU.
- Worker-Wiring (f5tts/whisper/voxtral/llm-adapter): Import, Sampler-Task,
  _stats.handle() nach dem targetInstance-Filter. llm-adapter zaehlt Tokens
  (usage.total_tokens) → Token-Graph nur bei LLM-Boxen. Dockerfiles kopieren
  node_stats.py.
- compose: llm-adapter bekommt runtime:nvidia + NVIDIA_VISIBLE_DEVICES=all +
  DRIVER_CAPABILITIES=utility (nur nvidia-smi, KEIN VRAM/Compute).
- diagnostic/server.js: relay node_stats_* (Browser→Box) + forward (Box→Browser).
- diagnostic/index.html: Auslastung-Button pro Node (Ziel bevorzugt llm-Instanz),
  Modal mit live nvidia-smi + Inline-SVG-Sparklines, Besen-Reset.

Reporter-Wahl bevorzugt die llm-Instanz (sieht alle GPUs + Tokens); GPU-Worker
sehen ihre gepinnte Karte. Gitignored Historie stoert git-Baum der Box nicht.
Deploy: diagnostic + GPU-Boxen neu bauen.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-09-19 03:26:17 +02:00
..

Local-LLM-Adapter (AI-Box) — Plan B, Phase B0

Bringt ein lokales, schnelles LLM (Qwen3 8B) auf die AI-Box und haengt es per RVS an ARIA — fuer die einfachen ~80 % der Turns (<1 s), waehrend Claude das Tiefen-Hirn bleibt. Siehe docs/plan-local-llm-router.md im Repo-Root.

Zwei Container (in xtts/docker-compose.yml)

  • llamallama.cpp-Server (CUDA), serviert das GGUF OpenAI-kompatibel auf :8081, nur im Compose-Netz.
  • llm-adapter — verbindet sich per Token an den RVS (wie f5tts/whisper), nimmt llm_request entgegen, ruft llama lokal, antwortet llm_response.

Modell — Auto-Download (nichts manuell ablegen)

llama.cpp zieht das GGUF beim ersten Start selbst von Hugging Face und cached es unter xtts/models/ (Bind-Mount → kein Re-Download bei Restart). Default: Qwen3 8B, Q4_K_M aus dem offiziellen Repo Qwen/Qwen3-8B-GGUF.

Modell/Quant wechseln = in der .env der AI-Box setzen (kein Code):

LLM_HF_REPO=Qwen/Qwen3-8B-GGUF     # HF-Repo
LLM_HF_QUANT=Q4_K_M                # Quant-Tag (Q4_K_M, Q5_K_M, Q8_0, …)
LLM_CTX=8192                       # Kontextfenster (kleiner = weniger VRAM)

Mistral statt Qwen testen (A/B): LLM_HF_REPO auf ein Mistral-Small-3-GGUF-Repo umstellen + Container neu — Ein-Zeilen-Wechsel, kein Code.

Der erste Start lädt mehrere GB — Log zeigt den Download-Fortschritt. Danach liegt das GGUF im Cache und der Start ist sofort.

Modell-Auswahl in ARIA Diagnostic (on-demand laden/aktivieren mehrerer Modelle) ist ein geplanter Folge-Baustein via llama-swap — siehe docs/plan-local-llm-router.md.

Start (auf der AI-Box)

cd xtts
docker compose up -d --build llama llm-adapter
docker logs -f aria-llm-adapter     # "RVS verbunden — llm-adapter online"

Standalone-Test (ohne ARIA), direkt gegen llama.cpp

curl http://localhost:8081/v1/chat/completions -H "Content-Type: application/json" -d '{
  "messages":[{"role":"system","content":"Du bist ARIA."},
              {"role":"user","content":"sag kurz hallo"}],
  "max_tokens":64
}'

VRAM-Hinweis (RTX 3060, 12 GB)

whisper-small (~12) + f5tts (~12) + qwen3-8b-q4 (~6) ≈ 910 GB. Passt, aber knapp. Bei OOM: LLM_CTX reduzieren, -ngl senken (weniger Layer auf GPU), oder kleineres Quant (Q4_K_S / IQ4_XS).

Nachrichten-Kontrakt (RVS)

  • llm_request{ requestId, messages:[{role,content}], max_tokens?, temperature?, stop? }
  • llm_response{ requestId, ok, content, error?, model, elapsedMs }
  • llm_partial — reserviert fuer B2 (Token-Streaming), noch ungenutzt.