diff --git a/docs/plan-local-llm-router.md b/docs/plan-local-llm-router.md index 9380048..9118af9 100644 --- a/docs/plan-local-llm-router.md +++ b/docs/plan-local-llm-router.md @@ -109,6 +109,14 @@ zeigt statt auf `llama:8081` auf `llama-swap`. `model`-Feld seiner llama-swap-Requests → swap/Download passiert automatisch. - Status zurück an Diagnostic (lädt / bereit / VRAM-OOM), analog whisper-Status. +**Konkret gewünschte UI (Stefan):** +- Modell-Status sichtbar: **lädt (mit Fortschrittsbalken) → heruntergeladen → + aktiviert**. Ist ein Modell schon im Cache: **nicht neu laden, nur + aktivieren** (llama.cpp/llama-swap macht das nativ ueber den Cache). +- **Testchat-Zeile** in Diagnostic: kurze Nachricht direkt ans lokale LLM + schicken, Antwort + Latenz anzeigen. Nutzt denselben RVS-Pfad + (`llm_request`/`llm_response`) wie der Self-Test — kein neuer Kanal noetig. + Bis dahin: **ein** Modell via `-hf` Auto-Download (B0, erledigt). Erst end-to-end grün, dann dieser Komfort-Layer.