docs: lokales LLM — Awareness (volle Liste) vs Authority (kuratierter Satz)

Klargestellt: lokales Modell ist ueber ALLES im Bilde (kurze Awareness-Liste im
System-Prompt -> gezieltes Escalieren), darf aber nur den sicheren Satz
ausfuehren. Harte Grenze ist Kontext/VRAM (volles Schema ~15-20K Tokens passt
nicht in 8K, 32K-Kontext sprengt die geteilte 12GB-3060), nicht Misstrauen.
Claude im RZ mit 200K-1M Kontext kann sich das ganze Arsenal leisten.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
2026-07-11 11:24:53 +02:00
co-authored by Claude Opus 4.8
parent e6e87a8b20
commit 25a9b71482
+22 -9
View File
@@ -85,16 +85,29 @@ messages + tools → Qwen antwortet mit `tool_calls` → Brain fuehrt via
`_dispatch_tool` aus → Ergebnis zurueck → finale Antwort. Tool-Loop im Brain, `_dispatch_tool` aus → Ergebnis zurueck → finale Antwort. Tool-Loop im Brain,
Ziel = lokales LLM statt Claude-Proxy. Ziel = lokales LLM statt Claude-Proxy.
**Kritische Regel: klein halten.** Der Wert des lokalen Tiers ist Speed; das **Awareness ≠ Authority.** Das lokale Modell soll WISSEN, was ARIA alles kann
volle Arsenal (~49 K Zeichen Schemas) wuerde den Prompt sprengen und das kleine (damit es gezielt eskaliert statt zu halluzinieren), aber nicht alles ausfuehren.
Modell ueberfordern. Daher nur ein **Start-Satz haeufiger, risikoarmer Tools**:
- Lokal: Wetter, Uhrzeit, `memory_search` (lesen), `trigger_timer`,
Spotify-Steuerung (Nicht-Fast-Path-Saetze), Licht/Smart-Home.
- Bleibt bei Claude: `skill_create/update/delete`, `oauth_*`, `project_*`,
`flux_generate`, `memory_save` (schreiben) — erst spaeter evtl. lokal.
Escalation-Netz bleibt: braucht ein Turn ein Tool, das lokal nicht dabei ist → **Harte Grenze = Kontext/VRAM, nicht Misstrauen.** Das volle Tool-Schema sind
`<<ESCALATE>>` → Claude mit vollem Arsenal. ~15-20 K Tokens. Qwens Kontext steht auf 8 K (`LLM_CTX=8192`) — es passt nicht
rein. Hochdrehen auf 32 K kostet mehrere GB KV-Cache extra → OOM auf der
geteilten 12-GB-3060 (Whisper + F5-TTS liegen mit drauf). Claude im RZ hat
200 K-1 M Kontext und ist zuverlaessig → kann sich das ganze Arsenal leisten;
das lokale 8B auf Heim-Hardware nicht. Andere Hardware-Klasse, anderes Budget.
**Design (gibt „im Bilde" ohne VRAM zu sprengen):**
- **Ausfuehrbar lokal:** kleiner, risikoarmer Start-Satz — Wetter, Uhrzeit,
`memory_search` (lesen), `trigger_timer`, Spotify-Steuerung, Licht/Smart-Home.
- **Awareness-Liste (billig, ~paar hundert Tokens im System-Prompt):** kurze
Aufzaehlung des Rests — „ARIA kann ausserdem: Skills bauen, OAuth, Projekte,
Bilder, ins Gedaechtnis schreiben — dafuer `<<ESCALATE>>`." Kein volles Schema.
- **Bleibt bei Claude (Authority):** `skill_create/update/delete`, `oauth_*`,
`project_*`, `flux_generate`, `memory_save`.
Escalation-Netz bleibt: braucht ein Turn ein Tool, das lokal nicht ausfuehrbar
ist → `<<ESCALATE>>` → Claude mit vollem Arsenal. Der „Nur lokales LLM"-Haken
dient dazu, spaeter datengetrieben zu messen, ob der ausfuehrbare Satz erweitert
werden kann.
Implementierung (B1): Adapter reicht `tools` an llama.cpp + gibt `tool_calls` Implementierung (B1): Adapter reicht `tools` an llama.cpp + gibt `tool_calls`
zurueck; Bridge schleust beides durch (llm_request/llm_response); Brain-Tool-Loop zurueck; Bridge schleust beides durch (llm_request/llm_response); Brain-Tool-Loop