docs: lokales LLM — Awareness (volle Liste) vs Authority (kuratierter Satz)
Klargestellt: lokales Modell ist ueber ALLES im Bilde (kurze Awareness-Liste im System-Prompt -> gezieltes Escalieren), darf aber nur den sicheren Satz ausfuehren. Harte Grenze ist Kontext/VRAM (volles Schema ~15-20K Tokens passt nicht in 8K, 32K-Kontext sprengt die geteilte 12GB-3060), nicht Misstrauen. Claude im RZ mit 200K-1M Kontext kann sich das ganze Arsenal leisten. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -85,16 +85,29 @@ messages + tools → Qwen antwortet mit `tool_calls` → Brain fuehrt via
|
|||||||
`_dispatch_tool` aus → Ergebnis zurueck → finale Antwort. Tool-Loop im Brain,
|
`_dispatch_tool` aus → Ergebnis zurueck → finale Antwort. Tool-Loop im Brain,
|
||||||
Ziel = lokales LLM statt Claude-Proxy.
|
Ziel = lokales LLM statt Claude-Proxy.
|
||||||
|
|
||||||
**Kritische Regel: klein halten.** Der Wert des lokalen Tiers ist Speed; das
|
**Awareness ≠ Authority.** Das lokale Modell soll WISSEN, was ARIA alles kann
|
||||||
volle Arsenal (~49 K Zeichen Schemas) wuerde den Prompt sprengen und das kleine
|
(damit es gezielt eskaliert statt zu halluzinieren), aber nicht alles ausfuehren.
|
||||||
Modell ueberfordern. Daher nur ein **Start-Satz haeufiger, risikoarmer Tools**:
|
|
||||||
- Lokal: Wetter, Uhrzeit, `memory_search` (lesen), `trigger_timer`,
|
|
||||||
Spotify-Steuerung (Nicht-Fast-Path-Saetze), Licht/Smart-Home.
|
|
||||||
- Bleibt bei Claude: `skill_create/update/delete`, `oauth_*`, `project_*`,
|
|
||||||
`flux_generate`, `memory_save` (schreiben) — erst spaeter evtl. lokal.
|
|
||||||
|
|
||||||
Escalation-Netz bleibt: braucht ein Turn ein Tool, das lokal nicht dabei ist →
|
**Harte Grenze = Kontext/VRAM, nicht Misstrauen.** Das volle Tool-Schema sind
|
||||||
`<<ESCALATE>>` → Claude mit vollem Arsenal.
|
~15-20 K Tokens. Qwens Kontext steht auf 8 K (`LLM_CTX=8192`) — es passt nicht
|
||||||
|
rein. Hochdrehen auf 32 K kostet mehrere GB KV-Cache extra → OOM auf der
|
||||||
|
geteilten 12-GB-3060 (Whisper + F5-TTS liegen mit drauf). Claude im RZ hat
|
||||||
|
200 K-1 M Kontext und ist zuverlaessig → kann sich das ganze Arsenal leisten;
|
||||||
|
das lokale 8B auf Heim-Hardware nicht. Andere Hardware-Klasse, anderes Budget.
|
||||||
|
|
||||||
|
**Design (gibt „im Bilde" ohne VRAM zu sprengen):**
|
||||||
|
- **Ausfuehrbar lokal:** kleiner, risikoarmer Start-Satz — Wetter, Uhrzeit,
|
||||||
|
`memory_search` (lesen), `trigger_timer`, Spotify-Steuerung, Licht/Smart-Home.
|
||||||
|
- **Awareness-Liste (billig, ~paar hundert Tokens im System-Prompt):** kurze
|
||||||
|
Aufzaehlung des Rests — „ARIA kann ausserdem: Skills bauen, OAuth, Projekte,
|
||||||
|
Bilder, ins Gedaechtnis schreiben — dafuer `<<ESCALATE>>`." Kein volles Schema.
|
||||||
|
- **Bleibt bei Claude (Authority):** `skill_create/update/delete`, `oauth_*`,
|
||||||
|
`project_*`, `flux_generate`, `memory_save`.
|
||||||
|
|
||||||
|
Escalation-Netz bleibt: braucht ein Turn ein Tool, das lokal nicht ausfuehrbar
|
||||||
|
ist → `<<ESCALATE>>` → Claude mit vollem Arsenal. Der „Nur lokales LLM"-Haken
|
||||||
|
dient dazu, spaeter datengetrieben zu messen, ob der ausfuehrbare Satz erweitert
|
||||||
|
werden kann.
|
||||||
|
|
||||||
Implementierung (B1): Adapter reicht `tools` an llama.cpp + gibt `tool_calls`
|
Implementierung (B1): Adapter reicht `tools` an llama.cpp + gibt `tool_calls`
|
||||||
zurueck; Bridge schleust beides durch (llm_request/llm_response); Brain-Tool-Loop
|
zurueck; Bridge schleust beides durch (llm_request/llm_response); Brain-Tool-Loop
|
||||||
|
|||||||
Reference in New Issue
Block a user