From eebafe8895ab2a8f78d2ea95504a9de42e2e1002 Mon Sep 17 00:00:00 2001 From: duffyduck Date: Sat, 11 Jul 2026 11:30:17 +0200 Subject: [PATCH] docs: Skalierung/Multi-GPU/Cluster + Diagnostic-VRAM-Info (Klarstellung: kein VRAM ueber RVS) Roher VRAM ist nicht ueber RVS teilbar (Relay, nicht GPU-Bus). Echte Pfade: mehr Karten/Box = VRAM-Pool (volles Arsenal), mehr GPU-Hosts = Modell-Server ueber RVS (Cluster), llama-swap = geteilter Server im Host. Plus geplantes Diagnostic-Info-Icon mit VRAM-Bedarf pro Ausbaustufe. Co-Authored-By: Claude Opus 4.8 --- docs/plan-local-llm-router.md | 26 ++++++++++++++++++++++++++ 1 file changed, 26 insertions(+) diff --git a/docs/plan-local-llm-router.md b/docs/plan-local-llm-router.md index 6da0702..f5d0b44 100644 --- a/docs/plan-local-llm-router.md +++ b/docs/plan-local-llm-router.md @@ -169,6 +169,32 @@ zeigt statt auf `llama:8081` auf `llama-swap`. Bis dahin: **ein** Modell via `-hf` Auto-Download (B0, erledigt). Erst end-to-end grün, dann dieser Komfort-Layer. +## Skalierung: VRAM, Multi-GPU, „Cluster" + +**Wichtige Klarstellung:** Roher VRAM/GPU ist NICHT ueber RVS teilbar. RVS ist ein +Nachrichten-Relay; GPUs werden lokal per CUDA/PCIe angesprochen. Ueber RVS teilt +man **Inferenz-Faehigkeit** (transkribiere/vervollstaendige), nicht VRAM. Es gibt +daher keinen „GPU-Broker-Container", der Karten uebers Netz verleiht. + +Skalierungspfade (echt): +- **Mehr Karten in EINER Box → VRAM-Pool.** llama.cpp/vLLM splitten ein Modell + ueber mehrere GPUs (`--tensor-split`). 2×3060 = 24 GB → groesseres Modell ODER + Qwen8B mit grossem Kontext → **volles Tool-Schema passt rein**. Das ist der + Weg zum „vollen Arsenal lokal". +- **Ein Modell ueber mehrere HOSTS splitten** (llama.cpp `--rpc`): moeglich, aber + langsam (Layer-Grenzen ueber's Netz) — nur schnelles LAN, fuer „schnell" + ungeeignet. Nicht empfohlen. +- **Mehrere eigenstaendige Modell-Server, je einer pro GPU/Host, Router waehlt:** + einfach, = unser RVS-Muster. Zweiter GPU-Host = noch ein llm-adapter, meldet + sich am RVS an, Router load-balanced. Das ist der sinnvolle „Cluster". +- **Innerhalb eines Hosts:** ein geteilter Inferenz-Server (`llama-swap`/vLLM) + statt VRAM-Duplikat pro Container — kommt mit B0.5. + +**Diagnostic ⓘ (Feature):** Checkbox „volleres Arsenal" + Info-Icon mit +VRAM-Bedarf: 12 GB (1×3060) = kuratierte Tools; 24 GB (2×3060, eine Box) = Qwen +mit grossem Kontext/volles Schema oder groesseres Modell; Cluster = weitere +GPU-Hosts als Modell-Server ueber RVS. (B0.5/B1-UI.) + ## Nicht-Ziele - Kein echter Gemini-Live-Duplex-Klon (Text-Modell als Hirn).