From 182351e022db1abaa5e0cb992bb7d1d1b2463576 Mon Sep 17 00:00:00 2001 From: duffyduck Date: Fri, 18 Sep 2026 14:13:35 +0200 Subject: [PATCH] docs(compute): Whisper-als-STT-Beispiel fuer kleine GPUs MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit .env.example + README: eigene Beispiel-Zeile "kleine Karte" — COMPOSE_PROFILES=whisper,f5tts (Whisper statt Voxtral, beide auf EINER GPU), Default der Vorlage auf whisper,f5tts gesetzt (Voxtral-3B braucht ~9 GB). GPU-Defaults angepasst (WHISPER_GPU=0 neben F5TTS_GPU=0) + Klarstellung: pro Node genau EIN STT (Voxtral ODER Whisper). Co-Authored-By: Claude Opus 4.8 --- README.md | 6 ++++++ xtts/.env.example | 23 ++++++++++++++--------- 2 files changed, 20 insertions(+), 9 deletions(-) diff --git a/README.md b/README.md index 350c4f2..0d95ae1 100644 --- a/README.md +++ b/README.md @@ -825,6 +825,8 @@ Jeder Dienst haengt an einem Compose-Profil. Ein Node startet ueber STT-Box COMPOSE_PROFILES=voxtral VOXTRAL_GPU=0 TTS-Box COMPOSE_PROFILES=f5tts F5TTS_GPU=0 LLM-Box COMPOSE_PROFILES=llm LLM_GPU=0 + -- kleine Karte: Whisper (klein) statt Voxtral, neben F5-TTS -- +Klein-Box COMPOSE_PROFILES=whisper,f5tts WHISPER_GPU=0 F5TTS_GPU=0 ── oder All-in-One ── Gamebox COMPOSE_PROFILES=voxtral,f5tts,llm VOXTRAL_GPU=1 F5TTS_GPU=0 LLM_GPU=0 @@ -836,6 +838,10 @@ ARIA-VM STT-Timeout → lokaler CPU-Whisper-Fallback. ``` +> STT: pro Node **genau einen** — Voxtral-3B (~9 GB, beste Qualitaet) *oder* +> Whisper (klein, passt neben F5-TTS auf eine GPU mit wenig VRAM). Beide zusammen +> beantworten dieselbe Anfrage doppelt. + Die STT-Node teilt sich das `./voices/`-Volume mit F5-TTS nur, wenn beide auf demselben Node laufen (Referenz-Text-Transkription beim Voice-Upload). Auf getrennten Nodes transkribiert F5-TTS ueber den STT-Node via RVS. diff --git a/xtts/.env.example b/xtts/.env.example index deba0d5..a356820 100644 --- a/xtts/.env.example +++ b/xtts/.env.example @@ -6,13 +6,17 @@ # ─── Welche Dienste startet DIESER Node? ────────── # Komma-getrennt aus: voxtral, whisper, f5tts, llm # Nur die aufgefuehrten Dienste starten bei `docker compose up -d`. -# nur STT-Box → COMPOSE_PROFILES=voxtral -# nur TTS-Box → COMPOSE_PROFILES=f5tts -# nur LLM-Box → COMPOSE_PROFILES=llm -# All-in-One (alte Gamebox) → COMPOSE_PROFILES=voxtral,f5tts,llm +# nur STT-Box (Voxtral) → COMPOSE_PROFILES=voxtral +# nur STT-Box (Whisper) → COMPOSE_PROFILES=whisper +# nur TTS-Box → COMPOSE_PROFILES=f5tts +# nur LLM-Box → COMPOSE_PROFILES=llm +# Kleine Karte (wenig VRAM): Whisper + F5-TTS auf EINER GPU +# → COMPOSE_PROFILES=whisper,f5tts +# All-in-One, grosse Karte → COMPOSE_PROFILES=voxtral,f5tts,llm # Hinweis: voxtral UND whisper zusammen NICHT sinnvoll — beide sind STT und -# wuerden dieselbe Anfrage doppelt beantworten. Whisper ist der Fallback. -COMPOSE_PROFILES=voxtral,f5tts,llm +# wuerden dieselbe Anfrage doppelt beantworten. Pro Node genau EINEN STT waehlen: +# Voxtral-3B (~9 GB, beste Qualitaet) ODER Whisper (klein, passt neben F5-TTS). +COMPOSE_PROFILES=whisper,f5tts # ─── Node-Name ──────────────────────────────────── # Freier Name dieses Rechners. Erscheint in Diagnostic (Flotten-Anzeige) und @@ -23,9 +27,10 @@ NODE_NAME=gamebox # Setzt NVIDIA_VISIBLE_DEVICES fuer den jeweiligen Container. # Einzelne Karte → "0" oder "1"; mehrere Karten → "0,1". # Braucht das NVIDIA Container Toolkit (registriert die `nvidia`-Runtime). -VOXTRAL_GPU=1 # STT-3B ~9 GB → am besten die groessere Karte (z.B. 12 GB) -WHISPER_GPU=1 # Fallback-STT (nur relevant mit Profil "whisper") -F5TTS_GPU=0 # TTS ist klein → passt auf die kleinere Karte +# Nur die GPUs der aktiven Profile (COMPOSE_PROFILES) sind ueberhaupt relevant. +WHISPER_GPU=0 # kleines STT → passt neben F5-TTS auf EINE Karte +F5TTS_GPU=0 # TTS ist klein → gleiche Karte wie Whisper +VOXTRAL_GPU=1 # STT-3B ~9 GB → nur auf einer groesseren Karte (z.B. 12 GB) LLM_GPU=0 # lokales LLM (teilt sich ggf. die Karte mit F5-TTS) # ─── RVS-Verbindung (gleiche Daten wie auf der ARIA-VM) ───