Stefans Repro: nach dem Senden ging sofort ein Passiv-Fenster auf (waehrend ARIA
noch arbeitete), und obwohl er nichts sagte, kam eine "Nachricht von ihm" — Voxtral
halluzinierte aus Fast-Nichts einen Fuellsatz. Der ging als Phantom-Turn ans Brain
und liess das Gespraech entgleisen (Antwort drauf, dann Konversation-Ende).
Ursache war eine Nebenwirkung des "Sprache erkannt"-Pings (9e78d75): der feuerte
beim ERSTEN Voice-Frame — also auch bei einem kurzen Geraeusch-Blip. Damit war der
App-No-Speech-Watchdog geloescht, der akustische Endpoint feuerte, und Voxtral
transkribierte den Blip → Halluzination. (Vorher haette der Watchdog den Blip
verworfen.)
Fix: voiced_frames-Zaehler (Endpointer-Frames mit echter Stimme). Erst ab
STREAM_MIN_VOICED_FRAMES (=2, ~400ms, env-tunebar) gilt es als Sprache:
- Der Speech-Ping feuert erst ab dieser Schwelle (ein Blip loescht den Watchdog
also nicht mehr).
- _finalize transkribiert unter der Schwelle NICHT, sondern schickt ein leeres
Endpoint (no-speech) → App re-armt still, kein Phantom-Turn. Manueller Stop
(stream_end) ist ausgenommen (bewusst gesprochen, kurze Woerter ok).
Deploy: docker compose up -d --build voxtral-bridge.
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
Voxtral-STT-3B-Satellit (Transformers)
Streaming-STT via Voxtral-Mini-3B-2507 (Mistral, Apache 2.0) über 🤗 Transformers. Ersetzt whisper als STT — genauer, und ohne Treiber-Upgrade: läuft auf dem Trixie-Standardtreiber (550/CUDA 12.4) via torch 2.6.0+cu124 (derselbe Trick wie bei f5tts).
- Modell ~9 GB (bf16) → GPU 1 (die 12-GB-Karte; per Compose gepinnt).
- F5-TTS + LLM bleiben auf GPU 0 (8 GB).
- Arbeitsweise = chunked wie whisper: live PCM → alle ~1 s transkribieren
(Partials) → adaptiver Endpointer (Rausch-Boden-VAD + semantische
Stagnation, aus M0.1) feuert
stt_endpoint. RVS-Protokoll identisch → drop-in.
Starten (Profil voxtral)
cd xtts
docker compose stop whisper-bridge # sonst beantworten beide stt_*
docker compose --profile voxtral up -d --build
docker logs -f aria-voxtral-bridge # Modell laedt (mehrere GB), dann "RVS verbunden"
Zurück zu whisper: docker compose --profile voxtral down && docker compose up -d whisper-bridge.
⚠️ Auf echter Hardware verifizieren (blind gebaut)
- Transformers-API. Die exakte Voxtral-Transkriptions-API ist in
bridge.pyin einer Methode gekapselt (VoxtralRunner._transcribe_blocking), modelliert nach der HF-Modelcard (apply_transcription_request→generate→batch_decode). Beim ersten Lauf gegen die Modelcard prüfen und dort anpassen. - HF-Gating. Ist
Voxtral-Mini-3B-2507gated,HF_TOKENinxtts/.envsetzen (wird alsHUGGING_FACE_HUB_TOKENdurchgereicht). - VRAM/Tempo. 3B in bf16 ~9 GB auf der 12-GB-Karte — Rest fürs KV-Cache. Ist die
Partial-Transkription (alle 1 s) zu schwer,
STREAM_TRANSCRIBE_INTERVAL_MShochsetzen. - torch-Konflikt. Falls
transformers/mistral-commonbeim Build torch>2.6 erzwingen, meldet der Constraint einen Konflikt → dann brauchen wir doch das Treiber-Upgrade (bootstrap.sh --upgrade-drivervia NVIDIA-CUDA-Repo) + cu126-torch.
Protokoll (RVS, identisch zu whisper — drop-in)
Rein: stt_stream_start, stt_audio_chunk (16 kHz mono s16le, base64), stt_stream_end.
Raus: stt_partial, stt_endpoint, stt_stream_done.
TTS
Bleibt F5-TTS (klingt gut, passt auf GPU 0). Voxtral-TTS bräuchte ~24 GB — separates Thema.
Quellen
- Modell: https://huggingface.co/mistralai/Voxtral-Mini-3B-2507
- Transformers-Nutzung: HF-Modelcard (Voxtral) +
mistral-common