Files
ARIA-AGENT/xtts/voxtral
duffyduckandClaude Opus 4.8 f2ead1242f feat(compute): Worker-Selbstanmeldung ueber RVS + Flotten-Anzeige (Stage 2)
Jeder GPU-Dienst meldet sich beim Connect mit worker_hello {instanceId,
service, node, gpus, model} und haelt die Registry per periodischem
worker_ping {instanceId, busy} (~10s) frisch. So weiss ARIA, was wo laeuft.

- xtts/{voxtral,whisper,f5tts}/bridge.py + llm-adapter/adapter.py:
  INSTANCE_ID=service@NODE_NAME, _worker_register()-Coroutine (hello + ping),
  busy-Quelle je Worker (aktive STT-Sessions / TTS-Render / in-flight LLM);
  Task sauber gecancelt bei Reconnect.
- bridge/aria_bridge.py: self._workers-Registry + Handler worker_hello/
  worker_ping (spiegelt sat_hello), _worker_list() (35s-Offline-TTL),
  _pick_worker() (Round-Robin freie Instanz, fuer Stage-3-Routing),
  /internal/worker-list-Endpoint.
- diagnostic/server.js: workers-Map, worker_hello/worker_ping-Tracking,
  worker_update-Broadcast + worker_list-Action + on-connect-Snapshot.
- diagnostic/index.html: "Compute-Flotte"-Panel im Satelliten-Tab — pro Node
  gruppiert, mit Dienst/Modell/GPU und frei/beschaeftigt/offline-Status.

Stage 2 von 3. Reine Sichtbarkeit, kein Routing-Verhalten geaendert.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-09-18 12:22:47 +02:00
..

Voxtral-STT-3B-Satellit (Transformers)

Streaming-STT via Voxtral-Mini-3B-2507 (Mistral, Apache 2.0) über 🤗 Transformers. Ersetzt whisper als STT — genauer, und ohne Treiber-Upgrade: läuft auf dem Trixie-Standardtreiber (550/CUDA 12.4) via torch 2.6.0+cu124 (derselbe Trick wie bei f5tts).

  • Modell ~9 GB (bf16) → GPU 1 (die 12-GB-Karte; per Compose gepinnt).
  • F5-TTS + LLM bleiben auf GPU 0 (8 GB).
  • Arbeitsweise = chunked wie whisper: live PCM → alle ~1 s transkribieren (Partials) → adaptiver Endpointer (Rausch-Boden-VAD + semantische Stagnation, aus M0.1) feuert stt_endpoint. RVS-Protokoll identisch → drop-in.

Starten (Profil voxtral)

cd xtts
docker compose stop whisper-bridge          # sonst beantworten beide stt_*
docker compose --profile voxtral up -d --build
docker logs -f aria-voxtral-bridge          # Modell laedt (mehrere GB), dann "RVS verbunden"

Zurück zu whisper: docker compose --profile voxtral down && docker compose up -d whisper-bridge.

⚠️ Auf echter Hardware verifizieren (blind gebaut)

  1. Transformers-API. Die exakte Voxtral-Transkriptions-API ist in bridge.py in einer Methode gekapselt (VoxtralRunner._transcribe_blocking), modelliert nach der HF-Modelcard (apply_transcription_requestgeneratebatch_decode). Beim ersten Lauf gegen die Modelcard prüfen und dort anpassen.
  2. HF-Gating. Ist Voxtral-Mini-3B-2507 gated, HF_TOKEN in xtts/.env setzen (wird als HUGGING_FACE_HUB_TOKEN durchgereicht).
  3. VRAM/Tempo. 3B in bf16 ~9 GB auf der 12-GB-Karte — Rest fürs KV-Cache. Ist die Partial-Transkription (alle 1 s) zu schwer, STREAM_TRANSCRIBE_INTERVAL_MS hochsetzen.
  4. torch-Konflikt. Falls transformers/mistral-common beim Build torch>2.6 erzwingen, meldet der Constraint einen Konflikt → dann brauchen wir doch das Treiber-Upgrade (bootstrap.sh --upgrade-driver via NVIDIA-CUDA-Repo) + cu126-torch.

Protokoll (RVS, identisch zu whisper — drop-in)

Rein: stt_stream_start, stt_audio_chunk (16 kHz mono s16le, base64), stt_stream_end. Raus: stt_partial, stt_endpoint, stt_stream_done.

TTS

Bleibt F5-TTS (klingt gut, passt auf GPU 0). Voxtral-TTS bräuchte ~24 GB — separates Thema.

Quellen