Voxtral hatte 0 Speaker-Filter (mit Voxtral reagierte ARIA auf JEDE Stimme). Jetzt portiert aus der whisper-Bridge: speaker_id.py (ECAPA/speechbrain) kopiert, Einmal-Check auf die ersten 1.5s (fremde Stimme → leeres stt_endpoint reason=speaker_mismatch, kein Transcribe/Brain), voice_id_enroll/status/delete-RVS-Handler + voiceIdThreshold-config. voice-id-Volume gemountet, speechbrain in requirements. Ohne Enrollment fail-open. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
11 lines
413 B
Plaintext
11 lines
413 B
Plaintext
# Voxtral-3B via Transformers. torch/torchaudio kommen cu124-gepinnt aus dem
|
|
# Dockerfile (nicht hier, sonst zieht pip das Default-CUDA-Wheel).
|
|
transformers>=4.54
|
|
mistral-common[audio]>=1.8.1
|
|
accelerate>=0.30
|
|
speechbrain>=1.0 # Speaker-ID (ECAPA-TDNN) — nur Stefans Stimme
|
|
soundfile>=0.12
|
|
librosa>=0.10 # VoxtralProcessor.load_audio_as nutzt librosa zum WAV-Laden
|
|
numpy>=1.24
|
|
websockets>=12.0
|