# Voxtral-3B via Transformers. torch/torchaudio kommen cu124-gepinnt aus dem # Dockerfile (nicht hier, sonst zieht pip das Default-CUDA-Wheel). transformers>=4.54 mistral-common[audio]>=1.8.1 accelerate>=0.30 soundfile>=0.12 librosa>=0.10 # VoxtralProcessor.load_audio_as nutzt librosa zum WAV-Laden numpy>=1.24 websockets>=12.0