Backports brachte keinen neueren Treiber (bleibt 550/CUDA 12.4). Statt Upgrade: Voxtral-Mini-3B-2507 via Transformers mit torch 2.6.0+cu124 (F5-Trick) — laeuft auf 550, ~9 GB bf16 auf GPU 1. Chunked wie whisper mit dem adaptiven M0.1-Endpointer, RVS-Protokoll identisch (drop-in). Ersetzt den vLLM-Realtime-4B-Ansatz (der brauchte 16 GB). Compose: ein Container, GPU-1-gepinnt, Profil 'voxtral'. Transformers-API in einer Methode gekapselt (verify-on-run). Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
9 lines
254 B
Plaintext
9 lines
254 B
Plaintext
# Voxtral-3B via Transformers. torch/torchaudio kommen cu124-gepinnt aus dem
|
|
# Dockerfile (nicht hier, sonst zieht pip das Default-CUDA-Wheel).
|
|
transformers>=4.54
|
|
mistral-common[audio]>=1.8.1
|
|
accelerate>=0.30
|
|
soundfile>=0.12
|
|
numpy>=1.24
|
|
websockets>=12.0
|