From 0aac114142960abc8b0d4d8fee37605a9cd9af29 Mon Sep 17 00:00:00 2001 From: duffyduck Date: Sat, 15 Aug 2026 11:16:50 +0200 Subject: [PATCH] fix(voxtral): PYTORCH_CUDA_ALLOC_CONF=expandable_segments gegen VRAM-OOM Modell laedt knapp nicht (12GB-Karte hatte 3.13GB durch Fremdprozess belegt). Anti-Fragmentierungs-Schalter reduziert den Peak-Bedarf beim Warmup; zusaetzlich muss GPU 1 frei sein (whisper stoppen). Co-Authored-By: Claude Opus 4.8 --- xtts/docker-compose.yml | 1 + 1 file changed, 1 insertion(+) diff --git a/xtts/docker-compose.yml b/xtts/docker-compose.yml index db4950f..957c79b 100644 --- a/xtts/docker-compose.yml +++ b/xtts/docker-compose.yml @@ -166,4 +166,5 @@ services: - VOXTRAL_MODEL=mistralai/Voxtral-Mini-3B-2507 - VOXTRAL_LANGUAGE=${WHISPER_LANGUAGE:-de} - HUGGING_FACE_HUB_TOKEN=${HF_TOKEN:-} # falls das Modell HF-gated ist + - PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True # weniger VRAM-Fragmentierung restart: unless-stopped