|
|
|
@@ -94,6 +94,24 @@ _HALLUCINATION_RE = re.compile(
|
|
|
|
|
re.IGNORECASE,
|
|
|
|
|
)
|
|
|
|
|
|
|
|
|
|
# Kollabiert unmittelbar wiederholte Phrasen (Voxtral-Repetition-Loop) auf EINE
|
|
|
|
|
# Kopie. Zweites Netz hinter no_repeat_ngram in der Generation. Phrase 5-80 Zeichen,
|
|
|
|
|
# 3+ mal hintereinander → eine. Kurze legitime Doppelungen ('ja ja', 'sehr sehr')
|
|
|
|
|
# bleiben (Unit < 5 Zeichen bzw. < 3 Wiederholungen).
|
|
|
|
|
_REPEAT_RE = re.compile(r"(.{5,80}?)(?:\s*\1){2,}", re.IGNORECASE | re.DOTALL)
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
def _collapse_repetitions(text: str) -> str:
|
|
|
|
|
if not text:
|
|
|
|
|
return text
|
|
|
|
|
out = text
|
|
|
|
|
for _ in range(3): # mehrfach fuer verschachtelte/ungleiche Loops
|
|
|
|
|
new = _REPEAT_RE.sub(r"\1", out)
|
|
|
|
|
if new == out:
|
|
|
|
|
break
|
|
|
|
|
out = new
|
|
|
|
|
return out.strip()
|
|
|
|
|
|
|
|
|
|
# Speaker-ID Gating global an/aus. DEFAULT AUS (fail-open) — die "nur meine Stimme"-
|
|
|
|
|
# Pruefung ist ein BEWUSSTER Schalter, kein Automatismus: ein einziger schlechter
|
|
|
|
|
# Enroll darf nie die ganze STT lahmlegen (genau das ist passiert). Wird per config-
|
|
|
|
@@ -162,7 +180,20 @@ class VoxtralRunner:
|
|
|
|
|
with torch.no_grad():
|
|
|
|
|
# hoch genug fuer lange Diktate (stoppt eh am EOS); 512 hat
|
|
|
|
|
# mehrminutige Aufnahmen abgeschnitten.
|
|
|
|
|
outputs = model.generate(**inputs, max_new_tokens=4096)
|
|
|
|
|
# Repetition-Bremse: Voxtral kippt bei Stille/Rauschen am Ende
|
|
|
|
|
# gern in eine Schleife und wiederholt einen Satz zig-mal
|
|
|
|
|
# ("Vergiss das, das ist nur... Vergiss das, das ist nur..."
|
|
|
|
|
# x15). no_repeat_ngram_size=4 laesst die ERSTE echte Nennung
|
|
|
|
|
# durch, verbietet aber die exakte 4-Gramm-Wiederholung → Loop
|
|
|
|
|
# bricht ab; repetition_penalty daempft zusaetzlich. Beides mild,
|
|
|
|
|
# damit normale Sprache (auch mal ein doppeltes Wort) unberuehrt
|
|
|
|
|
# bleibt.
|
|
|
|
|
outputs = model.generate(
|
|
|
|
|
**inputs,
|
|
|
|
|
max_new_tokens=4096,
|
|
|
|
|
no_repeat_ngram_size=4,
|
|
|
|
|
repetition_penalty=1.15,
|
|
|
|
|
)
|
|
|
|
|
trimmed = outputs[:, inputs.input_ids.shape[1]:]
|
|
|
|
|
text = proc.batch_decode(trimmed, skip_special_tokens=True)
|
|
|
|
|
return (text[0] if text else "").strip()
|
|
|
|
@@ -428,6 +459,17 @@ class SessionManager:
|
|
|
|
|
})
|
|
|
|
|
else:
|
|
|
|
|
self._update_noise_floor(sess, rms)
|
|
|
|
|
# No-Speech-Timeout: wurde die GANZE Zeit KEINE Stimme erkannt
|
|
|
|
|
# (last_voice_at==0), feuert der normale Endpoint unten NIE — der braucht
|
|
|
|
|
# last_voice_at>0. Ohne das bleibt ein reines Stille-Fenster offen bis
|
|
|
|
|
# Hardcap/manuellem Stop → genau Stefans Repro: "die Stille-Ende wird nie
|
|
|
|
|
# erreicht, stop ich selbst ist es weg". Nach endpoint_ms Stille ab Start
|
|
|
|
|
# schliessen wir das Fenster selbst als no-speech (leer, lautlos, zurueck
|
|
|
|
|
# aufs Wake-Word). voiced_frames==0 → _finalize verwirft ohne Transkript,
|
|
|
|
|
# also KEIN Phantom.
|
|
|
|
|
if sess.last_voice_at == 0 and (now - sess.started_at) * 1000.0 >= sess.endpoint_ms:
|
|
|
|
|
await self._finalize(sess, "no_speech")
|
|
|
|
|
return
|
|
|
|
|
# Endpoint: hat der User schon gesprochen UND ist es seit endpoint_ms still?
|
|
|
|
|
if sess.last_voice_at > 0 and (now - sess.last_voice_at) * 1000.0 >= sess.endpoint_ms:
|
|
|
|
|
await self._finalize(sess, "endpoint")
|
|
|
|
@@ -474,6 +516,12 @@ class SessionManager:
|
|
|
|
|
final_text = sess.last_partial
|
|
|
|
|
stt_ms = int((time.time() - t0) * 1000)
|
|
|
|
|
duration_s = audio.size / 16000.0
|
|
|
|
|
# Repetition-Loop einkassieren, falls trotz no_repeat_ngram was durchkam.
|
|
|
|
|
_collapsed = _collapse_repetitions(final_text)
|
|
|
|
|
if _collapsed != final_text:
|
|
|
|
|
logger.info("Stream %s: Repetition-Loop kollabiert (%d→%d Zeichen)",
|
|
|
|
|
sess.request_id[:8], len(final_text), len(_collapsed))
|
|
|
|
|
final_text = _collapsed
|
|
|
|
|
logger.info("Stream %s: FINAL (reason=%s, %.1fs, %dms): %r",
|
|
|
|
|
sess.request_id[:8], reason, duration_s, stt_ms, final_text[:120])
|
|
|
|
|
|
|
|
|
|