Compare commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
ff1205eb6b | ||
|
|
d12f67320b | ||
|
|
24a1b4d837 | ||
|
|
db96258f7d | ||
|
|
becc83d9e3 | ||
|
|
44220edbd1 | ||
|
|
fc13957000 | ||
|
|
60580fd67e | ||
|
|
2d83e4ad8b | ||
|
|
629a3d82ac | ||
|
|
9bb90a777a | ||
|
|
c3bb7985a2 | ||
|
|
debd96b16f | ||
|
|
486d7dedbb | ||
|
|
d5bcbb4814 | ||
|
|
54ebd57990 | ||
|
|
fb06ed928c | ||
|
|
08bb257791 | ||
|
|
44982a9b3c | ||
|
|
ddb1bfac6a | ||
|
|
4605698b02 | ||
|
|
1c11cb6a2f |
@@ -79,8 +79,8 @@ android {
|
||||
applicationId "com.ariacockpit"
|
||||
minSdkVersion rootProject.ext.minSdkVersion
|
||||
targetSdkVersion rootProject.ext.targetSdkVersion
|
||||
versionCode 20101
|
||||
versionName "0.2.1.1"
|
||||
versionCode 20104
|
||||
versionName "0.2.1.4"
|
||||
// Fallback fuer Libraries mit Product Flavors
|
||||
missingDimensionStrategy 'react-native-camera', 'general'
|
||||
}
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
{
|
||||
"name": "aria-cockpit",
|
||||
"version": "0.2.1.1",
|
||||
"version": "0.2.1.4",
|
||||
"private": true,
|
||||
"scripts": {
|
||||
"android": "react-native run-android",
|
||||
|
||||
@@ -121,13 +121,20 @@ const QRScanner: React.FC<QRScannerProps> = ({ visible, onScan, onClose }) => {
|
||||
<View style={styles.container}>
|
||||
{hasPermission ? (
|
||||
<>
|
||||
{/* react-native-camera-kit v13: die .d.ts markiert viele OPTIONALE
|
||||
CameraScreen-Props faelschlich als required (defaultProps fuellen
|
||||
sie zur Laufzeit) und kennt colorForScannerFrame nicht — der war
|
||||
ein No-Op und ist raus. scanBarcode/onReadCode ist die korrekte
|
||||
v13-Barcode-API. Props als any spreaden, um die kaputten Lib-Typen
|
||||
zu umgehen, ohne echten Code zu veraendern. */}
|
||||
<CameraScreen
|
||||
scanBarcode={true}
|
||||
onReadCode={handleBarcodeScan}
|
||||
showFrame={true}
|
||||
frameColor="#0096FF"
|
||||
laserColor="#0096FF"
|
||||
colorForScannerFrame="#0096FF"
|
||||
{...({
|
||||
scanBarcode: true,
|
||||
onReadCode: handleBarcodeScan,
|
||||
showFrame: true,
|
||||
frameColor: '#0096FF',
|
||||
laserColor: '#0096FF',
|
||||
} as any)}
|
||||
/>
|
||||
|
||||
{/* Overlay oben */}
|
||||
|
||||
@@ -338,6 +338,10 @@ const ChatScreen: React.FC = () => {
|
||||
// bliebe canPlay auf dem Mount-Initial-Wert haengen (mute ignoriert,
|
||||
// oder AsyncStorage-Load nicht beruecksichtigt).
|
||||
const ttsCanPlayRef = useRef<boolean>(true);
|
||||
// Letzte Antwort: nach dem Vorlesen 30s weiterlauschen (Gespraech) oder direkt
|
||||
// stoppen? Kommt als 'converse' in der Chat-Payload; onPlaybackFinished liest
|
||||
// es. Default true (Konversation). false = Einzelaktion/Skill-Antwort.
|
||||
const converseRef = useRef<boolean>(true);
|
||||
|
||||
const flatListRef = useRef<FlatList>(null);
|
||||
const messageIdCounter = useRef(0);
|
||||
@@ -990,6 +994,7 @@ const ChatScreen: React.FC = () => {
|
||||
// file_from_aria: ARIA hat eine Datei rausgegeben → als ARIA-Bubble anzeigen
|
||||
if (message.type === 'file_from_aria') {
|
||||
const p = message.payload || {};
|
||||
const sp = (p.serverPath as string) || '';
|
||||
const ariaMsg: ChatMessage = {
|
||||
id: nextId(),
|
||||
sender: 'aria',
|
||||
@@ -1000,10 +1005,20 @@ const ChatScreen: React.FC = () => {
|
||||
name: (p.name as string) || 'datei',
|
||||
size: (p.size as number) || 0,
|
||||
mimeType: (p.mimeType as string) || '',
|
||||
serverPath: (p.serverPath as string) || '',
|
||||
serverPath: sp,
|
||||
}],
|
||||
};
|
||||
setMessages(prev => capMessages([...prev, ariaMsg]));
|
||||
setMessages(prev => {
|
||||
// Falls die Chat-Bubble mit dieser Datei schon da ist (Event-Reihen-
|
||||
// folge kann variieren, und die chat-Payload traegt die files jetzt
|
||||
// selbst), keine doppelte Solo-Bubble anlegen.
|
||||
if (sp && prev.some(m =>
|
||||
m.sender === 'aria' && m.attachments?.some(a => a.serverPath === sp)
|
||||
)) {
|
||||
return prev;
|
||||
}
|
||||
return capMessages([...prev, ariaMsg]);
|
||||
});
|
||||
return;
|
||||
}
|
||||
|
||||
@@ -1152,26 +1167,53 @@ const ChatScreen: React.FC = () => {
|
||||
|
||||
const text = (message.payload.text as string) || '';
|
||||
const ts = message.timestamp;
|
||||
// ARIA-Dateien, die DIREKT an dieser Chat-Bubble haengen (Bridge schickt
|
||||
// sie jetzt in der chat-Payload mit — vorher kamen sie nur als separates
|
||||
// file_from_aria-Event, wodurch der Anhang live nicht an der Nachricht
|
||||
// erschien, sondern erst nach einem Seitenwechsel/Reload).
|
||||
const incomingFiles = Array.isArray((message.payload as any).files)
|
||||
? (message.payload as any).files as Array<any> : [];
|
||||
const fileAttachments: Attachment[] = incomingFiles.map(f => ({
|
||||
type: (typeof f.mimeType === 'string' && f.mimeType.startsWith('image/')) ? 'image' : 'file',
|
||||
name: f.name || 'datei',
|
||||
size: f.size || 0,
|
||||
mimeType: f.mimeType || '',
|
||||
serverPath: f.serverPath || '',
|
||||
}));
|
||||
const incomingPaths = new Set(
|
||||
fileAttachments.map(a => a.serverPath).filter(Boolean) as string[]
|
||||
);
|
||||
// Duplikat-Schutz: gleicher Text innerhalb 5s ignorieren
|
||||
setMessages(prev => {
|
||||
const isDuplicate = prev.some(m =>
|
||||
m.sender === 'aria' && m.text === text && Math.abs(m.timestamp - ts) < 5000
|
||||
);
|
||||
if (isDuplicate) return prev;
|
||||
const payloadAtts = (message.payload.attachments as Attachment[] | undefined) || [];
|
||||
const mergedAtts = [...payloadAtts, ...fileAttachments];
|
||||
const ariaMsg: ChatMessage = {
|
||||
id: nextId(),
|
||||
sender: 'aria',
|
||||
text,
|
||||
timestamp: ts,
|
||||
attachments: message.payload.attachments as Attachment[] | undefined,
|
||||
attachments: mergedAtts.length ? mergedAtts : undefined,
|
||||
messageId: (message.payload.messageId as string) || undefined,
|
||||
backupTs: (message.payload.backupTs as number) || undefined,
|
||||
projectId: ((message.payload as any).projectId as string) || '',
|
||||
answeredBy: ((message.payload as any).answeredBy as string) || '',
|
||||
};
|
||||
// Die separate file_from_aria-Bubble (leerer Text, nur Datei), die kurz
|
||||
// zuvor fuer DIESE Datei ankam, entfernen — sonst doppelt (einmal solo,
|
||||
// einmal an der Text-Bubble). Nur solche mit passendem serverPath.
|
||||
const deduped = incomingPaths.size
|
||||
? prev.filter(m => !(
|
||||
m.sender === 'aria' && !m.text && (m.attachments?.length) &&
|
||||
m.attachments.every(a => a.serverPath && incomingPaths.has(a.serverPath))
|
||||
))
|
||||
: prev;
|
||||
// ARIA hat geantwortet → alle User-Bubbles davor als 'delivered'
|
||||
// markieren (WhatsApp-Doppelhaken ✓✓). Brain hat sie verarbeitet.
|
||||
return capMessages([...prev, ariaMsg]).map(m =>
|
||||
return capMessages([...deduped, ariaMsg]).map(m =>
|
||||
m.sender === 'user'
|
||||
&& (m.deliveryStatus === 'sent' || m.deliveryStatus === 'sending')
|
||||
? { ...m, deliveryStatus: 'delivered' }
|
||||
@@ -1213,6 +1255,9 @@ const ChatScreen: React.FC = () => {
|
||||
// ODER local). Ein Antwort-Skill (speak=true) faellt NICHT hierunter —
|
||||
// der wird vorgelesen + haelt das Gespraech offen. Kein answeredBy-
|
||||
// Fallback mehr: die Bridge schickt speak zuverlaessig mit.
|
||||
// Merken ob nach dem Vorlesen 30s weiterlauschen (Gespraech) oder direkt
|
||||
// stoppen — onPlaybackFinished liest converseRef. Default true.
|
||||
converseRef.current = (message.payload as any).converse !== false;
|
||||
const _isSilent = (message.payload as any).speak === false;
|
||||
if (_isSilent && wakeWordService.isConversing()) {
|
||||
// Klarer Steuerbefehl (Liedersteuerung etc.) = KEINE Konversation →
|
||||
@@ -1451,8 +1496,10 @@ const ChatScreen: React.FC = () => {
|
||||
// Gespraech (gesprochene Antwort): KEIN neuer Gong / kein Aufnahme-Fenster,
|
||||
// sondern direkt passives Lauschen (30s weiterreden wie mit einem Menschen).
|
||||
// Im Hintergrund gibt's kein Multi-Turn → direkt re-armen (skipPassive).
|
||||
// converse=false (Skill-/Einzelantwort, z.B. 'was laeuft gerade') → auch
|
||||
// ohne 30s: vorlesen + direkt zurueck aufs Wake-Word.
|
||||
const bg = AppState.currentState !== 'active';
|
||||
wakeWordService.endConversation(bg).catch(() => {});
|
||||
wakeWordService.endConversation(bg || !converseRef.current).catch(() => {});
|
||||
});
|
||||
return () => unsubPlayback();
|
||||
}, []);
|
||||
@@ -1528,9 +1575,15 @@ const ChatScreen: React.FC = () => {
|
||||
} else {
|
||||
// Kein Speech im Window → Konversation beenden
|
||||
console.log('[Chat] STT-Endpoint ohne Text (reason=%s) — endConversation', ev.reason);
|
||||
// Placeholder-Bubble wieder weg
|
||||
// NUR den noch UNAUFGELOESTEN Platzhalter entfernen. Nach manuellem Stop
|
||||
// klappt oft ein zweites, LEERES stream_end-Endpoint nach (das Audio war
|
||||
// schon vom echten Endpoint transkribiert) — das darf die bereits mit
|
||||
// dem STT-Text gefuellte Bubble NICHT loeschen, sonst verschwindet die
|
||||
// Sprachnachricht obwohl ARIA schon an der Antwort arbeitet.
|
||||
if (ev.audioRequestId) {
|
||||
setMessages(prev => prev.filter(m => m.audioRequestId !== ev.audioRequestId));
|
||||
setMessages(prev => prev.filter(m =>
|
||||
!(m.audioRequestId === ev.audioRequestId
|
||||
&& m.text.includes('Spracheingabe wird verarbeitet'))));
|
||||
}
|
||||
// Bei Passive-Listen + speaker_mismatch oder no-speech: erneut passiv
|
||||
// lauschen (Timer im wakeword-service laeuft weiter, regelt das Ende).
|
||||
@@ -1942,49 +1995,6 @@ const ChatScreen: React.FC = () => {
|
||||
}, timeoutMs);
|
||||
}, []);
|
||||
|
||||
const sendTextMessage = useCallback(async () => {
|
||||
const text = inputText.trim();
|
||||
|
||||
// Wenn pending Anhaenge vorhanden → Anhaenge + Text zusammen senden
|
||||
if (pendingAttachments.length > 0) {
|
||||
sendPendingAttachments(text);
|
||||
return;
|
||||
}
|
||||
|
||||
if (!text) return;
|
||||
|
||||
setInputText('');
|
||||
|
||||
// Barge-In: laufende ARIA-Aktivitaet abbrechen wenn welche da ist.
|
||||
const wasInterrupted = interruptAriaIfBusy();
|
||||
const location = await getCurrentLocation();
|
||||
|
||||
const cmid = nextClientMsgId();
|
||||
const activePid = focusedProjectIdRef.current;
|
||||
const userMsg: ChatMessage = {
|
||||
id: nextId(),
|
||||
sender: 'user',
|
||||
text,
|
||||
timestamp: Date.now(),
|
||||
clientMsgId: cmid,
|
||||
deliveryStatus: connectionStateRef.current === 'connected' ? 'sending' : 'queued',
|
||||
sendAttempts: 1,
|
||||
projectId: activePid,
|
||||
};
|
||||
setMessages(prev => capMessages([...prev, userMsg]));
|
||||
|
||||
console.log('[Chat] sende cmid=%s voice=%s speed=%s interrupted=%s project=%s',
|
||||
cmid, localXttsVoiceRef.current || '(default)', ttsSpeedRef.current, wasInterrupted, activePid || '(main)');
|
||||
dispatchWithAck(cmid, 'chat', {
|
||||
text,
|
||||
voice: localXttsVoiceRef.current,
|
||||
speed: ttsSpeedRef.current,
|
||||
interrupted: wasInterrupted,
|
||||
projectId: activePid,
|
||||
...(location && { location }),
|
||||
});
|
||||
}, [inputText, getCurrentLocation, pendingAttachments, sendPendingAttachments, interruptAriaIfBusy, dispatchWithAck]);
|
||||
|
||||
// Anfrage abbrechen — nur den fokussierten Kontext (kontext-scoped Cancel).
|
||||
const cancelRequest = useCallback(() => {
|
||||
const pid = focusedProjectIdRef.current || '';
|
||||
@@ -2070,6 +2080,16 @@ const ChatScreen: React.FC = () => {
|
||||
// forwarded direkt an Brain. Im wake-word-conversing-Fall zusaetzlich
|
||||
// endConversation: User hat explizit gestoppt → kein Multi-Turn-Resume.
|
||||
const handleVoiceButtonStop = useCallback(async (): Promise<void> => {
|
||||
// Stop WAEHREND des passiven 30s-Lauschens ('listening'): sauber beenden
|
||||
// (zurueck aufs Wake-Word), NICHT den passiven Stream neu starten.
|
||||
// exitPassiveListening cancelt den Stream selbst (via _freeMic) → es feuert
|
||||
// kein leeres Endpoint, das startPassiveStreamingRecording erneut ausloest
|
||||
// (genau das liess die 30s vorher von vorne loslaufen).
|
||||
if (wakeWordService.getState() === 'listening') {
|
||||
console.log('[Chat] Manueller Stop im Passiv-Lauschen → exitPassiveListening (Ende)');
|
||||
await wakeWordService.exitPassiveListening('manual');
|
||||
return;
|
||||
}
|
||||
await audioService.stopStreamingRecording('user');
|
||||
if (wakeWordService.isConversing()) {
|
||||
console.log('[Chat] Manueller Stop in Konversation → endConversation, zurueck zu armed');
|
||||
@@ -2181,6 +2201,53 @@ const ChatScreen: React.FC = () => {
|
||||
setInputText('');
|
||||
}, [pendingAttachments, getCurrentLocation, dispatchWithAck]);
|
||||
|
||||
// Reine Text-Nachricht senden. Steht bewusst NACH interruptAriaIfBusy und
|
||||
// sendPendingAttachments — beide stehen in seinem deps-Array, und wenn es
|
||||
// davor deklariert waere, laendeten sie dort in der Temporal Dead Zone
|
||||
// (tsc TS2448/2454; lief nur zufaellig, weil Babel const→var hebt).
|
||||
const sendTextMessage = useCallback(async () => {
|
||||
const text = inputText.trim();
|
||||
|
||||
// Wenn pending Anhaenge vorhanden → Anhaenge + Text zusammen senden
|
||||
if (pendingAttachments.length > 0) {
|
||||
sendPendingAttachments(text);
|
||||
return;
|
||||
}
|
||||
|
||||
if (!text) return;
|
||||
|
||||
setInputText('');
|
||||
|
||||
// Barge-In: laufende ARIA-Aktivitaet abbrechen wenn welche da ist.
|
||||
const wasInterrupted = interruptAriaIfBusy();
|
||||
const location = await getCurrentLocation();
|
||||
|
||||
const cmid = nextClientMsgId();
|
||||
const activePid = focusedProjectIdRef.current;
|
||||
const userMsg: ChatMessage = {
|
||||
id: nextId(),
|
||||
sender: 'user',
|
||||
text,
|
||||
timestamp: Date.now(),
|
||||
clientMsgId: cmid,
|
||||
deliveryStatus: connectionStateRef.current === 'connected' ? 'sending' : 'queued',
|
||||
sendAttempts: 1,
|
||||
projectId: activePid,
|
||||
};
|
||||
setMessages(prev => capMessages([...prev, userMsg]));
|
||||
|
||||
console.log('[Chat] sende cmid=%s voice=%s speed=%s interrupted=%s project=%s',
|
||||
cmid, localXttsVoiceRef.current || '(default)', ttsSpeedRef.current, wasInterrupted, activePid || '(main)');
|
||||
dispatchWithAck(cmid, 'chat', {
|
||||
text,
|
||||
voice: localXttsVoiceRef.current,
|
||||
speed: ttsSpeedRef.current,
|
||||
interrupted: wasInterrupted,
|
||||
projectId: activePid,
|
||||
...(location && { location }),
|
||||
});
|
||||
}, [inputText, getCurrentLocation, pendingAttachments, sendPendingAttachments, interruptAriaIfBusy, dispatchWithAck]);
|
||||
|
||||
// --- Rendering ---
|
||||
|
||||
const renderMessage = ({ item }: { item: ChatMessage }) => {
|
||||
|
||||
+239
-30
@@ -237,19 +237,38 @@ META_TOOLS = [
|
||||
"speak": {
|
||||
"type": "boolean",
|
||||
"description": (
|
||||
"Soll die Antwort dieses Skills VORGELESEN werden (TTS)? "
|
||||
"Default false. \n"
|
||||
"- false = reiner STEUERBEFEHL (Spotify next/pause, Licht, "
|
||||
"Rollade): es gibt nichts vorzulesen, die App beendet direkt "
|
||||
"und lauscht wieder aufs Wake-Word (knackig, wie ein "
|
||||
"Kommando).\n"
|
||||
"- true = ANTWORT-Skill: das Ergebnis ist eine Information, "
|
||||
"die Stefan HOEREN will (z.B. ein Wuerfelergebnis, ein "
|
||||
"Nachschlage-Wert, ein Status). Dann wird die Antwort "
|
||||
"vorgelesen und das Gespraechs-Fenster bleibt offen.\n"
|
||||
"Gilt fuer Fast-Path UND wenn das lokale LLM den Skill "
|
||||
"aufruft. Im Zweifel bei Kommandos false, bei "
|
||||
"Frage-Antwort-Skills true."
|
||||
"STATISCHER Default fuers Vorlesen dieses Skills (TTS). "
|
||||
"Default false.\n\n"
|
||||
"WARUM es das gibt: ARIA ist voice-first. Ein reiner "
|
||||
"STEUERBEFEHL (Spotify next/pause, Licht an) muss NICHT "
|
||||
"vorgelesen werden — die Aktion selbst ist die Bestaetigung, "
|
||||
"Vorlesen waere nervig. Ein ANTWORT-Skill dagegen liefert "
|
||||
"eine Info, die Stefan HOEREN will (Wuerfelergebnis, Status, "
|
||||
"'was laeuft gerade'). Also: Kommando-Skill=false, "
|
||||
"Antwort-Skill=true.\n\n"
|
||||
"PRO AUFRUF (wichtig fuer gemischte Skills!): Wenn EIN Skill "
|
||||
"beides kann (z.B. Spotify: 'next' = stumm, 'was laeuft' = "
|
||||
"vorlesen), kann dein run.py im JSON-Output pro Aufruf "
|
||||
"`speak` (und `converse`, s.u.) setzen — das ueberschreibt "
|
||||
"diesen statischen Default. Beispiel-Output:\n"
|
||||
" next -> {\"ok\":true,\"speak\":false,\"converse\":false}\n"
|
||||
" was_laeuft -> {\"ok\":true,\"speak\":true,\"converse\":false,"
|
||||
"\"reply\":\"Laeuft: …\"}"
|
||||
),
|
||||
},
|
||||
"converse": {
|
||||
"type": "boolean",
|
||||
"description": (
|
||||
"Soll ARIA NACH dieser Skill-Antwort 30s WEITERLAUSCHEN "
|
||||
"(Dialog), oder direkt zurueck aufs Wake-Word? Default false.\n\n"
|
||||
"WARUM getrennt von speak: 'vorlesen' und 'weiterreden "
|
||||
"koennen' sind zwei verschiedene Dinge. 'was laeuft gerade' "
|
||||
"soll vorgelesen werden (speak=true), aber es ist eine "
|
||||
"abgeschlossene Einzel-Info — Stefan will danach NICHT ins "
|
||||
"30s-Mikrofon-Fenster gezwungen werden (converse=false). Nur "
|
||||
"wenn eine echte Rueckfrage/ein Dialog sinnvoll ist "
|
||||
"(converse=true). Am besten pro Aufruf im run.py-Output "
|
||||
"setzen (dynamisch), nicht statisch."
|
||||
),
|
||||
},
|
||||
},
|
||||
@@ -265,6 +284,27 @@ META_TOOLS = [
|
||||
"parameters": {"type": "object", "properties": {}},
|
||||
},
|
||||
},
|
||||
{
|
||||
"type": "function",
|
||||
"function": {
|
||||
"name": "skill_get",
|
||||
"description": (
|
||||
"Liest einen EXISTIERENDEN Skill VOLLSTAENDIG: Manifest (inkl. "
|
||||
"args, fast_patterns, speak/converse) + kompletter entry_code "
|
||||
"(der echte Python-Code) + README. IMMER vor `skill_update` "
|
||||
"aufrufen, damit du den bestehenden Code SIEHST und ihn gezielt "
|
||||
"aenderst statt blind zu ueberschreiben (Blind-Rewrite killt "
|
||||
"leicht funktionierende Teile!)."
|
||||
),
|
||||
"parameters": {
|
||||
"type": "object",
|
||||
"properties": {
|
||||
"name": {"type": "string", "description": "Skill-Name."},
|
||||
},
|
||||
"required": ["name"],
|
||||
},
|
||||
},
|
||||
},
|
||||
{
|
||||
"type": "function",
|
||||
"function": {
|
||||
@@ -331,8 +371,18 @@ META_TOOLS = [
|
||||
"speak": {
|
||||
"type": "boolean",
|
||||
"description": (
|
||||
"Vorlesen ja/nein (siehe skill_create). false = "
|
||||
"Steuerbefehl/stumm, true = Antwort-Skill/vorlesen."
|
||||
"Statischer Vorlese-Default (siehe skill_create). false = "
|
||||
"Steuerbefehl/stumm, true = Antwort-Skill/vorlesen. Pro "
|
||||
"Aufruf via run.py-JSON-Output ueberschreibbar."
|
||||
),
|
||||
},
|
||||
"converse": {
|
||||
"type": "boolean",
|
||||
"description": (
|
||||
"Statischer Default: nach der Antwort 30s weiterlauschen "
|
||||
"(Dialog=true) oder direkt zurueck aufs Wake-Word (false, "
|
||||
"Default). Siehe skill_create. Pro Aufruf via Output "
|
||||
"ueberschreibbar."
|
||||
),
|
||||
},
|
||||
},
|
||||
@@ -1064,6 +1114,56 @@ def _fold_umlauts(s: str) -> str:
|
||||
.replace("ß", "ss"))
|
||||
|
||||
|
||||
def _looks_like_skill_action(text: str) -> bool:
|
||||
"""Erkennt eine BEHAUPTETE Steuerbefehl-Quittung (v.a. Spotify) im Reply.
|
||||
Genutzt fuer den Anti-Halluzinations-Guard: sagt local sowas, hat aber KEIN
|
||||
Werkzeug gerufen, ist real nichts passiert → eskalieren. Bewusst eng, um
|
||||
normale Konversation ueber Musik nicht zu treffen."""
|
||||
t = (text or "").strip().lower()
|
||||
if not t:
|
||||
return False
|
||||
if t.startswith("spotify:") or t.startswith("spotify -") or t.startswith("musik:"):
|
||||
return True
|
||||
if "playlist" in t and ("abspiel" in t or "spiele" in t or "starte" in t):
|
||||
return True
|
||||
if ("ueberspring" in t or "überspring" in t) and ("titel" in t or "lied" in t or "song" in t):
|
||||
return True
|
||||
return False
|
||||
|
||||
|
||||
def _claims_live_media_state(text: str) -> bool:
|
||||
"""Erkennt eine BEHAUPTETE Live-Zustands-Auskunft, die NUR ein Werkzeug
|
||||
wissen kann: aktueller Song/Interpret, Restzeit, was gerade laeuft, welches
|
||||
Geraet spielt. local erfindet das gern (mal 'Midnight City von M83', mal
|
||||
'The House Of House') ohne run_spotify zu rufen. Ohne echten Skill-Aufruf ist
|
||||
das reine Halluzination → eskalieren (Claude ruft das Tool zuverlaessig).
|
||||
|
||||
Bewusst auf Medien-/Wiedergabe-Zustand begrenzt, damit normale Musik-
|
||||
Konversation ('ich mag M83') NICHT getroffen wird — es muss nach einer
|
||||
konkreten Ist-Zustands-Auskunft klingen."""
|
||||
t = (text or "").strip().lower()
|
||||
if not t:
|
||||
return False
|
||||
# Restzeit/Abspielposition ('noch 52 Sekunden', 'Restzeit 2:34').
|
||||
if "restzeit" in t or "restlaufzeit" in t:
|
||||
return True
|
||||
if re.search(r"\bnoch\s+\d+\s*(sekunde|minute|sek|min)", t):
|
||||
return True
|
||||
# 'aktueller Song/Titel/Lied heisst/ist …' / 'es laeuft gerade …' /
|
||||
# 'spielt gerade …' / 'jetzt laeuft …' — Ist-Zustands-Auskunft.
|
||||
if re.search(r"(aktuell\w*\s+(song|titel|lied|stueck|track))", t):
|
||||
return True
|
||||
if re.search(r"(l(ae|ä)uft|spielt)\s+(gerade|jetzt|aktuell|zurzeit|grade)", t):
|
||||
return True
|
||||
if re.search(r"(gerade|jetzt|zurzeit|grade)\s+(l(ae|ä)uft|spielt)", t):
|
||||
return True
|
||||
# Skip-Quittung, die einen konkreten Folgetitel behauptet ('… ist jetzt „X"').
|
||||
if ("ueberspring" in t or "übersprung" in t or "uebersprung" in t) and (
|
||||
"song" in t or "titel" in t or "lied" in t):
|
||||
return True
|
||||
return False
|
||||
|
||||
|
||||
def _normalize_for_fast_match(text: str) -> str:
|
||||
norm = _strip_leading_hint_blocks(text).lower()
|
||||
norm = _fold_umlauts(norm)
|
||||
@@ -1179,8 +1279,12 @@ class Agent:
|
||||
continue
|
||||
args = pat.get("args") or {}
|
||||
reply = pat.get("reply") or f"{skill_name}: ok"
|
||||
# Vorlesen? Folgt dem Skill-Manifest (Default False=Steuerbefehl).
|
||||
# Vorlesen/Weiterlauschen folgen dem Skill — GENAU wie bei local/
|
||||
# Claude: Manifest-Default, vom Skill-Output pro Aufruf ueber-
|
||||
# schreibbar. Also NICHT generell converse=False: ein Fast-Path-
|
||||
# Skill darf ein Dialog-Skill sein.
|
||||
self._fast_path_speak = bool(skill.get("speak", False))
|
||||
self._fast_path_converse = bool(skill.get("converse", False))
|
||||
logger.info("[fast-path] match skill=%s pattern=%r msg=%r",
|
||||
skill_name, rx, user_message[:60])
|
||||
try:
|
||||
@@ -1193,6 +1297,16 @@ class Agent:
|
||||
tail = (res.get("stderr") or res.get("stdout") or "").strip().splitlines()
|
||||
hint = (tail[-1] if tail else "")[:120]
|
||||
return f"{skill_name}: {reply} — Fehler: {hint or 'siehe Brain-Log'}"
|
||||
# Per-Aufruf-Override aus dem Skill-JSON-Output (falls vorhanden).
|
||||
try:
|
||||
_j = json.loads((res.get("stdout") or "").strip())
|
||||
if isinstance(_j, dict):
|
||||
if isinstance(_j.get("speak"), bool):
|
||||
self._fast_path_speak = _j["speak"]
|
||||
if isinstance(_j.get("converse"), bool):
|
||||
self._fast_path_converse = _j["converse"]
|
||||
except Exception:
|
||||
pass
|
||||
return reply
|
||||
return None
|
||||
|
||||
@@ -1248,11 +1362,10 @@ class Agent:
|
||||
break
|
||||
return tools
|
||||
|
||||
def _skill_speak_flag(self, tname: str) -> bool:
|
||||
"""speak-Flag eines run_*-Skills aus dem Manifest (Default False =
|
||||
Steuerbefehl/stumm). Loest run_-Name → Skill fuzzy auf (Bindestriche)."""
|
||||
def _resolve_skill_manifest(self, tname: str) -> Optional[dict]:
|
||||
"""run_-Toolname → Skill-Manifest (fuzzy, Bindestrich-Mapping)."""
|
||||
if not tname.startswith("run_"):
|
||||
return True
|
||||
return None
|
||||
suffix = tname[len("run_"):]
|
||||
m = skills_mod.read_manifest(suffix)
|
||||
if m is None:
|
||||
@@ -1261,7 +1374,28 @@ class Agent:
|
||||
if re.sub(r"[^a-zA-Z0-9_]", "_", cn) == suffix:
|
||||
m = cand
|
||||
break
|
||||
return bool((m or {}).get("speak", False))
|
||||
return m
|
||||
|
||||
def _skill_speak_flag(self, tname: str) -> bool:
|
||||
"""speak-Flag eines run_*-Skills aus dem Manifest (Default False)."""
|
||||
if not tname.startswith("run_"):
|
||||
return True
|
||||
return bool((self._resolve_skill_manifest(tname) or {}).get("speak", False))
|
||||
|
||||
def _skill_response_flags(self, tname: str) -> tuple:
|
||||
"""(speak, converse) fuer einen gerade ausgefuehrten run_*-Skill.
|
||||
Prioritaet: JSON-Output des Skills (self._last_skill_flags, pro Aufruf) >
|
||||
Manifest-Default > False. So kann EIN Skill pro Operation unterschiedlich
|
||||
sein — 'next' stumm/stop, 'was laeuft' vorlesen aber trotzdem stop."""
|
||||
flags = getattr(self, "_last_skill_flags", None) or {}
|
||||
m = self._resolve_skill_manifest(tname) or {}
|
||||
speak = bool(m.get("speak", False))
|
||||
converse = bool(m.get("converse", False))
|
||||
if isinstance(flags.get("speak"), bool):
|
||||
speak = flags["speak"]
|
||||
if isinstance(flags.get("converse"), bool):
|
||||
converse = flags["converse"]
|
||||
return speak, converse
|
||||
|
||||
def _try_local_fast_lane(self, user_message: str,
|
||||
active_project_id: str) -> Optional[str]:
|
||||
@@ -1273,9 +1407,28 @@ class Agent:
|
||||
# dem Manifest (Steuerbefehl-Skill=False → stumm, Antwort-Skill=True).
|
||||
# Info-Tools (web_search/memory_search/trigger_timer) lassen es bei True.
|
||||
self._local_turn_speak = True
|
||||
# Nach der Antwort 30s weiterlauschen? Default True (Gespraech/Info via
|
||||
# web_search). Ein run_*-Skill setzt es auf seinen Output-Wert (Default
|
||||
# False = Einzelaktion).
|
||||
self._local_turn_converse = True
|
||||
# Hat local in diesem Turn ueberhaupt einen echten Skill (run_*) gerufen?
|
||||
# Fuer den Anti-Halluzinations-Guard: behauptet local eine Spotify-/Skill-
|
||||
# Aktion OHNE das Tool zu rufen → eskalieren statt eine erfundene
|
||||
# Bestaetigung durchzulassen.
|
||||
self._local_ran_skill = False
|
||||
local_only = bool(cfg.get("localOnly"))
|
||||
local_model = cfg.get("localLlmModel") or "qwen3-8b" # B0.5: llama-swap-Key
|
||||
tools = self._build_local_tools() # B1b: kuratierte Tools
|
||||
# B1a-Rueckbau (bewusst): local ist TOOL-LOS — nur reines Reden. Ein 8B
|
||||
# ist ein unzuverlaessiger Tool-Caller: mit Werkzeug in der Hand erfindet
|
||||
# er lieber eine plausible Antwort ('der Song ist X'), statt das Tool zu
|
||||
# rufen — das war die Halo-Quelle UND zwang zu per-Skill-Guards. Ohne
|
||||
# Tools KANN er kein Skill-Ergebnis faelschen. Alles mit Grundwahrheit
|
||||
# (Fakt/Live-Zustand/Gedaechtnis/Aktion) gehoert an Claude oder an den
|
||||
# deterministischen Fast-Path — nicht an den 8B. WIE es dorthin kommt:
|
||||
# das Modell eskaliert SELBST (<<ESCALATE>>, siehe Prompt) — bewusst KEINE
|
||||
# Input-Wortliste im Router. Der Output-Guard unten faengt ab, wenn der
|
||||
# 8B doch mal statt zu eskalieren einen Live-Zustand behauptet.
|
||||
tools = []
|
||||
|
||||
sys_prompt = router_mod.build_local_system_prompt(IDENTITY_ANCHOR,
|
||||
has_tools=bool(tools))
|
||||
@@ -1324,7 +1477,9 @@ class Agent:
|
||||
# Turn das speak-Flag des Skills (Steuerbefehl=stumm,
|
||||
# Antwort-Skill=vorlesen). Letzter Skill gewinnt.
|
||||
if tname.startswith("run_") and not self._local_tool_failed(tname, tresult):
|
||||
self._local_turn_speak = self._skill_speak_flag(tname)
|
||||
self._local_turn_speak, self._local_turn_converse = \
|
||||
self._skill_response_flags(tname)
|
||||
self._local_ran_skill = True
|
||||
if self._local_tool_failed(tname, tresult):
|
||||
had_error = True
|
||||
messages.append({"role": "tool",
|
||||
@@ -1370,6 +1525,15 @@ class Agent:
|
||||
logger.info("[router] lokal eskaliert → Claude")
|
||||
return None
|
||||
|
||||
# Anti-Halluzination: local behauptet manchmal eine Musik-/Skill-Aktion
|
||||
# ('Spotify: …', 'Playlist … abspielen'), OHNE run_spotify gerufen zu
|
||||
# haben → es ist real nichts passiert. Dann eskalieren: Claude ruft das
|
||||
# Tool zuverlaessig. (Echte Skill-Ausfuehrung → _local_ran_skill=True.)
|
||||
if not self._local_ran_skill and (
|
||||
_looks_like_skill_action(final) or _claims_live_media_state(final)):
|
||||
logger.info("[router] lokal: Aktion/Live-Zustand behauptet ohne Tool-Call → Claude")
|
||||
return None
|
||||
|
||||
logger.info("[router] lokal beantwortet (%d Zeichen)", len(final))
|
||||
self.conversation.add("assistant", final, project_id=active_project_id)
|
||||
return final
|
||||
@@ -1422,7 +1586,9 @@ class Agent:
|
||||
# Vorlesen folgt dem Skill-Manifest (speak): Steuerbefehl=stumm,
|
||||
# Antwort-Skill=vorlesen. Default False (reiner Steuerbefehl).
|
||||
speak = bool(getattr(self, "_fast_path_speak", False))
|
||||
return fast_reply, "fast-path", speak
|
||||
# converse folgt dem Skill (Manifest/Output) — nicht mehr generell False.
|
||||
converse = bool(getattr(self, "_fast_path_converse", False))
|
||||
return fast_reply, "fast-path", speak, converse
|
||||
|
||||
# 1. User-Turn an die Konversation
|
||||
self.conversation.add("user", user_message, source=source,
|
||||
@@ -1436,10 +1602,11 @@ class Agent:
|
||||
# teure Claude-Aufbau + Tool-Loop wird uebersprungen. Sonst None → Claude.
|
||||
local_reply = self._try_local_fast_lane(user_message, active_project_id)
|
||||
if local_reply is not None:
|
||||
# speak folgt dem Skill: Steuerbefehl-Skill (speak=false) → stumm +
|
||||
# App beendet direkt; Antwort-Skill/Info-Tool → vorlesen + Gespraech.
|
||||
# speak = vorlesen? converse = danach 30s weiterlauschen? Beides folgt
|
||||
# dem Skill (bzw. Default: Info/Gespraech = vorlesen + 30s).
|
||||
speak = getattr(self, "_local_turn_speak", True)
|
||||
return local_reply, "local", speak
|
||||
converse = getattr(self, "_local_turn_converse", True)
|
||||
return local_reply, "local", speak, converse
|
||||
|
||||
# 2. Hot Memory (alle pinned Punkte)
|
||||
hot = self.store.list_pinned()
|
||||
@@ -1561,6 +1728,7 @@ class Agent:
|
||||
# der Bubble (Stefans Wunsch). Antwort-Skills (speak=true) + reine
|
||||
# Konversation bleiben gesprochen.
|
||||
self._claude_turn_speak = True
|
||||
self._claude_turn_converse = True # Default Gespraech; run_*-Skill setzt es
|
||||
try:
|
||||
for iteration in range(self.MAX_TOOL_ITERATIONS):
|
||||
result = self.proxy.chat_full(messages, tools=tools,
|
||||
@@ -1582,7 +1750,8 @@ class Agent:
|
||||
# ausgefuehrt → Antwort nicht vorlesen (letzter Skill gewinnt).
|
||||
_tn = tc.get("name") or ""
|
||||
if _tn.startswith("run_") and not self._local_tool_failed(_tn, tool_result):
|
||||
self._claude_turn_speak = self._skill_speak_flag(_tn)
|
||||
self._claude_turn_speak, self._claude_turn_converse = \
|
||||
self._skill_response_flags(_tn)
|
||||
# Cap auf 50 KB — passt zur Cap in _dispatch_tool fuer
|
||||
# Skill-Outputs (siehe agent.py weiter unten). 8 KB war
|
||||
# viel zu wenig: Spotify _all=true mit 90 Playlists
|
||||
@@ -1651,8 +1820,10 @@ class Agent:
|
||||
# 7. Assistant-Turn (final reply) in die Conversation
|
||||
self.conversation.add("assistant", final_reply,
|
||||
project_id=active_project_id)
|
||||
# speak folgt dem ausgefuehrten Skill (Steuerbefehl=stumm), sonst True.
|
||||
return final_reply, "claude", bool(getattr(self, "_claude_turn_speak", True))
|
||||
# speak/converse folgen dem ausgefuehrten Skill (sonst Default: Gespraech).
|
||||
return (final_reply, "claude",
|
||||
bool(getattr(self, "_claude_turn_speak", True)),
|
||||
bool(getattr(self, "_claude_turn_converse", True)))
|
||||
|
||||
# ── Tool-Dispatcher ───────────────────────────────────────
|
||||
|
||||
@@ -1674,6 +1845,7 @@ class Agent:
|
||||
config_schema=arguments.get("config_schema") or None,
|
||||
fast_patterns=arguments.get("fast_patterns") or None,
|
||||
speak=bool(arguments.get("speak", False)),
|
||||
converse=bool(arguments.get("converse", False)),
|
||||
author="aria",
|
||||
)
|
||||
# Side-Channel-Event: Stefan soll sehen wenn ARIA was anlegt
|
||||
@@ -1725,6 +1897,29 @@ class Agent:
|
||||
f"- {s['name']} ({s['execution']}) {'aktiv' if s.get('active', True) else 'DEAKTIVIERT'}: {s.get('description', '')}"
|
||||
for s in items
|
||||
)
|
||||
if name == "skill_get":
|
||||
sk_name = (arguments.get("name") or "").strip()
|
||||
if not sk_name:
|
||||
return "FEHLER: name ist Pflicht."
|
||||
src = skills_mod.read_skill_source(sk_name)
|
||||
if src is None:
|
||||
return f"FEHLER: Skill '{sk_name}' nicht gefunden."
|
||||
m = src["manifest"]
|
||||
# Manifest kompakt + kompletter Code, damit ARIA gezielt aendern kann.
|
||||
meta = {
|
||||
"name": m.get("name"), "description": m.get("description"),
|
||||
"execution": m.get("execution"), "entry": m.get("entry"),
|
||||
"active": m.get("active"), "args": m.get("args"),
|
||||
"requires": m.get("requires"),
|
||||
"config_schema": m.get("config_schema"),
|
||||
"fast_patterns": m.get("fast_patterns"),
|
||||
"speak": m.get("speak"), "converse": m.get("converse"),
|
||||
}
|
||||
return (
|
||||
f"MANIFEST:\n{json.dumps(meta, ensure_ascii=False, indent=2)}\n\n"
|
||||
f"ENTRY-CODE ({src['entry']}):\n{src['entry_code']}\n\n"
|
||||
f"README:\n{src.get('readme') or '(leer)'}"
|
||||
)
|
||||
if name == "skill_update":
|
||||
skill_name = (arguments.get("name") or "").strip()
|
||||
if not skill_name:
|
||||
@@ -1735,6 +1930,8 @@ class Agent:
|
||||
patch[k] = arguments[k]
|
||||
if "speak" in arguments and arguments["speak"] is not None:
|
||||
patch["speak"] = bool(arguments["speak"])
|
||||
if "converse" in arguments and arguments["converse"] is not None:
|
||||
patch["converse"] = bool(arguments["converse"])
|
||||
if "pip_packages" in arguments and isinstance(arguments["pip_packages"], list):
|
||||
patch["pip_packages"] = arguments["pip_packages"]
|
||||
if "config_schema" in arguments and isinstance(arguments["config_schema"], list):
|
||||
@@ -1836,6 +2033,18 @@ class Agent:
|
||||
skill_name = cand_name
|
||||
break
|
||||
res = skills_mod.run_skill(skill_name, args=arguments)
|
||||
# Steuer-Flags aus dem Skill-JSON-Output (speak/converse) fuer
|
||||
# DIESEN Aufruf merken. Der Aufrufer (local/claude/fast-path)
|
||||
# liest sie und steuert damit Vorlesen (speak) + 30s-Weiter-
|
||||
# lauschen (converse) — pro Aufruf, dynamisch. Kein JSON / nicht
|
||||
# gesetzt → Aufrufer nimmt Manifest-Default (speak) bzw. False.
|
||||
self._last_skill_flags = None
|
||||
if res.get("ok"):
|
||||
try:
|
||||
_j = json.loads((res.get("stdout") or "").strip())
|
||||
self._last_skill_flags = _j if isinstance(_j, dict) else None
|
||||
except Exception:
|
||||
self._last_skill_flags = None
|
||||
# 2000 Zeichen war viel zu wenig — Spotify-JSON ist 5-15 KB,
|
||||
# da wurde der Track-Name regelmaessig abgeschnitten und ARIA
|
||||
# hat aus dem Album-Kontext halluziniert. Claude kann hunderte
|
||||
|
||||
@@ -150,7 +150,7 @@ async def _fire(trigger: dict, agent_factory) -> None:
|
||||
|
||||
try:
|
||||
agent = agent_factory()
|
||||
reply, _, _ = agent.chat(prompt, source="trigger")
|
||||
reply, _, _, _ = agent.chat(prompt, source="trigger")
|
||||
events = agent.pop_events()
|
||||
logger.info("[trigger] %s gefeuert → ARIA-Reply: %s", name, reply[:80])
|
||||
triggers_mod.append_log(name, {"event": "reply", "text": reply[:500]})
|
||||
|
||||
+5
-1
@@ -636,6 +636,9 @@ class ChatOut(BaseModel):
|
||||
# Soll die Antwort vorgelesen werden? Fast-Path (reiner Steuerbefehl) = False;
|
||||
# ARIA-Antworten (local/claude) = True. System-Flag statt <voice>-Tag.
|
||||
speak: bool = True
|
||||
# Soll die App nach der Antwort 30s weiterlauschen (Gespraech)? Einzelaktionen/
|
||||
# Skills = False (direkt zurueck aufs Wake-Word), Konversation = True.
|
||||
converse: bool = True
|
||||
# Echo der project_id die dieser Turn hatte. Bridge nutzt sie damit die
|
||||
# ausgehende Chat-Bubble sauber getaggt in der richtigen Thread-Bahn der
|
||||
# UI landet.
|
||||
@@ -719,7 +722,7 @@ async def chat(body: ChatIn, background: BackgroundTasks):
|
||||
# Sync-Aufruf im Executor damit wir den Event-Loop nicht blocken —
|
||||
# chat() macht HTTP-Calls (Proxy) die 30-60s dauern koennen.
|
||||
loop = asyncio.get_running_loop()
|
||||
reply, answered_by, speak = await loop.run_in_executor(
|
||||
reply, answered_by, speak, converse = await loop.run_in_executor(
|
||||
None,
|
||||
lambda: a.chat(
|
||||
body.message, source=body.source, project_id=pid,
|
||||
@@ -743,6 +746,7 @@ async def chat(body: ChatIn, background: BackgroundTasks):
|
||||
project_id=pid,
|
||||
answered_by=answered_by,
|
||||
speak=speak,
|
||||
converse=converse,
|
||||
)
|
||||
finally:
|
||||
_project_pending[pid] = [
|
||||
|
||||
+52
-4
@@ -75,6 +75,16 @@ _TOOL_HINTS = re.compile(
|
||||
re.IGNORECASE,
|
||||
)
|
||||
|
||||
# HINWEIS (bewusst KEINE Live-/Topic-Wortliste mehr): frueher stand hier ein
|
||||
# _LIVE_HINTS-Blacklist (Wetter/Musik/Uhrzeit/… → Claude). Das war die falsche
|
||||
# Idee — aus offenem Freitext die Absicht per Wortliste zu erraten ist NIE
|
||||
# vollstaendig, jeder Miss = ein Halo. Die generische Loesung ist keine groessere
|
||||
# Regex, sondern: das Modell entscheidet selbst („brauche ich Grundwahrheit/ein
|
||||
# Tool? → <<ESCALATE>>", siehe build_local_system_prompt). Ein 8B kann das noch
|
||||
# nicht zuverlaessig → local bleibt per Einstellung abschaltbar; ein staerkeres
|
||||
# lokales Modell uebernimmt spaeter genau diese Selbst-Erkennung. Absicherung ist
|
||||
# der Output-Guard in agent.py, nicht eine Input-Wortliste.
|
||||
|
||||
# Technik-/Tiefe-Marker → Claude (lokales 8B soll das nicht raten).
|
||||
_HARD_HINTS = re.compile(
|
||||
r"```|" # Codeblock
|
||||
@@ -86,6 +96,18 @@ _HARD_HINTS = re.compile(
|
||||
|
||||
_MAX_LEN_FOR_LOCAL = 220 # laengere Nachrichten = eher komplexe Aufgaben → Claude
|
||||
|
||||
# Expliziter Nutzer-Wunsch „nimm das grosse Modell". Stefan sagt oft „frag Clodi"
|
||||
# / „benutze direkt Claude" — dann soll der Turn NICHT lokal versucht werden,
|
||||
# sondern direkt an Claude gehen. „Clodi/Clody" ist sein Kosename fuer Claude und
|
||||
# meint praktisch immer Routing; „claude"/„grosses modell" nur in Imperativ-Kontext
|
||||
# (nimm/nutze/frag/…), damit reine Trivia „was ist Claude" nicht faelschlich matcht.
|
||||
_FORCE_CLAUDE = re.compile(
|
||||
r"\b(clodi|clody)\b"
|
||||
r"|\b(nimm|nutze|benutze|verwende|frag(e|st)?|nimms?t?|mit|via|direkt|per)\b"
|
||||
r"[^.?!]*\b(claude|gro(ss|ß)es?\s+modell)\b",
|
||||
re.IGNORECASE,
|
||||
)
|
||||
|
||||
|
||||
def _strip_leading_hint_blocks(text: str) -> str:
|
||||
"""Fuehrende `[ ... ]`-Hint-Bloecke (GPS, Barge-In von der Bridge) weg —
|
||||
@@ -108,6 +130,10 @@ def should_try_local(user_message: str, cfg: dict) -> bool:
|
||||
msg = _strip_leading_hint_blocks(user_message)
|
||||
if not msg or len(msg) > _MAX_LEN_FOR_LOCAL:
|
||||
return False
|
||||
# Expliziter „nimm Claude/Clodi"-Wunsch → nie lokal (User hat entschieden).
|
||||
if _FORCE_CLAUDE.search(msg):
|
||||
logger.info("[router] expliziter Claude-Wunsch erkannt → nicht lokal")
|
||||
return False
|
||||
if _TOOL_HINTS.search(msg):
|
||||
return False
|
||||
if _HARD_HINTS.search(msg):
|
||||
@@ -122,10 +148,16 @@ def should_try_local(user_message: str, cfg: dict) -> bool:
|
||||
# kein volles Memory (B1a).
|
||||
|
||||
# Was das lokale Tier NICHT selbst kann → dafuer eskaliert es an Claude.
|
||||
# Seit dem B1a-Rueckbau hat local KEINE Werkzeuge mehr: es kann nichts
|
||||
# nachschlagen und nichts steuern. Alles was aktuelle Grundwahrheit oder eine
|
||||
# Aktion braucht, gehoert ans grosse Modell.
|
||||
_AWARENESS = (
|
||||
"Nur das grosse Modell (nicht du im Schnell-Modus) kann: Bilder generieren, "
|
||||
"Skills bauen/aendern, Projekte & OAuth verwalten, ins Gedaechtnis SCHREIBEN, "
|
||||
"sowie tiefe/technische Analysen und langen Code."
|
||||
"Du hast im Schnell-Modus KEINE Werkzeuge — du kannst nichts nachschlagen und "
|
||||
"nichts steuern. Nur das grosse Modell kann: aktuelle Infos holen (Wetter, "
|
||||
"News, Uhrzeit, Preise), Musik/Spotify steuern oder den laufenden Song "
|
||||
"nennen, Timer setzen, Bilder generieren, Skills bauen/aendern, Projekte & "
|
||||
"OAuth verwalten, ins Gedaechtnis schreiben, sowie tiefe/technische Analysen "
|
||||
"und langen Code. Fuer ALL das eskalierst du."
|
||||
)
|
||||
|
||||
|
||||
@@ -153,10 +185,26 @@ def build_local_system_prompt(identity_anchor: str, has_tools: bool = False,
|
||||
"GPS-Hinweis in der Nachricht.",
|
||||
"- `memory_search`: in ARIAs Gedaechtnis nachsehen (lesen).",
|
||||
"- `trigger_timer`: Timer/Erinnerung setzen ('in 10 Minuten…').",
|
||||
"- `run_spotify`: Musik steuern (naechster Titel, Pause, weiter).",
|
||||
"- `run_*`-Skills: konkrete Faehigkeiten (z.B. Musik/Spotify u.a.). "
|
||||
"Was ein Skill kann + welche Parameter er nimmt, steht in SEINER "
|
||||
"Tool-Beschreibung — LIES sie und nutze den Skill fuer ALLES was "
|
||||
"dazu passt (nicht nur die offensichtlichen Faelle). Nie selbst eine "
|
||||
"Aktion 'spielen'/'nachschauen', wenn ein Skill das kann.",
|
||||
"WICHTIG: Bei reinem Smalltalk ('wie gehts', Begruessung, Meinung) "
|
||||
"KEIN Werkzeug — einfach direkt antworten. Werkzeuge nur bei echtem "
|
||||
"Bedarf; erfinde keine.",
|
||||
"ANTI-HALLUZINATION (kritisch): Behaupte NIEMALS eine Aktion als "
|
||||
"erledigt, ohne das Werkzeug WIRKLICH aufgerufen zu haben. Keine "
|
||||
"'Spotify: …' / 'Playlist abspielen'-Quittung o.ae. ohne echten "
|
||||
"Skill-Aufruf. Kannst/willst du es nicht per Werkzeug tun, sag es "
|
||||
"ehrlich oder eskaliere — erfinde keine Bestaetigung.",
|
||||
"Das gilt GENAUSO fuer Live-Auskuenfte: Nenne NIEMALS einen aktuellen "
|
||||
"Songtitel, Interpreten, die Restzeit oder was gerade laeuft/welches "
|
||||
"Geraet spielt, ohne den passenden Skill (z.B. run_spotify) WIRKLICH "
|
||||
"aufgerufen und sein Ergebnis gelesen zu haben. Kein Tool-Ergebnis = du "
|
||||
"weisst es NICHT — dann eskaliere, statt einen Titel/eine Zeit zu raten. "
|
||||
"Gib nur weiter, was im Skill-Ergebnis wirklich steht; hat der Skill "
|
||||
"keinen Titel geliefert (z.B. nur 'OK: next'), erfinde auch keinen.",
|
||||
]
|
||||
parts += [
|
||||
"",
|
||||
|
||||
+30
-3
@@ -139,6 +139,26 @@ def read_manifest(name: str) -> Optional[dict]:
|
||||
return None
|
||||
|
||||
|
||||
def read_skill_source(name: str) -> Optional[dict]:
|
||||
"""Manifest + kompletter entry_code + README eines Skills. Damit ARIA einen
|
||||
Skill LESEN kann bevor sie ihn per skill_update aendert (sonst Blind-Rewrite,
|
||||
der bestehende Funktionen killt)."""
|
||||
m = read_manifest(name)
|
||||
if m is None:
|
||||
return None
|
||||
d = _skill_dir(name)
|
||||
entry = m.get("entry", "run.sh")
|
||||
try:
|
||||
code = (d / entry).read_text(encoding="utf-8")
|
||||
except Exception as exc:
|
||||
code = f"(entry-Datei '{entry}' nicht lesbar: {exc})"
|
||||
try:
|
||||
readme = (d / "README.md").read_text(encoding="utf-8")
|
||||
except Exception:
|
||||
readme = ""
|
||||
return {"manifest": m, "entry": entry, "entry_code": code, "readme": readme}
|
||||
|
||||
|
||||
def write_manifest(name: str, manifest: dict) -> None:
|
||||
d = _skill_dir(name)
|
||||
d.mkdir(parents=True, exist_ok=True)
|
||||
@@ -166,6 +186,7 @@ def create_skill(
|
||||
config_schema: Optional[list] = None,
|
||||
fast_patterns: Optional[list] = None,
|
||||
speak: bool = False,
|
||||
converse: bool = False,
|
||||
) -> dict:
|
||||
"""Legt einen neuen Skill an. Wirft ValueError bei ungueltigen Inputs.
|
||||
|
||||
@@ -218,9 +239,12 @@ def create_skill(
|
||||
"fast_patterns": _normalize_fast_patterns(fast_patterns),
|
||||
# speak: soll die Antwort dieses Skills vorgelesen werden (TTS)?
|
||||
# False (Default) = reiner Steuerbefehl (Spotify, Licht) → stumm, App
|
||||
# beendet direkt. True = Antwort-Skill (Info/Ergebnis) → vorlesen +
|
||||
# Gespraechs-Fenster. Gilt fuer Fast-Path UND local-Skill-Ausfuehrung.
|
||||
# beendet direkt. True = Antwort-Skill (Info/Ergebnis) → vorlesen.
|
||||
# converse: nach der Antwort 30s weiterlauschen (Dialog)? Default False
|
||||
# (Einzelaktion). Beide sind STATISCHE Defaults — der Skill kann sie im
|
||||
# JSON-Output pro Aufruf ueberschreiben (gemischte Skills).
|
||||
"speak": bool(speak),
|
||||
"converse": bool(converse),
|
||||
"version_history": [],
|
||||
}
|
||||
write_manifest(name, manifest)
|
||||
@@ -341,12 +365,15 @@ def update_skill(name: str, patch: dict) -> dict:
|
||||
# nach archive_current_version manifest neu laden (version_history geupdatet)
|
||||
manifest = read_manifest(name) or manifest
|
||||
|
||||
allowed = {"description", "args", "requires", "active", "version", "entry", "speak"}
|
||||
allowed = {"description", "args", "requires", "active", "version", "entry",
|
||||
"speak", "converse"}
|
||||
for k, v in patch.items():
|
||||
if k in allowed:
|
||||
manifest[k] = v
|
||||
if "speak" in patch:
|
||||
manifest["speak"] = bool(patch["speak"])
|
||||
if "converse" in patch:
|
||||
manifest["converse"] = bool(patch["converse"])
|
||||
if "config_schema" in patch:
|
||||
manifest["config_schema"] = _normalize_config_schema(patch["config_schema"])
|
||||
if "fast_patterns" in patch:
|
||||
|
||||
+252
-9
@@ -16,6 +16,7 @@ import asyncio
|
||||
import base64
|
||||
import json
|
||||
import logging
|
||||
import math
|
||||
import mimetypes
|
||||
import os
|
||||
import re
|
||||
@@ -32,6 +33,7 @@ from pathlib import Path
|
||||
from typing import Optional
|
||||
|
||||
import subprocess
|
||||
import urllib.parse
|
||||
import urllib.request
|
||||
import numpy as np
|
||||
import sounddevice as sd
|
||||
@@ -293,10 +295,17 @@ def clean_text_for_tts(text: str) -> str:
|
||||
if not text:
|
||||
return ""
|
||||
|
||||
# <voice>...</voice> wenn vorhanden → nur das nehmen
|
||||
# <voice>...</voice> wenn vorhanden → nur diesen Inhalt lesen. ABER: ein
|
||||
# LEERES <voice></voice> darf die Sprachausgabe nicht verstummen lassen.
|
||||
# Claude haengt reflexartig manchmal ein leeres Tag an (v.a. bei Spotify-
|
||||
# Antworten) — frueher wurde daraus text="" → gar keine TTS (Playlist-Wechsel
|
||||
# 'Prodigy' stumm, 'Fliegen' gesprochen, rein je nachdem ob Claude Inhalt ins
|
||||
# Tag schrieb). Leeres/whitespace-Tag → ignorieren und den normalen Text lesen.
|
||||
voice_match = _re_tts.search(r'<voice>([\s\S]*?)</voice>', text, _re_tts.IGNORECASE)
|
||||
if voice_match:
|
||||
if voice_match and voice_match.group(1).strip():
|
||||
text = voice_match.group(1)
|
||||
else:
|
||||
text = _re_tts.sub(r'<voice>[\s\S]*?</voice>', ' ', text, flags=_re_tts.IGNORECASE)
|
||||
|
||||
t = text
|
||||
|
||||
@@ -370,6 +379,37 @@ def clean_text_for_tts(text: str) -> str:
|
||||
return t.strip()
|
||||
|
||||
|
||||
# ── Geo: Bewegungsrichtung aus zwei GPS-Punkten ──────────────
|
||||
|
||||
# Fahrtrichtung als Himmelsrichtungs-Adverb (8-Wind, "…waerts"). Index =
|
||||
# gerundeter Bearing / 45 (mod 8).
|
||||
_COMPASS_ADV = ["nordwaerts", "nordostwaerts", "ostwaerts", "suedostwaerts",
|
||||
"suedwaerts", "suedwestwaerts", "westwaerts", "nordwestwaerts"]
|
||||
|
||||
|
||||
def _haversine_m(lat1: float, lon1: float, lat2: float, lon2: float) -> float:
|
||||
"""Distanz in Metern zwischen zwei GPS-Punkten."""
|
||||
r = 6371000.0
|
||||
p1, p2 = math.radians(lat1), math.radians(lat2)
|
||||
dp = math.radians(lat2 - lat1)
|
||||
dl = math.radians(lon2 - lon1)
|
||||
a = math.sin(dp / 2) ** 2 + math.cos(p1) * math.cos(p2) * math.sin(dl / 2) ** 2
|
||||
return 2 * r * math.asin(min(1.0, math.sqrt(a)))
|
||||
|
||||
|
||||
def _bearing_deg(lat1: float, lon1: float, lat2: float, lon2: float) -> float:
|
||||
"""Kompass-Peilung 0..360 (0=Nord) von Punkt1 nach Punkt2."""
|
||||
p1, p2 = math.radians(lat1), math.radians(lat2)
|
||||
dl = math.radians(lon2 - lon1)
|
||||
y = math.sin(dl) * math.cos(p2)
|
||||
x = math.cos(p1) * math.sin(p2) - math.sin(p1) * math.cos(p2) * math.cos(dl)
|
||||
return (math.degrees(math.atan2(y, x)) + 360.0) % 360.0
|
||||
|
||||
|
||||
def _heading_word(bearing: float) -> str:
|
||||
return _COMPASS_ADV[round(bearing / 45.0) % 8]
|
||||
|
||||
|
||||
# ── STT Engine ───────────────────────────────────────────────
|
||||
|
||||
|
||||
@@ -1175,8 +1215,28 @@ class ARIABridge:
|
||||
"lat": float(lat),
|
||||
"lon": float(lon),
|
||||
})
|
||||
lat, lon = float(lat), float(lon)
|
||||
# Fuer den Standort-Praefix merken (auch fuer Turns ohne frisches GPS).
|
||||
self._last_location = {"lat": lat, "lon": lon}
|
||||
# Fahrtrichtung aus dem Bewegungsvektor. Anker bleibt stehen bis wir
|
||||
# uns >MIN_MOVE_M wirklich wegbewegt haben — so zaehlt echtes Fahren,
|
||||
# nicht das GPS-Jitter im Stand. Stehen wir → letzte Richtung bleibt.
|
||||
# Umdrehen liefert automatisch neue Punkte → neue Richtung.
|
||||
MIN_MOVE_M = 25.0
|
||||
anchor = getattr(self, "_heading_anchor", None)
|
||||
if anchor:
|
||||
moved = _haversine_m(anchor["lat"], anchor["lon"], lat, lon)
|
||||
if moved >= MIN_MOVE_M:
|
||||
_bg = _bearing_deg(anchor["lat"], anchor["lon"], lat, lon)
|
||||
self._last_heading = _heading_word(_bg)
|
||||
self._last_bearing = int(round(_bg)) % 360 # exakte Peilung
|
||||
self._heading_anchor = {"lat": lat, "lon": lon}
|
||||
else:
|
||||
self._heading_anchor = {"lat": lat, "lon": lon}
|
||||
except Exception:
|
||||
return
|
||||
# Ortsname im Hintergrund aufloesen (Nominatim, gecacht) — kein Modell.
|
||||
self._maybe_reverse_geocode(float(lat), float(lon))
|
||||
# Fire-and-forget: Brain-on-demand-Tick. Wenn Brain nicht antwortet
|
||||
# oder langsam ist, blockt das nicht den GPS-Pfad.
|
||||
try:
|
||||
@@ -1184,6 +1244,150 @@ class ARIABridge:
|
||||
except Exception:
|
||||
pass
|
||||
|
||||
def _maybe_reverse_geocode(self, lat: float, lon: float) -> None:
|
||||
"""Loest lat/lon → Ortsname auf, aber nur bei nennenswerter Bewegung
|
||||
(~1 km Raster) und im Hintergrund. Ergebnis landet in
|
||||
self._last_place_name; der Standort-Praefix liest es dann nur ab."""
|
||||
try:
|
||||
key = (round(lat, 3), round(lon, 3)) # ~110 m — fuer Strasse/Hausnr
|
||||
except Exception:
|
||||
return
|
||||
if key == getattr(self, "_geocoded_key", None):
|
||||
return # diese Gegend schon aufgeloest
|
||||
# Neue Gegend: alten Namen verwerfen, sonst zeigt der Praefix die falsche
|
||||
# Stadt bis der neue Geocode da ist.
|
||||
self._geocoded_key = key
|
||||
self._last_place_name = ""
|
||||
try:
|
||||
self._geocode_task = asyncio.create_task(self._do_reverse_geocode(lat, lon, key))
|
||||
except Exception:
|
||||
self._geocode_task = None
|
||||
|
||||
async def _ensure_place_name(self, lat, lon) -> None:
|
||||
"""Stellt (blockierend, mit Timeout) sicher, dass der Ortsname fuer die
|
||||
aktuelle Position da ist — fuer die ERSTE Nachricht an einem neuen Ort,
|
||||
wo der Hintergrund-Geocode noch laeuft. Gecacht → danach instant."""
|
||||
try:
|
||||
lat, lon = float(lat), float(lon)
|
||||
key = (round(lat, 3), round(lon, 3))
|
||||
except Exception:
|
||||
return
|
||||
if key == getattr(self, "_geocoded_key", None) and getattr(self, "_last_place_name", ""):
|
||||
return # schon aufgeloest
|
||||
if key != getattr(self, "_geocoded_key", None):
|
||||
self._maybe_reverse_geocode(lat, lon) # startet Task
|
||||
task = getattr(self, "_geocode_task", None)
|
||||
if task is not None and not task.done():
|
||||
try:
|
||||
await asyncio.wait_for(asyncio.shield(task), timeout=6)
|
||||
except Exception:
|
||||
pass # Timeout/Fehler → Praefix faellt auf reine Koordinaten zurueck
|
||||
|
||||
async def _do_reverse_geocode(self, lat: float, lon: float, key) -> None:
|
||||
"""Nominatim-Reverse-Geocode (keyless, gratis). Baut einen moeglichst
|
||||
genauen Ort: Strasse+Hausnummer, PLZ+Stadt, Bundesland; bei Autobahn/
|
||||
Bundesstrasse zusaetzlich die Ref (A 28 / B 75) + best-effort Kilometer
|
||||
(Overpass-Milestone). Setzt self._last_place_name. Fehler → still
|
||||
(Praefix faellt auf reine Koordinaten zurueck)."""
|
||||
base = os.environ.get("NOMINATIM_URL", "https://nominatim.openstreetmap.org").rstrip("/")
|
||||
url = (f"{base}/reverse?lat={lat:.5f}&lon={lon:.5f}&format=jsonv2"
|
||||
f"&zoom=18&addressdetails=1&extratags=1&accept-language=de")
|
||||
|
||||
def _fetch():
|
||||
try:
|
||||
req = urllib.request.Request(url, headers={
|
||||
# Nominatim verlangt einen aussagekraeftigen User-Agent.
|
||||
"User-Agent": "ARIA-Assistant/1.0 (personal voice assistant)",
|
||||
})
|
||||
with urllib.request.urlopen(req, timeout=8) as r:
|
||||
return json.loads(r.read().decode("utf-8", "ignore"))
|
||||
except Exception as exc:
|
||||
logger.debug("[geo] reverse-geocode fehlgeschlagen: %s", exc)
|
||||
return None
|
||||
|
||||
data = await asyncio.get_event_loop().run_in_executor(None, _fetch)
|
||||
if not isinstance(data, dict):
|
||||
return
|
||||
addr = data.get("address") or {}
|
||||
extra = data.get("extratags") or {}
|
||||
road = addr.get("road") or ""
|
||||
house = addr.get("house_number") or ""
|
||||
city = (addr.get("city") or addr.get("town") or addr.get("village")
|
||||
or addr.get("municipality") or addr.get("county") or "")
|
||||
plz = addr.get("postcode") or ""
|
||||
state = addr.get("state") or ""
|
||||
ref = (extra.get("ref") or "").strip() # z.B. "A 28", "B 75"
|
||||
|
||||
# Strasse + Hausnummer
|
||||
street = (f"{road} {house}".strip()) if road else ""
|
||||
# PLZ + Ort
|
||||
citypart = (f"{plz} {city}".strip()) if plz else city
|
||||
|
||||
segs: list[str] = []
|
||||
# Autobahn/Bundes-/Kreisstrasse? Ref + (best-effort) Kilometer voranstellen.
|
||||
is_road = bool(ref) or any(w in road.lower()
|
||||
for w in ("autobahn", "bundesstrasse", "bundesstraße",
|
||||
"kreisstrasse", "kreisstraße"))
|
||||
if is_road:
|
||||
label = ref or road
|
||||
km = await self._overpass_km(lat, lon)
|
||||
if km:
|
||||
label = f"{label} bei km {km}"
|
||||
if label:
|
||||
segs.append(label)
|
||||
if street:
|
||||
segs.append(street)
|
||||
if citypart:
|
||||
segs.append(citypart)
|
||||
if state and (state not in citypart):
|
||||
segs.append(state)
|
||||
|
||||
name = ", ".join(s for s in segs if s)
|
||||
if not name:
|
||||
name = data.get("name") or ""
|
||||
# Nur uebernehmen wenn Stefan nicht schon weitergezogen ist (key aktuell).
|
||||
if name and getattr(self, "_geocoded_key", None) == key:
|
||||
self._last_place_name = name
|
||||
logger.info("[geo] %.5f,%.5f → %s", lat, lon, name)
|
||||
|
||||
async def _overpass_km(self, lat: float, lon: float) -> str:
|
||||
"""Best-effort Autobahn/Strassen-Kilometer: naechsten OSM-Milestone
|
||||
(highway=milestone mit distance-Tag) im Umkreis suchen. Leer wenn keiner
|
||||
gefunden / Overpass nicht erreichbar. Milestones stehen i.d.R. alle 500 m,
|
||||
also grob (fuer Pannenhilfe 'ca. km X' voellig ausreichend)."""
|
||||
ov = os.environ.get("OVERPASS_URL", "https://overpass-api.de/api/interpreter")
|
||||
query = (f"[out:json][timeout:8];"
|
||||
f"node(around:900,{lat:.5f},{lon:.5f})[highway=milestone];out;")
|
||||
|
||||
def _fetch():
|
||||
try:
|
||||
body = urllib.parse.urlencode({"data": query}).encode("utf-8")
|
||||
req = urllib.request.Request(ov, data=body, headers={
|
||||
"User-Agent": "ARIA-Assistant/1.0 (personal voice assistant)",
|
||||
})
|
||||
with urllib.request.urlopen(req, timeout=12) as r:
|
||||
return json.loads(r.read().decode("utf-8", "ignore"))
|
||||
except Exception as exc:
|
||||
logger.debug("[geo] overpass-km fehlgeschlagen: %s", exc)
|
||||
return None
|
||||
|
||||
d = await asyncio.get_event_loop().run_in_executor(None, _fetch)
|
||||
if not isinstance(d, dict):
|
||||
return ""
|
||||
best_dist = ""
|
||||
best_sq = 1e18
|
||||
for e in (d.get("elements") or []):
|
||||
tags = e.get("tags") or {}
|
||||
dist = tags.get("distance") or tags.get("milestone:distance") or ""
|
||||
elat, elon = e.get("lat"), e.get("lon")
|
||||
if not dist or elat is None or elon is None:
|
||||
continue
|
||||
sq = (float(elat) - lat) ** 2 + (float(elon) - lon) ** 2
|
||||
if sq < best_sq:
|
||||
best_sq = sq
|
||||
best_dist = str(dist)
|
||||
return best_dist.replace(".", ",") if best_dist else ""
|
||||
|
||||
async def _trigger_brain_check_now(self) -> None:
|
||||
"""Brain-Endpoint POST /triggers/check-now anstossen."""
|
||||
brain_url = os.environ.get("BRAIN_URL", "http://aria-brain:8080")
|
||||
@@ -1356,6 +1560,13 @@ class ARIABridge:
|
||||
"text": display_text,
|
||||
"sender": "aria",
|
||||
"messageId": message_id,
|
||||
# ARIA-Dateien DIREKT an der Chat-Bubble mitschicken — sonst kommt
|
||||
# der Anhang live nur als separates file_from_aria-Event (eigene
|
||||
# Bubble) und taucht an der Nachricht erst nach einem Seiten-
|
||||
# wechsel auf (Reload aus chat_backup, das die files kennt). Selbe
|
||||
# Struktur wie im Backup, damit App live == Reload rendert.
|
||||
"files": [{"serverPath": f["serverPath"], "name": f["name"],
|
||||
"mimeType": f["mimeType"], "size": f["size"]} for f in aria_files],
|
||||
# backupTs = der ts in chat_backup.jsonl. Wird von Clients als
|
||||
# Bubble-ID fuer das Mülltonne-Loeschen verwendet (delete_message_request).
|
||||
"backupTs": assistant_backup_ts,
|
||||
@@ -1371,6 +1582,9 @@ class ARIABridge:
|
||||
# und daran haengt das Wake-Word-Re-Arm — sonst bleibt das Ohr
|
||||
# nach einem Fast-Path-Befehl grau haengen.
|
||||
"speak": bool(payload.get("speak", True)) if isinstance(payload, dict) else True,
|
||||
# Nach dieser Antwort 30s weiterlauschen? Steuert das Gespraechs-
|
||||
# Fenster in der App (Skill/Einzelaktion=False, Konversation=True).
|
||||
"converse": bool(payload.get("converse", True)) if isinstance(payload, dict) else True,
|
||||
},
|
||||
"timestamp": int(asyncio.get_event_loop().time() * 1000),
|
||||
})
|
||||
@@ -1557,14 +1771,33 @@ class ARIABridge:
|
||||
"gesprochen oder gearbeitet hast. Folgendes ist eine Korrektur, "
|
||||
"Ergaenzung oder ein Themenwechsel zu deiner letzten Antwort.]"
|
||||
)
|
||||
if location and isinstance(location, dict):
|
||||
lat = location.get("lat")
|
||||
lon = location.get("lon") or location.get("lng")
|
||||
# Standort: frische GPS aus der Nachricht, sonst der zuletzt bekannte
|
||||
# (damit's beim passiven Weiterreden ohne frisches GPS nicht wegfaellt).
|
||||
loc = location if (isinstance(location, dict) and location.get("lat") is not None) \
|
||||
else getattr(self, "_last_location", None)
|
||||
if isinstance(loc, dict):
|
||||
lat = loc.get("lat")
|
||||
lon = loc.get("lon") or loc.get("lng")
|
||||
if lat is not None and lon is not None:
|
||||
# Ortsname kommt vom Reverse-Geocode (Nominatim, gecacht) — so
|
||||
# muss KEIN Modell Koordinaten raten (das lokale 8B tippt sonst
|
||||
# daneben, z.B. "Berlin" fuer Oldenburg). Noch nicht aufgeloest
|
||||
# → nur Koordinaten (Claude kann die zur Not selbst deuten).
|
||||
place = getattr(self, "_last_place_name", "")
|
||||
where = f"{place} " if place else ""
|
||||
heading = getattr(self, "_last_heading", "")
|
||||
bearing = getattr(self, "_last_bearing", None)
|
||||
if heading and bearing is not None:
|
||||
moving = f", unterwegs {heading} ({bearing} Grad)"
|
||||
elif heading:
|
||||
moving = f", unterwegs {heading}"
|
||||
else:
|
||||
moving = ""
|
||||
parts.append(
|
||||
f"[Stefans aktuelle GPS-Position: {float(lat):.6f}, {float(lon):.6f}. "
|
||||
f"Nutze die nur wenn die Frage sich auf seinen Standort bezieht. "
|
||||
f"Erwaehne sie nicht von dir aus, ausser er fragt explizit danach.]"
|
||||
f"[Stefans aktueller Standort: {where}(GPS {float(lat):.5f}, "
|
||||
f"{float(lon):.5f}){moving}. Nutze das nur wenn die Frage sich "
|
||||
f"auf seinen Standort/seine Fahrtrichtung bezieht. Erwaehne es "
|
||||
f"nicht von dir aus, ausser er fragt explizit danach.]"
|
||||
)
|
||||
if parts:
|
||||
return " ".join(parts) + " " + text
|
||||
@@ -1712,6 +1945,9 @@ class ARIABridge:
|
||||
# Soll vorgelesen werden? Fast-Path (Steuerbefehl) = False. System-Flag
|
||||
# vom Brain — robust, unabhaengig von <voice>-Tags im Reply-Text.
|
||||
speak = data.get("speak", True)
|
||||
# Nach der Antwort 30s weiterlauschen (Gespraech) oder direkt zurueck aufs
|
||||
# Wake-Word? Einzelaktionen/Skills = False. Reicht die App aus.
|
||||
converse = data.get("converse", True)
|
||||
|
||||
# Side-Channel-Events VOR der Chat-Bubble broadcasten (z.B. skill_created)
|
||||
# damit sie in der UI vor der Reply auftauchen
|
||||
@@ -1780,7 +2016,8 @@ class ARIABridge:
|
||||
try:
|
||||
await self._process_core_response(reply, {"projectId": turn_project_id,
|
||||
"answeredBy": answered_by,
|
||||
"speak": speak})
|
||||
"speak": speak,
|
||||
"converse": converse})
|
||||
except Exception:
|
||||
logger.exception("[brain] _process_core_response Fehler")
|
||||
await self._emit_activity("idle", "", project_id=project_id)
|
||||
@@ -2087,6 +2324,9 @@ class ARIABridge:
|
||||
logger.info("[rvs] App-Chat (mit Anhaengen) project=%s: '%s'",
|
||||
str(payload.get("projectId") or "") or "(main)", text[:80])
|
||||
else:
|
||||
_lg = location or getattr(self, "_last_location", None)
|
||||
if isinstance(_lg, dict) and _lg.get("lat") is not None:
|
||||
await self._ensure_place_name(_lg.get("lat"), _lg.get("lon") or _lg.get("lng"))
|
||||
core_text = self._build_core_text(text, interrupted, location)
|
||||
logger.info("[rvs] App-Chat%s%s: '%s'",
|
||||
" [BARGE-IN]" if interrupted else "",
|
||||
@@ -3184,6 +3424,9 @@ class ARIABridge:
|
||||
logger.warning("[rvs] STT-Text konnte nicht an RVS gesendet werden: %s", e)
|
||||
|
||||
# Dann an Brain — der blockt synchron bis ARIA fertig ist.
|
||||
_lg = location or getattr(self, "_last_location", None)
|
||||
if isinstance(_lg, dict) and _lg.get("lat") is not None:
|
||||
await self._ensure_place_name(_lg.get("lat"), _lg.get("lon") or _lg.get("lng"))
|
||||
core_text = self._build_core_text(text, interrupted, location)
|
||||
await self.send_to_core(core_text,
|
||||
source="app-voice" + (" [barge-in]" if interrupted else ""),
|
||||
|
||||
Reference in New Issue
Block a user