feat: add multimodal audio analysis

This commit is contained in:
enne2
2026-09-08 11:11:06 +02:00
parent 4a88084b2b
commit 4920c4c0ba
4 changed files with 202 additions and 1 deletions
+4 -1
View File
@@ -8,9 +8,10 @@ Estensione per [pi](https://github.com/badlogic/pi-mono) che integra il client O
- generazione, editing, composizione e analisi immagini;
- analisi video;
- trascrizione audio e input vocale F12 tramite Antigravity;
- analisi qualitativa di effetti audio con waveform e metadati locali;
- catalogo modelli e stato conversazione Antigravity.
Strumenti principali: `agy`, `agy_generate`, `agy_edit`, `agy_inpaint`, `agy_style_transfer`, `agy_compose`, `agy_character`, `agy_analyze`, `agy_transcribe`, `agy_video`, `agy_models`, `agy_conversation`, `antigravity_chat`.
Strumenti principali: `agy`, `agy_generate`, `agy_edit`, `agy_inpaint`, `agy_style_transfer`, `agy_compose`, `agy_character`, `agy_analyze`, `agy_transcribe`, `agy_analyze_audio`, `agy_video`, `agy_models`, `agy_conversation`, `antigravity_chat`.
Non include TTS interno né generazione immagini verificata iterativa.
@@ -18,6 +19,8 @@ Non include TTS interno né generazione immagini verificata iterativa.
Premi **F12** per avviare/fermare la registrazione. L'audio viene ottimizzato, convertito in Opus/OGG e inviato al modello `voiceModel` tramite il gateway Antigravity OAuth. Il workflow genera trascrizione e prompt pulito; con `vocalPlanningMode=true` richiede una conferma nell'overlay prima dell'invio a pi.
`agy_analyze_audio` aggiunge un percorso separato per gli effetti non vocali: misura il file con `ffprobe`, genera una waveform con `ffmpeg` e invia audio, immagine e contesto locale insieme a Gemini tramite `inlineData`. Non richiede una chiave Gemini esterna e non assume che l'audio contenga parlato.
`agy_transcribe` usa la stessa pipeline Antigravity. Non esistono fallback a servizi con chiave API esterna. I suoni di start/stop/done sono effetti locali, non sintesi vocale.
## Configurazione