2137150da3
- Aggiunti docs/ (9 pagine MkDocs, tema Material) + mkdocs.yml - Fix mkdocs.yml: repo_url -> git.enne2.net, tasklist (era taskbuttons), fence Mermaid via helper locale mermaid_fence.py (def_fence_mermaid rimosso da pymdown-extensions moderne) - Documentate le nuove funzionalità: agy_create_verified (generazione verificata con verifica OpenCV DINAMICA generata dall'LLM), workflow vocale a 2 fasi (vocalPlanningMode), chiavi config context/webSearch - tools.md ora documenta 14 tool; vocal-workflow.md include l'overlay di conferma piano; configuration.md include vocalPlanningMode - .gitignore: esclusi site/ e __pycache__/ - Build MkDocs verificata (site/ generato correttamente)
3.5 KiB
3.5 KiB
Panoramica di agy-pi
agy-pi è un'estensione avanzata per pi (@earendil-works/pi-coding-agent) che integra Google Antigravity CLI (agy) e le API di Gemini multimodale come subagent autonomo e assistente multimodale dentro l'ambiente di pi.
Il Problema & La Soluzione
| Sfida | Soluzione offertata da agy-pi |
|---|---|
| Limitazione Text-Only di pi | agy-pi agisce da ponte multimodale: pi delega ad agy l'elaborazione di immagini, audio, video e compiti di ragionamento profondo. |
| Generazione & Editing Immagini | Implementa formule narrative strutturate ([Soggetto]+[Azione]+[Stile], Keep+Change+Add+Render, Inpainting, Style Transfer, Composizione Multi-Immagine, Character Consistency). |
| Input Vocale Senza Mani | Scorciatoia F12 con registrazione microfono, indicatore TUI live, soppressione silenzio, feedback sonori sci-fi e trascrizione nativa via Gemini/enne2. |
| Multimodalità Ibrida (Voce + Tastiera) | Integra automaticamente il testo presente nel campo editor di pi con il messaggio vocale registrato. |
| Context Lost in the Middle | Sistema di Context Injection in 4 fasi (<environment_snapshot>, <session_state>, <durable_memory>, <web_context>) con token cap ed euristiche anti-ridondanza. |
Caratteristiche Principali
graph TD
PI[pi Coding Agent] -->|Tool Call / Slash Command| EXT[agy-pi Extension]
subgraph Core Features
EXT --> TOOLS[14 Specialized Tools]
EXT --> VOCAL[Workflow Vocale F12]
EXT --> CTX[Context Injection Engine]
EXT --> TUI[TUI Overlays /agy:key & /agy:status]
end
TOOLS --> AGY_CLI[Google Antigravity CLI agy]
VOCAL --> GEMINI_STT[Gemini STT / enne2 STT]
VOCAL --> GEMINI_TTS[Gemini TTS / Feedbacks Sonori]
CTX --> MEMORY[Memory JSON & Web Search Grounding]
- Subagent Multimodale Avanzato: Espone 14 strumenti specializzati riconosciuti dall'LLM di pi per generare, modificare ed analizzare asset multimediali, inclusa la generazione verificata iterativa (
agy_create_verified) con verifica visione + OpenCV dinamico. - Sistema di Configurazione Persistente: Configurazione via
/agy:configsalvata con permessi restrittivi0600in~/.config/agy-pi/config.json. - Interfaccia Grafica TUI: Dialoghi interattivi in sovrimpressione (
/agy:keyper mascherare e gestire la chiave API Gemini e/agy:statusper la diagnostica di sistema). - Modulo Vocale Sci-Fi Integrato: Registrazione ad alte prestazioni via
ffmpeg, rilevamento automatico del parlato (volumedetect), compressionelibopus/libmp3lamee feedback acustici sintetizzati proceduralmente.
Requisiti e Dipendenze
- Node.js: >= 18.x / v22.x
- pi-coding-agent:
@earendil-works/pi-coding-agent - Google Antigravity CLI (
agy): Installato e autenticato in locale (es.~/.local/bin/agy). - ffmpeg: Necessario per il recording del microfono, la rimozione del silenzio e i feedback sonori procedurali.
- Utilità Audio System:
paplay(PulseAudio),aplay(ALSA) offplay.
Installazione Rapida
# Installazione da repository locale
pi install /percorso/a/agy-pi
# Oppure test dinamico senza installazione permanente
pi -e /percorso/a/agy-pi
Configura la chiave API Gemini per la trascrizione vocale e la ricerca web:
# Tramite overlay grafico dentro pi:
/agy:key
# Oppure via linea di comando:
/agy:config set geminiApiKey AIzaSy...
