Voice-first Reverse Search
Agente de voz para encontrar cosas que no puedes describir del todo, como una canción, un libro, un lugar o un producto que recuerdas a medias. Escucha, dibuja controles en pantalla conforme avanza la conversación y busca en la fuente adecuada.
Arquitectura
Audio bidireccional con Gemini Live API, detección de voz en el servidor e interrupciones, a través de un proxy en Bun que emite tokens efímeros para que la llave de la API no salga del servidor. El agente genera su propia interfaz con A2UI y dirige cada consulta a una herramienta de búsqueda por dominio (música, libros, mapas, compras o búsqueda web en paralelo), con caché y límite de peticiones. Una presencia 3D con shaders reacciona a la voz. Desplegado en Cloud Run con Terraform, Secret Manager y alerta de presupuesto.
Aspectos clave
- Hecho en un hackathon, desplegado en vivo
- Voz en tiempo real que se puede interrumpir
- Interfaz generada por el agente
- Pruebas en vivo de herramientas y evaluaciones con LLM como juez
- Una versión anterior comparó modelos por latencia y costo