NOTICIAS

Google lanza Gemini 3.8 Live para conversaciones de voz con IA más fluidas

El nuevo modelo puede narrar en voz alta lo que está haciendo mientras ejecuta tareas en segundo plano, cambiar entre 97 idiomas en medio de una conversación, y ya lidera el ranking de calidad de voz a voz de Artificial Analysis. (Fuente: Android Headlines)

Hablar con un asistente de IA suele venir acompañado de pausas incómodas e intercambios rígidos de ida y vuelta. Google busca eliminar esos puntos de fricción con sus últimos lanzamientos: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking.

Anunciados en nombre del equipo de Audio de Gemini por el ingeniero principal Tom Ouyang y la integrante del staff Malini Jaganathan, estos dos modelos traen capacidades conversacionales casi en tiempo real para desarrolladores, equipos empresariales y usuarios cotidianos. El modelo estándar 3.8 Live se enfoca en alta escalabilidad y eficiencia de costos, mientras que 3.8 Live Extended Thinking apunta a tareas complejas de varios pasos que requieren razonamiento profundo.

Lo que distingue a estos modelos es su capacidad de ejecutar herramientas y llamadas de API en segundo plano sin interrumpir la conversación. Gemini 3.8 Live procesa entradas visuales casi en tiempo real, lo que le permite responder preguntas en vivo sobre lo que está viendo, y detecta y hace la transición automáticamente entre 97 idiomas soportados en medio de una oración.

Para cargas de trabajo más pesadas, Extended Thinking razona y habla simultáneamente. En lugar de quedarse en silencio mientras busca datos, el modelo usa señales verbales naturales como dejame revisar eso y ofrece narración de progreso en vivo para guiar a los usuarios a través de operaciones en segundo plano. Demostraciones publicadas por Google muestran al modelo convirtiendo bocetos de papel en componentes funcionales de React, gestionando reservas complejas de restaurantes a través de llamadas de función asincrónicas, y guiando resolución de problemas en vivo dentro de Google Search.

Según Google, Gemini 3.8 Live Extended Thinking se ubicó en el primer puesto general del Índice de Calidad de Voz a Voz de Artificial Analysis, con un puntaje de 82,6. También lidera evaluaciones de benchmarks agénticos, asegurando 68,6% en τ-Voice y 35,1% en el benchmark τ-Voice-banking de Sierra, además de un puntaje de 97,7% en Big Bench Audio. Mientras tanto, el 3.8 Live estándar se quedó con el segundo puesto en Speech Agent Arena.

Rajan Patel, VP de Ingeniería de Search, confirmó que Gemini 3.8 Live ya está disponible globalmente en Search Live. Los suscriptores pagos de Workspace también están obteniendo acceso a las funciones de Extended Thinking en Docs, Gmail y Keep.

Para desarrolladores, los modelos son accesibles a través de la API de Gemini Live mediante conexiones WebSocket con estado. Manejan audio PCM crudo de 16 bits a 16kHz junto con imágenes JPEG de hasta un cuadro por segundo para entregar salida de audio a 24kHz. Plataformas como LiveKit, Vercel, Pipecat y Agora gestionan la infraestructura subyacente de streaming de medios, mientras socios empresariales como Salesforce, Genspark y Lumeris ya están probando la tecnología.

En materia de seguridad, Google confirmó que todo el audio generado por el modelo incluye marcas de agua SynthID imperceptibles, tejidas directamente en la salida de sonido para mantener el audio sintético fácilmente detectable.

Nota elaborada con asistencia de IA. Fuentes verificadas y contenido editado por el equipo de Infosertec. Conocé nuestro proceso editorial.

Deja un comentario

Descubre más desde

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo