Google presenta Gemini 3.8 Live y Extended Thinking para agentes de voz empresariales
Contexto visual y herramientas en segundo plano acompañan tareas empresariales. | Créditos: Google

Google presenta Gemini 3.8 Live y Extended Thinking para agentes de voz empresariales

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en tiempo real orientados a agentes de voz. El primero prioriza escala y eficiencia de costos, mientras que Extended Thinking está diseñado para tareas de mayor complejidad que requieren razonamiento de varios pasos.

Gemini 3.8 Live Extended Thinking alcanzó 82,6% en el Speech to Speech Index de Artificial Analysis, según los resultados publicados por Google. | Créditos: Google.
Gemini presenta tres modelos Flash para agentes de IA
Google amplía su oferta de IA con modelos rápidos, económicos y una variante especializada en ciberseguridad para detectar y corregir vulnerabilidades

Herramientas en segundo plano y razonamiento multietapa

Gemini 3.8 Live procesa entradas visuales casi en tiempo real y puede detectar y cambiar automáticamente entre 97 idiomas durante una misma conversación. También ejecuta herramientas y llamadas a API en segundo plano, de modo que puede mantener el diálogo mientras esas operaciones continúan.

Gemini incorpora nueva función de análisis agéntico para videos largos
Gemini revisa dinámicamente segmentos de video para reducir hasta 88% los tokens y 66% el costo, con mejoras de precisión de hasta 7% en pruebas de IA

Extended Thinking lleva esa lógica a procesos más complejos al razonar y hablar de manera simultánea. Google indica que el modelo utiliza avisos verbales y narración de progreso para acompañar tareas multietapa, entre ellas reservas coordinadas, llamadas de funciones asíncronas y generación de componentes a partir de bocetos y comentarios por voz.

Google informa que Gemini 3.8 Live Extended Thinking obtuvo 82,6 puntos en Speech to Speech Quality Index de Artificial Analysis, 68,6% en τ-Voice, 35,1% en τ-Voice-banking de Sierra y 97,7% en Big Bench Audio. La compañía también señala que Gemini 3.8 Live alcanzó el segundo lugar en Speech Agent Arena.

Los modelos pueden utilizarse mediante Gemini Live API, que ya es empleada por plataformas como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents para desarrollar interfaces controladas por voz. Google también menciona a Salesforce, Genspark y Lumeris entre las compañías que están trabajando con Gemini 3.8 Live y Extended Thinking.

Eva Bench de ServiceNow compara precisión y experiencia de distintos modelos de voz, incluidos Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. | Créditos: Google.

Gemini 3.8 Live llega a API, Search y Workspace

El despliegue comenzó el 15 de septiembre en Gemini API y Google AI Studio para desarrolladores, mientras las empresas pueden acceder mediante una vista previa privada en Gemini Enterprise. Gemini 3.8 Live también se incorpora a Search Live, mientras Extended Thinking llega a Gemini Live y a servicios de Google Workspace según el tipo de suscripción.

Gemini continua creciendo y ya supera los 1.000 millones de usuarios mensuales
Google destaca el uso de voz, archivos e imágenes en la aplicación, que además suma más de 100 millones de usuarios activos en iOS a nivel global hoy

Google añade que todo el audio generado por sus productos de inteligencia artificial incorpora SynthID. La marca de agua se integra de forma imperceptible en la salida de audio con el objetivo de mantener detectable el contenido generado mediante IA.