Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en tiempo real orientados a agentes de voz. El primero prioriza escala y eficiencia de costos, mientras que Extended Thinking está diseñado para tareas de mayor complejidad que requieren razonamiento de varios pasos.


Herramientas en segundo plano y razonamiento multietapa
Gemini 3.8 Live procesa entradas visuales casi en tiempo real y puede detectar y cambiar automáticamente entre 97 idiomas durante una misma conversación. También ejecuta herramientas y llamadas a API en segundo plano, de modo que puede mantener el diálogo mientras esas operaciones continúan.

Extended Thinking lleva esa lógica a procesos más complejos al razonar y hablar de manera simultánea. Google indica que el modelo utiliza avisos verbales y narración de progreso para acompañar tareas multietapa, entre ellas reservas coordinadas, llamadas de funciones asíncronas y generación de componentes a partir de bocetos y comentarios por voz.
Google informa que Gemini 3.8 Live Extended Thinking obtuvo 82,6 puntos en Speech to Speech Quality Index de Artificial Analysis, 68,6% en τ-Voice, 35,1% en τ-Voice-banking de Sierra y 97,7% en Big Bench Audio. La compañía también señala que Gemini 3.8 Live alcanzó el segundo lugar en Speech Agent Arena.
Los modelos pueden utilizarse mediante Gemini Live API, que ya es empleada por plataformas como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents para desarrollar interfaces controladas por voz. Google también menciona a Salesforce, Genspark y Lumeris entre las compañías que están trabajando con Gemini 3.8 Live y Extended Thinking.

Gemini 3.8 Live llega a API, Search y Workspace
El despliegue comenzó el 15 de septiembre en Gemini API y Google AI Studio para desarrolladores, mientras las empresas pueden acceder mediante una vista previa privada en Gemini Enterprise. Gemini 3.8 Live también se incorpora a Search Live, mientras Extended Thinking llega a Gemini Live y a servicios de Google Workspace según el tipo de suscripción.
Google añade que todo el audio generado por sus productos de inteligencia artificial incorpora SynthID. La marca de agua se integra de forma imperceptible en la salida de audio con el objetivo de mantener detectable el contenido generado mediante IA.


