Google presentó la comprensión agéntica de video para Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite. La función está disponible para videos cargados y contenidos de YouTube mediante la API de Gemini en Google AI Studio y Gemini Enterprise Agent Platform.
A diferencia del procesamiento estático, que analiza el video con una frecuencia fija de cuadros por segundo, el nuevo modo permite que Gemini determine qué segmentos necesita revisar, a qué velocidad y mediante qué modalidad. El modelo puede recurrir a cuadros de video, audio o transcripciones y cargar solo las partes relevantes para responder una consulta.
Menos tokens y menor costo de análisis
El procesamiento estático utiliza por defecto una frecuencia de un cuadro por segundo, aunque puede modificarse mediante la API. Con el modo agéntico, Gemini emplea un ciclo que invoca una herramienta interna para localizar y cargar los fragmentos necesarios del archivo.
En las pruebas publicadas por Google, esta modalidad redujo el consumo de tokens hasta un 88% y el costo del análisis hasta un 66%, mientras que la precisión mejoró hasta un 7%. Los beneficios fueron especialmente notorios en videos extensos, desde tutoriales de diez minutos hasta clases de 90 minutos y grabaciones de varias horas.
Google indicó que las mejoras se observaron en los tres modelos compatibles. Entre ellos, Gemini 3.7 Flash obtuvo la mejor combinación de calidad y eficiencia de costos entre los modelos evaluados por la compañía.

Búsqueda precisa dentro de videos extensos
La función permite localizar momentos de menos de un segundo, buscar información específica dentro de grabaciones de varias horas, volver a analizar segmentos a una mayor frecuencia de cuadros para detectar anomalías y contar objetos o acciones repetidas.
La comprensión agéntica de video utiliza las tarifas estándar de tokens de la API de Gemini y no incorpora un cargo adicional. Para activarla, los desarrolladores deben configurar el procesamiento como agentic en la solicitud a la API.

Google también anunció que la función llegará próximamente a los usuarios de la aplicación Gemini mediante los modelos Flash y Flash-Lite. Durante los próximos meses, además, se integrará en Ask YouTube para responder consultas utilizando la información visual de los videos.


