Modelos de IA

Google lleva comprensión agéntica de video a los modelos Gemini

Google lanzó comprensión agéntica de video para Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, reduciendo tokens y costos mientras mejora la calidad.

Publicado Actualizado
Google DeepMindGeminiIA de video

Google lanzó el 1 de septiembre la comprensión agéntica de video para Gemini, añadiendo un nuevo modo de análisis a Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite. La compañía dice que la función puede reducir el consumo de tokens hasta un 88%, bajar costos hasta un 66% y mejorar la calidad hasta un 7% en benchmarks estándar de análisis de video. Está disponible para videos subidos y videos de YouTube mediante la API de Gemini en Google AI Studio y Gemini Enterprise Agent Platform.

La función cambia la forma en que un modelo consume video. El procesamiento estático tradicional ingiere video a una tasa fija de fotogramas, a menudo un fotograma por segundo de forma predeterminada, con ajustes mediante API. Ese enfoque es simple, pero puede ser ineficiente para videos largos o tareas donde la información importante aparece brevemente. La comprensión agéntica de video permite que Gemini adopte un enfoque más dirigido por objetivos: puede buscar, escanear e inspeccionar dinámicamente segmentos relevantes entre fotogramas, audio y transcripciones, tomando solo los momentos y señales necesarios para responder.

Google compara la idea con la visión agéntica, que combina ejecución de código con comprensión nativa de imágenes de Gemini. En video, el mismo bucle permite que el modelo decida qué mirar, a qué velocidad y mediante qué modalidad. Si busca un momento específico en una clase de 90 minutos, no necesita procesar cada segundo con la misma profundidad. Puede usar la transcripción para acotar el rango temporal, inspeccionar fotogramas de la sección relevante, escuchar audio si hace falta y devolver una respuesta basada en la evidencia seleccionada. Para desarrolladores, Google dice que esto reduce trabajo que antes debía construirse manualmente en pipelines de recuperación y preprocesamiento.

Las mejoras de eficiencia importan especialmente en video largo. Quienes crean herramientas educativas, archivos de medios, analítica de seguridad o productos de revisión de reuniones suelen elegir entre precisión y costo. Muestrear más fotogramas captura más detalle, pero consume tokens y eleva facturas rápidamente. Muestrear menos ahorra dinero, pero puede perder acciones rápidas, anomalías sutiles o límites precisos de escena. Google afirma que la comprensión agéntica mejora ese equilibrio al remuestrear ventanas importantes con mayor frecuencia cuando es necesario, sin procesar de forma uniforme metraje irrelevante.

Los casos de uso muestran que no es solo optimización de facturación. La recuperación de momentos subsegundo puede identificar cortes precisos o cambios rápidos de estado, útil para edición automática y análisis deportivo. La búsqueda tipo aguja en un pajar puede responder preguntas en grabaciones de varias horas sin consumir millones de tokens. La detección de anomalías puede enfocarse en ventanas interesantes y examinar movimiento o artefactos visuales más de cerca. El conteo de acciones y objetos puede mejorar cuando el modelo vuelve a mirar segmentos cortos a distintas tasas de fotogramas en lugar de depender de muestras dispersas.

El lanzamiento también señala la dirección de los productos multimodales. La comprensión temprana de video a menudo significaba pasar una representación comprimida del metraje al modelo y esperar que los detalles relevantes sobrevivieran. El video agéntico hace al modelo más activo, más parecido a un analista que decide dónde mirar después. Eso puede mejorar calidad y eficiencia, pero vuelve la evaluación más compleja porque los resultados dependen de la estrategia de búsqueda del modelo. Para equipos que crean IA de video, la pregunta práctica será si los ahorros y mejoras se sostienen en su propio contenido. La propuesta de Google es clara: menos ingestión estática y más inspección dirigida por el modelo.