Modèles d’IA

Google apporte la compréhension vidéo agentique aux modèles Gemini

Google lance la compréhension vidéo agentique pour Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite, afin de réduire tokens et coûts tout en améliorant la qualité.

Publié Mis à jour
Google DeepMindGeminiIA vidéo

Google a lancé le 1er septembre la compréhension vidéo agentique pour Gemini, ajoutant un nouveau mode d’analyse à Gemini 3.7 Flash, Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. L’entreprise indique que la fonction peut réduire la consommation de tokens jusqu’à 88%, baisser les coûts jusqu’à 66% et améliorer la qualité jusqu’à 7% sur des benchmarks standard d’analyse vidéo. Elle est disponible pour les vidéos importées et les vidéos YouTube via l’API Gemini dans Google AI Studio et Gemini Enterprise Agent Platform.

La fonction change la manière dont un modèle consomme la vidéo. Le traitement statique classique ingère la vidéo à une cadence fixe, souvent une image par seconde par défaut, avec possibilité d’ajustement par API. Cette approche est simple, mais inefficace pour les longues vidéos ou les tâches où l’information importante apparaît brièvement. La compréhension vidéo agentique permet à Gemini d’adopter une démarche plus orientée objectif: il peut rechercher, scanner et inspecter dynamiquement les segments pertinents dans les images, l’audio et les transcriptions, en ne récupérant que les moments et signaux nécessaires.

Google compare l’idée à la vision agentique, qui combine exécution de code et compréhension native d’images par Gemini. Pour la vidéo, la même boucle permet au modèle de décider quoi regarder, à quelle vitesse et via quelle modalité. Pour trouver un instant précis dans un cours de 90 minutes, il n’a pas besoin de traiter chaque seconde avec la même profondeur. Il peut utiliser la transcription pour réduire l’intervalle, examiner les images de la section pertinente, écouter l’audio si nécessaire et fournir une réponse ancrée dans les éléments sélectionnés. Pour les développeurs, Google dit que cela évite de construire manuellement une partie des pipelines de récupération et de prétraitement.

Les gains d’efficacité comptent particulièrement pour les vidéos longues. Les équipes qui créent des outils éducatifs, archives médias, analyses de sécurité ou produits de revue de réunions arbitrent souvent entre précision et coût. Un échantillonnage plus dense des images capture davantage de détails, mais consomme rapidement des tokens et augmente les factures. Un échantillonnage faible coûte moins cher, mais peut manquer des actions rapides, anomalies subtiles ou limites de scènes précises. Google affirme que la compréhension agentique améliore cet équilibre en rééchantillonnant les fenêtres importantes à plus haute fréquence si nécessaire, sans traiter uniformément des séquences non pertinentes.

Les cas d’usage montrent que ce n’est pas seulement une optimisation de coût. La récupération d’instants sous la seconde peut repérer des coupes serrées ou des changements d’état rapides, utiles pour le montage automatisé et l’analyse sportive. La recherche d’aiguille dans une botte de foin peut répondre à des questions sur des enregistrements de plusieurs heures sans consommer des millions de tokens. La détection d’anomalies peut cibler des fenêtres intéressantes et inspecter de près mouvements ou artefacts visuels. Le comptage d’actions et d’objets peut aussi s’améliorer lorsque le modèle revoit de courts segments à différentes cadences au lieu de dépendre d’échantillons clairsemés.

Le lancement indique également la direction des produits d’IA multimodale. Les premières approches de compréhension vidéo consistaient souvent à transmettre au modèle une représentation compressée du contenu, en espérant que les détails utiles restent présents. La vidéo agentique rend le modèle plus actif, plus proche d’un analyste décidant où regarder ensuite. Cela peut améliorer qualité et efficacité, mais rend l’évaluation plus complexe car les résultats dépendent de la stratégie de recherche du modèle. Pour les équipes qui construisent de l’IA vidéo, la question pratique sera de vérifier si les économies et gains de précision se maintiennent sur leurs propres contenus. Google leur propose une option: moins d’ingestion statique, davantage d’inspection guidée par le modèle.