Modelos de IA

Google leva compreensão agêntica de vídeo aos modelos Gemini

O Google lançou compreensão agêntica de vídeo para Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite, reduzindo tokens e custos enquanto melhora a qualidade.

Publicado Atualizado
Google DeepMindGeminiIA de vídeo

O Google lançou em 1º de setembro a compreensão agêntica de vídeo para Gemini, adicionando um novo modo de análise ao Gemini 3.7 Flash, Gemini 3.6 Flash e Gemini 3.5 Flash-Lite. A empresa afirma que o recurso pode reduzir o consumo de tokens em até 88%, diminuir custos em até 66% e melhorar a qualidade em até 7% em benchmarks padrão de análise de vídeo. Ele está disponível para uploads de vídeo e vídeos do YouTube por meio da API Gemini no Google AI Studio e na Gemini Enterprise Agent Platform.

O recurso muda a forma como um modelo consome vídeo. O processamento estático convencional lê o vídeo em uma taxa fixa de quadros, muitas vezes um quadro por segundo por padrão, com ajustes possíveis pela API. Essa abordagem é simples, mas pode ser ineficiente em vídeos longos ou tarefas nas quais a informação importante aparece rapidamente. A compreensão agêntica de vídeo permite que o Gemini adote uma postura mais orientada ao objetivo: ele pode buscar, escanear e inspecionar dinamicamente segmentos relevantes entre quadros, áudio e transcrições, trazendo apenas os momentos e sinais necessários para responder.

O Google compara a ideia à visão agêntica, que combina execução de código com a compreensão nativa de imagens do Gemini. Em vídeo, o mesmo loop permite ao modelo decidir o que assistir, em qual velocidade e por qual modalidade. Para encontrar um momento específico em uma aula de 90 minutos, o modelo não precisa processar cada segundo com a mesma profundidade. Ele pode usar a transcrição para estreitar o intervalo, examinar quadros ao redor da seção relevante, ouvir o áudio se necessário e devolver uma resposta baseada nas evidências escolhidas. Para desenvolvedores, o Google diz que isso reduz trabalho antes feito manualmente em pipelines de recuperação e pré-processamento.

Os ganhos de eficiência são especialmente importantes em vídeos longos. Desenvolvedores de ferramentas educacionais, arquivos de mídia, análise de segurança ou revisão de reuniões costumam escolher entre precisão e custo. Amostragem de quadros mais alta captura mais detalhes, mas consome tokens e aumenta a conta rapidamente. Amostragem menor economiza, mas pode perder ações rápidas, anomalias sutis ou limites precisos de cena. O Google afirma que a compreensão agêntica melhora esse equilíbrio ao reamostrar janelas importantes em taxas maiores quando necessário, evitando processar trechos irrelevantes de forma uniforme.

Os casos de uso mostram que não se trata apenas de otimização de cobrança. Recuperação de momentos abaixo de um segundo pode identificar cortes apertados ou mudanças rápidas de estado, algo útil para edição automatizada e análise esportiva. Busca de agulha no palheiro em vídeos longos pode responder perguntas em gravações de várias horas sem consumir milhões de tokens. Detecção de anomalias pode focar janelas interessantes e examinar movimentos ou artefatos visuais de perto. Contagem de ações e objetos também pode melhorar quando o modelo revê pequenos segmentos em diferentes taxas de quadros em vez de depender de amostras esparsas.

O lançamento também indica a direção dos produtos multimodais. A compreensão inicial de vídeo muitas vezes significava passar uma representação comprimida ao modelo e esperar que os detalhes relevantes sobrevivessem. O vídeo agêntico torna o modelo mais ativo, mais parecido com um analista que decide onde olhar em seguida. Isso pode melhorar qualidade e eficiência, mas também torna a avaliação mais complexa porque os resultados dependem da estratégia de busca do modelo. Para equipes que constroem IA de vídeo, a pergunta prática será se a economia e os ganhos de precisão se mantêm em seu próprio conteúdo. A proposta do Google é testar menos ingestão estática e mais inspeção dirigida pelo modelo.