AI 模型

Google 为 Gemini 模型推出 agentic 视频理解能力

Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic 视频理解,降低 token 与成本并提升视频分析质量。

发布于 更新于
Google DeepMindGemini视频 AI

Google 9 月 1 日为 Gemini 推出 agentic 视频理解能力,把一种新的视频分析模式加入 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。公司称,在标准视频分析基准上,这项能力最多可减少 88% token 消耗、降低 66% 成本,并让质量提升最多 7%。它已经通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 面向视频上传和 YouTube 视频开放。

这项能力改变了模型“观看”视频的方式。传统静态处理通常以固定帧率读取视频,默认往往是每秒一帧,开发者可以通过 API 调整。这样的方式简单,但面对长视频或关键画面只短暂出现的任务时并不高效。agentic 视频理解让 Gemini 以更目标导向的方式处理视频:模型可以在视觉帧、音频和转录文本之间动态搜索、扫描和检查相关片段,只提取回答问题所需的时刻和信号。

Google 把它类比为 agentic vision,后者结合代码执行和 Gemini 原生图像理解。在视频场景中,类似的 agent 循环让模型决定看什么、以什么速度看、通过哪种模态看。比如要在 90 分钟讲座中找到某个具体时刻,模型不必以相同深度处理每一秒。它可以先用转录文本缩小时间范围,再检查相关片段附近的画面,需要时听取音频,最后给出有依据的回答。Google 称,这能减少开发者过去需要自行构建的视频检索和预处理工作。

长视频场景让效率提升尤其有价值。做教育工具、媒体档案、安全分析或会议回顾产品的开发者,常常要在准确率和成本之间取舍。更高帧率能捕捉更多细节,却会迅速消耗 token 并推高账单;更低采样能省钱,却可能错过快速动作、细微异常或精确剪辑边界。Google 表示,agentic 视频理解通过在关键窗口必要时提高采样,而不是对无关片段一视同仁地处理,从而改善这种权衡。

Google 列出的使用场景也说明,这不仅是成本优化。亚秒级时刻检索可以识别紧密剪辑或快速状态变化,对自动剪辑和体育分析很重要。大海捞针式长视频搜索可以在不消耗数百万 token 的情况下回答多小时视频中的问题。异常检测可以聚焦有价值的时间窗口,更细致地检查运动和视觉伪影。动作和物体计数也会受益,因为模型可以用不同帧率反复查看短片段,而不是依赖稀疏采样。

这次发布也显示多模态 AI 产品的发展方向。早期视频理解常常意味着把压缩后的视频表示交给模型,再期待关键细节没有丢失。agentic 视频让模型更主动,更像一个会决定下一步看哪里的人类分析员。这可能同时提升质量和效率,但也让评估更复杂,因为结果取决于模型的搜索策略。对视频 AI 团队来说,实际问题是这些成本节省和准确率提升能否在自己的内容上保持稳定。Google 这次提供的是一种新选择:减少静态吞吐,让模型自己决定该看哪里。