Google DeepMind发布Gemini智能体视频理解,token消耗最高降88%
Introducing agentic video understanding with Gemini
Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。
官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。
2026年9月1日
|
我们用于视频分析的全新智能体功能可削减高达88%的令牌消耗,降低高达66%的成本,并将质量提升高达7%。
Rohan Doshi
Google DeepMind高级产品经理
Mario Lučić
Google DeepMind研究总监
收听文章
[[duration]]分钟
此内容由Google AI生成。生成式AI尚处于实验阶段
今天,我们在最新模型中推出智能体视频理解:Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。这一新功能提升了准确性,同时大幅减少视频分析的令牌消耗和成本。与结合代码执行与Gemini模型原生图像理解的智能体视觉类似,智能体视频理解利用Gemini的原生视频工具提升性能,并解锁视频处理的新能力,如亚秒级时刻检索、更准确的异常检测、精确计数等。
该功能今日上线,支持通过Google AI Studio中的Gemini API以及Gemini企业智能体平台上传视频和YouTube视频。
基准测试
与当前“静态”处理(模型以固定帧率(默认1 FPS,可通过API调整)摄取视频)不同,智能体视频理解将模型的核心推理与原生视频工具相结合,动态搜索、扫描和检查视觉帧、音频和转录文本中的目标视频片段。在标准视频分析基准测试中,采用智能体视频理解的Gemini模型将分析成本降低高达66%,令牌消耗减少高达88%,同时准确性提升高达7%。
这些效率提升在长视频(从10分钟操作指南到90分钟讲座及数小时录制)中尤为显著,因为静态处理迫使开发者在高令牌成本或遗漏关键细节的技术之间做选择。
启用智能体视频理解后,Gemini 3.7 Flash的令牌消耗可减少高达88%,准确性提升高达7%。
虽然这些提升覆盖所有三种受支持模型,但采用智能体理解的Gemini 3.7 Flash在整体质量上最优,且在质量与成本效率的组合上最佳,使其在测试的视频理解模型中处于准确性与成本的帕累托前沿。
使用智能体视频理解使Gemini 3.7 Flash位于视频分析准确性与成本的帕累托前沿。
工作原理
与静态处理(模型以固定帧率摄取媒体流)不同,智能体视频理解使Gemini能够以主动、目标导向的方式决定观看什么、以什么速度、通过哪种模态(帧、音频或转录文本),仅获取所需的时刻和信号。此前开发者可能需要手动实现,而借助智能体视频理解,Gemini可通过智能体循环完成,调用内部工具加载视频文件的相关部分,大幅降低开发开销。
能力与用例
智能体视频理解改变了开发者在各种严苛应用中处理长视频内容的方式。
- 亚秒级时刻检索:精确定位在1 FPS下容易错过的瞬间状态变化和紧凑剪切边界,使精确的自动视频剪辑成为可能。
- 长篇视频中的大海捞针式搜索:在不消耗数百万个令牌的情况下,回答跨越数小时视频的复杂查询。
- 异常检测:以更高的帧率重新采样感兴趣的时间窗口,以检查快速运动和细微的视觉伪影。
- 动作与物体计数:随时间准确跟踪重复的物理运动和不同的物体。
真实世界的结果
我们的许多早期访问合作伙伴在测试智能体视频理解时都看到了强劲的表现。以下是一些反馈:
开始使用
智能体视频理解可通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform中使用,并将在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite上推出。它使用标准的Gemini API令牌定价,不收取额外功能费用。
要启用它,只需在API配置中将处理设置为“agentic”。阅读我们的开发者指南,了解更多关于该功能以及如何开始使用的信息。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)我们还将把智能体视频理解的效率和质量改进带给Google产品中的数十亿用户。该功能将很快在Gemini应用中的Flash和Flash-Lite模型上向所有用户推出。在接下来的几个月里,智能体视频理解还将为YouTube视频观看页面上的“Ask YouTube”功能提供支持,利用Gemini提供基于视觉内容的更高质量答案。
感谢以下人员对此工作的贡献: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin, 以及Agentic Vision团队。
在收件箱中获取Google的最新消息
注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
您的信息将按照Google的隐私政策使用。您可以随时选择退出。
来源:Google DeepMind · deepmind.google