Google 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能
Introducing agentic video understanding with Gemini
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
官方给出 token 与成本降幅及可用入口,读者可据此判断长视频分析的成本结构变化。
2026年9月1日
|
我们全新的视频分析智能体功能可将 token 消耗降低多达 88%,成本降低多达 66%,质量提升多达 7%。
Rohan Doshi
Google DeepMind 高级产品经理
Mario Lučić
Google DeepMind 研究总监
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 仍处于实验阶段
今天,我们在最新模型中推出智能体视频理解功能:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这一新能力在提升准确性的同时,大幅降低了视频分析的 token 用量和成本。与智能体视觉类似——后者将代码执行与 Gemini 模型的原生图像理解相结合——智能体视频理解利用 Gemini 的原生视频工具来提升性能,并解锁视频处理的新能力,例如亚秒级片段检索、更精准的异常检测、精确计数等。
该功能即日起可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 用于视频上传和 YouTube 视频。
基准测试
与当前“静态”处理方式不同——模型以固定帧率(默认 1 FPS,可通过 API 调整)摄取视频——智能体视频理解将模型的核心推理与原生视频工具相结合,跨视觉帧、音频和转录文本动态搜索、扫描和检查目标视频片段。在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型将分析成本降低多达 66%,token 消耗降低多达 88%,同时将准确性提升多达 7%。
这些效率提升在长视频上尤为显著(从 10 分钟的操作指南到 90 分钟的讲座以及数小时的录像),因为静态处理会迫使开发者要么承担高昂的 token 成本,要么采用会丢失关键细节的技术。
启用智能体视频理解后,Gemini 3.7 Flash 的 token 消耗降低多达 88%,准确性提升多达 7%。
虽然这些收益覆盖全部三款支持的模型,但搭载智能体理解的 Gemini 3.7 Flash 提供了整体最佳的质量,以及质量与成本效率的最佳组合,使其在受测的视频理解模型中处于准确率与成本的帕累托前沿。
使用智能体视频理解使 Gemini 3.7 Flash 处于视频分析的准确率与成本帕累托前沿。
工作原理
静态处理方式让模型以固定帧率摄取媒体流,而智能体视频理解则让 Gemini 在决定看什么、以何种速度、通过哪种模态(帧、音频或转录文本)方面发挥主动的、目标导向的作用,仅获取所需的片段和信号。虽然开发者此前可以手动完成这一工作,但借助智能体视频理解,Gemini 可以通过智能体循环来实现,调用内部工具加载视频文件的相关部分,从而显著减少开发开销。
能力与用例
智能体视频理解改变了开发者处理各类高要求应用中长视频内容的方式。
- 亚秒级片段检索:精确定位在 1 FPS 下极易被遗漏的瞬间状态变化和紧凑的剪辑边界,使精确的自动化视频编辑成为可能。
- 长篇幅大海捞针式搜索:无需消耗数百万 token,即可跨多小时的视频回答复杂查询。
- 异常检测:以更高 FPS 对感兴趣的时间窗口重新采样,以检查快速运动和细微的视觉伪影。
- 动作与物体计数:准确追踪随时间重复的物理动作和不同物体。
真实世界成果
我们的许多早期访问合作伙伴在使用智能体视频理解进行测试时都看到了强劲的性能表现。以下是他们的评价:
开始使用
智能体视频理解可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 使用,将在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出。它采用标准 Gemini API token 定价,不收取额外功能费用。
要启用它,只需在 API 配置中将处理设置为 "agentic"。阅读我们的开发者指南,深入了解该功能以及如何开始使用。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)我们还将智能体视频理解的效率和质量提升带给 Google 各产品中的数十亿用户。该功能将很快在 Gemini 应用中面向所有用户推出,覆盖 Flash 和 Flash-Lite 模型。在未来几个月内,智能体视频理解还将为 YouTube 视频观看页面上的“Ask YouTube”功能提供支持,利用 Gemini 提供基于视觉内容的高质量答案。
感谢以下人员对本工作的贡献: Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及 Agentic Vision 团队。
在您的收件箱中获取 Google 的最新资讯
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等更多内容。
您的信息将按照Google 隐私政策使用。您可以随时选择退出。
来源:Google Gemini Blog · blog.google