Google为Gemini Flash模型推出Agentic视频理解功能,按需导航加载视频片段而非全量摄入,Token消耗降低最高88%。
视频一直是成本最高的推理模态。Gemini 模型拿到一段 90 分钟的讲座视频,此前只能以固定的每秒 1 帧速度全量摄入,无论问题是"总结这段视频"还是"演讲者什么时候切换到定价页的?"。这种单遍设计迫使开发者做一个糟糕的权衡:要么为完整时间线支付高额 context 成本,要么预先分chunk视频但冒着丢失关键细节的风险。
本周,Google 在其 Flash 模型系列上推出了 Agentic Video Understanding 功能。Gemini 不再摄入整个时间线,而是在视频中自主导航——决定看什么、以什么帧率看、通过哪种模态看。Google 报告称最多可减少 88% 的 token,最多降低 66% 的成本,在标准视频基准测试上最高提升 7% 的准确率。
能否部署?可以,但只能作为托管 API 功能使用。没有开源权重,也无法自托管。通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 交付,支持文件上传和公开 YouTube URL 两种方式,计费按标准 Gemini API token 定价,不收额外功能费。
静态处理(仍是每个 Gemini 模型的默认模式)以单遍方式每秒提取 1 帧,处理单声道 1 Kbps 音频,每秒插入时间戳。Agentic 处理则用循环替代了这一切。模型结合自身推理能力与原生视频工具,搜索、扫描、检查目标片段(跨帧、音频和字幕),只加载 prompt 所需的内容。开发者此前已可手动拼装这套流程;改变在于 Gemini 在内部运行这个循环——这正是开发开销消失的地方。
在 Google 的评估中,Gemini 3.7 Flash 配合 Agentic Understanding,在所测模型中处于视频分析准确率-成本 Pareto 前沿。效率提升集中在长视频内容上,从 10 分钟的教程指南到数小时的长录制。
Agentic 处理在响应步骤数组中新增两种步骤类型:当模型请求某个片段或字幕时的 processing_call,以及该加载完成时的对应 processing_result。它们与 thought 步骤交错出现,并位于 model_output 之前,因此可以在 UI 中驱动实时进度追踪。通过它们的存在,你也能验证 Agentic 模式是否实际运行了。
Token 计算也因此分拆。导航推理按 thought token 计费(total_thought_tokens);按需加载的帧、音频和字幕按 tool-use token 计费(total_tool_use_tokens)。
启用方式只需在 video part 上设置一个字段:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
也可以在单个请求中对同一视频混用不同模式——长讲座用 agentic,短剪辑用 static。
Agentic 模式让 Gemini 可以在视频时间线中自主导航,而非以固定 1 FPS 摄入。
Google 报告最多减少 88% 的 token、66% 的成本,视频基准测试最高提升 7% 的准确率。
支持 Gemini 3.8、3.7、3.6 Flash 及 3.5 Flash-Lite;通过一个 processing 字段启用。
静态模式对 5 分钟以下的片段和逐帧精确工作仍然更优。
标准 API 定价适用,但导航推理按 thought token 计费。
查看 Google 官方博客、Gemini API 视频理解文档、AI Studio 中的开发者指南以及 Agentic Vision 公告。另外,欢迎关注我们的 Twitter,记得加入我们的 15 万+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 Telegram 吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。在统计分析、机器学习和数据工程方面有坚实基础,擅长将复杂数据集转化为可操作的洞察。