Gemini 3.7/3.6/3.5 Flash新增智能帧选择能力,模型自主决定关注视频的哪些片段与分辨率,而非均匀抽帧,精度和效率同步提升。
Google 正在为其 Gemini Flash 模型配备基于 Agent 的视频分析功能,可以动态搜索视频内容,而非按固定模式逐帧扫描。
模型自主决定分析视频的哪些部分以及如何分析,Google 声称此举最高可节省 88% 的 token用量,成本降低 66%,同时提升准确率。
该功能现已通过 Gemini API 提供,用于在长视频中查找特定场景,后续计划集成到 Gemini 应用和 YouTube。
Google 正在为多个 Gemini 模型添加基于 Agent 的视频分析。与按固定速率逐帧扫描视频不同,模型会自主搜寻相关片段,Google 声称这大幅削减了 token 用量和成本。
最新模型 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 能够捕捉不到一秒的瞬间,包括状态变化或切换——这类细节在每秒一帧的采样率下会漏掉。Google 表示,这让自动化视频编辑变得更加精准。
该系统还能在数小时的视频素材中定位单个场景,而不会消耗数百万 token。它通过以更高帧率重采样可疑时间段来发现异常,并准确计数随时间重复的动作和单个物体。
在 1H-VideoQA 和 LVBench 上,token 用量下降 88%,而准确率略有提升。| 图片:Google

此前,Gemini 依赖静态处理,默认以每秒一帧的固定帧率对视频进行采样,可通过 API 调整。自 2025 年推出原生视频分析以来,Gemini 一直在转录音轨并按每秒一次的方式分析画面。
Google 表示,基于 Agent 的变体将模型的推理直接绑定到原生视频工具。模型自主决定查看哪些部分、以什么速度、通过哪种模态——无论是画面、音轨还是转录文本。它只提取给定任务实际需要的片段和信号。
Gemini 现在只加载视频中重要的部分
Gemini 现在使用内部工具来获取视频的相关部分。开发者此前可以手动构建这种选择性加载方式,但现在模型自己就能处理。
Gemini 不再以固定帧率加载视频,而是使用循环来选择性检索所需部分的画面、音轨或转录文本。| 图片:Google

该方法建立在 Google 于今年 1 月为 Gemini 3 Flash 推出的"Agent 视觉"功能之上。那项功能让模型能够编写和运行 Python 代码来缩放、裁剪和标注图像,在响应前通过思考-行动-观察循环检查每个结果。发布时它并非在所有情况下都自动生效,但基础架构已经就位。Google 在去年 12 月宣布 Gemini 3 Flash 时,就已标注视频视觉和空间推理为即将推出的能力。
效率提升在长视频上表现最为明显,从 10 分钟的教程到 90 分钟的讲座再到数小时的录像。使用静态处理,开发者不得不在高 token 成本和丢弃重要细节的方法之间做出取舍。在 Google 自己的基准测试(包括 LongVideoBench)上,采用基于 Agent 分析的 Gemini 3.7 Flash 在整体质量上得分最高,同时实现了准确率和成本效率的最佳组合。
在 Google 自己的 1H-VideoQA 评估中,Gemini 3.7 Flash 以最低的每次查询成本达到了最高准确率。| 图片:Google

API 不额外收费
该功能现已通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent 平台提供,支持视频上传和 YouTube 视频。开发者在 API 配置中将处理模式设置为"agentic",按标准 Gemini API token 费率付费,不收取额外费用。更多详情请参阅开发者指南。
Google 计划也将这些改进带到自己的产品中。该功能将很快面向所有 Gemini 应用中 Flash 和 Flash Lite 设备用户推出。在未来几个月内,基于 Agent 的视频分析也将为播放页面上的"询问 YouTube"功能提供支持,使回答与视频中实际可见内容更加紧密相关。
无炒作的 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、周报 AI 新闻通讯、六期/年专属"AI Radar"前沿报告、完整档案访问以及评论区权限。