Gemini 推出智能体式视频理解:token 最高减少 88%,成本最高降低 66%

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体式视频理解。模型不再按固定帧率被动读完整段视频,而是动态搜索、扫描并检查画面、音频和字幕中的相关片段。官方称,在标准视频分析基准上,token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。开发者可通过 Google AI Studio 和 Gemini Enterprise Agent Platform,把 API 配置设为 agentic 来启用。

Google DeepMind 在官方博客发布了「智能体式视频理解」(agentic video understanding),并同步面向 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 三款模型开放。文章由高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 署名。官方给出的核心数字很直接:在标准视频分析基准上,该功能最多可把 token 消耗降低 88%,把分析成本降低 66%,同时把准确率最多提高 7%。这三个数字都是「最高值」,实际收益会随视频长度与任务类型而变化。 要理解这项更新,先看旧做法。传统的「静态」处理会按固定帧率把整段视频送进模型,默认是每秒 1 帧,开发者可以通过 API 调整。这种做法简单,但有两个硬伤。第一,成本与视频时长线性相关,一段 90 分钟的讲座和一段多小时的录像会吃掉大量 token。第二,开发者被迫二选一:要么承担高昂的 token 成本,要么采用抽帧、截断、摘要等压缩手段,而这些手段往往会丢掉关键细节。官方特别指出,长视频场景,也就是从十分钟的教程到九十分钟的讲座,再到数小时的录像,是这种矛盾最突出的地方,也是新功能收益最明显的地方。 新机制的核心是让模型从被动接收变成主动检索。官方的说法是,模型把自身的推理能力与原生视频工具结合起来,围绕目标动态地搜索、扫描和检查视频中的相关片段,涉及的信号包括视觉画面、音频和字幕转写文本三种模态。模型要自行决定看什么、用多快的速度看、通过哪种模态去看,只取回完成任务所需的时刻与信号。这一过程以「智能体循环」(agentic loop) 的方式完成:模型调用内部工具,加载视频文件中相关的部分,再根据观察结果决定下一步。官方还提到,开发者以前也可以手动实现类似流程,例如自己写代码切片、转写、检索再喂给模型,而现在这套循环由 Gemini 自己完成,开发与维护的工作量因此显著下降。

这一思路与此前推出的「智能体式视觉」(agentic vision) 一脉相承。后者把代码执行与 Gemini 原生的图像理解结合起来。新功能则把同样的思路搬到视频上,依托的是 Gemini 的原生视频工具。官方列出的新能力包括亚秒级的片段检索、更准确的异常检测和精确计数等。这些任务有一个共同点:答案往往只藏在很短的几个时刻里,用 1 FPS 的均匀采样很容易漏掉,而让模型回头放慢速度、反复检查就能解决。 在性能方面,官方称收益覆盖三款受支持的模型,但 Gemini 3.7 Flash 搭配智能体式理解的整体质量最好,也是质量与成本组合最优的一个。官方图表显示,它位于已测试模型的「准确率对成本」帕累托前沿上,也就是说,在被测范围内,没有别的配置能以更低成本取得更高准确率。需要提醒的是,这些结果来自 Google 自己选定的标准视频分析基准,官方摘录中没有给出各基准的名称与逐项数据,读者在评估时应当用自己的业务视频做对照测试。

在使用方式上,该功能目前支持视频上传和 YouTube 视频,通过 Google AI Studio 与 Gemini Enterprise Agent Platform 中的 Gemini API 提供。官方摘要说明,开发者只需把 API 配置设置为「agentic」即可启用。这是一个低迁移成本的开关,现有的视频分析流水线不需要重写。 对开发者和企业而言,影响主要有三点。其一,成本结构改变。长视频分析此前常常因为 token 账单而难以规模化,例如安防录像审阅、会议与课程回顾、媒体资产检索和合规抽检。成本最多降低 66%,会让一批原本不划算的场景变得可行。其二,工程负担转移。过去需要自建的抽帧、分段、转写对齐与检索逻辑,现在可以交给模型内部的工具循环。其三,质量与成本不再必然对立,准确率上升的同时成本下降,这对生产环境尤其有吸引力。

当然,也要看到风险与未知。智能体循环意味着模型会进行多步调用,延迟与行为的可预测性是需要实测的问题,官方摘录并未给出延迟数据。模型自主决定「看哪里」,也可能在极端情况下漏看关键片段,因此对高风险场景,例如安全监控和医疗影像,仍需要抽样复核和人工把关。此外,是否支持更多模型、更多输入来源,官方尚未说明。 从行业趋势看,这次发布说明多模态竞争的重点正在从「能看多长」转向「怎样看得聪明」。上下文窗口再大,逐帧全量输入也不经济。让模型像人一样先浏览、再定位、再细看,是更接近真实工作方式的路线。可以预期,其他模型厂商也会推出类似的主动式媒体检索能力,而开发者的关注点会从预处理流水线转向评测与成本监控。对于正在评估视频 AI 的团队,现实的做法是:先用代表性视频做并行对比,记录 token、成本与准确率,再决定是否迁移。

最后给出一个落地建议。评测时应分开记录三类指标:每个任务的 token 用量、每个任务的总费用,以及答案的正确率。长视频与短视频要分组统计,因为官方明确说收益在长视频上更突出。若短视频上收益有限,也属正常,不必强行全量切换。

Sources