AREX Feed Article
Gemini 上线智能体视频理解:官方称最多省 88% token,三款 Flash 模型即日开放
9 月 1 日, 与 同日官宣,为 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 推出 agentic video understanding(智能体视频理解)。官方称,模型不再扫描整个视频文件,而是跨视频的 transcript(转录稿)、音频与画面帧推理,动态调整帧率提取关键时刻,分析准确率更高,token 用量最多减少 88%,效率提升对长视频最明显。
Google AI Developers 同步放出的演示视频里,Gemini 3.7 Flash 自动调速,准确识别并逐次数清了视频中的每一次鼓掌(clap)。官方解释,静态处理默认按固定 1 FPS(每秒 1 帧)摄取视频,转瞬即逝的动作容易被整个漏掉,或被误认成响指(snap)、点击(click)。
从固定 1 FPS 到按需重采样:模型自己决定看哪里
今年 1 月 27 日,Google 在 Gemini 3 Flash 上推出 ,把图像理解变成结合代码执行的主动检查,官方称在多数视觉基准上带来 5~10% 的质量提升;视频版沿用同一思路。由 Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 署名,9 月 1 日发布。
博客解释,静态处理是让模型以固定帧率处理整段视频流;agentic 模式则让模型在 agentic loop(智能体循环)中自行决定看哪一段、用什么速度、走哪个模态(帧、音频或 transcript),只取需要的时刻与信号,调用内部工具加载视频的相关部分。官方配图画出了这条循环:模型在 Observation(观察)与 Think(思考)之间反复,按需调用 get_transcript、get_frames(start, end, fps)、get_audio(start, end) 三个工具。
旧方式的成本,Google 的 写得很清楚:视觉描述默认按 1 FPS 采样,默认分辨率下每秒视频约消耗 300 token,100 万 token 的上下文窗口只能覆盖约 1 小时视频(低分辨率可到 3 小时)。博客称,静态处理让开发者不得不在「高 token 成本」与「丢失关键细节」之间二选一,这正是 10 分钟教程、90 分钟讲座、数小时录制这类长视频的痛点。
数清每一次鼓掌:演示与官方基准图表
演示之外,官方公布了跨标准视频理解基准的对比图表(均为 Google 官方发布口径)。以 3.7 Flash 为例:token 消耗上,Minerva 从 80.9K 降到 33.6K,1H-VideoQA(1 小时视频问答基准)从 397.6K 降到 47.7K,LVBench(长视频基准)从 300.3K 降到 36.0K;准确率上,三者分别从 73.7% 升到 79.0%、87.5% 升到 88.5%、85.1% 升到 88.6%。按图表数字复算,两项长视频基准的 token 降幅都约 88%,与官方「最多减少 88%」的表述吻合。
官方称,综合所有基准,agentic 模式比静态处理成本最多降 66%、准确率最多升 7%;三个模型里,3.7 Flash 加 agentic 理解的整体质量与质量-成本组合都最好,处于被测模型的「准确率-成本」pareto 前沿(帕累托前沿)。官方图表把 3.7 Flash 与 GPT 5.6 Sol、GPT 5.6 Terra、Claude Opus 5.0、Grok 4.6 放进同一张 1H-VideoQA 散点图比较。
官方列出的四类用例是:亚秒级时刻检索(1 FPS 下容易漏掉的瞬间状态变化与剪辑边界)、长视频 needle-in-a-haystack(大海捞针)检索、异常检测(对感兴趣的时间窗用更高帧率重采样)、动作与物体计数。
即日可用:processing 设为 agentic,不加收功能费
上线方式上,官方口径一致:今日起对视频上传与 YouTube 视频开放,通过 Gemini API 在 Google AI Studio 与 Gemini Enterprise Agent Platform 使用,三个模型都支持。启用只需在 API 配置里把 processing 设为 agentic,官方博客给出的示例:
from google import genai
client = genai.Client()interaction = client.interactions.create( model="gemini-3.7-flash", input=[ {"type": "video", "uri": "https://youtu.be/7Z5Vy9JBANs", "processing": "agentic"}, {"type": "text", "text": "What are the 3 most important announcements in this keynote?"}, ],)print(interaction.output_text)定价沿用标准 Gemini API token 计费,不另收功能费。接下来的两步在官方博客里有明确时间表:该能力即将在 Gemini 应用中向所有用户推出,覆盖 Flash 与 Flash-Lite 模型;未来几个月,将驱动 YouTube 视频观看页的 "Ask YouTube" 功能,用 Gemini 给出锚定在画面内容上的回答。
团队转发庆祝,社区追问「采样间隙丢了什么」
发布当天,三位参与该工作的 Google DeepMind 成员转发了公告,名字都出现在官方博客的致谢名单里。Gemini Vision 团队技术项目经理 写道:「我们 Google DeepMind 的一小群人拼命把它做了出来。在众多『第一次』中,正式推出 Agentic Video:少 88% 的 token,少 66% 的成本,多 7% 的质量。」研究科学家 说:「今天,我们在 Gemini 里正式推出 Agentic Video,把智能体能力直接带到视频,让模型主动检查、锚定并推理时间维度的视觉上下文。」
中文社区里,自称全栈开发者的「兵五进一」(1.3 万粉丝)把这次更新的核心概括为「效率结构变了」:「以前做视频理解,模型基本要把画面按固定采样率转成 token,视频一长,上下文消耗跟着涨……智能体式理解相当于把均匀灌输换成按需读取,跟人看长视频时快进无关片段、放慢关键片段很像。」他也留了保留意见:「我更想看到它在真实长视频基准上的表现。」
工程侧的追问更具体。自称 ex-Googler、研究 AI/ML 的 问:「完全落在初始采样之间的事件,召回机制是什么?如果一个语义关键、只有 100 毫秒的事件在采样帧、音频和 transcript 里都没有留下线索,是什么让智能体回到那个区间、用更高帧率复查?」用户 直接质疑 88% 的含金量:「88% 省的是检索,不是智能。动态帧率在 2 小时视频上占优,但会漏掉 200 毫秒的叠加画面、一次实验读数、一个界面闪烁。没有逐帧召回兜底,这只是一个穿上能力外衣的成本数字。」
省 token 的幅度有官方图表数字支撑,采样间隙的召回机制则在官宣博客与两条推文中都没有解释。模型靠什么发现并回看这些间隙里的关键瞬间,官方还没有给出答案。