Gemini 智能体式 AI视频理解详解:何时真能省下 88% Token
Gemini 为长视频引入智能体式 AI视频理解:模型按需读取转写、画面帧与音频,官方称最多可减少 88% Token。本文拆解支持的模型、Interactions API 接入方式、真实成本与性能边界,并说明静态处理仍然占优的场景,帮助团队用可验证的测试流程判断这项能力是否值得投入生产。

2026年9月1日,Google 为 Gemini API 引入了一种新的长视频读取方式:模型不再按固定频率加载整条时间线,而是只调取回答当前问题所需的转写、画面帧或音频。据 Google 称,这种 AI视频理解方式最多可将长视频的 Token 用量减少 88%;但这个比例只是上限,并不代表每张账单都会统一打折。
Gemini 智能体式 AI视频理解到底是什么
过去的默认方案是静态处理。Gemini 每秒提取一帧,同时处理音频,再把这些素材放入上下文窗口,一次性给出答案。不管问题是否需要完整视频,模型都会按固定采样率查看整条时间线,因此这种方式的资源消耗更容易预测。
新选项是智能体式处理。模型先判断需要哪些证据,再按需请求某段转写、载入相关时刻的画面帧、检查音频,并可重复这一过程,最后才组织答案。说得直白一点,Gemini 现在会先在视频内部搜索,再回答关于视频的问题。
可以把它理解成一名在影像档案馆工作的研究员。静态模式会让所有胶片依次从桌前经过;智能体模式则先查目录,找出最可能相关的胶片,核对具体场景,只有证据不足时才继续调取下一段素材。
该能力已面向 gemini-3.7-flash、gemini-3.6-flash 和 gemini-3.5-flash-lite 推出,同时支持 Interactions API 与 GenerateContent API。Interactions API 是更推荐的接入路径。下文也以它为例,因为响应会展示模型的处理步骤。

这套循环背后新增了两种响应步骤。processing_call 表示模型请求另一段视频或转写,对应的 processing_result 则包含返回内容。只要 interaction.steps 中出现这两类步骤,就说明智能体导航确实运行了。应用可以把它们展示为处理进度,但不需要像自定义函数调用那样逐一响应。
有一条边界必须说清:这是视频理解,不是视频生成。这三个模型接收视频、输出文本。如果目标是创建或编辑视频,应使用另一套 Gemini Omni Flash 工作流。
为什么 AI视频理解中的 88% 值得关注
静态视频的成本增长方式非常直接。按低媒体分辨率计算,指南估算每秒视频约消耗 100 Token。因此,一小时视频在生成答案之前,就会产生约 360,000 个输入 Token。按照 Gemini 3.7 Flash 或 3.6 Flash 当前的 Standard 费率,在 2026年12月31日之前,每 100 万个输入 Token 收费 $0.75,这部分输入成本约为 $0.27。
如果输入预算完整实现 88% 的降幅,用量会降至 43,200 Token;按同一费率计算,约为 $0.0324。这正是最理想的使用场景:面对一段很长的录像,只问一个目标明确的问题,不必再把每个采样帧都塞进上下文。
但这并不是整张账单。智能体探索会产生按输出费率计费的思考 Token,也会产生用于加载转写、音频和画面帧的工具调用 Token。当问题范围很宽,或视频画面信息密集时,模型也可能查看更多素材。Google 称长篇内容的质量约提升 7%,但公开指南没有展示这一数字背后的基准测试。
模型不同,单价也不同。Gemini 3.5 Flash-Lite 的 Standard 费率为每 100 万个输入 Token $0.30、每 100 万个输出 Token $2.50。Gemini 3.7 Flash 和 3.6 Flash 每 100 万个输入与输出 Token 的费率则分别为 $0.75 和 $3.75,该价格有效至 2026 年底;两者的计划费率都将在 2027年1月1日翻倍。
因此,智能体式视频理解可以同时从两个方向创造价值:既能让更长的素材纳入上下文预算,也能减少模型真正需要检查的付费内容。视频越长、问题越聚焦,收益通常越明显。
哪些用户不会受到影响?处理三十秒产品短片的团队,不太可能获得同等收益。已经明确只需某个五分钟片段的工作流,直接截取该片段并使用静态模式或许更合适。Gemini 消费者应用的用户同样不会多出一个开关;Google 推出的是 API 处理参数,而不是面向消费者的控制项。
哪些团队现在就能用上
管理一小时培训录像的 L&D 负责人
大型企业的学习与发展负责人可以上传一场录制好的工作坊,让模型提炼主要流程、每项流程对应的示例,并生成测验。智能体模式可以先查看转写,在幻灯片或现场演示至关重要时再调取画面帧,其余无关片段则不必处理。
它的价值不只是降低摘要成本。同一份素材还可以回答“演讲者如何解释升级处理?”这类定向问题,无须先用每一帧填满上下文窗口。
审阅客户访谈的 SaaS 研究负责人
产品研究负责人可以让模型从一小时访谈中找出客户提到上手阻力、定价困惑或缺失工作流的所有时刻。答案可附带时间戳,方便研究人员回到原始录像核对,再决定是否把模型输出转化为产品决策。
真正的收益是审阅更快,同时保留核查路径。Gemini 负责缩小素材范围,研究人员仍需检查支撑结论的原始片段。
检索素材库的媒体运营团队
媒体团队可以让 Gemini 检查一场很长的网络研讨会、员工大会或访谈,定位某个指定主题出现的时刻。这正是智能体模式的典型任务:时间线很长,检索目标很具体。
这样一来,交接会更高效。剪辑师拿到的是可能相关的时刻与时间戳,而不是对整期内容的宽泛总结。
筛查质检录像的制造业 QA 工程师
QA 工程师可以用智能体模式在长时间摄像记录中搜索特定事件,例如防护门开启或警示灯发生变化。Gemini 找到可疑区间后,工程师再用静态模式处理这一小段视频。
第二步不可省略。当每个采样帧都很重要时,静态模式仍是更合适的工具;Google 也提醒,每秒一帧的处理方式可能漏掉快速动作。这个流程先用智能体模式定位大致区间,再由静态模式或专用视觉系统确认事件。
让课堂问答持续下去的教育产品
教育产品开发者可以围绕一节课程建立一轮交互,再让学生通过 previous_interaction_id 连续追问。服务器会保留视频上下文,产品不必每轮都重建完整对话。
其价值在于形成真正的学习会话,而非一次性的摘要。需要注意的是状态管理:如果产品采用无状态模式,就必须重放返回的每一个处理步骤,否则下一轮回答会丢失视频上下文。
如何通过 Interactions API 启用智能体模式
最短且接近生产环境的方案,是使用 Google 官方 Gen AI Python SDK 与 Files API。对于时长较长的视频、计划重复提问的素材,以及总请求超过 20 MB 的情况,都应使用 Files API。
设置 API 密钥并安装 SDK
在 Google AI Studio 创建 Gemini API 密钥,将其写入
GEMINI_API_KEY,然后安装当前版本的 SDK:Bashexport GEMINI_API_KEY="YOUR_API_KEY" pip install -U google-genai上传视频并请求智能体式处理
把路径替换为本地视频文件。下面是 Google 智能体视频指南中的 Python 流程:
Pythonimport time from google import genai client = genai.Client() # Upload a long video video_file = client.files.upload(file="path/to/lecture.mp4") while video_file.state.name == "PROCESSING": time.sleep(2) video_file = client.files.get(name=video_file.name) # Use agentic processing interaction = client.interactions.create( model="gemini-3.7-flash", input=[ { "type": "video", "uri": video_file.uri, "mime_type": video_file.mime_type, "processing": "agentic" }, {"type": "text", "text": "What are the three main arguments presented?"} ] ) print(interaction.output_text)先验证模式,再采信测试结果
检查
interaction.steps。你应该先看到processing_call和processing_result条目,之后才是最终的model_output。没有看到前两类步骤,就不能证明请求使用了动态导航。用正确的指标做对照测试
用同一批有代表性的视频和问题,分别测试静态模式与智能体模式。比较总输入 Token、思考 Token、工具调用 Token、首 Token 延迟、答案质量和最终成本。88% 是厂商给出的最高值,能否在生产环境成立,取决于实际提示词组合。
最常见的错误,是把 processing 放在请求对象上,而不是视频对象内。它必须位于该视频输入内部。一条请求包含多个视频时,每个视频都可以选择自己的模式:长课程可使用智能体模式,短实验片段则保持静态模式。
提示词顺序也有影响。当输入由一个视频和一段文本组成时,Google 建议像上面的示例一样,先放视频,再放文本提示词。
必须坦白的限制
智能体模式用搜索循环替代了固定扫描。对于五分钟以内的短片,这个循环可能会略微增加首 Token 延迟,因为模型要先推理、请求素材并等待内部工具返回结果,之后才开始生成最终答案。如果视频很短,而且应用对延迟敏感,静态模式仍是更干净的默认选择。
自定义截取与帧率控制是另一条明确边界。start_offset、end_offset 和自定义 fps 只适用于静态处理。如果已经知道准确区间,截取后发起静态请求,往往比让模型重新寻找一次更简单,也更可预测。
输入限制也要谨慎处理,因为 Google 当前指南存在前后矛盾:对照表把内联数据标注为低于 100 MB,但详细的内联章节却要求总请求低于 20 MB,并明确表示超过 20 MB 时应使用 Files API。在 Google 统一页面说法之前,按更保守的 20 MB 门槛执行。
Files API 本身允许付费账户上传最大 20 GB 的文件,免费账户上限为 2 GB。上下文窗口为 1,048,576 Token 的模型,最多可处理三小时低分辨率视频,或一小时高分辨率视频。系统支持公开 YouTube URL,但不支持私享和不公开的视频。免费层的 YouTube 输入还限制为每天八小时。
多轮状态在生产环境中还有一个陷阱。使用 previous_interaction_id 的有状态请求,会在服务器上保留视频上下文。无状态请求则必须回传每一个 processing_call 和 processing_result 步骤。省略这些步骤目前不会报错,但 Google 表示视频上下文会消失,后续回答质量将大幅下降。重放步骤也会增加输入 Token。
最后,检索不等于验证。Google 自己的安全指南也指出,模型输出可能不准确,后处理与人工评估必不可少。涉及医疗、法律、安全、合规或需要精确到画面帧的决策时,可以用 Gemini 定位证据,但必须让人工或确定性系统留在审批链路中。
现在该怎么选
如果产品会把长时间录像交给 Gemini,并针对某个时刻、主题或论点提出聚焦问题,本周就可以尝试智能体模式。优先考虑答案质量时,从 Gemini 3.7 Flash 开始;业务量与成本更重要时,再测试 Gemini 3.5 Flash-Lite。
如果视频很短、启动延迟至关重要、需要截取或自定义帧率,或者任务要求稳定扫描整条时间线,就继续使用静态模式。新选项并没有淘汰旧方案,只是增加了第二种读取策略。
如果产品还无法分别记录各类用量字段,或无法依据源视频时间戳核对答案,则应暂缓上线。缺少这些凭证,就无法判断智能体导航究竟降低了成本,还是仅仅把 Token 从一个类别挪到了另一个类别。
如果需求是视频生成、Gemini 消费者功能或确定性的逐帧分析,这次更新不会带来影响。它们属于不同产品,也对应不同技术问题。
如果希望下一次平台更新也能被转化为可执行的判断,欢迎订阅邮件通讯。
2026年9月2日
