Gemini 智能体式 AI视频理解详解:何时真能省下 88% Token

Gemini 为长视频引入智能体式 AI视频理解:模型按需读取转写、画面帧与音频,官方称最多可减少 88% Token。本文拆解支持的模型、Interactions API 接入方式、真实成本与性能边界,并说明静态处理仍然占优的场景,帮助团队用可验证的测试流程判断这项能力是否值得投入生产。

Wednesday, September 2, 2026Omid Saffari
Tools
Gemini 智能体式 AI视频理解详解:何时真能省下 88% Token

2026年9月1日,Google 为 Gemini API 引入了一种新的长视频读取方式:模型不再按固定频率加载整条时间线,而是只调取回答当前问题所需的转写、画面帧或音频。据 Google 称,这种 AI视频理解方式最多可将长视频的 Token 用量减少 88%;但这个比例只是上限,并不代表每张账单都会统一打折。

Gemini 智能体式 AI视频理解到底是什么

过去的默认方案是静态处理Gemini 每秒提取一帧,同时处理音频,再把这些素材放入上下文窗口,一次性给出答案。不管问题是否需要完整视频,模型都会按固定采样率查看整条时间线,因此这种方式的资源消耗更容易预测。

新选项是智能体式处理。模型先判断需要哪些证据,再按需请求某段转写、载入相关时刻的画面帧、检查音频,并可重复这一过程,最后才组织答案。说得直白一点,Gemini 现在会先在视频内部搜索,再回答关于视频的问题。

可以把它理解成一名在影像档案馆工作的研究员。静态模式会让所有胶片依次从桌前经过;智能体模式则先查目录,找出最可能相关的胶片,核对具体场景,只有证据不足时才继续调取下一段素材。

该能力已面向 gemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-lite 推出,同时支持 Interactions API 与 GenerateContent API。Interactions API 是更推荐的接入路径。下文也以它为例,因为响应会展示模型的处理步骤。

判断维度静态模式智能体模式
读取方式每秒一帧并结合音频,一次处理完毕按需加载转写、画面帧或音频
更适合短视频、低启动延迟、需要覆盖整条时间线的精确任务长视频,以及只关注特定时刻的问题
Token 特征低媒体分辨率下每秒约 100 Token用量不固定,处理长视频时最多可减少 88% Token
额外控制截取时间区间与自定义帧率由模型动态控制浏览过程
默认设置否,需要设置 processing: "agentic"
黏土风视频档案库:静态模式加载全部画面帧,智能体模式选择转写、画面帧和音频
静态模式加载整条时间线;智能体模式会返回查找当前问题所需的证据。

这套循环背后新增了两种响应步骤。processing_call 表示模型请求另一段视频或转写,对应的 processing_result 则包含返回内容。只要 interaction.steps 中出现这两类步骤,就说明智能体导航确实运行了。应用可以把它们展示为处理进度,但不需要像自定义函数调用那样逐一响应。

有一条边界必须说清:这是视频理解,不是视频生成。这三个模型接收视频、输出文本。如果目标是创建或编辑视频,应使用另一套 Gemini Omni Flash 工作流

为什么 AI视频理解中的 88% 值得关注

静态视频的成本增长方式非常直接。按低媒体分辨率计算,指南估算每秒视频约消耗 100 Token。因此,一小时视频在生成答案之前,就会产生约 360,000 个输入 Token。按照 Gemini 3.7 Flash 或 3.6 Flash 当前的 Standard 费率,在 2026年12月31日之前,每 100 万个输入 Token 收费 $0.75,这部分输入成本约为 $0.27。

如果输入预算完整实现 88% 的降幅,用量会降至 43,200 Token;按同一费率计算,约为 $0.0324。这正是最理想的使用场景:面对一段很长的录像,只问一个目标明确的问题,不必再把每个采样帧都塞进上下文。

但这并不是整张账单。智能体探索会产生按输出费率计费的思考 Token,也会产生用于加载转写、音频和画面帧的工具调用 Token。当问题范围很宽,或视频画面信息密集时,模型也可能查看更多素材。Google 称长篇内容的质量约提升 7%,但公开指南没有展示这一数字背后的基准测试。

模型不同,单价也不同。Gemini 3.5 Flash-Lite 的 Standard 费率为每 100 万个输入 Token $0.30、每 100 万个输出 Token $2.50。Gemini 3.7 Flash 和 3.6 Flash 每 100 万个输入与输出 Token 的费率则分别为 $0.75 和 $3.75,该价格有效至 2026 年底;两者的计划费率都将在 2027年1月1日翻倍。

因此,智能体式视频理解可以同时从两个方向创造价值:既能让更长的素材纳入上下文预算,也能减少模型真正需要检查的付费内容。视频越长、问题越聚焦,收益通常越明显。

哪些用户不会受到影响?处理三十秒产品短片的团队,不太可能获得同等收益。已经明确只需某个五分钟片段的工作流,直接截取该片段并使用静态模式或许更合适。Gemini 消费者应用的用户同样不会多出一个开关;Google 推出的是 API 处理参数,而不是面向消费者的控制项。

哪些团队现在就能用上

管理一小时培训录像的 L&D 负责人

大型企业的学习与发展负责人可以上传一场录制好的工作坊,让模型提炼主要流程、每项流程对应的示例,并生成测验。智能体模式可以先查看转写,在幻灯片或现场演示至关重要时再调取画面帧,其余无关片段则不必处理。

它的价值不只是降低摘要成本。同一份素材还可以回答“演讲者如何解释升级处理?”这类定向问题,无须先用每一帧填满上下文窗口。

审阅客户访谈的 SaaS 研究负责人

产品研究负责人可以让模型从一小时访谈中找出客户提到上手阻力、定价困惑或缺失工作流的所有时刻。答案可附带时间戳,方便研究人员回到原始录像核对,再决定是否把模型输出转化为产品决策。

真正的收益是审阅更快,同时保留核查路径。Gemini 负责缩小素材范围,研究人员仍需检查支撑结论的原始片段。

检索素材库的媒体运营团队

媒体团队可以让 Gemini 检查一场很长的网络研讨会、员工大会或访谈,定位某个指定主题出现的时刻。这正是智能体模式的典型任务:时间线很长,检索目标很具体。

这样一来,交接会更高效。剪辑师拿到的是可能相关的时刻与时间戳,而不是对整期内容的宽泛总结。

筛查质检录像的制造业 QA 工程师

QA 工程师可以用智能体模式在长时间摄像记录中搜索特定事件,例如防护门开启或警示灯发生变化。Gemini 找到可疑区间后,工程师再用静态模式处理这一小段视频。

第二步不可省略。当每个采样帧都很重要时,静态模式仍是更合适的工具;Google 也提醒,每秒一帧的处理方式可能漏掉快速动作。这个流程先用智能体模式定位大致区间,再由静态模式或专用视觉系统确认事件。

让课堂问答持续下去的教育产品

教育产品开发者可以围绕一节课程建立一轮交互,再让学生通过 previous_interaction_id 连续追问。服务器会保留视频上下文,产品不必每轮都重建完整对话。

其价值在于形成真正的学习会话,而非一次性的摘要。需要注意的是状态管理:如果产品采用无状态模式,就必须重放返回的每一个处理步骤,否则下一轮回答会丢失视频上下文。

如何通过 Interactions API 启用智能体模式

最短且接近生产环境的方案,是使用 Google 官方 Gen AI Python SDK 与 Files API。对于时长较长的视频、计划重复提问的素材,以及总请求超过 20 MB 的情况,都应使用 Files API。

  1. 设置 API 密钥并安装 SDK

    在 Google AI Studio 创建 Gemini API 密钥,将其写入 GEMINI_API_KEY,然后安装当前版本的 SDK:

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. 上传视频并请求智能体式处理

    把路径替换为本地视频文件。下面是 Google 智能体视频指南中的 Python 流程:

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. 先验证模式,再采信测试结果

    检查 interaction.steps。你应该先看到 processing_callprocessing_result 条目,之后才是最终的 model_output。没有看到前两类步骤,就不能证明请求使用了动态导航。

  4. 用正确的指标做对照测试

    用同一批有代表性的视频和问题,分别测试静态模式与智能体模式。比较总输入 Token、思考 Token、工具调用 Token、首 Token 延迟、答案质量和最终成本。88% 是厂商给出的最高值,能否在生产环境成立,取决于实际提示词组合。

最常见的错误,是把 processing 放在请求对象上,而不是视频对象内。它必须位于该视频输入内部。一条请求包含多个视频时,每个视频都可以选择自己的模式:长课程可使用智能体模式,短实验片段则保持静态模式。

提示词顺序也有影响。当输入由一个视频和一段文本组成时,Google 建议像上面的示例一样,先放视频,再放文本提示词。

必须坦白的限制

智能体模式用搜索循环替代了固定扫描。对于五分钟以内的短片,这个循环可能会略微增加首 Token 延迟,因为模型要先推理、请求素材并等待内部工具返回结果,之后才开始生成最终答案。如果视频很短,而且应用对延迟敏感,静态模式仍是更干净的默认选择。

自定义截取与帧率控制是另一条明确边界。start_offsetend_offset 和自定义 fps 只适用于静态处理。如果已经知道准确区间,截取后发起静态请求,往往比让模型重新寻找一次更简单,也更可预测。

输入限制也要谨慎处理,因为 Google 当前指南存在前后矛盾:对照表把内联数据标注为低于 100 MB,但详细的内联章节却要求总请求低于 20 MB,并明确表示超过 20 MB 时应使用 Files API。在 Google 统一页面说法之前,按更保守的 20 MB 门槛执行。

Files API 本身允许付费账户上传最大 20 GB 的文件,免费账户上限为 2 GB。上下文窗口为 1,048,576 Token 的模型,最多可处理三小时低分辨率视频,或一小时高分辨率视频。系统支持公开 YouTube URL,但不支持私享和不公开的视频。免费层的 YouTube 输入还限制为每天八小时。

多轮状态在生产环境中还有一个陷阱。使用 previous_interaction_id 的有状态请求,会在服务器上保留视频上下文。无状态请求则必须回传每一个 processing_callprocessing_result 步骤。省略这些步骤目前不会报错,但 Google 表示视频上下文会消失,后续回答质量将大幅下降。重放步骤也会增加输入 Token。

最后,检索不等于验证。Google 自己的安全指南也指出,模型输出可能不准确,后处理与人工评估必不可少。涉及医疗、法律、安全、合规或需要精确到画面帧的决策时,可以用 Gemini 定位证据,但必须让人工或确定性系统留在审批链路中。

现在该怎么选

如果产品会把长时间录像交给 Gemini,并针对某个时刻、主题或论点提出聚焦问题,本周就可以尝试智能体模式。优先考虑答案质量时,从 Gemini 3.7 Flash 开始;业务量与成本更重要时,再测试 Gemini 3.5 Flash-Lite。

如果视频很短、启动延迟至关重要、需要截取或自定义帧率,或者任务要求稳定扫描整条时间线,就继续使用静态模式。新选项并没有淘汰旧方案,只是增加了第二种读取策略。

如果产品还无法分别记录各类用量字段,或无法依据源视频时间戳核对答案,则应暂缓上线。缺少这些凭证,就无法判断智能体导航究竟降低了成本,还是仅仅把 Token 从一个类别挪到了另一个类别。

如果需求是视频生成、Gemini 消费者功能或确定性的逐帧分析,这次更新不会带来影响。它们属于不同产品,也对应不同技术问题。

如果希望下一次平台更新也能被转化为可执行的判断,欢迎订阅邮件通讯

最近更新

2026年9月2日

分类Explained

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Explained 文章

查看全部 Explained 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。