2026 年电脑操作 AI Agent 选型:多模态大模型全面对比

对比 GPT-5.6 Sol、Claude Opus 5、Gemini 3.7 Flash 与 DeepSeek V4-Flash-Vision-Exp 的电脑操作能力、API 价格、安全控制和落地门槛,用统一 token 任务与 22 秒测试,判断哪款 AI Agent 以最低验收成本完成浏览器、移动端和桌面自动化。

Wednesday, September 2, 2026Omid Saffari
2026 年电脑操作 AI Agent 选型:多模态大模型全面对比

2026 年,电脑操作 AI Agent 的综合首选是 GPT-5.6 Sol;但按 50,000 个输入 token、5,000 个输出 token 的统一任务口径计算,纯模型成本为 $0.40。同样的 token 用量下,Gemini 3.7 Flash 为 $0.05625,DeepSeek V4-Flash-Vision-Exp 为 $0.0143 至 $0.0286。真正该买的不是 token 标价最低的路线,而是每次验收通过成本最低的路线。

AI Agent 电脑操作模型速览

下面四条路线对应的是不同形态的电脑操作。GPT-5.6 Sol、Claude Opus 5 和 Gemini 3.7 Flash 都提供定义明确的电脑操作工具与动作循环。DeepSeek V4-Flash-Vision-Exp 只提供视觉模型和通用工具调用;电脑动作、执行器、审批机制和故障恢复都要由应用自行实现。

价格核验于 2026 年八月 22 日。“起步价”指每百万 token 的 API 直销标价,按输入/输出展示;除非另有说明,不含执行器托管、工具费、重试和人工审核。

工具最适合起步价免费试用
GPT-5.6 Sol已披露电脑操作质量最高每 MTok $5/$30API 无免费层
Claude Opus 5治理要求严格的企业桌面与浏览器任务每 MTok $5/$25新用户少量额度
Gemini 3.7 Flash成本最低的原生电脑操作路线截至十二月 31 日每 MTok $0.75/$3.75Computer Use 不提供
DeepSeek V4-Flash-Vision-Exp预算优先的自定义 Agent 执行框架非高峰每 MTok $0.22/$0.66未公开

综合排名:

  1. GPT-5.6 Sol:操作失败代价高、又希望获得本组最强已披露电脑操作成绩时,它是综合首选。
  2. Claude Opus 5:如果浏览器结构感知、提示词注入自动确认、数据处理或受监管工作负载资格比 benchmark 领先更重要,它更适合企业控制场景。
  3. Gemini 3.7 Flash:可回滚的浏览器、移动端和桌面自动化中,它是性价比最高的原生路线。模型已经 GA,但 Computer Use 仍处于 Preview。
  4. DeepSeek V4-Flash-Vision-Exp:适合已经拥有执行器和评测体系、希望压低成本底线的技术团队。它是实验性视觉核心,不是开箱即用的电脑操作系统。

不要因为一个模型能在截图中识别按钮,就采购电脑操作模型。生产级 Agent 必须能感知状态、提出许可范围内的动作、在隔离环境中执行、观察结果、从错误中恢复,并在产生后果前停下等待审批。所谓“最佳模型”,应当是在可接受风险下,以最低成本跑完整个闭环的路线。

一分钟看懂结论

高价值任务中,一次状态漏判、坐标错误或恢复失败就可能耗掉操作人员几分钟,此时应优先选择 GPT-5.6 Sol。OpenAI 公布 Sol 在 OSWorld 2.0 上达到 62.6%。这是厂商披露的 benchmark 结果,不代表它在你的 CRM、理赔门户或桌面应用里也有相同表现;但在当前四条路线中,这是已披露的最强电脑操作成绩。

如果控制层本身就是采购重点,选择 Claude Opus 5。Anthropic 当前工具集提供 17 个客户端动作,可在一轮中批量返回多个动作;另有能够读取页面结构的浏览器专用工具,并会自动检查截图中疑似提示词注入的内容。Computer use 现已在 Claude API 上 GA,少了一项重要的采购障碍,不过运行环境与动作执行仍由你的应用负责。

如果工作流可以回滚、需要原生动作 schema,又必须把成本压到接近底线,选择 Gemini 3.7 Flash。在本文统一工作负载下,它的标准化 token 成本远低于 Sol。Google 还会给出动作意图和安全决策,便于审批与日志记录。代价是产品状态:Gemini 3.7 Flash 已 GA,但 Computer Use 仍是 Preview;Google 也明确提醒,涉及敏感或不可逆操作时必须严密监督。

只有当“自己搭建缺失的控制平面”对团队来说反而是优势时,才选择 DeepSeek V4-Flash-Vision-Exp。它的高峰 token 价格仍低于 Gemini 当前 Standard 费率;在不计文本和输出的情况下,100 张达到最大 token 用量的截图输入,高峰期成本不超过 $0.016896。低价确实有意义,但缺少第一方电脑动作工具同样关键。没有现成浏览器或桌面执行框架的团队,应把工程与安全体系本身视为产品开发,而不是简单配置。

按电脑操作任务风险与控制需求,将工作负载分配给 GPT-5.6、Claude、Gemini 或 DeepSeek 的实体决策流程
先判断任务风险和所需控制层,再选择模型路线。

22 秒测试:token 单价为什么不等于任务成本

截图 Agent 运行的是循环,而不是一次推理。应用发送截图和状态,模型返回一个动作或一小批动作,执行器完成操作,应用再捕获新状态并继续询问。每一轮都可能增加图像 token、工具定义、动作结果与延迟,也多一次需要故障恢复的机会。

因此,模型公布的输入价格只是成本底线。真正的采购指标是:

每次验收通过成本 = 模型 token + 工具费 + 执行器运行成本 + 人工审核 + 重试成本,再除以验收通过次数。

“验收通过”是关键。模型说任务完成,并不代表任务真的完成;输出必须通过确定性校验或指定人工标准。比如表单录入可以要求每个字段都与源记录一致,而且最终提交仍需审批;视觉 QA 则可以要求目标流程已跑通、预期元素已出现,并保留证据截图。

为了横向比较 API 价格,本文采用一个统一任务:总计量输入 50,000 token,输出 5,000 token。输入额度包含截图、工具定义、历史状态和结果。这不是对所有工作流的用量预测,只是一把统一标尺。

  • GPT-5.6 Sol 的模型 token 成本为 $0.40
  • Claude Opus 5 为 $0.375
  • Gemini 3.7 Flash Standard Paid 在 2026 年十二月 31 日前为 $0.05625
  • DeepSeek V4-Flash-Vision-Exp 的 cache-miss 输入在非高峰为 $0.0143,高峰为 $0.0286

如果提交 1,000 个任务,这些底线分别变成:Sol $400、Opus 5 $375、Gemini $56.25、DeepSeek $14.30 至 $28.60。数字不含执行器和厂商特定工具费,并且只是假设计量 token 形态相同,并未假设成功率相同。

对比电脑操作模型标准化 token 成本的实体柱状图
50K 计量输入 token 与 5K 输出 token 的纯模型成本;DeepSeek 按高峰费率计算。

再把人工成本算进去。若操作人员综合成本为每小时 $60,一分钟就是 $1。Sol 相比 DeepSeek 高峰费率多出的 $0.3714,相当于 22.284 秒人工;Claude 的溢价相当于 20.784 秒,Gemini 则为 1.659 秒

这就是22 秒测试:只要 Sol 每个已提交任务能减少 22 秒的审核、返工或循环失败恢复时间,它相对 DeepSeek 高峰价的 token 溢价就被抵消。按 1,000 个任务计算,Sol 的模型 token 多花 $371.40,需要节省约 6.19 小时人工才能回本。而人工一旦打开日志、理解状态、纠正错误并重启任务,一次干预往往就不止这么久。

这个测试并不能证明 Sol 一定能省下这些时间,它只是告诉你评测该测什么。Benchmark 可以成为启动试点的理由,真正能证明预算合理的只有故障恢复时间日志。

不同厂商的额外项目还会改变成本底线:

  • 若一个 OpenAI 任务产生 20 次可计费 computer-tool 调用,按当前每 1,000 次 $2.50 计算,在执行器托管之前还要增加 $0.05
  • Claude 默认的 Opus 5 computer 工具集会给一次未缓存请求增加约 4,520 个输入 token,按基础输入费率价值 $0.0226;browser 工具集约 6,610 个 token,价值 $0.03305。Prompt caching 可以降低重复开销,但应读取实际计量用量,不要假定每一轮都命中缓存。
  • Gemini 按所选模型的正常 token 费率收取 Computer Use 费用,其中包括输出和 thinking token。推理过程过长时,输出侧成本会高于简单的 5,000-token 标尺。
  • DeepSeek 把每张图片限制在 384 个输入 token,但自定义动作 schema、执行器响应、重试和安全检查仍会消耗资金,以及图像价格之外的工程时间。

如果要做更广泛的价格路由,可以参考最便宜的 AI API 对比,其中覆盖无需操作屏幕的模型。电脑操作必须单独做预算,因为截图、状态切换与恢复成本会在多轮循环中不断累积。

1. GPT-5.6 Sol:高代价失败场景的综合首选

GPT-5.6 Sol 是 OpenAI 的前沿多模态大模型,也是电脑操作失败会带来明显恢复成本时最稳妥的起点。gpt-5.6 alias 会路由到 Sol;该模型接受图像输入,支持 1,050,000-token 上下文窗口,并可调用 Responses API 当前的 computer 工具。

适用于 GPT-5.6 的 OpenAI 电脑操作文档
GPT-5.6 Sol 电脑操作

OpenAI 公布 Sol 在 OSWorld 2.0 上为 62.6%,Terra 为 50.2%,Luna 为 45.6%。OSWorld 衡量 Agent 操作桌面软件的能力,比通用聊天 benchmark 更贴近本文的采购问题。不过,该结果仍来自 OpenAI 的评测环境。它足以让 Sol 进入试点名单,却不能取代自己的验收测试。

Sol 的优势在哪里

OpenAI 当前方案最实用的一点是灵活。模型既可以查看截图、通过内置工具返回电脑动作,也可以结合自定义工具和代码执行框架工作。技术团队因此可以从 Playwright 浏览器起步,在流程跨越原生桌面应用时再迁移到完整虚拟机。

当前指南也把安全层放在了正确的位置:建议采用隔离浏览器或 VM、使用空白继承环境、尽可能禁用扩展和本地文件系统访问,并对会产生后果的动作进行明确审批;当屏幕内容疑似提示词注入时,还要求 Agent 停止执行。这些是实施说明,不是自动防护,但能让试点从更安全的默认状态开始。

Sol 最适合界面复杂、价值较高且可以回滚的工作流。例如,一支中型企业财务团队需要从三个 Web 门户收集数据,与源记录核对后,准备一条待审批记录。只要更强的状态跟踪与恢复能力能减少一点操作人员清理时间,Sol 的溢价就可能合理。反过来,如果表单控件长期稳定、数据又能直接通过 API 发送,就没有必要用 Sol。

OpenAI 价格表

OpenAI 当前有三个支持电脑操作的 GPT-5.6 档位:

  • **GPT-5.6 Sol:**每百万输入 token $5.00、每百万缓存输入 token $0.50、每百万输出 token $30.00。
  • **GPT-5.6 Terra:**每百万输入 token $2.00、每百万缓存输入 token $0.20、每百万输出 token $12.00。
  • **GPT-5.6 Luna:**每百万输入 token $0.20、每百万缓存输入 token $0.02、每百万输出 token $1.20。

Computer 工具还可能按每 1,000 次可计费工具调用 $2.50收费;内置工具消耗的 token 则按所选模型费率计费。Sol 没有受支持的 API Free tier。

这个系列天然形成了实用的路由梯度:先用 Sol 确定质量上限,再在同一批已验收任务上运行 Terra;只有当某类任务的完成与审核表现仍在阈值内,才把它下放给 Terra。Luna 便宜得多,但厂商披露的 OSWorld 成绩也更低。它适合在验收规则已经验证后处理边界清楚、可回滚的任务,而不该只因为输入 token 便宜就成为默认选择。

如何安全试点 Sol

  1. 选择一个边界清楚的工作流

    任务要有明确的起始状态、确定性的结束检查,并且任何不可逆动作之前都要经过审批。浏览器 QA、证据收集、准备待审核记录都很适合。首次评测不要包含购买、删除、发布或提交。

  2. 固定运行环境

    使用隔离的浏览器配置、容器或 VM。移除继承的环境变量,尽可能禁用扩展与本地文件系统访问,只允许访问必需域名,并且只暴露任务需要的凭据。

  3. 执行前定义审批规则

    提前写明哪些动作必须由人工确认,例如发送消息、接受条款、更改账户数据或产生财务承诺。暂停必须由执行器强制落实,而不是依赖模型文字表态。

  4. 记录状态与验收结果

    保留初始状态、每张截图、提议动作、已执行动作、工具结果、安全暂停、最终状态和验收结果。模型最后一句“已完成”不等于验收检查。

  5. Sol 通过后再向低价档路由

    先用 Sol 建立可达到的完成率与审核基线,再让 Terra 和 Luna 在相同任务、相同环境、相同审批规则下对比。低档位失败的任务类型继续交给 Sol 升级处理。

**最适合:**失败恢复代价高的高价值、多步骤浏览器或桌面任务。
**突出优势:**OpenAI 公布 OSWorld 2.0 成绩为 62.6%,是本文四条路线中最强的当前已披露电脑操作结果。
**价格:**每百万输入/输出 token,Sol $5/$30、Terra $2/$12、Luna $0.20/$1.20,另加适用的工具调用费。
**免费试用:**Sol 没有受支持的 API Free tier。

优势
做得好的地方
8 points

  • 在本文四条路线中,已披露的电脑操作 benchmark 成绩最强。
  • GPT-5.6 系列共用一种 Responses API 工具形态,便于在质量与成本之间路由。
  • 当前指南覆盖隔离执行、提示词注入、域名白名单和后果性动作审批。
  • Sol、Terra 与 Luna 构成跨度很大的价格梯度,无需更换外围执行框架。
  • Sol 的标准化纯模型任务成本是本次对比中最高的。
  • Computer-tool 调用可能产生单独费用。
  • 浏览器、VM、动作执行器、验收检查与日志仍要由客户搭建或接入。
  • 厂商 benchmark 领先并不能证明它在私有应用中的可靠性。

**哪些人应该跳过:**如果已有确定性 API,任务价值低且高度重复,或 Terra、Luna、Gemini 已能达到同一验收阈值,就不要把 Sol 作为默认执行模型。一个稳定控件若能由常规自动化更安全地点击,就不必支付前沿模型费率。

2. Claude Opus 5:企业级桌面治理的首选

如果电脑操作的控制层与模型原始能力同等重要,Claude Opus 5 是更合适的选择。Anthropic 于 2026 年八月 20 日让 computer use 在 Claude API 上正式 GA,并同时推出新的 browser use 工具。当前 computer_toolset_20260801 只需一次声明即可提供 17 个客户端工具,且不需要 beta header。

Claude Platform 当前电脑操作工具集文档
Claude Opus 5 电脑操作

Computer use 与 browser use 的差别非常实际。Computer use 通过截图工作,用鼠标和键盘动作控制完整桌面;browser use 还能读取页面结构,并对具体页面元素执行动作。当整个流程都在 Web 应用内时,后者更合适,因为结构信息通常比单纯屏幕坐标更容易准确定位输入框或按钮。

两者依然是客户端执行工具。Claude 不会自行连接桌面;你的应用要在容器、VM 或受控浏览器中运行每个动作,把结果返回,再次调用模型。Computer use 目前也不能在 Claude Managed Agents 中使用。如果采购方以为 Anthropic 会托管完整桌面会话,那就误判了产品边界。

Claude 为什么赢在治理能力

Claude 可以在一轮模型调用中返回多个电脑动作,执行器按顺序运行,并在第一个失败动作处停止。对于 click、type、observe 这类安全序列,这能减少模型往返;但如果中间状态必须核验,就不该盲目批处理。一次点击若可能打开错误账户,Agent 应先看到结果,再输入内容。

Anthropic 还会运行截图分类器,识别疑似提示词注入,并引导模型在下一步动作前请求确认。客户可以联系支持团队退出这项机制,但对于会浏览不受信页面的工作流,默认开启很有价值。分类器只是额外一道防线,不能取代域名白名单、凭据边界或执行器层审批。

相比 beta 阶段,数据处理规则也更清楚:客户端控制截图、动作和文件的存储,Anthropic 表示 computer use 符合 zero data retention 资格;它也可以在 Anthropic BAA 下用于受 HIPAA 监管的工作负载。具备资格不代表应用天然合规,但能移除医疗采购评审中的一个模型层障碍。

这套组合适合理赔、保险、金融或运营流程:目标软件没有可用 API,同时买方又需要保留每一步的证据。Anthropic 引用客户 Asteroid 的数据称,其最长理赔流程从 32 分钟降到 13 分钟,任务成本下降约 30%,且在不修改 prompt 的情况下完成率达到 100%。这是有明确归属的客户案例,不是新部署项目可直接套用的预期值。它说明真正值得测量的结果是:减少循环轮次、提升定位准确度,能够改变运营成本,而不只是改变模型分数。

Claude 多动作成本深度分析进一步说明,动作批处理何时省钱,以及哪些节点仍必须先观察再继续。

Claude 价格表

当前工具集支持 Sonnet 5、Opus 5、Fable 5、限量开放的 Mythos 5,以及 Opus 4.8。相关的当前模型梯度如下:

  • **Claude Sonnet 5:**每百万基础输入 token $2,每百万输出 token $10。5 分钟 cache write 为 $2.50,1 小时 cache write 为 $4,cache hit 为每百万 token $0.20。
  • **Claude Opus 5:**每百万基础输入 token $5,每百万输出 token $25。5 分钟 cache write 为 $6.25,1 小时 cache write 为 $10,cache hit 为每百万 token $0.50。
  • **Claude Fable 5 和 Claude Mythos 5:**每百万基础输入 token $10,每百万输出 token $50。Mythos 5 限量开放。
  • **Opus 5 Fast mode:**每百万输入 token $10,输出 token $50。
  • **Opus 5 Batch:**每百万输入 token $2.50,输出 token $12.50。Batch 适合异步模型任务,但交互式电脑操作循环仍必须按顺序观察和执行。

新的 API 用户会获得金额未公开的少量免费额度。Anthropic 要求企业买家联系销售团队申请延长试用。

容易被忽略的成本是工具定义开销。默认 computer 工具集会为请求增加约 4,520 个 Opus 5 输入 token,Sonnet 5 则约 4,590 个。关闭 zoom 可减少约 410 个 token。Browser 工具集更大,Opus 5 约增加 6,610 个 token,Sonnet 5 约 6,670 个;全部启用四个可选 browser 成员还会增加约 880 个 token

按 Opus 5 基础输入费率计算,一次未缓存的默认 computer 工具集,在加入截图、任务上下文、动作结果或输出之前就约为 $0.0226;同样口径下,browser 工具集约为 $0.03305。短任务里,声明可用控制面所花的钱可能比业务数据本身还多。工作流允许时,应缓存稳定的指令和工具定义,关闭不用的成员,并以响应中的实际计量用量为准,而不是估算。

**最适合:**需要明确控制、审计证据和受支持迁移路径的企业浏览器与桌面工作流。
**突出优势:**GA computer use 提供 17 个客户端动作、顺序动作批处理,以及单独的页面结构感知 browser 工具。
**价格:**每百万基础输入/输出 token,Sonnet 5 $2/$10,Opus 5 $5/$25,Fable 5 或限量开放的 Mythos 5 $10/$50。
**免费试用:**新用户有少量 API 额度,金额未说明;企业评测需联系销售团队。

优势
做得好的地方
9 points

  • Computer use 已在 Claude API 上 GA,当前工具集不需要 beta header。
  • 对于纯 Web 工作流,browser use 能利用页面结构,不必只依赖像素坐标。
  • 提示词注入自动确认、客户控制执行和 ZDR 资格,有利于搭建严肃的控制体系。
  • 安全的动作批处理可以减少重复模型轮次和总耗时。
  • Sonnet 5 以更低成本提供同一套当前工具集。
  • Computer 与 browser 工具定义会给每次请求增加数千个输入 token。
  • Claude Managed Agents 内无法使用 computer use。
  • 沙箱、执行器、凭据、审批、日志和故障恢复仍全部由应用负责。
  • Claude 文档明确提醒,延迟、坐标错误、滚动失败,以及冷门或多应用场景都会降低可靠性。

**哪些人应该跳过:**如果任务始终在网页内,而 browser use 已能覆盖,就不要使用完整桌面 computer use;有稳定 API 时,两者都应跳过。只追求最便宜可回滚 UI 循环的买方,应先试 Gemini;已经拥有整套动作框架的买方,则应把 DeepSeek 作为模型核心来核算。

3. Gemini 3.7 Flash:原生电脑操作的性价比首选

Gemini 3.7 Flash 是 Google 为 Computer Use 推荐的模型,也是本文提供厂商定义动作循环的路线中,性价比最高的一条。模型本身已经 GA,拥有 1 million-token 上下文窗口和 64,000-token 最大输出;Computer Use 仍处于 Preview。

Google Gemini API 的浏览器、移动端和桌面电脑操作文档
Gemini 3.7 Flash Computer Use

Google 支持三种目标环境:浏览器、移动端和桌面。应用发送 prompt、环境和截图,Gemini 返回界面动作的函数调用;客户端负责缩放坐标、执行动作、捕获新屏幕并发回模型。仍然需要安全的 VM 或容器,以及客户端动作处理器;Google 的示例使用 Playwright。

Gemini 3.x 新增的两个信号尤其适合审批层。每个动作都可以带一个 intent,简要解释模型为何选择该动作;单独的 safety decision 则可将动作标记为允许、需要确认或阻止。Intent 不能证明动作正确,但它比单独一个点击坐标能为策略引擎和审核人员提供更多上下文。

安全系统可按策略类别配置,截图提示词注入检测则需要主动启用。因此,Gemini 很适合正在自行设计审批体验的产品团队:应用可以把拟执行动作、模型意图、策略决策与当前截图放在同一界面,只在工作流风险确有需要时才要求人工介入。

Gemini 适合哪些场景

对于可回滚的跨环境任务,Gemini 是合理的首轮试点路线。移动产品团队可以用同一模型分别跑 Web 浏览器和移动构建中的注册流程,收集截图并标记两端流程差异;客服运营团队也可以让它从批准的网站收集公开信息、准备记录,但不点击最终提交按钮。

按本文统一 token 用量,Gemini 当前 Standard Paid 的成本底线为每个任务 $0.05625,或每 1,000 个任务 $56.25。它比 DeepSeek 高峰价每个任务多 $0.02765。按每小时 $60 的人工成本,只要 Gemini 节省 1.659 秒工程或审核时间,就能抵消这笔模型溢价。定义好的动作 schema、安全决策或省掉一个自定义适配器,很快就可能超过这个门槛。

真正的警告在产品状态,而不在细则里。Google 表示 Computer Use 可能出现错误和安全漏洞,不建议在缺少严密监督的情况下用于关键决策、敏感数据或会造成严重后果的不可逆操作。模型 GA 并不会让 Preview 工具也变成 GA;采购、风险评审和上线范围都应以工具状态为准。

Gemini 价格表

Google 为 Gemini 3.7 Flash 提供四种处理模式。截至 2026 年十二月 31 日

  • **Standard:**每百万输入 token $0.75、输出 token $3.75、缓存 token $0.075。
  • **Batch:**每百万输入 token $0.375、输出 token $1.875、缓存 token $0.0375。
  • **Flex:**每百万输入 token $0.375、输出 token $1.875、缓存 token $0.0375。
  • **Priority:**每百万输入 token $1.35、输出 token $6.75、缓存 token $0.135。

2027 年一月 1 日起,Standard 变为 $1.50/$7.50,缓存输入为 $0.15;Batch 和 Flex 变为 $0.75/$3.75,缓存输入为 $0.075;Priority 变为 $2.70/$13.50,缓存输入为 $0.27。

模型的 Standard Free tier 提供免费输入和输出 token,但 Computer Use 不对 Free tier 开放。在 Paid 方案中,Google 按普通模型 token 为 Computer Use 计费。这一点必须写进试用计划:在 AI Studio 免费试基础模型,并不等于免费测试生产环境中的电脑操作循环。

交互式 Agent 通常更关心 Standard 或 Priority,而不是 Batch 所代表的异步成本。若服务行为符合循环要求,Flex 适合可以排期的任务。不要只把最便宜模式抄进商业测算,还要确认端到端交互方式与延迟真的适合这项工作。

**最适合:**需要低 token 价格和原生动作 schema 的可回滚浏览器、移动端与桌面自动化。
**突出优势:**同一个推荐模型覆盖三类环境,并提供动作 intent、可配置安全策略、确认决策和可选的提示词注入检测。
**价格:**截至 2026 年十二月 31 日,Standard 每百万输入/输出 token 为 $0.75/$3.75;Batch 和 Flex 为 $0.375/$1.875;Priority 为 $1.35/$6.75。
**免费试用:**模型有 Free tier,但 Computer Use 仅对 Paid 开放。

优势
做得好的地方
8 points

  • 在三条提供厂商定义电脑操作工具的路线中,当前 token 价格最低。
  • 浏览器、移动端与桌面支持适合产品 QA 和跨端工作流。
  • 动作 intent 与 safety decision 更容易用于审批和审计界面。
  • Paid Computer Use 在价格页上没有单独按次收费,只按普通模型 token 计费。
  • Gemini 3.7 Flash 虽已 GA,Computer Use 仍处于 Preview。
  • Google 明确警告:敏感、关键或不可逆任务不能脱离严密监督。
  • 低价优惠在 2026 年底结束。
  • 提示词注入截图检测需要主动启用,执行器与沙箱仍由客户提供。

**哪些人应该跳过:**如果受监管或不可逆的生产工作流无法接受 Preview 风险,就不要用 Gemini Computer Use;如果仅靠浏览器不够,而目标桌面环境又无法隔离,也应跳过。如果质量问题会明显消耗操作人员时间,应先对比 Sol 与 Claude,再优化 token 价格。

4. DeepSeek V4-Flash-Vision-Exp:自定义低成本执行框架的首选

DeepSeek V4-Flash-Vision-Exp 是本次排名中最便宜的模型核心,也是电脑操作产品最不完整的一款。DeepSeek 于 2026 年八月 21 日发布这款实验性多模态大模型,准确 API 标识符为 deepseek-v4-flash-vision-exp

展示图像输入与限制的 DeepSeek V4 Flash Vision Exp API 文档
DeepSeek V4-Flash-Vision-Exp 视觉 API

该模型接受文本与图像输入,支持通用工具调用,可通过 OpenAI-compatible Chat Completions、Responses API 以及 Anthropic-compatible 接口使用。它拥有 1 million-token 上下文窗口,最大输出 384,000 token,支持 thinking 与 non-thinking 模式,标示的并发上限为 2,500。

这些都是搭建电脑操作 Agent 的有用组件,却不是第一方电脑操作动作工具。DeepSeek 文档说明了如何发送截图、如何调用通用工具,但没有记录内置的浏览器或桌面动作 schema、执行器、审批决策或运行环境。把它称为模型核心,是本文根据这一产品边界作出的编辑判断。

实际部署时,团队必须自行定义 click、type、scroll、screenshot、wait 和 ask for approval 等工具,还要验证参数、映射坐标、在隔离浏览器或 VM 中执行动作、返回新状态、检测死循环、遇错停止并完整记录。成熟的自动化团队可能更喜欢这种控制权;第一次采购电脑操作 Agent 的团队,则应把这些工作计为应用开发。

为什么它的价格值得关注

DeepSeek 对 V4-Flash-Vision-Exp 采用与 Flash 路线相同的高峰/非高峰价格:

  • **非高峰:**每百万 cache-hit 输入 token $0.007、cache-miss 输入 token $0.22、输出 token $0.66。
  • **高峰:**每百万 cache-hit 输入 token $0.014、cache-miss 输入 token $0.44、输出 token $1.32。

高峰时段为 01:00 至 04:00 UTC06:00 至 10:00 UTC,其余时间均为非高峰。从北京时间 2026 年八月 23 日起,北京时间每周六、周日全天执行非高峰费率。

价格页没有宣传免费层或试用。不过实际评测的 token 成本仍然极低:按 50,000 输入/5,000 输出 token 的统一任务,非高峰为 $0.0143,高峰为 $0.0286。在 token 成为主要开支前,团队足以运行大量实验;但这并不会让开发、审核或错误动作也变便宜。

它的视觉 token 规则非常清楚。大图会被缩放到约 800 × 800 像素的预算,每张图最多 384 个输入 token。按高峰 cache-miss 价格计算,100 张达到 token 上限的截图,其图像输入成本不超过 $0.016896;非高峰则为 $0.008448。文本、输出、重复历史、通用工具调用和重试均不在这项计算内。

这个上限既是成本优势,也是感知限制。密集表格、小对话框或多栏仪表盘被压入该图像预算时,可能丢失关键细节。必要时应发送聚焦裁剪图,或采用文档中的 original detail 路径,再验证服务如何调整图像尺寸。图像 token 便宜,不等于小字识别准确。

DeepSeek 接受 JPEG、PNG、GIF 和 WebP,可发送 base64 数据、公开 URL 或 Files API 引用。服务允许每次请求最多 600 张图片;单边最大 8,192 像素,当请求包含 15 张或更多图片时,单边最大 4,096 像素。Base64 与 URL 图片最大 32 MiB,Files API 图片最大 64 MiB,内联请求体最大 48 MiB

这些上限远高于普通截图循环,真正的瓶颈并非上传数量,而是自定义控制平面。团队必须证明自己的动作 schema、坐标映射、审批和恢复逻辑能够产出验收通过的结果。一个模型能看见按钮,并不代表它已经获得按下按钮的权限。

若要从屏幕操作之外比较两家厂商,可阅读 DeepSeek 与 ChatGPT 对比

**最适合:**希望在自有浏览器或桌面执行框架中使用低成本视觉核心的资深 Agent 团队。
**突出优势:**每张图片最多 384 个输入 token,非高峰 cache-miss 输入/输出价格为 $0.22/$0.66。
**价格:**每百万 cache-miss 输入/输出 token,非高峰 $0.22/$0.66,高峰 $0.44/$1.32;cache hit 非高峰 $0.007,高峰 $0.014。
**免费试用:**实时价格页未宣传免费层或试用。

优势
做得好的地方
10 points

  • 本文四条路线中,标准化模型 token 成本最低。
  • 兼容 OpenAI、Responses API 和 Anthropic 的请求形态,可减少模型适配工作。
  • 通用工具调用让成熟团队能够定义自己的动作词汇与策略边界。
  • 每张图片 384-token 的明确上限,便于控制截图输入成本。
  • 大上下文、输出、并发与图片数量上限,为复杂自定义工作流留足空间。
  • 实验性模型状态带来变更与生产风险。
  • 没有已记录的第一方电脑操作动作工具、执行器、安全决策或审批层。
  • 自动缩放图像可能抹去细小界面信息。
  • 高峰与非高峰时段让无法排队的流量更难预测成本。
  • 低 token 成本可能掩盖更高的工程、评测和审核账单。

**哪些人应该跳过:**如果买方想要开箱即用的动作循环,需要厂商定义的安全决策,或者没有隔离执行器和评测系统,就不要选 DeepSeek。对于小字号或高密度屏幕任务,也要等聚焦截图通过有代表性的视觉测试后再考虑。

不同团队该怎么选

资金充足、希望自动完成可回滚竞品研究的创业者,应从 Gemini 3.7 Flash 开始。它提供动作循环,覆盖浏览器与桌面环境,纯模型成本也足够低,可以扩大评测规模。如果审核与循环失败恢复时间超过前面的约 22 秒门槛,选择应转向 Sol;如果不受信 Web 内容和审批设计变成更难的问题,则转向 Claude。

需要在受监管或遗留应用中搬运数据的中型企业 CTO,应从 Claude Opus 5Sonnet 5 开始。Computer use 已在 Claude API 上 GA,截图分类器可以请求确认,客户端控制环境,而且该功能具备 ZDR 资格。Anthropic BAA 下的 HIPAA 资格有助于模型评审,但工作流仍需要最小权限凭据、受保护日志,并在提交前由人工确认。如果全部步骤都在网页上,应选择 browser use,而不是完整 computer use。

要自动化高价值、界面混乱的桌面工作流,资深运营人员应先试 GPT-5.6 Sol。Sol 的厂商披露 OSWorld 领先成绩,加上较小的人工回本门槛,足以支持先为质量上限付费。确定验收标准后,再把稳定任务形态路由给 Terra、Luna 或 Gemini。最常见的错误,是一开始就选最低档,却从未弄清更强模型究竟能减少多少恢复工作。

已经拥有动作执行器、策略服务和评测套件的技术开发者,应把 DeepSeek V4-Flash-Vision-Exp 纳入候选。到这个成熟度,自定义动作 schema 不再是一项新工程,非高峰费率也能显著改变大规模评测与批处理工作负载的成本。对于小字屏幕、状态模糊和重复失败,仍要保留更强的升级路线。

最终选择取决于四个问题:

  1. **有稳定 API 吗?**有就用 API。屏幕控制只应作为缺乏可靠程序化通道时的后备方案。
  2. **错误动作能回滚吗?**不能回滚,就必须审批,并优先选择产品状态、控制能力与采购要求能匹配后果的路线。
  3. **团队已经拥有执行器吗?**如果没有,DeepSeek 节省的 token 买不到完整解决方案。
  4. **高价模型能减少多少审核秒数?**根据每次验收通过任务的日志,在 Sol、Claude、Gemini 与 DeepSeek 中做选择,不能只看价格表。

这些多模态大模型是怎么选出来的

本排名围绕采购决策采用五项标准:

  • **电脑操作完整度:**厂商是否定义动作循环,还是只提供视觉与通用工具调用?
  • **当前证据:**今天能否核验相关电脑操作成绩、产品状态或实施细节?
  • **每次验收通过成本:**统一 token 用量要花多少钱?高价路线要节省多少人工时间才值得?
  • **生产落地门槛:**沙箱、执行器、审批、提示词注入防御和日志中,哪些仍由买方负责?
  • **价格持续性:**价格是标准费率、限时费率、高峰费率,还是依附于 Preview 功能?

这些产品的对比依据,是它们在 2026 年八月 22 日的实时文档、价格页、模型页和有明确名称的厂商客户证据。本轮没有把它们放入同一浏览器执行框架实测,因此本文不声称拥有测试结果。成本模型是基于锁定价格表的原创分析;下文 240 次运行协议,才是买方生成自身工作流证据的方法。

榜单只收录四条路线,是因为它们分别代表四类采购决策:最大可靠性、企业治理、低成本弹性和自定义技术栈经济性。每条入选路线都有当前差异化优势、价格表、实施路径和明确短板。旧模型只会在下文迁移场景中出现。

没有任何联盟营销关系影响本排名,也没有为商业目的塞入无关合作伙伴。是否商业化并未改变模型名次。

不建议选择的路线

新集成不要使用 OpenAI computer-use-preview

OpenAI 当前 GA 请求形态要求使用 GPT-5.5 或更新模型,并配置 tools: [{ type: "computer" }]。旧版 computer-use-preview 模型和 computer_use_preview 工具使用不同的动作形态,还需要旧请求设置。已有应用可以在迁移期间暂时保留,但新项目从旧路径起步,只会制造一批注定要替换的工作。

Gemini 3.7 可用时,不要选择 Gemini 2.5 Computer Use Preview

Google 将 Gemini 2.5 Computer Use Preview 标记为旧版模型。当 prompt token 不超过 200,000 时,其每百万输入 token 为 $1.25,输出 token 为 $10;超过 200,000 后升至 $2.50/$15。Gemini 3.7 Flash 是 Google 推荐的 computer use 模型,截至 2026 年十二月 31 日价格为 $0.75/$3.75。只有在确实测量过、又暂时无法消除兼容性依赖时,才应保留 2.5。

不要把文本版 DeepSeek 经视觉代理包装成电脑操作模型

官方 DeepSeek API 上,只有 deepseek-v4-flash-vision-exp 接受图像;其他 DeepSeek 模型收到图像输入会返回 400 错误。第三方适配器可以先让另一个模型描述截图,再把文本交给 DeepSeek,但这样评测的是双模型技术栈,而不是 DeepSeek 视觉电脑操作。价格、延迟、信息损失和数据处理都会变化。应把代理明确列为独立组件,或者直接使用准确的视觉模型。

没有验收测试的屏幕 Agent 都不要用

“模型走到流程末尾”不等于业务结果。浏览器 Agent 可能打开错误账户、把内容输进错误字段,或在页面变化后未识别失败就停下。如果任务没有确定性检查或指定审核人标准,就不适合交给这些模型中的任何一个自主执行。

比模型名称更重要的生产检查清单

模型只是受控系统中的一个组件。提高运行量之前,生产评审应回答以下问题:

  • **环境:**浏览器或桌面是否与主机、个人账户、本地文件和无关凭据隔离?
  • **可达范围:**域名、应用和许可动作是否限制在工作流所需范围?
  • **密钥:**每个任务是否只获得必要的凭据范围?截图或日志会不会暴露密钥?
  • **后果:**哪些动作必须始终由人工确认?执行器是否会强制执行这条规则?
  • **注入:**页面、图片、文档或对话框要求 Agent 忽略任务时,系统会怎么处理?
  • **状态:**执行动作前,系统能否证明当前操作的是哪个账户、记录、窗口与步骤?
  • **恢复:**动作失败后是否停止批处理、保存证据,并返回足够状态以便安全重试或升级?
  • **验收:**哪项机器检查或审核人员决定,才算任务完成?
  • **经济性:**是否按每次验收通过记录模型 token、工具调用、运行时间、重试和人工审核秒数?
  • **变更:**模型快照、价格、浏览器或目标 UI 变化后,团队能否重新运行同一任务集?

更换模型应该是一件平淡无奇的事:动作接口、安全策略、日志与验收测试保持不变,只替换背后的模型。如果每换一家厂商都要重写整个控制平面,说明系统把某个厂商的工具格式误当成了产品架构。

下周一就做:运行 240 次对比测试

不要安排笼统的“AI Agent 试点”。下周只选一个任务类别,做出一个路由决策。使用 20 个代表性任务、本文的四条路线,每条路线各跑三次,总计 240 次运行。重复三次足以暴露一部分偶然好运,但不会假装这个样本就是通用 benchmark。

  1. 周一:冻结任务与验收规则

    从一个工作流中选择 20 个任务,覆盖常规情况、小屏状态、弹窗、模糊控件和一个安全的提示词注入测试样例。移除最终不可逆动作,写清准确的通过条件和必须转人工的情形。

  2. 周二:保持环境一致

    所有路线使用相同 viewport、浏览器或 VM 镜像、域名白名单、初始状态、凭据范围、动作词汇、时限和审批策略。对于 DeepSeek,要把自定义工具映射到原生路线所用的同一套底层执行器动作。

  3. 周三:收集完整运行成本

    记录计量输入、缓存输入、输出、可计费工具调用、执行器运行时间、总耗时、尝试次数、安全暂停和人工审核秒数。保存首次失败状态,以及最终通过验收的证据。

  4. 周四:计算每次验收通过成本

    汇总模型成本、工具费、执行器成本、按约定时薪计算的审核人工与重试成本,再除以验收通过次数。同时报告无需修改即通过、修复后通过、安全拒绝和不安全失败的比例。

  5. 周五:为一个任务类别定路由,并保留升级路径

    选择达到验收与安全阈值的最便宜路线;出现动作重复、状态不确定、疑似注入、校验失败或高后果步骤时,保留更强模型作为升级通道。记录模型标识符与价格日期,以便重跑决策。

周一的动作刻意做得很小。一个经过测量的任务类别可以形成可辩护的预算条目;一场宽泛演示只会留下一堆截图,却给不出路由规则。

常见问题

哪款 AI 最适合操作电脑?

对于失败代价高的任务,GPT-5.6 Sol 是综合首选,依据是已披露的 62.6% OSWorld 2.0 成绩,以及其 token 溢价较低的人工回本门槛。Claude Opus 5 更适合企业治理,Gemini 3.7 Flash 是性价比路线,DeepSeek V4-Flash-Vision-Exp 则适合已经拥有动作执行框架的团队。

哪款多模态大模型最好?

在电脑操作场景中,最好的多模态大模型必须能看清目标界面、配合所需动作与审批层工作,并把每次验收通过成本降到最低。视觉推理能力本身并不能提供安全执行器、安全策略或完成检查。

目前能力最强的 AI 模型是哪款?

没有任何单一 benchmark 足以支撑它在所有任务上都最强的结论。OpenAI 公布 GPT-5.6 Sol 在 OSWorld 2.0 上为 62.6%;Anthropic 强调 Opus 5 的电脑操作能力,Google 则为其工具推荐 Gemini 3.7 Flash。可以依据这些披露建立候选名单,再用自己的工作流,按验收通过次数、恢复时间与安全表现排名。

下载 AI Tools Map for Business Owners,把这份候选名单变成一周内可执行的电脑操作对比测试。

最近更新

2026年9月2日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。