Claude Sonnet 5评测:接近 Opus 4.8,但真实成本高于标价

Claude Sonnet 5 的代理与编程能力已逼近 Opus 4.8,首发价为每百万输入 token $2;但新 tokenizer 会让同一任务多消耗约 30% token。本文拆解真实成本、API 的 3 项破坏性变更、与 Opus 4.8 的取舍,以及哪些团队该立即迁移、哪些工作负载更适合继续等待。

Thursday, September 3, 2026Omid Saffari
Claude Sonnet 5评测:接近 Opus 4.8,但真实成本高于标价

这篇 Claude Sonnet 5评测先说结论:Claude Sonnet 5 已成为所有 Free 和 Pro 账户的默认模型,在代理任务上的表现接近 Opus 4.8,而且截至 8 月 31 日,API 标价为每百万输入 token $2。但价格页没有写明一个关键代价:新 tokenizer 会让同一项任务消耗的 token 比 Sonnet 4.6 多约 30%,所以实际账单会高于标价给人的感觉。

Claude Sonnet 5评测:一句话结论

如果主要用它做 AI 代理、编程和大量调用工具的自动化任务,应该切换到 Sonnet 5;但在认定成本下降之前,先把 tokenizer 变化算进预算。

Anthropic 于 2026 年 6 月 30 日发布 Sonnet 5,将其定位为迄今代理能力最强的 Sonnet 模型:它能规划多步骤工作、操作浏览器和终端等工具,并完成以往 Sonnet 模型容易中途卡住的任务。在 API 和 Claude Code 中,它默认以 effort=high 运行;在这一设置下,部分任务的表现已接近 Opus 4.8,而标价仅为后者的一小部分。对已经深度使用 Claude Code 或正在构建 AI 代理的大多数人来说,它现在就是更合适的默认选择。

真正需要谨慎的是成本,而不是能力。首发价格看起来像是降价,但新 tokenizer 会让同一段文本的 token 数增加约 30%;同时,API 还有 3 项破坏性变更,如果不先处理,迁移后的请求会直接返回 400。下文会逐项说明。

Claude Sonnet 5 产品页面
Claude Sonnet 5

与 Sonnet 4.6 相比,真正变了什么

Sonnet 5 可以直接替换 Sonnet 4.6:它减少了一部分手动控制,换来了明显更强的自主执行能力。

最显著的提升是代理任务的持续执行能力。Anthropic 自己也承认,近期最明显的能力跃升此前主要出现在 Opus 级模型上,而 Sonnet 5 缩小了这道差距:它以更低价格提供接近 Opus 4.8 的表现,同时比 Sonnet 4.6 覆盖更宽的成本与速度区间。它在推理、工具调用、编程和知识工作上都优于 4.6;参与早期测试的合作方称,它可以完成多步骤软件任务,并在无人提醒的情况下检查自己的输出。在 Anthropic 重点展示的代理搜索(BrowseComp)和计算机操作(OSWorld-Verified)基准中,它全面优于 4.6;提高 effort 后,部分任务还能追平 Opus 4.8。按照 Anthropic 的安全说明,它也比 4.6 更少出现不良行为,而网络安全任务能力明显弱于当前的 Opus 模型——对大多数企业用途而言,这反而是优势,而不是损失。

最实用的一项行为变化是:adaptive thinking 默认开启。 在 Sonnet 4.6 中,请求如果不带 thinking 字段,就不会进行思考;到了 Sonnet 5,同样的请求会自动采用自适应思考。默认答案因此更好,但 max_tokens 同时限制思考过程和最终回复,所以按 4.6 调好的输出上限现在可能会截断用户实际看到的答案。凡是过去不启用思考的工作负载,都应该重新检查 max_tokens。

真实价格:完整的 Claude 5 产品梯队

Sonnet 5 的 API 首发价截至 2026 年 8 月 31 日为:每百万输入 token $2、每百万输出 token $10;此后调整为输入 $3、输出 $15。按当前数据,它在整个产品梯队中的位置如下:

模型API ID价格(每 MTok 输入 / 输出)上下文最大输出
Claude Fable 5claude-fable-5$10 / $501M128k
Claude Opus 4.8claude-opus-4-8$5 / $251M128k
Claude Sonnet 5claude-sonnet-5$2 / $10 首发,之后 $3 / $151M128k
Claude Haiku 4.5claude-haiku-4-5$1 / $5200k64k

换算成比例后,选择会更清楚。按首发价计算,Sonnet 5 的单 token 成本是 Opus 4.8 的 40%;即使采用 8 月后的标准价,也只是 Opus 的 60%。与更便宜的型号相比,Sonnet 5 的标准价是 Haiku 4.5 的 3x,而 Haiku 的上下文窗口最高只有 200k,Sonnet 5 则达到完整的 1M。因此,Sonnet 5 本来就是产品线的中间档:比 Opus 便宜,能力显著高于 Haiku,同时拥有与旗舰型号相同的 1M 上下文和 128k 最大输出。

还有一项对长任务很重要、却容易被忽略的规格:Sonnet 5 的 1M-token 上下文既是默认值也是最大值,不提供更小上下文的版本;在 Batch API 中加入 output-300k-2026-03-24 beta header 后,最大输出可提高到 300k token。与 Opus 档位相比,它缺少的是 Priority Tier 访问权限,因为 Sonnet 5 不提供该选项。

Claude 5 系列的价格与能力梯队
Sonnet 5 的位置:价格低于 Opus,能力远高于 Haiku,并拥有相同的 1M 上下文。

别忽视 tokenizer 带来的 30% 隐性成本

标价降了,但单位工作量的实际成本没有同步下降那么多,因为 Sonnet 5 使用了新的 tokenizer,同一段文本生成的 token 比 Sonnet 4.6 多约 30%。

tokenizer 负责把文本切分成用于计费的 token。Sonnet 5 的 tokenizer 与 4.6 不同,Anthropic 明确表示,同样的输入文本会多产生约 30% 的 token,具体比例取决于内容。单 token 价格没有变化,但账单按 token 计算:如果某个请求在 4.6 上被切分为 10,000 token,到了 Sonnet 5 上就会变成约 13,000 token;在单价变化之外,同等任务的成本还会增加约 30%。这也意味着 1M 上下文窗口能容纳的实际文本更少,而按照 4.6 输出量设置的 max_tokens 可能会提前截断回复。

实际操作只有一条原则:不要再沿用旧模型测出的 token 数,必须针对 Sonnet 5 重新测量。 如果成本预测、单次请求预算或上下文装填逻辑建立在 4.6 的数据上,现在都会偏乐观。此前 Opus 产品线也出现过同样的情况,我在 Opus 4.7 tokenizer 变化中做过详细拆解;解决方法依旧是先重新计数,再作决定。

同一句话在 Sonnet 5 上会多消耗约 30% token
单 token 价格不变,但同一段文本的计费 token 增加约 30%。

这些变化并不意味着 Sonnet 5 昂贵。按首发价计算,在输出质量相近时,它依然远低于 Opus。只是诚实的比较方式应该是把“$2 的标价、真实的能力提升,以及约 30% 的 token 开销”放在一起看,而不是简单地说“它变便宜了”。在假定能省钱之前,先用自己的工作负载算一遍。

切换前先处理 3 项破坏性变更

从 4.6 迁移总体并不麻烦,但有 3 类昨天还能正常工作的请求,现在会返回 400 错误。必须先处理这些问题,否则代理循环第一次调用就会中断。

  1. 删除采样参数

    在 Sonnet 5 上,只要将 temperature、top_p 或 top_k 设为非默认值,请求就会返回 400 错误。请从请求中删除这些参数;使用默认值或直接省略参数都可以。如果需要引导模型行为,应把相应要求写入 system prompt。对 Sonnet 级模型而言,这是一项新限制,不过 Opus 4.7 已经采用了同样的规则。

  2. 移除手动 extended thinking

    旧的 thinking: {type: "enabled", budget_tokens: N} 写法已被移除,继续使用会返回 400。请改用带 effort 参数的 adaptive thinking,方式与 Opus 4.8 相同。如果希望完全关闭思考,则传入 thinking: {type: "disabled"}。

  3. 重新检查 max_tokens

    由于 adaptive thinking 默认开启,且 max_tokens 同时限制思考和回复内容,因此所有按 4.6 调整过的上限都应重新测试。过去不启用思考的工作负载最容易出现输出截断。

Python
# Fails on Sonnet 5 (returns 400)
resp = client.messages.create(
    model="claude-sonnet-5",
    temperature=0.7,
    thinking={"type": "enabled", "budget_tokens": 32000},
    max_tokens=4000,
    messages=[...],
)

# Works: no sampling params, adaptive thinking, roomier max_tokens
resp = client.messages.create(
    model="claude-sonnet-5",
    thinking={"type": "adaptive"},
    max_tokens=8000,
    messages=[...],
)

Claude Sonnet 5 vs Opus 4.8:什么时候该选更便宜的模型

对于代理编程和工具调用自动化,Sonnet 5 在 effort=high 下应当作为默认选择;只有任务确实需要更高能力上限时,才升级到 Opus 4.8。

Sonnet 5 的核心优势在于 effort 调节档位。它提供与 Opus 档位相同的 medium/high/extra-high 级别;Anthropic 自己的成本—性能曲线显示,它覆盖的范围远大于 4.6:medium effort 具有很高的效率,提高 effort 后,部分任务能够达到 Opus 4.8 的能力。考虑到其首发价只有 Opus 的 40%(8 月后为 60%),更合理的做法是先用 Sonnet 5,仅将少数特别困难的任务升级到 Opus,而不是所有任务都支付 Opus 的价格。

继续使用 Opus 4.8 的理由虽然有限,却很实际:有些工作只有能力曲线顶端的模型才能值回成本,例如最困难的代理编程任务、单个步骤失败就会代价高昂的长时间自主运行,或任何不能接受“部分任务追平”、因为真正重要的恰好是未追平部分的场景。如果要大规模委派无人值守的生产任务,多付的模型费用可能比一次 Sonnet 执行失败更便宜。

真实口碑:为什么有人认为它是降级

社区评价明显分化,假装没有争议并不诚实。除了有人称赞它“finishes tasks 4.6 couldn't”,本月 r/ClaudeAI 的公开讨论中也出现了标题直白的“Sonnet 5 is a downgrade”,以及一连串“is it actually worth using”和“what's the consensus”帖子。Anthropic 所说的“close to Opus 4.8”,与部分用户的实际感受之间确实存在落差,这一点值得正视。

多数分歧可以由两点解释。第一,默认启用 adaptive thinking 改变了回复形式和延迟,因此针对 4.6 更简短、无思考输出调校的工作流,即便质量提升,体验也会不同。第二,在重新测量之前,tokenizer 变化会让成本对比显得更差,人们会先把它理解为“更贵”,而不是“换了 tokenizer”。这两点都不代表模型本身不好,只说明所谓直接升级从来不会完全无缝。请先用自己的真实 prompt 测试,再决定是否相信任何人的结论——也包括我的结论。

哪些人应该切换,哪些人适合再等等

你在构建代理、用 Claude Code 交付代码,或运行大量调用工具的自动化任务。Sonnet 5 在 effort=high 下能以 Sonnet 的价格提供接近 Opus 的持续执行能力。可以迁移,但务必先重新核算 token 预算。

是否切换到 Sonnet 5 的决策图
一张快速判断该保留还是切换的决策图。
Claude Sonnet 5 已经可以使用了吗?

可以。它于 2026 年 6 月 30 日发布,已成为 Free 和 Pro 方案的默认模型;Max、Team 和 Enterprise 用户也可使用,并能在 Claude Code 以及 Claude API 中通过 claude-sonnet-5 调用。

Claude Sonnet 5 的价格是多少?

API 首发价截至 2026 年 8 月 31 日为每百万输入 token $2、每百万输出 token $10,之后调整为输入 $3、输出 $15。首发阶段相当于 Opus 4.8 费率的 40%,之后为 60%。需要注意,新 tokenizer 会让同一段文本产生的 token 比 Sonnet 4.6 多约 30%。

Sonnet 5 真的更好,还是一次降级?

在代理任务、编程和工具调用方面,它明显优于 Sonnet 4.6;提高 effort 后,表现可接近 Opus 4.8。部分用户觉得体验变差,主要因为 adaptive thinking 现在默认开启,而且 tokenizer 变化会让成本在重新测量前显得更高。最终仍应使用自己的 prompt 实测。

Claude Sonnet 5 比 GPT-5.6 更好吗?

两者会因任务不同而各有胜负;Sonnet 5 的优势是以较低价格提供持续执行代理任务和调用工具的能力。另一侧的完整分析可参阅 GPT-5.6 评测。

正在迁移编程或代理环境,想先把真正影响效果的配置调整到位?领取免费的 Claude Code + Codex 配置清单,在生产环境切换模型前完成值得检查的配置与成本控制步骤,并在每次新模型分析发布时及时收到更新。

最近更新
2026年9月3日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:逐项拆解价格、缓存、编程证据与 API 兼容性,说明 thinking、强制工具选择、computer 工具及进度流的五项迁移风险,并给出何时升级、何时保留旧模型的可执行判断框架。同时用固定 token 算例核对真实账单,帮助团队按每个合格结果的成本做选择。2026年9月23日AI
GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?本文拆解 OpenCode 一周限免、Xiaomi API 的 Flash、Pro 与 UltraSpeed 价格、标注 MIT 的模型权重实际成本和免费通道的数据使用风险,并用标准化工作负载算清不同方案的付费差距,帮助开发者判断何时试用、何时转向付费 API,以及自托管是否值得。2026年9月22日AI
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。2026年9月21日AI
AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。