Claude Haiku 5.5 价格详解:计费门槛、月账单与迁移建议
Claude Haiku 5.5 价格怎么计算,哪些任务值得迁移?拆解 API 输入输出费率、100K 提示词计费门槛、批处理和缓存规则,用每月一百万次分类调用对比 Haiku 4.5 与 Sonnet 5.5 的账单。结合错误成本、推理设置和迁移要求,判断低价能否带来实际节省,以及哪些工作仍应交给 Sonnet。
发布于

Claude Haiku 5.5 价格可以用一个例子说明:这款 Anthropic 面向高频自动化任务的小模型,每月处理一百万次短文本分类调用,如果每次使用 500 个输入 token 和 20 个计费输出 token,月费就是 $60。它是目前价格最低的 Claude,但单次提示词超过 100,000 个 token 后,费率会提高。分类、信息提取、路由和摘要都值得用它做评估;如果错误成本或复杂编程任务的影响超过 token 费用的节省,仍应使用 Anthropic 更大的通用模型 Claude Sonnet 5.5。
核验日期:2026 年 10 月 8 日,依据为 Anthropic 发布公告、定价文档和模型概览。下文预算均为基于明确假设计算的示例,所有价格均为 Anthropic 的美元标价。
Claude Haiku 5.5 有哪些变化?
对于边界清晰、需要反复执行的 AI 任务,Haiku 5.5 大幅降低了运行成本。 Anthropic 于 2026 年 10 月 7 日发布该模型,API ID 为 claude-haiku-5-5,并称其为迄今价格最低的小模型。Haiku 是 Claude 家族的小模型系列:如果业务需要频繁做出自动化决策,而且能精确定义什么答案可以接受,它就适合作为首选评估对象。参见发布公告。
相比上一代小模型 Claude Haiku 4.5,新版本同时带来了更低的费率、更大的容量和可调节的推理强度。对每次工单分类、每个字段提取都要付费的创业者而言,这些变化很有价值;如果产品的大头成本在于纠正模型错误,低价带来的影响就没那么大。
Anthropic 列出的可用渠道包括 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry。发布公告将 Microsoft 渠道称为 Azure。迁移现有服务时,应使用所在平台对应的接入方式和模型标识符。参见官方平台列表。
Claude Haiku 上下文窗口有多大?
在标准 API 中,Haiku 5.5 的上下文窗口为 1M token,最大输出为 128K token。上下文窗口决定单次请求可以容纳多少材料,最大输出则限制模型能生成多少内容。Haiku 4.5 的两项上限分别为 200K 上下文和 64K 输出。更大的容量可以容纳更长的任务,但这些只是容量上限,既不是 token 使用配额,也不保证答案质量。参见当前规格和版本变化。
这也是首个支持调节 effort 的 Haiku。自适应思考让模型自行决定何时推理、推理多少,默认开启。Haiku 5.5 的 API 默认 effort 为 medium。参见发布公告以及默认设置与思考模式。
简单分类任务可以先评估 low effort;存在例外情况或指令更严格的信息提取任务,则应比较 medium 和 high。Anthropic 支持 low、medium、high、xhigh 和 max,建议在评估确实显示收益时才使用最高档,并与 Sonnet 对比。更多推理可能消耗更多 token 和时间,因此预算记录中应把 effort 与模型名称一起写明。参见effort 使用指南。
Claude Haiku 5.5 价格:100K 提示词门槛如何计费?
提示词恰好为 100,000 个 token 时适用低档费率;超过后,整次请求按高档费率计费。 这个门槛看的是每次提示词的长度,与账户当月累计使用了多少 token 无关。
Token 是模型处理文本时使用的片段。输入指发送给模型的内容,包括相关指令、历史记录和工具提供的材料;输出指模型生成的内容。MTok 表示一百万个 token。下表均为每 MTok 的费率:
来源:Anthropic 模型定价。缓存命中指复用了部分输入,缓存价格并不适用于请求中的所有 token。

Haiku 的这个分界点会使整次请求切换到另一档价格,并非只对超出的 token 加价。以未使用缓存、输出为 1,000 个 token 的请求为例,按公布的费率计算:
- 输入 100,000 个 token: 0.1 × $0.10 + 0.001 × $0.50 = $0.01050。
- 输入 100,001 个 token: 0.100001 × $0.50 + 0.001 × $2.50 = $0.05250050。
只增加一个输入 token,整次请求就会切换到五倍费率,输入和输出费率都会改变。以上计算依据两档定价表,假设输入未缓存,输出数量相同。

摘要服务应把相关文档和指令组装在一起,再统计完整请求的 token 数。附上整段对话或一批无关文档,可能改变成本结构。只要不损害答案质量,就可以缩短上下文或通过检索获取相关内容;但盲目拆分文档,可能丢失原本希望模型解释的关联。
批处理如何让输入和输出费用减半?
结果可以异步返回的任务适合批处理,例如夜间打标签或处理积压的文档摘要。对于不超过 100,000 个 token 的提示词,Haiku 5.5 批处理费率为输入 $0.05、输出 $0.25,每 MTok 计费;超过门槛后则为 $0.25/$1.25。Batch API 对输入和输出都提供 50% 折扣。参见批处理定价和批处理文档。
实时请求的路由仍应走能满足应用时限的响应流程。批处理适合可以等待的工作;选择它时,交付方式也会随价格一起改变。
$0.01 缓存价需要满足哪些条件?
缓存会保存重复使用的提示词前缀,例如不变的信息提取规则,供后续请求复用。Haiku 5.5 低档缓存读取价格为每 MTok $0.01,但需要先付费写入:五分钟缓存为每 MTok $0.125,一小时缓存为 $0.20。提示词超过长度门槛后,对应价格为读取 $0.05、五分钟写入 $0.625、一小时写入 $1。参见缓存定价。
实际使用时,Haiku 5.5 的可缓存前缀至少需要 512 个 token。更短的前缀不会启用缓存。每次变化的客户消息仍按未缓存输入计费,新生成的答案仍按输出计费。检查 cache_creation_input_tokens 和 cache_read_input_tokens,确认实际发生了哪些缓存操作。参见缓存限制。
对短文本分类器,这个区别尤其关键。下一个示例中,整个提示词只有 500 个 token,低于缓存最低长度;如果按缓存命中价格估算这些调用,就会低估支出。
Claude Haiku API 费用:每月一百万次分类要多少钱?
示例月账单为 Haiku 5.5 的 $60、Haiku 4.5 的 $600,或 Sonnet 5.5 的 $1,200。 这里比较的是一个 SaaS 客服工单分类器的费率:它会返回队列标签和简短的结构化判断。
假设每月调用一百万次,每次使用 500 个未缓存输入 token 和 20 个计费输出 token,各模型都分别按这组计费数量计算。所有提示词均低于价格门槛;这个基准场景不使用缓存,不调用单独收费的服务端工具,也不重试。
每月用量合计为输入 500 MTok、输出 20 MTok。按官方标价计算如下:
在这些假设下,Haiku 5.5 每 1,000 次分类的费用为 $0.06。同样的任务改用批处理,三款模型的费用分别为 $30、$300 和 $600。这些总额只包含模型 token 费用,应用基础设施和人工复核另计。
Claude Haiku 4.5 价格与新版本相差多少?
Haiku 4.5 的输入 $1、输出 $5,每 MTok 计费,是新版本短提示词费率的十倍,因此上述示例每月可节省 $540。但 Haiku 5.5 的提示词超过 100,000 个 token 后,费率差距会缩小,新版本费率为 Haiku 4.5 的一半。参见官方价格。
一定要明确,这个比较假设各模型使用相同数量的 token。Anthropic 表示,Haiku 5.5 更新后的分词器每项任务会使用略多的 token。分词器负责把文本拆成可计数的 token。在预测自己业务的节省幅度前,应先用新模型重新统计同一输入,并测量包括思考在内的计费输出。参见 Anthropic 的分词器说明和 token 计数文档。
二十个输出 token 只是示例假设,不是每次请求都该照搬的上限。思考同样占用输出容量。如果模型需要先推理再返回标签,实际计费输出可能超过可见的简短答案。应评估较低的 effort 设置,并为输出上限留出足够空间,让模型能够完成任务。参见思考与输出限制。
比较其他供应商时,可以结合低价 AI API 对比,使用同一工作负载和验收标准。只有在预算内产出合格结果,更低的宣传费率才有实际价值。
开发者、运营负责人和采购方该怎么用?
先迁移工作中可重复执行的部分。 分类、信息提取、路由、摘要和子智能体都适合评估,因为这些任务的输入可以收窄,输出也便于检查。Anthropic 将 Haiku 定位于此类高频工作。参见模型定位。
开发者:给 Haiku 一个边界清晰的小任务
已经获得融资的创业者,可以从上面月账单示例中的客服工单分类器入手。定义允许使用的队列,附上工单,要求模型做出一个判断,同时为无法确定的案例安排去向。校验程序可以拒绝不在允许集合中的标签;对样本进行评分,则能发现那些标签看似合法、实际却分错队列的情况。
独立开发者也可以用 Haiku 做类似的信息提取小任务:从一份文档中提取续约日期和合同标识符,保留支撑结论的原文,并检查日期格式。在评估覆盖相关例外之前,不应让模型判断哪些商业条款优先于其他条款。
运营负责人:先缩小任务范围,再压缩预算
对中型企业的 CTO 来说,检索可能比宣传中的上下文上限更重要。给摘要模型提供相关会议内容或政策章节,再评估它是否保留了决策、责任人和例外情况。摘要悄悄漏掉一项义务,就会把工作转移到组织里的其他环节。
资深运营负责人选择路由系统时,应测量错分工单、未解决案例,以及得到合格判断所需的时间。升级处理的条件应来自可观察的证据,例如缺少必填字段、来源段落互相矛盾、类别不受支持或校验失败。仅凭模型自己宣称的置信度,不足以制定路由规则。
采购方:明确按什么结果付费
要求供应商按每次合格提取或每个完成案例报价,并把 token 数量、effort、重试和复核都算进去。若服务不断重试失败请求,或每张工单都附带整本政策手册,$60 的分类器预算就没有太大参考价值。
子智能体是在较大工作流中承担小任务的模型,可以给 Haiku 安排边界明确的证据收集工作。它适合尝试查找相关段落或返回简短摘要,再由 Sonnet 负责更全面的决策。交接过程也要评估:大模型需要足够的来源材料,才能检查子智能体的工作。
Claude Haiku 和 Sonnet 区别:怎样选择?
答案范围小、容易核验时,选择 Haiku;任务成败取决于判断、协调或故障恢复时,保留 Sonnet。 Sonnet 5.5 的未缓存输入和输出费率是 Haiku 短提示词费率的 20 倍、长提示词费率的四倍。更高的价格应换来更多合格结果。
Anthropic 的发布数据支持对新 Haiku 开展评估,也说明较难的编程任务仍有保留 Sonnet 的理由。以下为 Anthropic 公布的基准测试结果,数据依次对应 Haiku 5.5、Haiku 4.5 和 OpenAI GPT-6 Luna:
- GDPval-AA v2.1,知识工作: 1620、735、1437。
- OSWorld 2.1,离线子集,计算机操作: 72.4%、15.7%、48.9%。
- Terminal-Bench 4.0,智能体编程: 39.2%、0.0%、16.4%。Anthropic 公布的 Sonnet 5.5 在该基准上的成绩为 70.6%。
来源:Anthropic 性能表。这些分数反映的是对应评测任务的表现,不能直接确定模型在你的合同、工单或代码库中的验收通过率。
如果一项代码修改涉及整个仓库,需要发现依赖、协调编辑并从失败步骤中恢复,应继续让 Sonnet 主导。Haiku 则可以尝试承担单个文件摘要、特定测试失败信息提取等子任务。Anthropic 在发布公告中也建议,复杂的智能体编程应使用更大的模型。
先校验,再为升级处理付费
一个混合工作流示例是:所有分类任务先交给 Haiku,校验失败或无法确定的案例再交给 Sonnet。如果 10% 的案例需要额外调用一次 Sonnet,而 token 数量仍与基准场景相同,月账单就是 $60 + $120 = $180,比全部交给 Sonnet 处理少 $1,020。这个示例不包含校验基础设施费用,并假设第二次调用不需要额外上下文。
每个升级处理的案例,第一次 Haiku 调用仍然会计费。如果预算只统计最终成功的模型,就会漏掉这部分成本。应按每个完成任务所需的尝试次数统计重试,同时比较端到端耗时和 token 用量。

较大模型的接入流程可参考 Sonnet 5.5 使用指南。预算中应使用本文核验的当前缓存读取费率:每 MTok $0.10;Anthropic 于 10 月 7 日将它从 $0.20 下调至该价格。参见价格调整公告。
Claude Haiku 4.5 API 如何迁移到 5.5?
这次切换既是模型名称变更,也是接入方式的调整。 即使新模型能很好地完成任务,原本使用 Haiku 4.5 的服务也可能因为请求参数、响应解析或输出上限而失败。
按所在平台逐项检查 Anthropic 的 Haiku 迁移指南。需要重点处理的变化有:
- 更新模型 ID,重新计数。 Claude API 使用
claude-haiku-5-5。用该模型重新统计提示词 token 数,并重新检查成本估算和输出上限。 - 调整思考与采样设置。 将手动设置的
thinking.type: enabled和budget_tokens改为自适应思考,按工作负载设置output_config.effort,并按指南要求移除temperature、top_p和top_k。 - 移除 assistant 预填充。 在末尾提供一条 assistant 消息,让模型接着续写,会被拒绝。请求应以 user 轮次结束,并使用所在平台支持的输出格式机制。
- 按类型读取响应块。 响应可能先返回思考块。选择需要的文本块或工具调用块,并处理可见答案出现前就耗尽输出额度的情况。
- 处理拒绝响应和对话回放。 将
stop_reason为refusal的情况路由到相应的应用处理流程。回放思考内容时,应原样保留内容块,使用生成这些内容的账户或关联账户,并遵守指南中前缀保持不变的规则。
如果 CTO 已承诺购买 Priority Tier 容量,还有一个需要暂缓迁移的原因:Anthropic 的迁移指南指出,Haiku 5.5 不支持 Priority Tier。应先确定可接受的容量方案,再迁移队列。低价 token 不能替代服务要求。参见容量限制。
Haiku 何时退役?状态和日期要一起看
截至 2026 年 10 月 8 日,Anthropic 的弃用页面将 Haiku 4.5 列为 Active(活跃),退役时间不早于 2026 年 10 月 15 日。这表示最早时间下限,并非宣布届时停用。页面同时将 Haiku 5.5 列为 Active(活跃),退役时间不早于 2027 年 10 月 7 日。参见 Claude API 模型状态。
对于更旧的接入,Haiku 3.5 已于 2026 年 2 月 19 日在 Claude API 上退役,Haiku 3 则于 2026 年 4 月 20 日退役。这些日期来自 API 生命周期页面,并非根据 5.5 发布推算出的时间表。参见弃用历史。
Haiku 4.5 的迁移计划应围绕评估结果和接入准备情况制定。当前状态给了你从容决策的空间;仍应持续查看官方生命周期页面,留意正式公布的退役时间。
哪些宣传说法需要打折看?
三种看起来很诱人的说法,都需要补上适用条件,才能用于预算或架构决策。
“便宜 90%”说的是短提示词的费率差距。 它不保证完成同一任务的成本也降低 90%。分词方式、思考过程、请求长度、反复尝试和升级处理都会影响账单。相同 token 数的示例只比较价格;真正的预算应基于你观察到的实际用量。
百万 token 上下文窗口,不代表长提示词也便宜。 Haiku 在远低于容量上限的位置,就会进入高档费率。如果摘要服务每次请求都带上无关历史,可能花得更多,却得不到更好的摘要。应在完整组装提示词后计数,并为所需输出留出足够空间。
调高 effort,不能让 Haiku 在所有任务中达到 Sonnet 的效果。 如果提高推理强度能解决已观察到的问题,就值得评估;如果任务需要持续编程或困难判断,评估中也应保留 Sonnet。比较完成结果和实际耗时时,应把重试算进去。
Sonnet 缓存读取降价,也会影响现有智能体的成本比较。决定迁移前,先重新计算当前账单:Sonnet 反复复用的输入现在更便宜,而未缓存输入和输出仍按原标价计费。Claude API 定价指南可以帮助你把这次发布放到更完整的模型和功能预算中考虑。
本周可以从哪一步开始?
任务范围明确、验收标准清晰,就可以立即评估;队列的质量或容量要求尚未解决,就先等一等。 为重复分类付费的创业者,现在就有了值得测试的新选项;依赖 Priority Tier 的 CTO,则需要先确定容量方案。如果现有服务已经满足预算和质量目标,可以在比较期间继续使用当前模型。
选一个队列,定义什么结果算通过
准备有已知正确答案的代表性输入,包括模糊和困难案例。明确哪些错误需要复核,哪些失败可以安全重试。从分类、信息提取或范围受限的摘要任务入手。
让各候选模型处理同一组任务
用合适的 effort 设置,让 Haiku 4.5、Haiku 5.5 和 Sonnet 5.5 处理这些输入。分别记录各模型的输入计数、计费输出、完成任务耗时和合格结果,成本计算应包含每次尝试。检查提示词长度所属的价格档位时,要使用新分词器的计数。
迁移通过评估的部分,保留升级处理路径
完成迁移检查后,转移实测质量和成本符合要求的任务子集。校验输出、检查失败案例,并让 Sonnet 继续承担更难的工作。成功的标准,是在要求的响应速度下,以更低成本得到合格判断。
订阅邮件通讯,获取后续模型更新和 API 预算分析。
- 发布日期
- 分类
- AI
- 语言







