Kimi K3 评测:API 成本减半,但权重尚未开放

Kimi K3 评测聚焦真实采购决策:API 未缓存输入每百万 token $3、输出 $15,约为 GPT-5.6 Sol 混合 token 成本的一半。本文对比独立基准成绩、缓存经济性、会话稳定性、工具限制与开放权重承诺,并给出何时适合试用、为何暂不应全面迁移,以及自托管前必须等待哪些资料的明确建议。

Thursday, September 3, 2026Omid Saffari
Kimi K3 评测:API 成本减半,但权重尚未开放

Kimi K3 更适合先用在缓存命中率高、执行周期长的编程任务上,还不到成为统一默认模型的时候。它的 API 价格为每百万未缓存输入 token $3、输出 token $15,约为 GPT-5.6 Sol 混合 token 成本的一半。不过,官方承诺的权重和技术报告仍未公开;Kimi 自己的文档也提示,会话中途切换模型可能导致表现不稳定,模型有时会过于积极地执行操作,用户体验也仍有差距。这篇 Kimi K3 评测的结论因此很明确:值得受控试用,不宜全面迁移。

Kimi K3 于 2026 年 7 月 16 日发布,是 Moonshot AI 面向编程、AI Agent 和端到端知识工作的旗舰模型。目前可通过 Kimi.com、Kimi Work、Kimi Code 或 kimi-k3 API 使用。

Kimi K3 发布页面,展示模型详情与基准测试图表
Kimi K3

K3 的发布之所以值得关注,不是因为它试图宣称每个维度都领先,而是因为它把前沿级性价比真正带进了竞争。Kimi 也坦言,模型的综合表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。正是这种克制,让它更聚焦的优势显得可信:K3 以明显更低的 API 价格,提供了扎实的长周期任务能力。

Kimi K3 评测结论:一张表看懂

Kimi K3 值得进入受控的生产试验,但还不值得触发默认模型迁移。它的价格足以支撑真实业务测试,能力也足以在部分路由上胜出;只是以发布时的完成度来看,全面切换仍为时过早。

模型最适合每 1M token 的 API 价格(输入 / 输出)缓存输入现有证据主要短板
Kimi K3缓存命中的长上下文编程、代码库任务、重视成本的 Agent 试验$3 / $15$0.30Artificial Analysis Intelligence Index 得分 57,在 189 个模型中排名 #4权重和技术报告尚未公开;目前仅支持 max effort
GPT-5.6 Sol成熟的工具调用、高难度判断、广泛的生产路由$5 / $30$0.50前沿模型,拥有 1,050,000-token 上下文和成熟的工具生态输出价格更高
Claude Fable 5自主性和判断力足以抵消溢价的长周期任务$10 / $5090% 缓存折扣后为 $1Anthropic 目前能力最强的通用模型价格最高;部分敏感请求会回退到 Opus 4.8

决策规则很简单:当成本限制了长上下文 Agent 路由时,试用 K3;当一次错误的代价高于节省的 token 费用时,继续使用 Sol 或 Fable。 如果硬性要求是自托管,就等实际权重和许可证发布。

Kimi K3 到底是什么

Kimi K3 是基础设施级的混合专家模型,而不是每生成一个 token 都激活全部 2.8 万亿参数的超大稠密模型。混合专家模型会把每个 token 路由到少量专业子网络。K3 采用 Stable LatentMoE,在 896 个专家中激活 16 个,因此即使规模如此庞大,API 报价仍能低于闭源前沿模型。

官方快速入门文档明确了核心规格:

  • 总参数量为 2.8 万亿
  • 1,048,576-token 上下文,采用统一 token 定价,不另设长上下文价格档。
  • 原生视觉理解,可接收文本和图像输入,输出文本。
  • Kimi Delta Attention,一种为长序列高效传递信息而设计的混合注意力架构。
  • Attention Residuals,可跨模型深度提取有用表征,而不是对每一层进行等量累积。
  • 自动上下文缓存,无需提供缓存 ID、存活时间设置或额外请求参数。

Kimi 将相较 K2 约 2.5x 的扩展效率提升归因于这些架构和训练变化。这个数字应视为厂商的架构声明,而不是应用基准成绩。对采购者来说,更容易验证的结果是:K3 提供百万 token 的工作区,而当前缀命中缓存时,输入价格仅为未缓存价格的十分之一。

K3 已经以四种形式提供。Kimi.com 是聊天界面;Windows 和 Apple silicon Mac 上的 Kimi Work 3.1.0 或更高版本均可使用;Kimi Code 可在终端通过 /model 选择;开发者则通过 Kimi API 调用 kimi-k3 模型。

API 支持工具调用、JSON Mode、结构化输出、工具选择约束和动态加载工具。视觉输入有一项不太顺手的限制:不接受公开图片 URL,应用必须发送 base64 数据或 Kimi 文件引用。

Kimi K3 基准测试:达到前沿水平,但不是全面第一

独立测评把 Kimi K3 放在第一梯队附近,同时也揭示了低报价背后的成本:它速度偏慢,而且输出偏长。Artificial Analysis 给 K3 打出 57 分,在 189 个模型中排名 #4;实测输出速度为每秒 62.0 token,在 189 个模型中排名 #91;其 Intelligence Index 测试共产生 130M 输出 token,而平均值为 63M。

输出冗长会直接影响账单,因为输出是 K3 收费较高的一侧。Artificial Analysis 报告称,评测该模型共花费 $2,709.75。单个 token 便宜,并不意味着每个验收结果都便宜:如果模型生成的内容量约为对照组的两倍,实际成本仍可能升高。

Kimi 官方基准表呈现出的能力分布更有层次:

基准测试Kimi K3Claude Fable 5GPT-5.6 Sol解读
DeepSWE67.570.073.0在这项软件工程测试中,K3 落后于两者
Program Bench77.876.877.6K3 小幅领先
Terminal-Bench 2.188.384.688.8K3 几乎追平 Sol,并超过表中的 Fable 成绩
FrontierSWE81.286.671.3K3 位于两者之间
SWE Marathon42.035.039.0K3 在这项长周期测试中领先
GDPval-AA v2, Elo166817601748在广泛的专业工作测试中,K3 落后于两者
BrowseComp91.288.090.4在厂商表格的浏览测试中,K3 领先

这些成绩很强,但并非条件完全一致的正面对决。Kimi 使用 max reasoning、temperature 1.0 和 top-p 1.0 测试 K3;不同项目的评测运行器也在 Kimi Code、Claude Code 和 Codex 之间变化;部分 Fable 5 结果还可能包含回退到 Opus 4.8 的情况。这张表足以证明 K3 具备前沿竞争力,却不足以证明它是全场景赢家。

独立测评和厂商数据指向同一个实用结论:K3 的能力足以挑战某条生产路由,但证据还不足以支持替换全部路由。

优势
做得好的地方
10 points

  • K3 每百万未缓存 token 的输入价格为 $3、输出价格为 $15,显著低于 Sol 和 Fable 5。
  • 输入命中缓存后降至每百万 token $0.30,并自动执行前缀缓存。
  • 1,048,576-token 上下文不另收长上下文档位费用。
  • 原生视觉、结构化输出、工具调用和动态工具加载覆盖了 Agent 的核心需求。
  • 独立测评显示,K3 在综合智能指数的 189 个模型中排名 #4。
  • 完整权重、最终许可证和技术报告尚未公开。
  • 目前仅提供 max reasoning effort,无法把简单任务路由到更便宜或更快的 effort 档位。
  • Kimi 提醒,思考历史缺失或会话中途切换模型可能导致质量不稳定。
  • Kimi 的网页搜索工具正在更新,近期不建议使用。
  • 独立测评显示,K3 比对照组平均水平更慢,输出也长得多。

Kimi K3 API 价格,才是值得测试的核心理由

Kimi K3 说服生产团队试用它的第一个理由是成本,尤其适合在编程会话中反复复用稳定代码库前缀的场景。官方价目表显示,每百万命中缓存的输入 token 收费 $0.30,未命中缓存的输入 token 收费 $3,输出 token 收费 $15。

以每百万个未缓存输入 token 加每百万个输出 token 为例,直接对比如下:

  • Kimi K3:$18
  • GPT-5.6 Sol:$35
  • Claude Fable 5:$60

在这个刻意简化的工作负载中,K3 比 Sol 便宜 48.6%,比 Fable 便宜 70%。

更贴近编程 Agent 的例子是:每月使用 10M 输入 token 和 1M 输出 token,其中 9M 输入 token 足够稳定,可以命中缓存。Kimi 表示,其官方 API 在编程工作负载上的缓存命中率超过 90%;但你的应用能否复现这一结果,仍取决于代码库结构和前缀稳定性。

  • K3: 9 x $0.30 缓存输入 + 1 x $3 未缓存输入 + 1 x $15 输出 = $20.70
  • Sol: 9 x $0.50 缓存输入 + 1 x $5 未缓存输入 + 1 x $30 输出 = $39.50
  • Fable: 9 x $1 缓存输入 + 1 x $10 未缓存输入 + 1 x $50 输出 = $69.00

如果完全没有缓存命中,同一工作负载在 K3 上需要 $45,在 Sol 上需要 $80,在 Fable 上需要 $150。缓存并未创造 K3 的价格优势,但能在长会话中延续这种优势。

对比 Kimi K3、GPT-5.6 Sol 和 Claude Fable 5 缓存工作负载成本的决策图
输入缓存命中率达到 90% 时,K3 是最便宜且值得认真测试的路由。

真正的陷阱,是只优化 token 单价,而不是每个验收结果的成本。Artificial Analysis 观察到 K3 产生了 130M 输出 token,而对照组平均值为 63M。如果你的路由需要更多审核、更长生成内容或反复修正,$15 的输出价格会吃掉一部分账面节省。

面向个人用户的会员订阅与 API 是两套独立的购买路径。Kimi 的官方会员价格列出了免费的 Adagio 方案,包含 6 个 Agent credits 和一个并行 Agent 任务,但不含 Kimi Code credits。Moderato 月付 $19 起,年付折算为每月 $15,包含 60 个 Agent credits 和 1x Kimi Code credits。更高的月付档位分别为 Allegretto $39、Allegro $99 和 Vivace $199。

因此,免费方案适合体验 K3 的界面和输出风格,但不能替代面向生产工作负载的 API 评估,因为会员 credits 和 API token 账单采用不同的计量方式。

上生产前,限制条件比演示效果更重要

Kimi K3 的生产风险不在于基础智能,而在于会话状态、固定推理强度、工具权限和尚未成熟的产品体验相互叠加。

完整保留思考历史

K3 的训练方式要求会话全程保留思考历史。Kimi 提醒,如果 Agent 运行时丢弃这部分历史,或把已有会话从其他模型切换到 K3,质量可能变得非常不稳定。这不只是提示词格式问题:如果在对话中途改路由,模型路由实验可能会让 K3 看起来比实际更差。

评估 K3 时应创建全新会话,并完整保留助手历史。不要只在 Sol 或 Fable 已经运行到一半的任务轨迹中替换模型 ID 来做对比。

目前只有 max effort

K3 始终进行推理,而 reasoning_effort 目前只接受 max。更低和更高的控制档位已有规划,但现在尚不可用。这让生产系统少了一个实用杠杆:简单任务无法通过同一端点以更低成本、更快速度执行。

对于资金充足、正在排查高难度迁移问题的创始人,强制 max effort 或许没有问题;但对需要路由数千个普通分类任务的中型企业 CTO 来说,这是一种浪费。应在 K3 旁保留一个更便宜的模型,而不是让它处理所有请求。

用权限边界约束操作,而不只是靠提示词

Kimi 表示,由于 K3 经过了推进长周期任务的训练,当指令含糊时,它可能做出意料之外的决定。解决办法不是写一段更长的性格提示词,而是明确行动策略:工具白名单、外部写入前确认、支出上限、限定文件路径和回滚机制。

一个 Agent 即使写出了高质量补丁,只要同时改动了无关配置,也不能算真正有用的自主执行。应把主动行为视为一种需要缩小影响范围后才能使用的能力。

暂时不要依赖官方网页搜索工具

Kimi 的 API 文档称,网页搜索正在更新,近期不建议使用。对于研究型 Agent,这意味着需要单独接入搜索或检索层,不能默认 K3 的官方工具已经可以投入使用。

Kimi 还承认,其用户体验与 Fable 5 和 Sol 相比存在明显差距。这个说法看似笼统,但结合前述限制就很具体:会话兼容性较脆弱,effort 路由尚未完成,还有一项官方工具处于过渡期。这些问题并不会否定模型本身,却清楚限定了合理试验的范围。

开放权重仍只是承诺,至少要等到 7 月 27 日

在 2026 年 7 月 17 日,Kimi K3 还不是一个可用的自托管方案。Kimi 承诺在 7 月 27 日前发布完整模型权重,技术报告也会随权重一同提供。在这些文件和最终许可证公开前,“开放”描述的是官方宣布的目标,而不是可下载的生产资产。

模型规模也改变了“开放权重”的实际含义。K3 有 2.8 万亿参数,按每参数 4 bit 计算,原始权重约占 1.4 TB;按 16 bit 计算则约占 5.6 TB,且尚未计入运行时开销、缓存、激活值和冗余。Kimi 建议采用配备 64 个或更多加速器的超节点部署。

这是数据中心级基础设施,不是工作站模型。个人技术开发者应该租用 API;考虑私有推理的中型企业,则应先核算集群、网络、运维人员和容量冗余成本,再判断自托管是否真能省钱。

以下三个概念不能混为一谈:

  • 开放权重意味着可以下载训练后的参数。
  • 开源还要求代码和许可证条款允许目标用途。
  • 可实际自托管意味着模型能装进一套可持续承担的基础设施和运营预算。

当前的开放权重模型格局中,已经有更小、更容易部署的选项。K3 或许会以顶尖能力加入其中,但前提是发布文件和许可证真正落地。

Kimi K3、GPT-5.6 Sol 和 Claude Fable 5 怎么选

选择依据应是失败成本,而不是某个模型最好看的那一项基准成绩。

场景选择原因不适用情况
编程 Agent 需要反复读取庞大且稳定的代码库试用 Kimi K3自动缓存和 $0.30 的缓存输入价格让长会话更经济运行时无法完整保留思考历史
生产 Agent 需要丰富、成熟的工具和高难度判断GPT-5.6 Sol综合能力强,网页与计算机工具成熟,生产接口现已可用输出费用占主导,且 K3 在你的路由上达到同等质量
高风险、持续多日的任务更看重判断力而非价格Claude Fable 5面向需要规划、委派、测试和验证的高目标长周期工作$50 的输出价格无法通过减少修正次数收回
数据必须留在自有基础设施等待,或选择其他开放模型K3 权重和最终许可证尚未公开评估期可以接受使用 API
大量简单任务要求低延迟、低推理成本默认都不选这些旗舰模型K3 只有 max effort;Sol 和 Fable 也是高价路由实测失败率证明旗舰模型可以创造足够回报

Kimi K3 是性价比试验项

当长上下文、缓存代码库任务或原生视觉能形成真实的工作负载优势时,Kimi K3 值得测试。每百万 token 输入 $3、缓存输入 $0.30、输出 $15 的价格,给了它一定效率损失空间,仍可能在成本上击败前沿领先者。如果会话层无法保留历史、官方网页搜索是核心需求,或一次越权操作就可能代价高昂,则应跳过它。

GPT-5.6 Sol 是需要被挑战的生产默认项

GPT-5.6 Sol 更适合作为默认模型,尤其是在路由依赖成熟工具生态,并要求跨任务表现经过验证时。它支持 function calling、structured output、web and file search、code execution、hosted shell、computer use、MCP 和 tool search。其输入 $5、缓存输入 $0.50、输出 $30 的价格均高于 K3,但如果能降低审核负担,这笔溢价就有价值。现有的 GPT-5.6 路由指南说明了 Sol、Terra 和 Luna 应如何分工。

OpenAI GPT-5.6 发布页面,展示 Sol、Terra 和 Luna
GPT-5.6 Sol

如果一条稳定、可重复的路由能在 K3 上产出同样可验收的结果,就不该继续为 Sol 支付前沿模型溢价。那不是风险管理,只是习惯。

Claude Fable 5 提供判断力溢价

Claude Fable 5 是 Anthropic 面向高难度编程和知识工作推出的最强通用模型。每百万 token 的输入价格为 $10、输出为 $50,提示词缓存可享受 90% 的输入折扣。Anthropic 将它定位于能自行规划、委派、测试和检查结果的长周期项目。

Anthropic Claude Fable 5 产品与价格页面
Claude Fable 5

它的瓶颈在于价格和路由可预测性。敏感的网络安全与生物学请求可能回退到 Opus 4.8。只有当更少的修正、更好的判断或更长时间的可靠自主执行,能比 K3 或 Sol 产出更多可验收工作时,Fable 的溢价才值得支付。

一套可回滚的 Kimi K3 评估方案

采用 K3 最稳妥的方式,是每次只替换一条路由,并随时保留旧模型。模型升级应该像依赖项升级一样:可观测、可回滚,而且范围足够窄,便于定位问题。

Kimi K3 四阶段生产评估关卡,包含会话与工具风险警告
只有通过历史、权限和结果关卡后,K3 才应接管生产路由。
  1. 选择一条成本较高的路由

    先选择 Sol 或 Fable 成本确实可观、且 K3 可能具备优势的任务,例如代码库级调试、长文档分析或视觉辅助的前端修复。不要一开始就替换产品中的全部 AI 调用。

  2. 固定对比条件

    使用相同的提示词、文件、工具、权限边界和验收标准。尽可能保持 Agent 运行时不变,避免把工具差异误判为模型差异。

  3. 从新会话开始并保留历史

    为 K3 创建新会话,保留 API 所要求的完整助手思考历史,并让稳定前缀在字节层面保持足够一致,以获得缓存命中。绝不要把正在运行的会话从其他模型切换到 K3。

  4. 在模型之外限制操作

    设置工具白名单,外部写入和破坏性改动必须审批,限制支出,并保留回滚能力。边界应落实在代码和权限中,不能只写进系统提示词。

  5. 衡量可验收结果

    记录输入、缓存输入、输出、耗时、重试、被拒绝的工作和审核投入。用总支出除以验收结果,这一个指标同时反映 K3 的低报价与输出偏长的倾向。

  6. 只迁移 K3 真正胜出的路由

    只有当 K3 以更低总成本达到质量门槛时,才迁移对应路由。保留 Sol 或 Fable 作为疑难情况的明确升级路径,简单的大批量工作则继续交给更便宜的模型。

这套方案无需先相信 K3 在整体上更强,只要求证明它更适合某一项具体工作。只有把判断落到这个粒度,生产环境中的模型决策才经得起时间检验。

Kimi K3 是什么?

Kimi K3 是 Moonshot AI 的 2.8 万亿参数旗舰模型,面向长周期编程、知识工作和推理。它接受文本与图像输入,提供 1,048,576-token 上下文,可通过 Kimi 的应用、编程工具和 API 使用。

Kimi K3 会开源吗?

Kimi 表示将在 2026 年 7 月 27 日前发布完整模型权重。截至 7 月 17 日,权重、最终许可证和技术报告仍未公开,因此商业使用权和可复现的自托管方案,都应等这些资料发布后再评估。

可以在本地运行 Kimi AI 吗?

K3 不是常规本地模型。即使按每参数 4 bit 计算,其 2.8 万亿参数权重也约占 1.4 TB,这还没有计入运行时开销;Kimi 建议使用配备 64 个或更多加速器的超节点。多数团队应通过 API 评估 K3。

Kimi 完全免费吗?

不是。Adagio 会员方案免费,包含 6 个 Agent credits,但不含 Kimi Code credits。付费会员从每月 $19 的 Moderato 起,而 Kimi API 的输入和输出 token 费用另行计算。

Kimi K3 比 GPT-5.6 Sol 或 Claude Fable 5 更好吗?

整体上不是。K3 在部分厂商测试项目中领先,而且价格更低,但 Kimi 也表示,它的综合表现仍落后于 Sol 和 Fable。真正有意义的问题是:K3 能否用更低总成本达到你的路由验收标准。

想知道当前这些模型分别最适合哪些实际工作?免费获取为企业主准备的 AI 工具地图。

最近更新

2026年9月3日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。