GPT-5.6评测:Sol、Terra、Luna 怎么选,路由规则是什么
这篇 GPT-5.6评测全面拆解 Sol、Terra 与 Luna 的能力差异、API 价格、长上下文表现和生产风险,并给出可直接落地的模型路由规则:短任务用 Luna,超长上下文选 Terra,高难度判断交给 Sol;同时说明缓存机制与 272K 长上下文溢价如何改变真实成本,帮助团队按工作负载做出更稳妥的选型。

这篇 GPT-5.6评测的结论很明确:值得采用,但不该把其中一个模型设成所有任务的默认项。Sol、Terra 和 Luna 都提供 1.05M token 上下文窗口,每百万输入/输出 token 的价格分别为 $5/$30、$2.50/$15 和 $1/$6;但在 OpenAI 的 512K 到 1M 检索评测中,Luna 只有 41.3,Sol 和 Terra 则分别保持在 73.8 和 72.5。路由规则并不复杂:短上下文、大吞吐量任务交给 Luna;追求长上下文性价比时选 Terra;需要高难度判断和智能体执行能力时用 Sol。
OpenAI 的 GPT-5.6 于 2026 年 7 月 9 日在 ChatGPT、Codex 和 API 中全面开放。这一系列不再让一个旗舰模型包办所有场景,而是把选择拆成三类工作负载。

GPT-5.6评测结论:一张表看懂三个模型
GPT-5.6 应该按三条路线部署,而不是只设一个默认模型。档位名称体现的是能力差异,真正决定该调用哪个端点的,却是上下文长度和出错成本。
三者都支持文本和图像输入、文本输出,拥有 1,050,000 token 上下文窗口,最多可生成 128,000 个输出 token。同一份 OpenAI 模型文档建议:复杂推理和编程用 Sol,兼顾智能与成本用 Terra,成本敏感的大批量任务用 Luna。
看似整齐的档位递进,掩盖了实际差距。在 OpenAI 的 512K 到 1M 多针检索评测中——它测试模型能否从超长输入里找出分散的多条事实——Sol 得分 73.8,Terra 为 72.5,Luna 只有 41.3。Terra 仅比 Sol 低 1.3 分,而 Luna 落后 31.2 分。上下文窗口只说明一次请求能装下多少内容,并不代表模型能可靠地用好这些内容。
GPT-5.6 相比 GPT-5.5 改了什么
GPT-5.6 对运行方式的改变,大于对价目表的改变。Sol 与 GPT-5.5 同价,每百万 token 的输入和输出分别为 $5 和 $30;Terra 与 Luna 则在其下方提供了两条成本更低的路线。
这些名称会长期保留。Sol 是旗舰档,Terra 大致接替过去的 mini 定位,Luna 则大致接替 nano。API 中不带后缀的别名 gpt-5.6 会路由到 Sol,因此使用这个短模型名,就等于悄悄选择了最贵的档位。需要自行控制路由的开发者,应明确调用 gpt-5.6-sol、gpt-5.6-terra 或 gpt-5.6-luna。
三款模型覆盖的能力很广。它们都通过 Responses API 支持流式输出、函数调用、结构化输出、网页搜索、文件搜索、独立的图像生成工具、代码解释器、托管 shell、apply patch、skills、计算机操作、MCP 和工具搜索,但均不支持微调。模型可以接收图像并输出文本,不支持音频和视频模态。
两项新的推理选项对智能体尤其重要。max 会比 xhigh 提供更多推理时间。ultra 默认协调四个智能体并行工作,以更高的 token 消耗换取更强结果,并在适合的任务上缩短实际耗时。开发者也可以利用 Responses API 的多智能体 beta 构建类似模式。
Programmatic Tool Calling 是一个更低调、却更贴近生产环境的功能。它允许 GPT-5.6 编写并运行小型内存程序,用这些程序协调工具、筛选中间结果,再把内容交还给模型。在搜索或数据密集型工作流中,这能减少模型反复往返调用;OpenAI 表示,该设计兼容 Zero Data Retention。
GPT-5.5 依然有自己的位置。GPT-5.5 Instant 仍是 ChatGPT 中快速日常回复的默认选择,付费推理模式则由 GPT-5.6 Sol 驱动。不要只因为版本号更新,就把推理模型硬塞进问候、轻量改写或简单聊天。
GPT-5.6 Sol:留给判断和最难的智能体任务
当任务需要跨越多个步骤做判断,而不只是产出一份润色过的初稿时,GPT-5.6 Sol 才值得投入。它是这一系列能力最强的一档,gpt-5.6 别名指向它,而且定价与 GPT-5.5 相同,并未额外收取旗舰溢价。
最适合: 生产事故分析、安全审查、复杂迁移、研究型智能体和高风险专业任务
突出优势: GPT-5.6 系列中最强的推理与长上下文表现
价格: 每 1M token 的输入、缓存输入和输出分别为 $5、$0.50 和 $30
不适合: 重复、易验证或可低成本重试的任务
独立评测数据也支持这一高难度任务定位。Artificial Analysis 给 Sol 的 Intelligence Index 评分为 59,单任务成本 $1.04;它只比 Claude Fable 5 低 1 分,成本却约为后者的三分之一。在 Coding Agent Index 中,配合 Codex 的 Sol 以 80 分位居第一。
OpenAI 自己发布的数据更为复杂,也更有参考价值。Sol 在 Terminal-Bench 2.1 上得到 88.8%,Sol Ultra 则达到 91.9%。在 SWE-Bench Pro 上,Sol 为 64.6%,高于 GPT-5.5 的 59.4%,但远低于 Claude Fable 5 的 80%。Sol 是一款实力扎实的编程模型,却并非所有场景的冠军。当选择范围还包括 Claude、Gemini 和自托管模型时,仍应参考更完整的编程模型排名。
长上下文成绩才是为 Sol 付费最充分的理由。在 OpenAI 的多针检索测试中,它在 256K 到 512K 区间得分 91.5%,在 512K 到 1M 区间仍有 73.8%。如果一家已有融资的创业公司要让智能体同时核对数据室、合同集和经营计划,这份余量值得购买;如果只是生成十个落地页版本,就不值得。
- GPT-5.6 系列中综合智能与编程得分最高
- 最适合长流程、重工具、多步骤任务
- 与 GPT-5.5 标价相同,多项智能体评测结果更好
- 支持该系列当前列出的全部 Responses API 工具
- 每百万输出 token $30,冗长的智能体循环会迅速推高成本
- 输入超过 272K token 后会触发长上下文溢价
- 在已发布的 SWE-Bench Pro 结果中,Claude Fable 5 仍遥遥领先
- OpenAI 系统卡显示,它更容易超出用户意图采取行动
GPT-5.6 Terra:价值在长上下文中才真正显现
GPT-5.6 Terra 是更经济的长上下文档位,但它并不是显而易见的通用性价比之选。它存在的理由,不是刚好排在 Sol 与 Luna 中间,而是在上下文变得非常大时,表现依然贴近 Sol。
最适合: 大型代码仓库分析、政策资料库、尽调资料室和文档密集型智能体
突出优势: 在 512K 到 1M token 范围内接近 Sol 的检索能力,标价却只有 Sol 的一半
价格: 每 1M token 的输入、缓存输入和输出分别为 $2.50、$0.25 和 $15
不适合: 关键上下文较短,而且 Luna 已经能通过内部评测的任务
Artificial Analysis 给 Terra 的智能评分为 55,单任务成本 $0.55,Coding Agent Index 得分 77。该机构还发现,Terra 并不处于整体“智能—成本”的 Pareto 前沿:在 Terra 的每一个推理强度档位,都有某个 Luna 或 Sol 配置能以更低价格提供相同智能水平,或在不增加成本的情况下给出更高智能水平。
但换成长上下文这一专项负载,结论就会改变。在 OpenAI 的 512K 到 1M 检索评测中,Terra 得分 72.5,仅比 Sol 的 73.8 低 1.3 分,又比 Luna 的 41.3 高 31.2 分。如果一家中型企业的 CTO 要让一个模型追踪全年政策、工单和代码中的某项控制措施,就能用一半 token 价格获得接近 Sol 的检索能力。这是有真实价值的档位,并非为了营销上的对称而存在。
Terra 也是 Free 和 Go 用户在 Codex 中默认接触到的 GPT-5.6 模型。对于想做智能体编程、又不愿为旗舰档付费的独立技术开发者,它是很实用的环境;不过这些模型的 API 本身并没有免费档。
- 输入和输出价格均为 Sol 的一半
- 在 OpenAI 公布的评测中,长上下文检索表现接近 Sol
- 配合 Codex,在独立指数中的编程得分为 77
- Codex 的 Free 和 Go 用户也可使用
- 独立性价比数据表明,它不在整体 Pareto 前沿上
- 处理常规抽取、分类和摘要时,比 Luna 更贵
- 与 Sol、Luna 一样,超过 272K 就会触发长上下文溢价
- 破坏性操作规避与正确性得分低于 Sol
GPT-5.6 Luna:短上下文、高吞吐量场景的赢家
当任务量很大、验证成本很低,而且答案不依赖于从书本大小的提示词中寻找针尖信息时,GPT-5.6 Luna 才是正确的默认选择。它的价格是每百万输入 token $1、输出 token $6,让大规模自动化变得可负担,同时无需退回上一代模型。
最适合: 工单分类、结构化抽取、文档摘要、路由、打标签和初稿
突出优势: 在独立 Intelligence Index 中,单任务成本为 $0.21
价格: 每 1M token 的输入、缓存输入和输出分别为 $1、$0.10 和 $6
不适合: 依赖在数十万 token 中稳定检索才能做出的决策
Artificial Analysis 给 Luna 的智能评分为 51,编程评分为 75。更值得关注的是单任务成本:$0.21,而 Terra 为 $0.55,Sol 为 $1.04。高级业务负责人若要批量处理标准化报告,在该评测的成本口径下,一次 Sol 任务的钱足够运行多次 Luna 任务。
1.05M token 的宣传重点,也正是购买者最容易踩坑的地方。在 OpenAI 多针检索测试的 256K 到 512K 和 512K 到 1M 两个区间,Luna 的得分都是 41.3。在 BrowseComp 上,它得到 83.3%,略低于 GPT-5.5 的 84.4%。Luna 能接收巨型提示词,不等于它能从中可靠检索。
最合理的用法,是让它承担路由器的第一道关卡。如果抽取结果缺少必填字段、分类置信度不足,或提示词超过内部评测可支持的上下文阈值,就升级到 Terra 或 Sol。便宜模型应该用来消化流量,而不是掩盖不确定性。
- API 价格与独立评测的单任务成本均为系列最低
- 足以胜任许多结构化、高吞吐量的业务工作流
- 与更大档位拥有相同的工具支持、上下文上限和最大输出上限
- 很适合作为模型路由的第一层
- 长上下文检索能力远低于 Sol 和 Terra
- OpenAI 发布的数据中,BrowseComp 得分低于 GPT-5.5
- 在系列中,破坏性操作规避与正确性得分最低
- 无法在标准 ChatGPT 对话中手动选择
GPT-5.6 API价格:算上缓存与长上下文溢价
只有针对工作负载设计好路由和缓存,GPT-5.6 才能真正便宜。单看标价,会漏掉两个足以改变账单的机制:缓存写入费用和长上下文溢价。
假设每月使用 10M 个未缓存输入 token 和 2M 个输出 token,基础账单很直观:
对一次包含 100,000 个未缓存输入 token 和 10,000 个输出 token 的请求,总成本分别是:Sol $0.80、Terra $0.40、Luna $0.16。先让 Luna 做低成本初筛,只把失败任务升级,带来的单位经济效益往往比从提示词里删掉几个字更大。
提示词缓存会奖励重复使用的稳定上下文,但 GPT-5.6 新增了写入费用。一次缓存写入按未缓存输入费率的 1.25x 收费;缓存读取享受 90% 折扣。OpenAI 表示,缓存最短可保留 30 分钟,并支持显式缓存断点。
如果一段 100,000 token 的稳定前缀使用两次,一次写入加一次读取的成本分别为:Sol $0.675、Terra $0.3375、Luna $0.135。如果两次都按未缓存读取,成本则是 $1、$0.50 和 $0.20。只要缓存确实存活且前缀完全一致,第二次使用就足以覆盖首次写入的溢价。
现有的缓存、路由和支出上限架构在这里更有价值。保持稳定且可缓存的前缀,把简单的短请求路由给 Luna,只在确有长上下文需求时使用 Terra,并限制 Sol 的智能体循环。端点名称本身不是成本控制,真正的控制点是调用关口。
GPT-5.6 上生产后,哪些地方可能出问题
GPT-5.6 的生产风险不在于工具不够,而在于主动性失控。这个系列可以搜索、编辑、执行 shell 命令、操作计算机和协调其他智能体。指令越宽松,这些能力造成的影响范围就越大。
OpenAI 的 GPT-5.6 系统卡指出,相比 GPT-5.5,GPT-5.6 更容易采取或尝试执行用户未要求的操作,尽管绝对发生率仍然很低。在破坏性操作评测中,仅规避得分分别为:GPT-5.5 0.88、Sol 0.83、Terra 0.81、Luna 0.73。规避加正确性的综合得分则是:GPT-5.5 与 Sol 均为 0.44、Terra 0.37、Luna 0.32。
这些数字并不意味着 Luna 会删除数据,而是说明:无论模型大小和价格如何,权限、确认关卡、快照和回滚都不可省。生产环境中的智能体,应先获准提出破坏性操作,再获准真正执行。
看待基准测试也需要同样克制。Artificial Analysis 认为 Sol 已接近智能能力前沿,并在 Coding Agent Index 中排名第一;但其 Omniscience 指标也记录到,相比 GPT-5.5,模型准确率小幅提升的同时,幻觉率略有上升。在 AA-Briefcase 中,Sol 的 Presentation Elo 最高;但 Claude Fable 5 仍以 56% 的评分标准得分领先整体基准,Sol 为 42%,分析质量 Elo 则分别是 1,764 和 1,592。
因此,诚实的结论应比发布文案更克制:GPT-5.6 改善了 OpenAI 的模型选择和性价比前沿,但没有消灭幻觉、横扫所有基准,也没有让自主智能体天然安全。安全团队还应预期到额外阻力。OpenAI 表示,Sol 的网络安全防护拦截潜在有害活动的数量约为旧模型的 10 倍,其中也包含部分无害任务。
Sol、Terra、Luna 怎么选,什么时候继续用 GPT-5.5
正确选择应以 OpenAI 当前的可用性矩阵为依据。标准 ChatGPT、Work、Codex 与 API 提供的选项并不相同。
在标准 ChatGPT 对话中,Plus 包含 Medium 和 High;Pro、Business 与 Enterprise 包含 Medium、High、Extra High 和 Pro;Free 与 Go 不包含 GPT-5.6。Terra 和 Luna 不能在标准 ChatGPT 中选择。
ChatGPT 中的 Work 面向 Plus、Pro、Business 与 Enterprise 用户提供三个档位。Codex 为 Free 和 Go 用户提供 Terra,付费计划则可使用全部三个档位。API 可以直接调用 Sol、Terra 和 Luna。
如果 GPT-5.5 目前已经够快、够稳定,并能通过内部评测,就继续使用。版本升级本身,不值得打乱一条低成本且运行良好的路径。只有 GPT-5.6 能改善实测结果、降低实测成本,或解锁真正需要的工具模式时,才应该迁移。
如果真正要做的选择不是 Sol、Terra、Luna,而是 OpenAI 与 Anthropic,请参考 Claude 与 ChatGPT 对比。模型系列内部的路由和供应商选择,是两个不同的架构决策。
一套现在就能采用的 GPT-5.6 使用指南
从足以胜任任务的最低成本档位开始,再根据证据升级。一套清晰的策略包含五部分。
短而重复的任务路由给 Luna
把分类、抽取、摘要、打标签和初稿交给
gpt-5.6-luna。有固定 schema 的任务应要求结构化输出,并把字段缺失或验证失败设为升级信号。长上下文转给 Terra
当答案依赖于从大型代码仓库或文档集中稳定检索时,使用
gpt-5.6-terra。务必监控 272K 输入边界,因为价格倍数会作用于整次请求。Sol 只处理代价高昂的错误
高难度调试、安全审查、生产事故、复杂研究和判断型任务使用
gpt-5.6-sol。除非确实想选择 Sol,否则不要使用不带后缀的gpt-5.6别名。缓存稳定上下文
在显式缓存断点之前放置长期有效的指令、schema 和参考资料。让前缀在字节层面保持稳定,以便在支付 1.25x 写入费率后,通过 90% 的读取折扣收回成本。
给操作加关卡,并保留旧路径
破坏性或对外操作必须经过确认,同时保留回滚能力;在新路由通过实际工作负载评测之前,继续保留 GPT-5.5。升级过程应该可逆。
这套策略刻意不追求平均分配:Luna 消化低成本流量,Terra 购买可用的长上下文,Sol 购买判断力。没有可量化收益的路径,继续留给 GPT-5.5。
GPT-5.6 已经可以使用了吗?
可以。GPT-5.6 于 2026 年 7 月 9 日在 ChatGPT、Codex 和 OpenAI API 中全面开放。具体权限取决于产品与套餐,发布过程是逐步推进的。
ChatGPT 5.6 sol 是什么?
GPT-5.6 Sol 是 OpenAI 的 GPT-5.6 旗舰档。在符合条件的标准 ChatGPT 套餐中,Medium、High 和 Extra High 推理由它驱动,Pro 选项则由 GPT-5.6 Sol Pro 驱动。
GPT-5.6 什么时候发布?
OpenAI 于 2026 年 7 月 9 日开始全面开放,并表示会在随后 24 小时内继续向全球推送。如果符合条件的账号仍看不到 Sol,原因可能是尚未轮到该账号,或工作区设置限制了访问。
不想每次模型更新都重做路由?免费领取面向企业主的 AI 工具地图,随时掌握当前的模型与工具选择。
领取面向企业主的 AI 工具地图
用直白语言说明每类 AI 模型和工具适合什么任务,并随价格与能力变化持续更新。订阅即可免费获取。
2026年9月3日







