OpenAI Codex 实战指南:用 GPT-6.1 Sol 构建可靠 AI 智能体

OpenAI Codex 如何接入 GPT-6.1 Sol?本文从 Responses API、推理强度、工具权限、真实任务成本到模型路由,给出一套可直接落地的智能体配置方法,帮助团队在 GPT-6 Sol、GPT-6.1 Sol 与 Astra 之间做出可验证的选择,并用固定验收标准控制质量、延迟和预算。

Wednesday, September 30, 2026Omid Saffari
Tools
OpenAI Codex 实战指南:用 GPT-6.1 Sol 构建可靠 AI 智能体

把 GPT-6.1 Sol 用在 OpenAI Codex 与 API 智能体中那些严肃、可重复的工作上:这类任务对轻量模型要求太高,却又频繁到不该每次都直接交给 Astra。落地方式并不复杂:在 Responses API 上使用 gpt-6.1-sol,从 medium 开始,只开放任务真正需要的工具,并且只有在固定验收检查全部通过后才升级路由。为本文新开的 Codex 运行创建了一个小型 JavaScript 工具,编写四项测试并全部通过;按纯 token API 价格折算,成本为 $0.02816。

一分钟决定如何配置 OpenAI Codex

GPT-6.1 Sol 已可用于 API 智能体、Codex 和付费版 ChatGPT Work。普通 Chat 暂未提供该模型;面向这个模型的 Ultrafast 已经公布,但尚未上线。

使用场景应该选择什么需要注意什么
OpenAI API在 /v1/responses 上使用 gpt-6.1-sol工具调用必须通过 Responses
Codex CLIcodex --model gpt-6.1-sol正随付费方案逐步开放
Codex 和 ChatGPT Work在模型控制项中选择 GPT-6.1 SolPlus、Pro、Business、Enterprise 和 Edu 均包含;Enterprise 与 Edu 管理员需要手动启用
普通 Chat暂时不要围绕它规划GPT-6.1 Sol 首发时尚未在此提供
Ultrafast等待OpenAI 表示稍后推出;Standard 和 Fast 已上线

Standard API 的价格是每百万输入 token $2、每百万输出 token $10;GPT-6 Astra 则分别为 $10 和 $50。OpenAI 的发布公告确认了产品开放范围。如需查看更完整的访问权限与速率对比,请阅读 GPT-6.1 Sol 与 GPT-6 Sol 对比;本文只讨论配置与运行决策。

GPT-6.1 Sol 到底是什么

可以把 GPT-6 系列看成一张运营工作台:Astra 是留给最棘手、最有争议案例的专家;GPT-6.1 Sol 则像一位资深执行者,适合持续处理反复出现的复杂工作。GPT-6 Sol 是为旧工具调用路径保留的兼容选项。相比把新模型当成万能默认项,这种分工更实用。

GPT-6.1 Sol 可接收文本和图像、输出文本,拥有可容纳 1,050,000 个 token 的上下文窗口,最多可输出 128,000 个 token。对智能体而言,真正的价值在于它的工具面。在 Responses 中,它支持网页搜索、文件搜索、图像生成、代码解释器、托管 shell、apply patch、skills、计算机操作、MCP、工具搜索以及自定义函数。Responses 工具指南介绍了 API 如何让模型保持在智能体循环中,并自行判断下一步该调用哪个获准工具。

黏土风工作流:API、Codex 与 Work 汇入 GPT-6.1 Sol,随后依次选择推理强度、工具并通过评估门槛
安全的配置路径包括接口路由、推理强度、精简工具集和固定评估门槛。

同样重要的是它的限制:GPT-6.1 Sol 只有通过 Responses 才能使用工具。Chat Completions 仍能接收普通请求,却不能完成工具调用。如果现有智能体通过 Chat Completions 调用函数,那么只替换模型 ID 并不算完成迁移。

在 Responses API 中完成配置

先从一条路由和一项验收检查开始。不要因为模型页面列出了所有工具,就把它们全部开放。研究型任务可能只需要网页搜索和文件搜索;代码仓库任务可能需要 shell 与补丁权限;运营智能体也许只需要两个函数和一道审批边界。

下面是最精简且实用的 JavaScript 请求:

JavaScript
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6.1-sol",
  reasoning: { effort: "medium" },
  tools: [{ type: "web_search" }],
  input: "Find today's source for our target metric, cite it, and return one sentence."
});

console.log(response.output_text);

模型 ID 决定使用 Sol;reasoning 对象控制模型可以投入多少推理工作;tools 数组授予一种能力,并不代表命令模型一定调用它。提示词仍需写清期望结果、证据要求与停止条件。

如果要迁移现有的 Chat Completions 智能体,应把它当作三项改造:把请求发送到 Responses、解析带类型的 output 项,并决定对话状态如何延续。Astra Responses 迁移指南对这部分底层衔接有更详细的说明。

  1. 固定五个真实任务

    从实际工作流中选择已验收的样例,其中要包含一个失败案例。保留原有提示词、输入、权限和成功标准。

  2. 先从 medium 开始

    首先使用默认强度。每次只改变一个变量,避免把模型带来的提升与提示词或工具调整混在一起。

  3. 只授予必要的工具

    仅开放该路由必需的搜索、文件、函数、shell 或计算机控制能力。写入操作应始终受明确策略与审批边界约束。

  4. 记录通过验收的结果成本

    记录新输入、缓存输入、输出、重试、工具费用,以及最终状态是否通过。一趟便宜但失败的运行并不算节省。

  5. 根据证据分配路由

    Sol 能通过验收的任务就继续留在 Sol;只有棘手的剩余任务才升级到 Astra;不兼容的路由则继续使用 GPT-6 Sol,直到调用方完成改造。

按任务选择推理强度

对大多数智能体工作而言,medium 是合适的起点。GPT-6.1 Sol 还接受 low、high、xhigh 和 max,但会拒绝 none 与 minimal。因此,现有路由若使用后两者,就必须专门测试行为与延迟。OpenAI 的推理强度指南也采用了从高效执行逐步提升到最大推理强度的思路。

API 强度适用场景实际例子
low边界明确、重视速度和成本的执行任务应用一个小补丁、起草客服回复,或转换一条已知记录
medium兼顾规划能力与可靠性的默认选择智能体编程、研究、电子表格处理,或需要人工复核的协同交付物
high涉及权衡的高难度调试与多步骤工作追踪跨服务的间歇性故障,再提出修复方案并完成测试
xhigh已验证额外推理深度有价值的长时间异步任务安全审查、深度研究,或有挑战性的代码仓库改动
max相比延迟和用量,更重视推理深度的最高难度单项任务面对互相冲突的证据,完成一项高价值架构决策
黏土风五级推理阶梯,依次标注 Low、Medium、High、XHigh 和 Max,每一级对应不同任务
从 Medium 开始:边界明确的任务可以下调,只有评估证明质量提升时才上调。

三个相似的名称实际控制着不同的东西。max 是 API 的推理强度;Codex 中的 Ultra 是把工作分给多个子智能体的多智能体模式;Ultrafast 是速度模式,而 GPT-6.1 Sol 对它的支持仍在筹备中。不要在它真正可用前,就把 Ultrafast 当成现成功能写进预算或上线计划。

一次真实 GPT-6.1 Sol 任务花了多少 token

与其只看标价,不如用一次小型运行理解真实成本。Codex 中的 GPT-6.1 Sol 以 low 强度接到这样一个任务:创建一个无依赖的 JavaScript slugify 函数,恰好添加四个 node:test 用例,分别覆盖首尾空白、词间空格、标点和大小写混合;然后运行测试并修复所有失败项。

模型创建了 slugify.js 和 slugify.test.js,随后运行 node --test slugify.test.js。最终结果是 4 项通过、0 项失败。记录到的用量为 57,578 个输入 token,其中 48,640 个来自缓存,另有 542 个输出 token。也就是说,只有 8,938 个输入 token 按新输入费率计费。

Token 类型数量每 1M 的 Standard 费率成本
新输入8,938$2.00$0.017876
缓存输入48,640$0.10$0.004864
输出542$10.00$0.005420
纯 token 合计$0.028160
黏土风成本账本:8938 个新输入 token、48640 个缓存输入 token、542 个输出 token、4/4 项测试通过,token 成本为 $0.02816
即使是小型编程任务也会携带智能体上下文;缓存输入让它按 API 纯 token 折算的成本保持在 2.816 美分。

这是真实的 Codex 运行,因此消耗的是方案内使用额度,并未生成 API 账单。$0.02816 是按照 GPT-6.1 Sol 已公布的 Standard API 费率,对这组 token 构成进行精确折算的结果,其中不含任何付费托管工具费用。若以完全相同的构成运行 10,000 次,模型 token 成本将是 $281.60;保持 token 构成不变,按 Astra 费率计算则为 $1,651.20。后一项只是费率运算,并不是说 Astra 会消耗同样数量的 token。

这里的结论不是“每个小补丁都只要三美分”,而是智能体运行时、工具定义、指令和历史记录可能比用户眼前的请求占用更多资源。应该衡量整趟通过验收的运行,包括缓存上下文与重试成本。

Sol 最适合承担的七类工作

最能从 Sol 获益的,是那些需要反复处理高难度任务的团队。按潜在运营价值排序如下:

排名适用团队具体工作流为什么划算
1有维护任务队列的工程团队向 Codex 提供一个失败测试和代码仓库范围,让它检查、修改并运行测试套件,最后要求提交一份干净的差异评审可以从经过测试的改动开始,不必停留在诊断结果与交接说明上
2跨 CRM、账单和客服系统工作的运营负责人让 Responses 智能体读取案例、调用范围收窄的函数、准备更新内容,并在写入前停下等待审批一次受控运行就能替代在三个系统之间手动复制上下文
3面对长篇文档包的财务或法律分析师结合文件搜索与代码解释器,定位条款、核对表格并返回带引用的异常项分析师只需复核异常,不必逐页人工扫描
4每周制作简报的研究团队用网页搜索获取当前来源、用文件搜索检索内部资料,再以结构化输出生成最终简报资料收集与格式整理都留在同一条可审计路由内
5受困于无可用 API 软件的后台团队用计算机操作控制界面,并在任何不可逆步骤前要求截图或状态检查老旧应用无需先开发定制集成,也能进入智能体工作流
6维护大量已审批素材的产品内容团队让智能体读取需求、调用图像生成、验证必填字段,再把结果交给人工审核重复协调工作集中到一次运行中,审美判断与审批仍由人负责
7为多个内部智能体提供服务的平台团队使用 skills、MCP 和工具搜索,让每项工作只加载所需的指令与工具更小的活跃工具集可以减少干扰,也让权限更容易检查

Sol 不会让审批设计、确定性检查或可观测性变得多余。它的作用,是让这些系统以低于 Astra 的 token 费率获得更强的执行者。

值得开发的三类产品

1. 面向编程智能体的 Sol 迁移测试台

这是其中最有潜力的机会。美国每月大约有 8,100 次搜索指向 ai powered coding agent,并带有商业意图。团队需要的不是另一份含糊的模型排行榜,而是要确认:在相同提示词、工具和验收检查下,代码仓库任务能否分别在 gpt-6-sol、gpt-6.1-sol 与 Astra 上通过。

最小可售版本可以是一款 CLI 加一个 CI action。团队提供五个 JSON 测试样例、一条验收命令和允许使用的工具。测试台分别运行各模型,记录验收结果、延迟、新输入与缓存 token、重试和成本,最后给出是否升级的结论。问题在于,通用评估运行器很容易被复制;真正能形成壁垒的,是实用编程测试样例库、集成能力和有价值的失败诊断。

2. 面向运营智能体的强度与成本路由器

美国每月大约有 1,000 次搜索指向 ai workflow automation,具有商业意图,CPC 为 $37.80。这类市场要的是完成工作,而不是再多一个聊天框。路由器可以把边界清楚的案例交给 low,普通多步骤工作交给 medium,棘手故障交给 high,只有尚未解决的剩余部分才交给 Astra。

一个 MVP 需要一条队列、三套强度策略、一项验收函数和一个支出仪表盘。目标客户是已经为多套自动化付费的运营团队。风险在于虚假的确定感:如果一个廉价路由器把一项后果严重的案例分错类,节省下来的钱可能一次就被抵消。因此,产品从上线第一天起就必须提供可重放的测试样例与人工覆盖机制。

3. 文档智能体的验收层

ai document analysis 在美国每月大约有 1,000 次搜索,CPC 为 $10.44。这里要做的产品不是又一个“上传并总结”界面,而是一层验证机制:检查文档智能体是否找齐所有必填字段、保留引用、核对总额,并在不确定时升级处理。

最小版本可先支持一种周期性资料包,例如供应商合同或月度财务 PDF,并配备固定字段结构与异常队列。重复分析交给 GPT-6.1 Sol,只有存在争议或信息不全的案例才转给 Astra。难点是行业针对性:宽泛的横向产品会显得同质化,而聚焦单一资料包并提供可信检查,才更容易赢得信任。

何时继续使用 GPT-6 Sol,何时为 Astra 付费

当兼容性是主要约束时,应继续使用 GPT-6 Sol。它仍然接受 none 推理强度;当 reasoning_effort 为 none 时,也能通过 Chat Completions 调用函数,而 GPT-6.1 Sol 做不到。依赖这些行为的稳定路由,必须先迁移 API 路径并通过回归测试,然后再更换模型。

当最佳结果比 token 账单更重要时,才值得为 GPT-6 Astra 付费。OpenAI 将它描述为面向最高难度推理、编程、计算机操作、研究和文档创作的最强模型。应把它用于那些模糊但价值高的尾部任务,而且只有固定评估证明它带来实质提升时才升级。按 Standard 费率计算,Astra 每百万 token 的输入价格为 $10、输出价格为 $50;GPT-6.1 Sol 则是 $2 和 $10。

GPT-6.1 Sol 适合承接中间的大多数任务:基于 Responses、要求较高、会重复发生,并且有可衡量的成功条件。OpenAI 公布的首发评估显示,它在多项高难度工作负载中强于 GPT-6 Sol;但这些仍是厂商运行的结果。真正的上线门槛应该是团队自己的验收通过率。

会直接影响配置的限制

GPT-6.1 Sol 并不能替代所有路由。它不支持 none 或 minimal 强度,不能通过 Chat Completions 调用工具,不支持微调,不接收音频或视频输入,而且首发时没有进入普通 Chat。付费工具还会另行收费。当输入超过 272,000 个 token 时,整个请求也会转入更高的长上下文费率,因此不能把可容纳 1,050,000 个 token 的窗口当作免费的工作空间。

Ultrafast 是另一个必须讲清楚的限制。OpenAI 已经宣布,它在 Codex 中的 token 生成速度最高可达标准速度的 8x,但官方措辞仍是“即将推出”。在账户和客户端真正获得该功能前,应按 Standard 或 Fast 规划,并测量实际拿到的延迟。

本周一就能执行的方案

从当前智能体最近完成的工作中挑出五项:一项简单成功案例、两项常规任务、一项重工具任务,以及一项已知失败案例。在不改提示词和权限的前提下,用 GPT-6.1 Sol 的 medium 强度运行同一组测试样例。记录通过或失败、耗时、新输入、缓存输入、输出、重试和工具费用。

接下来要做的是路由,而不是宣布某个模型获胜。边界明确的工作如果仍能通过,就下调到 low;只有需要更深推理的失败案例才测试 high;受兼容性限制的调用方继续留在 GPT-6 Sol;只有当验收提升足以覆盖价格差异时,才把昂贵的剩余任务交给 Astra。这样本周就能得到一个生产决策,而不是一条关于模型的主观看法。

常见问题

GPT-6.1 Sol 是什么?

GPT-6.1 Sol 是 OpenAI 面向复杂编程、计算机操作和专业工作的低成本模型。它的 API ID 是 gpt-6.1-sol,工具调用通过 Responses API 运行。

什么是 AI 编程智能体?

AI 编程智能体可以在既定权限内检查代码仓库、编辑文件、运行命令与测试,并汇报结果。真正有价值的工作单位是经过测试的结果,而不只是生成代码。

ChatGPT 有编程智能体吗?

有。Codex 是 OpenAI 的编程智能体,GPT-6.1 Sol 正随其付费方案逐步开放。该模型也已进入 ChatGPT Work,但普通 Chat 暂未提供。

GPT-6 Sol 更便宜吗?

新输入和输出并没有更便宜:两款 Sol 模型的 Standard 标价都是每百万 token 输入 $2、输出 $10。GPT-6.1 Sol 的缓存输入费率更低。完整 Sol 对比详细说明了价格与兼容性的差异。

如果希望为自己的业务设计、测试并上线一条这样的智能体路由,请查看 AI 生产系统。

最近更新
2026年9月30日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

GPT-6.1 Sol 对比 GPT-6 Sol:价格、性能与升级建议

GPT-6.1 Sol 对比 GPT-6 Sol:价格、性能与升级建议

GPT-6.1 Sol 和 GPT-6 Sol 的输入、输出价格相同,但缓存读取降至每百万 token $0.10。本文对比两款模型的价格、基准测试、上下文、推理强度与工具调用限制,并给出 Responses API 迁移和生产评测建议,帮助你判断何时升级、何时继续使用 GPT-6 Sol。2026年9月30日AI
Claude Sonnet 使用教程:5.5 版从 Medium 上手

Claude Sonnet 使用教程:5.5 版从 Medium 上手

这份 Claude Sonnet 使用教程从 Medium 入门,结合本地测试说明 5.5 版如何用于客服摘要、客户简报、代码审查与 API 工作流,并梳理 Effort 选择、定价、迁移规则和人工核验要点,帮助你在投入生产前用可复核样本验证事实准确性、延迟与 token 成本。2026年9月28日AI
Jev 对比 GLM-5.3-Flash:AI 决策模型怎么选

Jev 对比 GLM-5.3-Flash:AI 决策模型怎么选

深度对比 Jev 与 GLM-5.3-Flash 两款 AI 决策模型的文本分类成本、图像输入、准确率、延迟与迁移代价,并用统一的 30 张工单测试框架,帮你判断何时该选低成本的 Jev,何时该选通过 Privatemode Decisions 调用的多模态 GLM-5.3-Flash。2026年9月27日AI
Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:逐项拆解价格、缓存、编程证据与 API 兼容性,说明 thinking、强制工具选择、computer 工具及进度流的五项迁移风险,并给出何时升级、何时保留旧模型的可执行判断框架。同时用固定 token 算例核对真实账单,帮助团队按每个合格结果的成本做选择。2026年9月23日AI
GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。