OpenAI Codex 实战指南:用 GPT-6.1 Sol 构建可靠 AI 智能体
OpenAI Codex 如何接入 GPT-6.1 Sol?本文从 Responses API、推理强度、工具权限、真实任务成本到模型路由,给出一套可直接落地的智能体配置方法,帮助团队在 GPT-6 Sol、GPT-6.1 Sol 与 Astra 之间做出可验证的选择,并用固定验收标准控制质量、延迟和预算。

把 GPT-6.1 Sol 用在 OpenAI Codex 与 API 智能体中那些严肃、可重复的工作上:这类任务对轻量模型要求太高,却又频繁到不该每次都直接交给 Astra。落地方式并不复杂:在 Responses API 上使用 gpt-6.1-sol,从 medium 开始,只开放任务真正需要的工具,并且只有在固定验收检查全部通过后才升级路由。为本文新开的 Codex 运行创建了一个小型 JavaScript 工具,编写四项测试并全部通过;按纯 token API 价格折算,成本为 $0.02816。
一分钟决定如何配置 OpenAI Codex
GPT-6.1 Sol 已可用于 API 智能体、Codex 和付费版 ChatGPT Work。普通 Chat 暂未提供该模型;面向这个模型的 Ultrafast 已经公布,但尚未上线。
Standard API 的价格是每百万输入 token $2、每百万输出 token $10;GPT-6 Astra 则分别为 $10 和 $50。OpenAI 的发布公告确认了产品开放范围。如需查看更完整的访问权限与速率对比,请阅读 GPT-6.1 Sol 与 GPT-6 Sol 对比;本文只讨论配置与运行决策。
GPT-6.1 Sol 到底是什么
可以把 GPT-6 系列看成一张运营工作台:Astra 是留给最棘手、最有争议案例的专家;GPT-6.1 Sol 则像一位资深执行者,适合持续处理反复出现的复杂工作。GPT-6 Sol 是为旧工具调用路径保留的兼容选项。相比把新模型当成万能默认项,这种分工更实用。
GPT-6.1 Sol 可接收文本和图像、输出文本,拥有可容纳 1,050,000 个 token 的上下文窗口,最多可输出 128,000 个 token。对智能体而言,真正的价值在于它的工具面。在 Responses 中,它支持网页搜索、文件搜索、图像生成、代码解释器、托管 shell、apply patch、skills、计算机操作、MCP、工具搜索以及自定义函数。Responses 工具指南介绍了 API 如何让模型保持在智能体循环中,并自行判断下一步该调用哪个获准工具。

同样重要的是它的限制:GPT-6.1 Sol 只有通过 Responses 才能使用工具。Chat Completions 仍能接收普通请求,却不能完成工具调用。如果现有智能体通过 Chat Completions 调用函数,那么只替换模型 ID 并不算完成迁移。
在 Responses API 中完成配置
先从一条路由和一项验收检查开始。不要因为模型页面列出了所有工具,就把它们全部开放。研究型任务可能只需要网页搜索和文件搜索;代码仓库任务可能需要 shell 与补丁权限;运营智能体也许只需要两个函数和一道审批边界。
下面是最精简且实用的 JavaScript 请求:
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-6.1-sol",
reasoning: { effort: "medium" },
tools: [{ type: "web_search" }],
input: "Find today's source for our target metric, cite it, and return one sentence."
});
console.log(response.output_text);模型 ID 决定使用 Sol;reasoning 对象控制模型可以投入多少推理工作;tools 数组授予一种能力,并不代表命令模型一定调用它。提示词仍需写清期望结果、证据要求与停止条件。
如果要迁移现有的 Chat Completions 智能体,应把它当作三项改造:把请求发送到 Responses、解析带类型的 output 项,并决定对话状态如何延续。Astra Responses 迁移指南对这部分底层衔接有更详细的说明。
固定五个真实任务
从实际工作流中选择已验收的样例,其中要包含一个失败案例。保留原有提示词、输入、权限和成功标准。
先从 medium 开始
首先使用默认强度。每次只改变一个变量,避免把模型带来的提升与提示词或工具调整混在一起。
只授予必要的工具
仅开放该路由必需的搜索、文件、函数、shell 或计算机控制能力。写入操作应始终受明确策略与审批边界约束。
记录通过验收的结果成本
记录新输入、缓存输入、输出、重试、工具费用,以及最终状态是否通过。一趟便宜但失败的运行并不算节省。
根据证据分配路由
Sol 能通过验收的任务就继续留在 Sol;只有棘手的剩余任务才升级到 Astra;不兼容的路由则继续使用 GPT-6 Sol,直到调用方完成改造。
按任务选择推理强度
对大多数智能体工作而言,medium 是合适的起点。GPT-6.1 Sol 还接受 low、high、xhigh 和 max,但会拒绝 none 与 minimal。因此,现有路由若使用后两者,就必须专门测试行为与延迟。OpenAI 的推理强度指南也采用了从高效执行逐步提升到最大推理强度的思路。

三个相似的名称实际控制着不同的东西。max 是 API 的推理强度;Codex 中的 Ultra 是把工作分给多个子智能体的多智能体模式;Ultrafast 是速度模式,而 GPT-6.1 Sol 对它的支持仍在筹备中。不要在它真正可用前,就把 Ultrafast 当成现成功能写进预算或上线计划。
一次真实 GPT-6.1 Sol 任务花了多少 token
与其只看标价,不如用一次小型运行理解真实成本。Codex 中的 GPT-6.1 Sol 以 low 强度接到这样一个任务:创建一个无依赖的 JavaScript slugify 函数,恰好添加四个 node:test 用例,分别覆盖首尾空白、词间空格、标点和大小写混合;然后运行测试并修复所有失败项。
模型创建了 slugify.js 和 slugify.test.js,随后运行 node --test slugify.test.js。最终结果是 4 项通过、0 项失败。记录到的用量为 57,578 个输入 token,其中 48,640 个来自缓存,另有 542 个输出 token。也就是说,只有 8,938 个输入 token 按新输入费率计费。

这是真实的 Codex 运行,因此消耗的是方案内使用额度,并未生成 API 账单。$0.02816 是按照 GPT-6.1 Sol 已公布的 Standard API 费率,对这组 token 构成进行精确折算的结果,其中不含任何付费托管工具费用。若以完全相同的构成运行 10,000 次,模型 token 成本将是 $281.60;保持 token 构成不变,按 Astra 费率计算则为 $1,651.20。后一项只是费率运算,并不是说 Astra 会消耗同样数量的 token。
这里的结论不是“每个小补丁都只要三美分”,而是智能体运行时、工具定义、指令和历史记录可能比用户眼前的请求占用更多资源。应该衡量整趟通过验收的运行,包括缓存上下文与重试成本。
Sol 最适合承担的七类工作
最能从 Sol 获益的,是那些需要反复处理高难度任务的团队。按潜在运营价值排序如下:
Sol 不会让审批设计、确定性检查或可观测性变得多余。它的作用,是让这些系统以低于 Astra 的 token 费率获得更强的执行者。
值得开发的三类产品
1. 面向编程智能体的 Sol 迁移测试台
这是其中最有潜力的机会。美国每月大约有 8,100 次搜索指向 ai powered coding agent,并带有商业意图。团队需要的不是另一份含糊的模型排行榜,而是要确认:在相同提示词、工具和验收检查下,代码仓库任务能否分别在 gpt-6-sol、gpt-6.1-sol 与 Astra 上通过。
最小可售版本可以是一款 CLI 加一个 CI action。团队提供五个 JSON 测试样例、一条验收命令和允许使用的工具。测试台分别运行各模型,记录验收结果、延迟、新输入与缓存 token、重试和成本,最后给出是否升级的结论。问题在于,通用评估运行器很容易被复制;真正能形成壁垒的,是实用编程测试样例库、集成能力和有价值的失败诊断。
2. 面向运营智能体的强度与成本路由器
美国每月大约有 1,000 次搜索指向 ai workflow automation,具有商业意图,CPC 为 $37.80。这类市场要的是完成工作,而不是再多一个聊天框。路由器可以把边界清楚的案例交给 low,普通多步骤工作交给 medium,棘手故障交给 high,只有尚未解决的剩余部分才交给 Astra。
一个 MVP 需要一条队列、三套强度策略、一项验收函数和一个支出仪表盘。目标客户是已经为多套自动化付费的运营团队。风险在于虚假的确定感:如果一个廉价路由器把一项后果严重的案例分错类,节省下来的钱可能一次就被抵消。因此,产品从上线第一天起就必须提供可重放的测试样例与人工覆盖机制。
3. 文档智能体的验收层
ai document analysis 在美国每月大约有 1,000 次搜索,CPC 为 $10.44。这里要做的产品不是又一个“上传并总结”界面,而是一层验证机制:检查文档智能体是否找齐所有必填字段、保留引用、核对总额,并在不确定时升级处理。
最小版本可先支持一种周期性资料包,例如供应商合同或月度财务 PDF,并配备固定字段结构与异常队列。重复分析交给 GPT-6.1 Sol,只有存在争议或信息不全的案例才转给 Astra。难点是行业针对性:宽泛的横向产品会显得同质化,而聚焦单一资料包并提供可信检查,才更容易赢得信任。
何时继续使用 GPT-6 Sol,何时为 Astra 付费
当兼容性是主要约束时,应继续使用 GPT-6 Sol。它仍然接受 none 推理强度;当 reasoning_effort 为 none 时,也能通过 Chat Completions 调用函数,而 GPT-6.1 Sol 做不到。依赖这些行为的稳定路由,必须先迁移 API 路径并通过回归测试,然后再更换模型。
当最佳结果比 token 账单更重要时,才值得为 GPT-6 Astra 付费。OpenAI 将它描述为面向最高难度推理、编程、计算机操作、研究和文档创作的最强模型。应把它用于那些模糊但价值高的尾部任务,而且只有固定评估证明它带来实质提升时才升级。按 Standard 费率计算,Astra 每百万 token 的输入价格为 $10、输出价格为 $50;GPT-6.1 Sol 则是 $2 和 $10。
GPT-6.1 Sol 适合承接中间的大多数任务:基于 Responses、要求较高、会重复发生,并且有可衡量的成功条件。OpenAI 公布的首发评估显示,它在多项高难度工作负载中强于 GPT-6 Sol;但这些仍是厂商运行的结果。真正的上线门槛应该是团队自己的验收通过率。
会直接影响配置的限制
GPT-6.1 Sol 并不能替代所有路由。它不支持 none 或 minimal 强度,不能通过 Chat Completions 调用工具,不支持微调,不接收音频或视频输入,而且首发时没有进入普通 Chat。付费工具还会另行收费。当输入超过 272,000 个 token 时,整个请求也会转入更高的长上下文费率,因此不能把可容纳 1,050,000 个 token 的窗口当作免费的工作空间。
Ultrafast 是另一个必须讲清楚的限制。OpenAI 已经宣布,它在 Codex 中的 token 生成速度最高可达标准速度的 8x,但官方措辞仍是“即将推出”。在账户和客户端真正获得该功能前,应按 Standard 或 Fast 规划,并测量实际拿到的延迟。
本周一就能执行的方案
从当前智能体最近完成的工作中挑出五项:一项简单成功案例、两项常规任务、一项重工具任务,以及一项已知失败案例。在不改提示词和权限的前提下,用 GPT-6.1 Sol 的 medium 强度运行同一组测试样例。记录通过或失败、耗时、新输入、缓存输入、输出、重试和工具费用。
接下来要做的是路由,而不是宣布某个模型获胜。边界明确的工作如果仍能通过,就下调到 low;只有需要更深推理的失败案例才测试 high;受兼容性限制的调用方继续留在 GPT-6 Sol;只有当验收提升足以覆盖价格差异时,才把昂贵的剩余任务交给 Astra。这样本周就能得到一个生产决策,而不是一条关于模型的主观看法。
常见问题
GPT-6.1 Sol 是什么?
GPT-6.1 Sol 是 OpenAI 面向复杂编程、计算机操作和专业工作的低成本模型。它的 API ID 是 gpt-6.1-sol,工具调用通过 Responses API 运行。
什么是 AI 编程智能体?
AI 编程智能体可以在既定权限内检查代码仓库、编辑文件、运行命令与测试,并汇报结果。真正有价值的工作单位是经过测试的结果,而不只是生成代码。
ChatGPT 有编程智能体吗?
有。Codex 是 OpenAI 的编程智能体,GPT-6.1 Sol 正随其付费方案逐步开放。该模型也已进入 ChatGPT Work,但普通 Chat 暂未提供。
GPT-6 Sol 更便宜吗?
新输入和输出并没有更便宜:两款 Sol 模型的 Standard 标价都是每百万 token 输入 $2、输出 $10。GPT-6.1 Sol 的缓存输入费率更低。完整 Sol 对比详细说明了价格与兼容性的差异。
如果希望为自己的业务设计、测试并上线一条这样的智能体路由,请查看 AI 生产系统。
- 最近更新
- 2026年9月30日
- 分类
- AI







