编程 Agent 最佳 AI网关:6 款方案价格、路由与治理对比
AI网关如何选?本文面向 Claude Code、Codex、Cursor 等编程智能体,对比 Vercel、Requesty、LiteLLM、OpenRouter、Portkey 与 Cloudflare 的价格、故障转移、成本归因、治理能力和部署负担,帮助团队按预算与基础设施要求找到合适方案。

Vercel AI Gateway 是大多数编程 Agent 团队最值得优先考虑的 AI网关:如今只需一条命令即可配置 9 款 Agent,而且基础 Token 层不收取任何加价。以每月 $2,000 的模型账单计算,Vercel 的网关费用为 $0,Requesty 为 $100,OpenRouter 则为 $110,且都尚未计入可选控制功能。因此,AI网关已经不再只是试验性工具,而应纳入正式的工程预算。
快速结论:AI网关应该怎么选?
除非部署方式、成本归因或治理要求明确指向其他产品,否则优先选择 Vercel AI Gateway。目前,它能以最省事的方式,把 Claude Code、Codex、Cursor 和 OpenCode 各自独立的配置,收拢到一份模型账单、一套故障转移规则和一个支出视图中。
有 5 种明确情形,应当放弃 Vercel。财务部门需要查明费用来自哪个代码仓库、分支或开发者时,选 Requesty。模型流量和提供商密钥必须留在自有基础设施中时,选 LiteLLM。相比针对具体 Agent 工具的接入方式,更看重模型和提供商目录广度时,选 OpenRouter。预算已经明确用于托管式防护规则、熔断器和策略控制时,选 Portkey。Workers、Cloudflare 日志和 Cloudflare 安全产品已经构成控制平面时,则选 Cloudflare AI Gateway。
AI网关是位于编程 Agent 与模型提供商之间的控制层。编程 Agent 仍然负责规划、修改文件、执行命令和调用工具;网关决定模型请求发往哪里、允许花费多少、交给哪家提供商、超时后如何处理,以及记录哪些内容。
这个边界非常重要。网关无法让能力不足的编程模型变强,无法修复质量欠佳的代码仓库指令文件,也不会替你审查不安全的代码。它能做的是:避免某家提供商宕机导致长任务前功尽弃,限制失控密钥的支出,并指出某个迁移分支消耗的模型预算是常规 Bug 修复的 4 倍。购买网关,是为了获得控制力,而不是智能。
为什么编程 Agent 会让 AI网关成为预算项
编程 Agent 会把一个看似简单的路由选择,放大成运营成本决策,因为一项任务可能触发一连串模型调用。普通聊天回答或许只需生成一次响应;编程 Agent 则可能要查看代码仓库、搜索符号、提出补丁、运行测试、读取失败信息、修改补丁,再请能力更强的模型复核结果。
Vercel 的生产环境指数显示,22.2% 的请求消耗了 58.9% 的 Token,也就是说,使用工具的请求所消耗的 Token 约为其他流量的 2.6 倍。同一数据集还显示,故障转移挽救了 3.5% 的请求。如果一批包含 10,000 个请求的工作负载符合这组汇总数据,那么约有 350 个请求会通过故障转移完成,而不是在第一家提供商处直接失败。这只是示例,并不保证其他工作负载也能达到相同的挽救比例,但足以说明:可靠性必须与模型价格一起评估。
如果固定上游模型账单,各家基础网关费用就更容易比较。假设按提供商定价计算的推理费用为每月 $2,000:
- Vercel 的 Token 加价为 $0。
- Requesty 按 5% 加价,增加 $100。
- OpenRouter 的 Pay as you go 费用为 5.5%,增加 $110。
- 通过 Cloudflare Unified Billing 购买额度时,增加 $100。
- Portkey 的起步价为每月 $49,包含 100,000 条已记录日志;它采用的计量方式不同于 Token 支出。
- LiteLLM 开源许可证增加的费用为 $0,但托管和运维人员成本仍由使用方承担。

百分比差异并非决策的全部。如果分支级成本归因能阻止某个失控的代码仓库消耗更多费用,那么 Requesty 多出的 $100 很划算。如果熔断器能保障发布流程不中断,Portkey 的 $49 也很划算。如果一名平台工程师从此要永久值守代理服务,LiteLLM 的零许可证费用反而可能很昂贵。
网关应该降低更换模型、提供商和 Agent 工具的成本。如果它只是把 6 张提供商账单变成第 7 张账单,就没有体现出应有价值。
这 6 款大模型网关是如何选出的
这 6 款产品的评判依据,是编程 Agent 实际带来的工作,而不是一份通用的 API 功能清单。价格和产品页面均于 2026 年 8 月 15 日完成核验。本轮评估未在生产环境中实际运行这些工具,因此排名依据是当前文档、标准化成本分析,以及各产品边界带来的实际影响。
排名由以下 6 项标准决定:
- 编程 Agent 工具接入: 明确提供 Claude Code、Codex、Cursor 及相关 Agent 文档的网关,集成风险低于只宣称兼容 OpenAI 接口的产品。
- 路由可靠性: 提供商排序、超时、重试、模型故障转移和熔断器都很重要,因为 Agent 可能在长链路的最后一次模型调用时失败。
- 成本可见性: 模型支出应该能归因到密钥、Agent、代码仓库、开发者、团队或策略,而不是只有一笔无法区分来源的 Token 总额。
- 策略控制: 提供商白名单、已批准模型清单、预算、数据保留控制和审计日志,决定团队能否从个人试验走向规模化使用。
- 部署负担: 托管网关收费,是为了减少运维工作;自托管网关免去平台费用,却把可用性、升级、存储和事件响应重新交给买方。
- 当前价格: 所有套餐和限制均以供应商实时页面为准。模型推理价格不参与排名,因为它会随模型和提供商变化,而且本次对比固定了上游账单。
Helicone 曾进入候选范围,但未列入排名。它是一款出色的可观测性产品,也提供网关功能,不过最突出的优势仍在链路追踪和分析,而不是广泛的编程 Agent 工具配置。通用 API 网关同样被排除。它们可以代理 HTTP 流量,但编程 Agent 需要理解模型的故障转移、Token 预算、Prompt 与响应控制,并兼容多种协议格式。
最终得到的是一份更短、决策规则也更严格的清单。下面每款产品都有自己最擅长的场景,也都有一道边界;越过这道边界,另一款产品就会成为更好的选择。
1. Vercel AI Gateway:编程 Agent 的综合最佳选择
Vercel AI Gateway 是默认首选,因为它消除了过去阻碍个人编程 Agent 工作流采用网关的配置成本。 目前,它的 CLI 可以创建密钥、预览配置变更,并通过 vercel ai-gateway coding-agents setup 配置 9 款受支持的 Agent。

实时支持表列出了 Claude Code、Cline、OpenAI Codex、Cursor、Hermes、Kilo Code、OpenClaw、OpenCode 和 Pi。Vercel 也为其他工具提供了手动接入文档。由于 Claude Code、Codex 和 Cursor 的协议行为并非通用 OpenAI 接口所能完全覆盖,它们分别使用专门的兼容端点。正是这一功能改变了采购逻辑:网关不再只是部署在自建应用背后的基础设施,也能直接服务工程师已经在使用的编程工具。
对一支 12 人产品团队而言,实际结果是:不同工作方式可以共享一份预算和一套故障转移策略。一名工程师继续使用 Claude Code,另一名在终端运行 Codex,第三名使用 Cursor;公司无需强制统一编辑器或模型提供商,所有请求仍可汇总到同一个支出视图。
最适合: 同时使用多款编程 Agent、希望最快完成托管式接入的团队
突出优势: 用一套 CLI 流程配置 9 款受支持的 Agent,并为 Claude Code、Codex 和 Cursor 提供专用端点
价格: 每月免费额度 $5;付费推理按提供商标价计费,Token 零加价
免费试用: 符合条件的模型可长期使用免费套餐,并非限时试用
基础层的定价格外清晰。Vercel 的实时定价页面说明,Token 不加价,也不收平台费。免费套餐每月包含 $5 额度、部分符合条件的模型,以及更低的单模型限额。购买额度后,账户会转为 Pay as you go,同时不再发放每月免费额度。Bring Your Own Key 只有转到付费套餐后才能使用,Vercel 不收取 BYOK 费用。
需要注意两点。第一,零加价只适用于 Token 层,并非所有控制功能。全团队提供商白名单和全团队零数据保留,各自按每 1,000 个请求 $0.10 收费。Trace drain 按每 1,000 条 Trace $0.05,另加每 GB 出站流量 $0.50。自定义报表还有独立的写入和查询计量。小团队可以忽略其中大部分,但受监管团队在认定网关免费之前,应先把这些费用算清楚。
第二,使用 BYOK 的请求失败后,可能会改用 Vercel 系统凭证重试,并从网关额度余额中扣除故障转移所产生的用量。它是合理的可靠性默认设置,但也是预算上的边界情况。如果财务部门要求每个请求都必须走现有提供商合同,就要审查这条故障转移路径,不能想当然。
对大多数产品团队而言,Vercel 的路由控制已经足够强。其文档涵盖提供商筛选、顺序设定、排序、自动缓存、提供商超时和模型故障转移。普通代码补全流量可以发给首选提供商;延迟超过容忍范围时快速切换;最后再用成本更高的模型作为恢复路径。
它的主要边界在于部署所有权。Vercel AI Gateway 是托管服务。如果团队要求网关进程、数据库、密钥和日志全部运行在自有网络内,它就不合适;这一要求出现时,无需比较其他功能,LiteLLM 直接胜出。
- 一条有文档支持的命令即可配置 9 款编程 Agent
- 为 Claude Code、Codex 和 Cursor 提供专用兼容端点
- Token 零加价,Token 平台费也为零
- 支持提供商排序、超时、缓存和模型故障转移
- 200+ 款模型共用一张账单和一个支出视图
- 不支持自托管网关部署
- BYOK 需要付费套餐
- 高级报表、Trace、白名单和全团队 ZDR 分别计费
- CLI 创建密钥后,Cursor 仍需在账户设置中完成最后几次点击
接入 Vercel AI Gateway,又不把迁移变成大工程
最稳妥的方式,是保留直连提供商的回滚路径,并从一个代码仓库开始。不要一次修改所有开发者和所有 Agent 的配置。
创建范围受控的试点密钥
为试点代码仓库单独创建一枚网关密钥,并设置每周或每月支出预算。不要复用全公司的应用密钥,因为编程 Agent 的循环调用需要独立的停止条件。
运行官方接入命令
运行
vercel ai-gateway coding-agents setup。让 CLI 检测已安装的 Agent,只选择试点工具,并在接受任何配置写入前检查屏幕上显示的 Diff。只保留一个主模型和一个故障转移模型
先使用团队已经信任的模型,再增加一个工具调用表现相近的提供商或模型作为故障转移。庞大的路由树会让失败任务更难解释。
核验身份与支出标签
分别从每款已配置的 Agent 运行一项范围明确的任务。确认控制台能按预期识别 Agent、模型、提供商、Token 用量、成本、延迟和故障转移状态。
保留直连通道
把原来的提供商配置保存在有文档说明的回滚文件中。如果网关改变了工具调用、模型发现或延迟表现,试点应能在几分钟内恢复。
2. Requesty:最适合按分支、代码仓库和开发者归因成本
当工程经理需要把模型支出对应到具体工作时,Requesty 是最佳网关。 它的 Claude Code 集成可以按分支、代码仓库、开发者和 Agent 版本标记请求,让团队不仅看到 Token 账单,还能追查费用来源。

对于同时推进迁移、功能分支和自动化审查的团队,这类归因能力比单纯的低费率更有价值。一支 B2B SaaS 团队可能会发现,后台审查成本很低,而某个代码仓库的测试修复循环吃掉了大部分月度预算。此时的应对措施很具体:调整该代码仓库或模型的策略,而不是削减所有开发者的权限。
最适合: 需要按分支、代码仓库或开发者核算编程 Agent 成本的团队
突出优势: Claude Code 分析标签、路由策略、EU 数据驻留以及 MCP 网关
价格: 免费模型 $0;Pay as you go 在模型基础成本上加价 5%;Enterprise 定制定价
免费试用: 免费套餐每天 200 个请求,无需信用卡
Requesty 的当前定价页面列出 20+ 家提供商的 600+ 款模型。Pay as you go 不收订阅费、席位费和最低消费;路由、缓存、故障转移及 EU 数据驻留也不另外收费。如果按提供商定价计算的月度推理费用为 $2,000,5% 加价就是 $100。
如果这些元数据能阻止一次成本更高的失控任务,或者让内部费用分摊成为可能,那么 $100 很容易证明物有所值。对只想更改 Base URL 的独立开发者来说,这笔费用就不那么划算。OpenRouter 宣称的模型目录更广,而在受支持的编程 Agent 上,Vercel 提供了更简洁的零加价路径。
Requesty 的 Enterprise 套餐加入了 SSO、RBAC、审计日志、已批准模型策略、PII 检测、分组预算、CI/CD 服务账户和定制 SLA。这些功能足以支持规模更大的工程组织,但价格需要询价。没有报价和有代表性的请求画像,团队无法比较 Enterprise 的成本。
有一处文档不一致值得留意。商业定价页写的是 600+ 款模型,而在 2026 年 8 月 10 日修改的 Claude Code 集成页仍写着 300+ 款模型。本文讨论付费模型目录时采用更大的数字,因为当前产品方案以实时定价页为准。但这种不一致也意味着:采购方应在账户的模型库中核验自己真正需要的型号,而不能把任何一个宣传数字当成保证。
Requesty 的 Claude Code 接入范围比 Vercel 的多 Agent CLI 窄,但成本归因更深入。它的 CLI 可以写入 Claude 配置,并备份原文件;可选的 Shell Wrapper 会在会话启动时注入代码仓库、分支、用户和 Agent 版本请求头。这段 Wrapper 在 Shell 配置中可见,而这些请求头会在转发给模型提供商之前移除。
它的边界是按比例计费。即使网关控制平面的工作量不变,5% 加价也会随模型支出增长。每月支出达到 $20,000 时,加价就是 $1,000。大型买方应把这笔费用与 Portkey 的订阅模式、LiteLLM 的运维成本,以及 Requesty Enterprise 的定制报价放在一起比较。
- 可按分支、代码仓库、开发者和 Agent 版本归因成本
- 免费模型每天包含 200 个免费请求
- Pay as you go 包含路由、缓存、故障转移、支出上限和 EU 数据驻留
- 提供 MCP 网关以及面向 CI/CD 的服务账户路径
- Pay as you go 没有订阅费、席位费或最低消费
- 5% 加价会随推理支出直接增长
- Enterprise 价格需要询价
- 多 Agent 接入不如 Vercel 的 9-Agent CLI 统一
- 实时页面对于模型目录是 300+ 还是 600+ 说法不一
3. LiteLLM:最佳自托管 LLM网关
当部署与数据的控制权比便利性更重要时,LiteLLM 是最佳选择。 它的开源代理可免费用于生产环境自托管,并通过一个兼容 OpenAI 的 API 接入 100+ 家提供商。

对于有私有网络边界的中型企业 CTO,这种吸引力非常直接:模型密钥、请求流量、虚拟密钥、预算、日志和 Prometheus 指标都留在企业自有基础设施中。LiteLLM 表示,自托管产品无法看到客户的数据或流量。这样,模型数据路径上就少了一层托管网关。
最适合: 要求自托管或隔离网络模型访问的平台团队
突出优势: 免费开源代理,支持 100+ 家提供商、虚拟密钥、预算、故障转移和 Prometheus
价格: 开源版 $0;Enterprise 按容量和部署方式提供年度定制报价
免费试用: Enterprise 可免费试用 30 天,无需信用卡;开源版持续免费
软件本身的价格是本次对比中最容易理解、也最容易被误解的数字。开源网关费用为 $0,包括生产环境使用。它包含用户和团队管理、支出追踪、速率限制、请求与响应日志,以及 LLM 故障转移。LiteLLM 不收取按 Token 计费的许可证费用。
但运维成本并非 $0。必须有人部署代理、管理数据库和 Secret、扩缩容、监控、在提供商变更 API 时升级、保留日志、测试故障转移,并在网关成为共享故障点时处理事故。LiteLLM 把供应商账单换成了基础设施责任。对平台团队而言,这可能是一笔好交易;对 5 人创业公司而言,可能恰恰相反。
Enterprise 增加了 SSO、SCIM、OIDC 或 JWT 身份验证、审计日志、Secret Manager 集成、密钥轮换、组织级控制、多区域控制平面、支持服务、SLA 和隔离网络部署。它采用年度定价,取决于请求容量、部署架构和支持服务,而不是 Token 数量。这个边界很重要:受监管企业或许会从开源版起步,但一旦身份、审计或全天候支持成为强制要求,就仍然需要 Enterprise。
LiteLLM 还有两个经常被采购方混为一谈的产品形态。Python SDK 是应用程序库;Proxy Server 才是提供身份验证、多租户支出管理、虚拟密钥和管理控制台的集中式网关。需要共享策略的编程 Agent 部署,应当评估 Proxy,而不只是给几段脚本加入 SDK。
编程 Agent 工具方面的边界在于文档与所有权。LiteLLM 提供许多 Agent 都能使用的兼容端点,却没有 Vercel 当前那种面向 9 款具名工具的一键安装器。每款 Agent 的环境变量、响应格式、模型发现和工具调用行为都需要单独验证。Codex 的 Responses API 行为与 Claude Code 的 Anthropic 协议尤其应该分别进行试点检查。
- 生产环境自托管的开源许可证为 $0
- 通过一个兼容 OpenAI 的 API 接入 100+ 家提供商
- 包含虚拟密钥、预算、速率限制、故障转移、日志和 Prometheus 指标
- 流量与密钥留在客户运营的基础设施内
- 可升级 Enterprise,以获得身份、审计、隔离网络、支持和多区域控制能力
- 买方自行承担可用性、升级、存储、扩缩容和事故响应
- Enterprise 价格不公开
- 针对具体 Agent 工具的接入不如 Vercel 完善
- 如果部署草率,集中式代理会成为新的内部故障域
4. OpenRouter:最适合广泛选模与快速试验
如果希望用一个账户比较庞大的模型市场,OpenRouter 是最佳网关。 它的实时 Pay as you go 页面列出 80+ 家提供商的 500+ 款模型,是本次清单中公开模型目录最广的一款。

这种广度非常适合独立技术开发者或研究任务较多的小团队。编程 Agent 可以用前沿模型规划代码仓库,用更快的模型完成搜索和分类,再用开放模型处理常规转换,而无需为每家提供商分别开通计费账户。
最适合: 快速对比模型,并访问广泛的提供商市场
突出优势: 500+ 款模型、80+ 家提供商,以及能识别任务的 Auto Router
价格: 免费套餐 $0;Pay as you go 收取 5.5% 平台费;Enterprise 折扣需定制
免费试用: 免费套餐包含 25+ 款模型、4 家提供商和每天 50 个请求
商业上的取舍非常明确。OpenRouter 的 Pay as you go 套餐没有最低消费,但会收取 5.5% 平台费。购买 $2,000 额度时,费用为 $110。Bring Your Own Key 目前每月包含按标价计算的 $25,000 推理额度,超过后收取 5% 费用。Enterprise 把这一额度提高到 $200,000,并通过报价提供费用折扣。
免费套餐适合验证兼容性,却不适合持续运行 Agent。一次较长的编程循环就可能用完每天 50 个请求。应把它视为连通性检查,而不是团队预算方案。
OpenRouter 的 Auto Router 比单纯的模型目录数量更值得关注。当前路由文档显示,它会把 Prompt 归入大约 30 种任务类型,包括代码调试和多步骤 Agent 规划,再根据过去 7 天滚动窗口内的总支出对模型排序。它还会考虑模型能力、工具支持、成本、账户限制和故障转移选项。
这种市场信号降低了试验门槛,也让复现变得更难。Router 每一轮都可能选中不同模型。会话粘性会在上一款模型仍是优先候选时继续使用它,但任务发生变化后,选择依然可能切换。对于需要多轮生成补丁的编程 Agent,中途换模型可能影响工具语法、推理风格或输出纪律。
解决办法不是彻底避开路由,而是明确动态路由应该出现在哪里。它适合评估、低风险分类或范围明确的后台步骤。对于发布关键补丁,应固定获批模型和提供商策略,除非团队已经验证过跨模型连续性。
OpenRouter 也支持跨提供商的策略路由和故障转移。如果同一模型由多家推理服务商提供,这项能力很有价值;但当买方需要代码仓库级内部结算、自托管控制或托管式企业防护规则时,它就不如 Requesty、LiteLLM 和 Portkey。
- 本次清单中公开目录最大,包含 500+ 款模型和 80+ 家提供商
- 无需分别开通提供商账户,即可快速比较模型
- Auto Router 会使用当前任务与市场信号
- 支持提供商故障转移、支出控制和策略路由
- 免费套餐可用于兼容性检查
- 5.5% Pay as you go 费用会随支出增长
- 免费套餐每天 50 个请求,不足以支持持续的 Agent 循环
- 动态路由可能在多轮之间更换模型
- 针对 Agent 工具的接入与代码仓库归因不如前两名
5. Portkey:最佳托管式治理层
当预算针对的是托管式控制平面,而非仅仅一个统一端点时,Portkey 是最佳选择。 它的网关集成了故障转移、条件路由、重试、熔断器、负载均衡、Canary 测试、MCP 支持、预算、速率限制、缓存和防护规则。

对于正从个人 Agent 密钥转向审批式访问的中型企业平台团队,这套能力很合适。一项策略可以限制模型,一份预算可以约束团队,一个熔断器可以阻止请求反复发往故障提供商。这款产品面向的是这样一个阶段:“给开发者发一枚网关密钥”已经变成身份、策略和事故管理问题。
最适合: 需要托管式路由、防护规则和治理能力的成长型平台团队
突出优势: 熔断器、Canary 测试、MCP 控制、条件路由和开源本地网关
价格: Developer $0,Production 每月 $49,Enterprise 定制定价
免费试用: Developer 套餐永久免费,但官方明确说明不适合生产环境
各套餐边界说明得格外坦率。Portkey 的 Developer 套餐每月记录 10,000 条日志,日志保留 3 天,指标保留 30 天。页面明确写明,该套餐不适合生产环境。
Production 每月 $49,包含 100,000 条已记录日志;在公开阈值以内,每增加 100,000 个请求收费 $9。日志保留 30 天,指标保留 90 天。记录 200,000 条日志时,在上游推理费用之外,订阅费为 $58。同一页面也说明,如果需要定制安全控制或数据驻留保证,不建议使用 Production。
这些需求必须选择 Enterprise。它采用定制定价,包含 1,000 万+ 条已记录日志、自定义保留期限、SSO、细粒度预算与速率限制、私有云和 VPC 托管、数据湖导出以及高级合规能力。这意味着,采购过程会从一张 $49 的银行卡账单,实质性地升级为企业采购流程。
Portkey 还提供一款开源本地网关,可通过 npx @portkey-ai/gateway 运行。它让团队能够测试路由界面,或自行托管数据路径。不过,采购方仍应把本地网关与托管式可观测性、策略、支持和 Enterprise 控制区分开来;后者才是 Portkey 在本排名中胜出的原因。
目前的产品转型也值得关注。Portkey 文档现已将产品称为 Prisma AIRS AI Gateway。网关页面和价格仍然有效,但采购方应确认:合同上使用哪个产品名称、适用哪条产品路线图,以及独立 Portkey 账户如何映射到 Palo Alto Networks 产品组合。这属于必要的采购尽调,并不是拒绝该工具的理由。
它在编程 Agent 领域的边界仍是接入体验。Portkey 可以部署在兼容的 Agent 协议之后,提供比 Vercel 更深入的通用控制平面,但目前没有同等的一条命令接入 9 款 Agent 工具的体验。只有当策略能力值得这些集成工作时才选择它,而不是因为功能列表更长。
- 托管式路由能力丰富,包含熔断器、重试、故障转移和 Canary 测试
- 支持 MCP、防护规则、预算和速率限制
- Production 公开定价为 $49,并明确采用已记录日志计量
- 提供开源本地网关选项
- Enterprise 可提供 SSO、私有部署、数据驻留和合规能力
- 官方明确说明免费套餐不适合生产环境
- 官方明确说明 $49 的 Production 不适合需要定制安全或数据驻留保证的场景
- Enterprise 采用定制定价
- 编程 Agent 工具接入不如 Vercel 完善
- 向 Prisma AIRS 转型带来了合同与路线图问题
6. Cloudflare AI Gateway:最适合已使用 Workers 的团队
如果应用的边缘网络、日志和安全能力已经由 Cloudflare 承载,Cloudflare AI Gateway 是阻力最小的选择。 目前,所有套餐都可以免费使用核心网关功能,包括分析、缓存和速率限制。

如果 Agent 或内部开发者平台已经运行在 Workers 上,这款产品很有吸引力。同一个账户可以通过兼容 OpenAI 的 REST 接口调用第三方与 Cloudflare 托管模型,记录成本和错误,缓存可安全复用的请求,应用速率限制,扫描敏感数据,并重试失败调用。
最适合: 已在使用 Workers、Cloudflare 日志或 Cloudflare 安全控制的团队
突出优势: 免费核心网关、边缘集成、DLP、缓存,以及兼容 OpenAI 的第三方模型访问
价格: 核心功能 $0;通过 Unified Billing 购买额度加收 5%;防护规则按 Workers AI 定价
免费试用: 核心网关功能永久免费,而非限时试用
定价页面给免费方案划出了明确边界。Workers Free 在所有网关之间总计存储 100,000 条日志;Workers Paid 则为每个网关存储 1,000 万条日志。所有套餐都提供持久化日志、分析、缓存和速率限制。
通过 Unified Billing 购买额度会加收 5%。因此,购买 $2,000 额度的成本为 $2,100,而提供商推理费用仍然不加价。这一区别很重要:模型价格没有变化,但统一管理凭证与账单需要付费。
所有套餐均免费提供 Data Loss Prevention 扫描。未订阅 Zero Trust 的账户可使用 2 个预定义 DLP Profile,更广泛的 Profile 则取决于 Cloudflare One 订阅。防护规则不属于免费核心功能:Cloudflare 会把 Prompt 与响应评估按 Workers AI Token 推理计费。
Cloudflare 也提供了实用的请求控制。其 REST 文档支持按请求设置超时与重试方式,最多尝试 5 次,重试延迟最长 5,000 毫秒。这些控制能够避免响应缓慢的提供商无限拖住 Agent 循环。
它的边界是编程 Agent 工具的接入体验。Cloudflare 说明的是应用程序如何调用网关,并没有 Vercel 或 Requesty 的 Claude Code 工作流那种具名 Agent 接入层。开发者必须逐一确认每款工具如何更改 Base URL、身份验证、模型发现和协议。软件一项可能是 $0,但集成成本会落到工程团队身上。
- 核心分析、缓存和速率限制免费
- 通过兼容 OpenAI 的方式访问 Cloudflare 及第三方模型
- 所有套餐都免费提供 DLP 扫描
- 非常适合已使用 Workers、Cloudflare 日志和安全产品的团队
- 超时和重试控制定义明确
- Unified Billing 购买额度时加收 5%
- 免费日志存储在整个账户达到 100,000 条后即到上限
- 防护规则会产生单独的 Workers AI 推理费用
- 没有同等的一条命令接入编程 Agent 工具的体验
- 完整 DLP Profile 可能需要单独订阅 Zero Trust
不同团队应该怎么选?
最好的网关,应该消除团队当前的协作成本,同时不制造更大的运维负担。先找出不可妥协的约束,再比较费用。
同时使用 Claude Code、Codex、Cursor、OpenCode 及相关 Agent 的混合团队,选择 Vercel AI Gateway。必须自托管时,或者成本必须归因到代码仓库和开发者、而不能只归因到 Agent、密钥和模型时,应改选其他方案。
需要按分支、代码仓库和开发者归因的代理机构、咨询公司或产品组织,选择 Requesty。如果这些元数据不会改变预算决策,5% 加价购买的就是无人使用的信息,此时应改选其他方案。
已经具备容器、数据库、Secret、日志和 On-call 机制的平台团队,选择 LiteLLM。如果代理服务只能由产品工程师非正式兼任维护,则应改用托管网关。
仍在比较模型和提供商的独立开发者或研究团队,选择 OpenRouter。候选清单稳定后,如果持续的 5.5% 费用已经超过广泛访问模型目录的价值,就应改选其他方案。
采购目标是已批准模型、防护规则、熔断器、Canary 测试和托管治理时,选择 Portkey。如果组织只需要一个端点和一个支出控制台,就应改选其他方案。
已经付费使用并熟悉 Workers 与 Cloudflare 安全产品时,选择 Cloudflare AI Gateway。如果采用整套周边平台带来的集成工作超过网关节省的成本,则应改选其他方案。

还有一条原则:网关决策与 Agent 工具决策要分开。Claude Code、Codex 和 Cursor 解决的是不同工程任务,而网关负责控制它们的模型流量。公司完全可以统一网关,却不统一编辑器。这往往才是更有价值的控制边界。
如果要查看范围更广的 Agent 候选清单,可以比较最佳 AI 编程 Agent。如果需要进一步了解网关之外的 SSO、数据保留、审计和部署问题,请阅读企业级编程 Agent 对比。
这些方案不适合当前需求
如果眼下最需要解决的是编程 Agent 工具接入,不要把 Helicone 作为首要采购对象。Helicone 的 Hobby 套餐免费包含 10,000 个请求,Pro 每月 $79,Team 每月 $799。它的可观测性、会话、Prompt 和分析能力可能很有价值,但只有当可见性是首要问题时,排名才会改变。就当前需求而言,它比不过 Vercel 的接入路径、Requesty 的代码仓库归因,也比不过 LiteLLM 的部署控制。
不要只因为公司已经采购了某款通用 API 网关,就直接选它。 传统网关理解路由、身份验证和 HTTP 策略;编程 Agent 流量还涉及提供商特定模型、Token 核算、工具调用兼容性、Prompt 缓存、模型故障转移和多种响应协议。平台团队扩展通用网关可能是合理选择,但“公司已经有 Kong”并不能算实施方案。
一旦多款 Agent 开始依赖某个自研透传代理,就不应继续使用它。 修改 Base URL 很容易;长期维护提供商适配器、安全重试、流式响应、预算计数器、密钥隔离、日志保留和模型弃用,却是在经营一款产品。只有独特的策略或部署约束足以证明长期投入合理时,才值得自建。
在完成跨模型连续性评估之前,不要让动态模型路由接管发布关键型 Agent 循环的每个步骤。 Router 可能为每项任务选出高效模型,却依然让一份长补丁更难复现。对实际生成变更的步骤固定模型,把动态路由留给边界明确的辅助工作。
最后,不要在第一天就迁移所有开发者的流量。网关可能改变身份验证、模型发现、缓存、错误行为和故障转移选择,而编程 Agent 的界面看上去毫无变化。因此,范围受控的试点和直连提供商的回滚路径必须写进上线计划。
常见问题
哪款 LLM网关最好?
Vercel AI Gateway 是编程 Agent 的最佳默认选择,因为它能用一条命令接入 9 款受支持的 Agent,并且 Token 零加价。必须自托管时,LiteLLM 更好;最看重代码仓库和开发者归因时,Requesty 更好;采购目标是托管治理时,则选择 Portkey。
OpenRouter 在 2026 年如何收费?
OpenRouter 当前的 Pay as you go 套餐收取 5.5% 平台费,包含 500+ 款模型和 80+ 家提供商,并且没有最低消费。免费套餐仅包含 25+ 款免费模型、4 家提供商和每天 50 个请求。目前,Pay as you go 的 BYOK 每月包含按标价计算的 $25,000 推理额度,超过后收取 5% 费用。
Cloudflare AI Gateway 在 2026 年多少钱?
Cloudflare AI Gateway 的核心功能免费。Unified Billing 购买额度时加收 5%;Workers Free 在整个账户存储 100,000 条日志;Workers Paid 为每个网关存储 1,000 万条日志;防护规则则作为 Workers AI 推理单独计费。
一个网关能同时路由 Claude Code 和 Codex 吗?
可以。网关必须支持各 Agent 工具所需的协议,或者提供专用兼容端点。Vercel 为 Claude Code 和 Codex 分别提供端点文档,而自托管网关和通用网关需要买方逐一验证 Agent 配置。
本周一该做什么
周一不要忙着迁移整个公司。先证明一个网关能在一个有代表性的代码仓库中,降低成本归因的不确定性和提供商风险。
周一:确定控制边界
选择一个代码仓库、一小组开发者,以及他们已经在用的两款编程 Agent。用一句话写清楚预算究竟要解决什么:统一账单、挽救提供商故障、归因支出、执行已批准模型策略,还是把流量留在私有部署中。如果一句话塞进了三个互不相关的目标,就缩小试点范围。
创建一枚有硬性支出上限的专用网关密钥。选择一个主模型和一个工具调用能力相近的故障转移模型。在迁移任何流量前,把直连提供商配置保存在回滚文件中,并记录当前的提供商账单。
周二:完成连接,再检查变更
使用 Vercel 时,运行官方接入命令,并在写入前检查每项变更。使用 Requesty 时,先备份 Claude Code 设置,只启用团队真正会用到的归因 Header。使用 LiteLLM 时,通过常规基础设施流程部署代理,而不是运行在个人笔记本上。无论选择哪款网关,都要确认 Secret 存入了获批的存储位置。
从每款 Agent 分别运行一项边界明确的 Issue。检查模型选择、工具调用、流式响应、错误、缓存行为、成本,以及与请求关联的身份信息。如果控制台无法解释钱是谁花的,或响应来自哪条故障转移路径,那么仅仅成功返回结果还不够。
周三和周四:主动测试故障路径
触发一次受控超时,或者使用测试路由,把主模型请求发给不可用的提供商。确认故障转移后,仍能保持编程 Agent 预期的线路格式。检查失败尝试是否计费、故障转移是否使用另一组凭证,以及 Trace 能否识别两次尝试。
让试点分别执行一个常规 Bug、一次多文件修改、一个测试修复循环和一项审查任务。记录单项任务完成成本、提供商故障、获救请求、配置变更耗时,以及开发者反馈的阻力。不要脱离工作结果,只比较 Prompt 次数。
周五:只购买真正改变决策的控制能力
只有网关提供的信息或可靠性确实会改变运维决策时,才应正式采用。被挽救的请求有价值;代码仓库预算超支有价值;违反提供商策略也有价值。一整屏无人查看的 Token 图表没有价值。
对大多数混合 Agent 团队而言,周一的首选是 Vercel AI Gateway:一枚试点密钥、一个主模型、一个故障转移模型,而且在策略提出实际要求之前不启用付费附加项。需要把成本责任落实到代码仓库和开发者时,改选 Requesty;数据路径必须留在公司基础设施内时,改选 LiteLLM。
把网关配置纳入版本管理,记录回滚路径,并保持精简的模型策略。目的不是让流量经过更多供应商,而是让下一次提供商宕机、新模型发布和预算审查,都能通过修改配置完成,而不必发动全公司迁移。
2026年9月3日







