2026 年最佳 AI网关:6 款工具帮你降低大模型推理成本

对比 Vercel、LiteLLM、Cloudflare、TrueFoundry、Portkey 与 OpenRouter 的价格、缓存机制、免费额度和生产限制,并用统一的 GPT-5.6 Sol 工作负载计算真实账单,帮团队找到能降低大模型推理成本、又不会牺牲输出质量与治理能力的 AI网关。

Wednesday, September 2, 2026Omid Saffari
2026 年最佳 AI网关:6 款工具帮你降低大模型推理成本

目前最值得优先考虑的托管 AI网关是 Vercel AI Gateway:按月计算,一项消耗 100 million 输入 token 和 20 million 输出 token 的 GPT-5.6 Sol 工作负载,按 OpenAI 当前直连价需 $800,按 Vercel 当前 Default 层价格则只需 $400。省下的 $400 是一个采购窗口,并非全年承诺,因为 Vercel 的 50% 折扣将在 2026 年 9 月 18 日结束。

真正长期有效的结论,比这次促销更具普适性。只有当路由、响应缓存或强制预算节省的模型费用,超过网关新增的服务费和运维投入时,大模型网关才能让总账单下降。Vercel 是免运维托管方案的默认选择,LiteLLM 适合自托管,Cloudflare 擅长缓存完全相同的请求,TrueFoundry 主打托管语义缓存,Portkey 是 $49 起步的治理方案,而 OpenRouter 更像一个模型供应商市场。

AI网关对比速览

下表中的套餐名称、公开价格和限制,均已于 2026 年 8 月 24 日对照厂商实时页面核验。“免费试用”会区分长期免费入口和限时体验;如果真正的付费门槛被藏起来,一个免费的原型很容易变成昂贵的生产依赖。

工具最适合起步价免费试用
Vercel AI Gateway最低的托管平台费用,以及当前 GPT-5.6 Sol 折扣Free 每月含 $5;Paid 按用量购买额度,零加价长期 Free 层
LiteLLM已有平台团队的自托管场景Open Source $0;Enterprise 按年定制Enterprise 试用 30 天
Cloudflare AI GatewayCloudflare 技术栈中的完全相同请求缓存核心网关功能 $0;模型供应商用量另计核心功能长期免费
TrueFoundry AI Gateway托管语义缓存与企业控制Developer $0;Pro $499/月7 天试用,另有 Developer 套餐
Portkey$49/月起的托管生产控制Developer $0;Production $49/月长期 Developer 套餐
OpenRouter按价格排序的供应商路由与统一模型市场Free $0;共享额度另收 5.5%长期 Free 套餐

单看起步价,无法判断谁最省钱。LiteLLM 的许可证可以免费,但控制平面会占用真实的工程时间;Cloudflare 的核心功能可以免费,但 Unified Billing 会加收 5%;TrueFoundry 能通过语义复用直接省掉整次模型调用,但首个生产层每月要 $499。真正该比较的,是网关发挥作用后,完整账单上还剩多少费用。

排名之前,先算清 AI模型网关的节省公式

实用的预算公式是:剩余模型供应商费用 + 网关费用 + 付费控制项 + 运维成本。只有这个总和低于同等有效输出数量下的直连成本,网关才值得引入。模型数量、仪表盘体验和故障转移范围当然有价值,但在它们真正减少支出或高代价故障之前,都不能算“省钱”。

用一张标准化账单,就能看清差异。OpenAI 当前公布的 GPT-5.6 Sol 价格是每 1 million 输入 token $4、每 1 million 输出 token $20。因此,一项消耗 100 million 输入 token 和 20 million 输出 token 的工作负载,在不计缓存输入折扣、工具费用和长上下文倍数前,成本是 $800:输入 $400,输出 $400。

Vercel 8 月价格更新显示,同一模型在其折扣后的 Default 服务层中,输入价为 $2、输出价为 $10,优惠持续到 9 月 18 日。于是这份标准化月账单降至 $400,降幅为 50%。目前 Flex 的输入价为 $1、输出价为 $5,Priority 则是输入 $4、输出 $20;这些价格均按每 1 million token 计,适用于请求不超过 272,000 token 的情况。

两个温室水池对比同一 GPT-5.6 Sol 工作负载的账单:直连为 $800,Vercel 为 $400;用量是 100 million 输入 token 和 20 million 输出 token
按当前 Vercel 折扣,这份标准化 Sol 月账单在 2026 年 9 月 18 日前可减半

模型单价只是第一根杠杆。完全命中的响应缓存可以直接跳过供应商调用;改走更便宜的模型可以降低单位成本,但前提是输出仍能达到验收标准;预算上限还能阻止失控的 Agent,它虽不是 token 折扣,却可能成为当月最大的一笔节省。因此,真正该追踪的是包含重试与审核在内的每个合格结果成本,而不是孤立的每 token 价格。

如果要先筛选底层供应商价格,可查看最便宜的 AI API 对比。本文从它的上一层出发,判断网关能否让这些供应商价格在实际使用中进一步下降。

1. Vercel AI Gateway:托管降本的综合首选

如果团队需要托管网关、不想承担 token 加价,又希望立即获得可量化的成本下降,Vercel AI Gateway 是综合最佳选择。

Vercel AI Gateway 价格页展示 Free、Paid 套餐及附加功能收费
Vercel AI Gateway 价格,核验于 2026 年 8 月 24 日

它最大的优势,是账算得非常具体。实时价格页显示,Free 和 Paid 都按供应商标价计费,网关不加价;当前 GPT-5.6 Sol 促销又把 Default 模型价格下调了 50%。对于已有资金、准备迁移一条高用量抽取或客服流程的创业团队,这意味着无需接手自托管代理,就能把标准化的 $800 模型账单直接降到 $400。

Free 层每月包含 $5 额度,仅覆盖符合条件的部分模型,采用较低且因模型而异的速率限制,也不支持自带密钥。Paid 层使用预购额度,开放全部可用模型,提高限额,并支持 BYOK,且不收取 Vercel 网关费,也无承诺期。购买额度后,团队会转入 Paid,因此每月 $5 的 Free 额度不再保留。

BYOK 的计费边界值得写进运行手册。使用客户供应商凭据的请求失败时,Vercel 可以为提高可靠性,改用自己的系统凭据重试;这次回退会从团队的网关额度余额中扣费。如果团队要求每个请求都走已谈判好的供应商账户,就应监控这笔余额并核对回退流量,不能把 BYOK 理解成“Vercel 额度永远不会变化”的保证。

“零加价”也不包含付费控制项。Custom Reporting 对每 1,000 次标签、用户 ID 或配额实体写入收取 $0.075,对每 1,000 次报表查询收取 $5。Pro 和 Enterprise 的团队级供应商允许列表按每 1,000 次成功请求收费 $0.10,而逐请求供应商过滤不额外收费。团队级零数据保留强制策略还要每 1,000 次请求收取 $0.10,不过 Pro 和 Enterprise 的逐请求 ZDR 免费。

Trace drains 的价格是每 1,000 条 trace $0.05,另加每 GB 出站流量 $0.50,Pro 没有包含额度。按 1 million 次成功请求计算,团队级允许列表会产生 $100,团队级 ZDR 再产生 $100,1 million 条 trace 在出站流量之前还要 $50。Vercel 仍可能是最便宜的选择,但采购时要比较配置完成后的完整账单,而不是只看 token 零加价的标题。

真正的限制在于时间。Sol 折扣非常适合作为迁移窗口,却不该成为永久架构的唯一依据。促销结束后,如果 Vercel 的零加价路由、预算、故障转移和可观测性,能替代团队原本需要自己承担的工作,它仍然划算;如果产品只稳定使用一个供应商模型,也不需要这些控制,那么折扣到期后,直连计费可能重新占优。

最适合: 希望获得托管路由、支出控制,且不接受公开 token 加价的中小型团队。
突出优势: 当前 GPT-5.6 Sol Default 价格可在 9 月 18 日前,把标准化的 $800 直连月账单降到 $400。
价格: Free 对符合条件的模型每月提供 $5;Paid 使用预购额度,按供应商标价计费且不加价;报表、策略和 trace 等可选项单独计量。
免费试用: 长期 Free 层,不是限时试用。

优势
做得好的地方
8 points

  • Free 和 Paid 都没有公开的 token 加价。
  • 当前 Sol 折扣让标准化工作负载获得可量化的 50% 节省。
  • Paid 支持 BYOK,且不收网关费。
  • 逐请求供应商过滤无需支付团队级允许列表的计量费。
  • 关键的 Sol 折扣将在 2026 年 9 月 18 日结束。
  • 购买额度后,每月循环发放的 $5 Free 额度会取消。
  • BYOK 请求失败时,系统凭据回退可能消耗 Vercel 额度。
  • 报表、团队级策略和 trace 会形成独立的用量费用。

最稳妥的落地路径,应让对比随时可以撤回:

  1. 隔离一条可验收的工作流

    选择一个有明确通过条件的任务,例如输出有效的结构化抽取结果,或生成通过审核的客服答复。为它单独配置网关密钥,避免费用与故障混入产品其他流量。

  2. 冻结直连基线

    记录该工作流直连供应商时具有代表性的一周数据:输入 token、输出 token、重试、延迟和合格结果。当前单位价格更低,只有在验收率不下降时才有意义。

  3. 让 10% 流量经过网关

    使用同一模型和服务层,将该工作流的 10% 发送给 Vercel。按照样本规模设置密钥级预算,避免一次配置错误把对比实验变成无限账单。

  4. 核对四类成本

    汇总模型用量、所有付费报表或策略控制、trace,以及审核或重试成本;同时检查失败的 BYOK 请求是否消耗了系统额度。

  5. 在 9 月做出决定

    只有当每个合格结果成本低于直连,且托管控制在促销后仍物有所值时,才保留这条路由。把 9 月 18 日写进预算日历,并在截止日前重新定价。

2. LiteLLM:已有平台团队时,最佳自托管 LLM网关

如果企业已经在运营共享基础设施,又希望网关许可证费用保持在 $0,LiteLLM 是最佳自托管选择。

LiteLLM 价格页展示 Open Source 与 Enterprise 套餐
LiteLLM 价格,核验于 2026 年 8 月 24 日

Open Source 套餐永久免费并采用自托管。它通过一套兼容 OpenAI 的 API 接入 100+ 家供应商,内置虚拟密钥、用户与团队、支出追踪、预算、速率限制、回退、日志和 Prometheus。对于已经由平台组管理容器、指标、密钥和 on-call 的中型企业 CTO,这套方案能统一供应商逻辑,而不新增每月网关许可证费用。

但“免费”只到许可证为止。计算资源、必要的数据存储、部署流水线、升级、安全评审、可观测性,以及网关故障时的响应人员,仍由企业自己提供。只有当这些工作本来就属于平台团队的边际职责,或自托管本身就是硬性要求时,LiteLLM 才是成本赢家。

Enterprise 套餐采用定制年度合同,价格取决于年度网关请求容量、部署架构和支持需求,从不按 token 用量定价。它增加 SSO 与 SCIM、OIDC 或 JWT 控制、审计日志、密钥管理器集成与密钥轮换、组织管理、多区域选项、正式支持和隔离网络部署。公开页面提供无需信用卡的 30 天 Enterprise 试用,但没有公布具体报价。

这种计价方式会改变盈亏平衡点。token 支出极高、请求容量却适中的团队,可以避免昂贵模型带来的比例抽成;模型支出很少、又没有平台职能的团队,则可能在员工精力上花得比托管网关收费更多。决定是否切换的关键不只是请求量,而是运营 LiteLLM 的新增月成本,是否低于它所替代的托管平台费用与运维工作。

对必须把数据平面留在自有环境内的受监管企业,LiteLLM 同样合适。即使纯模型账单没有下降,这种控制力也可能足以支撑采购决定。此时,降本是供应商路由、预算和集中控制带来的次生结果,并不能证明自托管天然便宜。

最适合: 已有平台职能、有自托管要求,或规模大到不愿支付比例网关费的团队。
突出优势: $0 的开源许可证,同时提供预算、虚拟密钥、回退、日志和 100+ 家供应商接入。
价格: Open Source 永久 $0;Enterprise 根据请求容量、架构和支持需求按年定制报价。
免费试用: Enterprise 可免信用卡试用 30 天;Open Source 可永久免费自托管。

优势
做得好的地方
7 points

  • 开源许可证免费,也不收每 token 网关税。
  • 可集中管理 100+ 家供应商的预算、密钥、回退和日志。
  • Enterprise 支持治理与隔离网络部署。
  • 使用高价模型并不会因 token 支出自动抬高 Enterprise 许可证费用。
  • 使用 Open Source 时,基础设施、升级、可靠性和故障响应都由买方负责。
  • Enterprise 没有公开价格,采购方无法仅凭官网完成成本建模。
  • 对没有平台能力的小团队而言,免费许可证可能变成运营成本最高的选择。

3. Cloudflare AI Gateway:完全相同请求的最佳选择

如果相当一部分请求可以安全复用,而且请求内容按字节完全一致,团队又能使用 BYOK,那么 Cloudflare AI Gateway 最能发挥降本作用。

Cloudflare AI Gateway 价格文档展示免费核心功能、日志限制、Unified Billing 和 Logpush
Cloudflare AI Gateway 价格,核验于 2026 年 8 月 24 日

Cloudflare 的核心费用很容易算清。仪表盘分析、缓存和速率限制在所有套餐中都免费。Workers Free 可在所有网关之间合计保存 100,000 条日志,每个账户最多建 10 个网关;Workers Paid 则可为每个网关保存 10 million 条日志,每个账户最多建 20 个网关。Logpush 仅限 Paid,包含每月 10 million 次请求,超出部分按每增加 1 million 次 $0.05 计费。

真正省钱的是缓存,而它的边界非常明确。Cloudflare 的默认缓存键包含供应商、端点、模型、供应商身份验证头和完整请求体。消息、工具或模型参数只要有一处不同,就会生成另一个缓存条目。命中缓存时会跳过供应商调用;但如果两段提示词表达相同含义、措辞不同,默认不会匹配。除非团队有意设计自定义缓存键,并能证明它足够安全。

缓存最短有效期为 60 秒,最长为 1 个月;单个可缓存请求最大 25 MB。它很适合重复分类任务、多人共享的静态说明,或确定性批处理提示词,却不适合直接用于个性化客服、持续变化的数据或随机创作输出。在这些场景里,一条便宜但过期的答案,造成的损失可能高于一次新的模型调用。

计费路径和命中率同样重要。BYOK 让网关核心保持免费,并由团队直接向供应商付费。Unified Billing 会透传供应商推理价,但购买额度时加收 5%,因此 $100 额度要付 $105。它还限制每个网关每 60 秒最多 200 次请求;Cloudflare 表示,这一速率限制不适用于 BYOK。

把标准化的 $800 账单代入一个明确假设:25% 的请求完全重复、token 构成相同,而且响应可以安全复用。使用 BYOK 缓存后,供应商支出剩下 $600,共省 $200。若使用 Unified Billing,则要对剩余 $600 加收 5%,总计 $630,净节省降为 $170。命中率更低时,优势可能消失;安全命中率更高时,Cloudflare 则很难被击败。

DLP 扫描在所有套餐中免费;没有 Zero Trust 订阅的账户可用 2 个预定义配置。Guardrails 并不免费:评估调用 Workers AI 模型,并按 Workers AI token 价格计费。这再次说明必须画对核算边界——缓存可以免费,安全层却可能新增一笔推理费用。

最适合: 已使用 Cloudflare、请求确定且重复,并愿意量化缓存安全性的团队。
突出优势: 免费的精确响应缓存,命中后可以完全免去供应商调用。
价格: 核心分析、缓存和速率限制免费;Unified Billing 加收 5%;日志、Logpush 和 guardrails 另有限额或计量费用。
免费试用: 核心功能与 Workers Free 日志存储长期免费,不是限时试用。

优势
做得好的地方
8 points

  • 核心网关分析、缓存和速率限制均为 $0。
  • 精确缓存一旦命中,会直接省掉供应商调用,而不只是少算几个提示词 token。
  • BYOK 可避开 5% 的 Unified Billing 费用及其托管凭据速率限制。
  • 缓存行为和硬性限制有清晰文档。
  • 默认缓存要求完全匹配,对话措辞稍有变化就会无法命中。
  • Unified Billing 加收 5%,且每个网关每 60 秒最多 200 次请求。
  • 免费日志存储由所有网关共享,上限为 100,000 条。
  • 不安全的自定义缓存键可能返回过期内容,或造成上下文串用。

4. TrueFoundry AI Gateway:最佳托管语义缓存

如果不同措辞经常对应同一个可安全复用的问题,TrueFoundry AI Gateway 是最佳托管选择。

TrueFoundry 价格页展示 Developer、Pro、Pro Plus 和 Enterprise 层
TrueFoundry AI Gateway 价格,核验于 2026 年 8 月 24 日

关键差异在于语义缓存。TrueFoundry 缓存文档说明,精确模式会对完整请求做哈希,语义模式则嵌入最后一条消息,再与历史请求比较语义;其余请求参数仍须一致。完整响应缓存命中后,不再调用 LLM,LLM 费用为零。因此,客服系统面对“如何重置密码?”的多种问法时,可以复用一条已审核答案,而无需为每种措辞重复付费。

缓存会按用户或虚拟账户自动隔离,还可用命名空间进一步分开租户或环境。这一点非常关键:如果一个客户的缓存答案流向另一个客户,再高的命中率也毫无价值。自托管语义缓存需要 Redis 和嵌入模型,SaaS 路线则会代管这部分基础设施。

公开价格页列出 4 个层级。Developer 每月 $0,包含 50,000 次请求和 3 个用户;Pro 每月 $499,包含 1 million 次请求和 10 个用户;额外 2 million 次请求加 5 个 API 密钥,每月另收 $499。Pro Plus 每月 $2,999,包含 1 million 次请求和 25 个用户,额外用量需联系销售。Enterprise 按请求与用户容量定制,支持 VPC 和隔离网络部署。

价格页宣传 7 天免费试用,网关页面则提供每月前 50,000 次请求免费、无需信用卡,并覆盖 1,600+ 个模型。这足以在升级到 Pro 前测出有代表性的缓存命中率,但不能据此用一套合成 FAQ 推断生产环境一定省钱。

当模型支出不高时,单看账单的门槛很高。面对标准化的 $800 供应商费用,$499 的 Pro 订阅至少要省掉 $499 的模型支出,也就是约 62.4%,才会仅凭推理成本胜出。治理、隔离、可观测性和节省的人力,可能让较低命中率下的 Pro 仍值得购买,但这些是独立收益,必须单独写清楚。

真正的风险是错误复用。语义阈值设得过松,可能返回一条听起来相关、却违反当前用户上下文或策略的历史答案。安全的测试方法,是用同一套验收标准分别评估缓存答案和新生成答案,按租户分段,并对涉及实时账户、法律、医疗或持续变化库存的问题禁用缓存。

最适合: 意图重复但措辞多变的客服、知识库和 FAQ 工作负载。
突出优势: 托管的语义级完整响应缓存,默认自动按账户隔离,并支持可选命名空间。
价格: Developer $0;Pro $499/月;Pro Plus $2,999/月;Enterprise 定制,具体请求与用户限制如上。
免费试用: 7 天试用,另有长期 Developer 层,每月 50,000 次请求。

优势
做得好的地方
8 points

  • 语义缓存能省掉精确缓存无法识别的整次模型调用。
  • 缓存条目默认按用户或虚拟账户隔离。
  • Developer 的月度请求额度足够进行一次有边界的命中率评估。
  • Enterprise 提供 VPC 和隔离网络部署。
  • Pro 每月 $499 的门槛,需要显著节省或治理价值才能覆盖。
  • Pro Plus 为 $2,999,但公开额度仍是每月 1 million 次请求。
  • 语义误命中会把成本优势变成质量问题或数据边界事故。
  • 自托管语义缓存还要运营 Redis 和嵌入模型。

5. Portkey:$49 起步的最佳托管治理升级

如果团队的原型已经需要走向生产,却又无法为每月 $499 的生产网关找到合理预算,Portkey 是门槛最低的优质托管方案。

Portkey 价格页展示 Open Source、Developer、Production 和 Enterprise 套餐
Portkey 价格,核验于 2026 年 8 月 24 日

套餐阶梯从 Open Source 开始:自托管、不限请求量,包含统一 API、重试与超时、路由、guardrails、自动回退、基础仪表盘、负载均衡和社区支持。页面没有说明这条路线的许可证价格,因此应像评估 LiteLLM 一样看待它:控制力很强,但基础设施和运维人员的成本仍由买方承担。

托管的 Developer 层为 Free Forever,每月允许 10,000 次请求,不提供超额用量,并明确面向原型和企业 PoC,而非生产。Production 每月 $49,包含 100,000 次请求;超出后,每增加 100,000 次每月加收 $9,最高到 3 million 次。套餐还包含精确与语义缓存、基于角色的访问控制、服务账户密钥和生产支持。

达到每月 1 million 次请求时,Production 在模型用量之前的成本为 $130:基础 $49 覆盖 100,000 次,剩余 900,000 次对应 9 个 $9 超额区块。这才是有意义的对比点。在标准化工作负载上,Portkey 必须通过缓存、路由、预算强制执行或减少运维工作,省下超过 $130,才能胜过不收网关费的方案。

Enterprise 根据请求容量定制价格,增加 SSO、细粒度预算与速率限制、私有云或 VPC 选项,以及更全面的合规控制。受监管企业可能会为治理能力购买这一层,即使供应商账单没有变化。

采购文件里还应注明一个命名差异。实时价格页把 $49 套餐称为 Production,当前文档则把同一个 $49 套餐称为 Pro。价格页还写明 Portkey 现已更名为 Prisma AIRS AI Gateway。团队在自动化套餐检查或围绕这些名称制定续费策略前,应先在订单中确认对应关系。

在语义缓存深度上,Portkey 排在 TrueFoundry 之后,因为它的公开资料没有把节省机制讲得同样易于审计。对于希望获得可预测托管基础费、又不想每次购买共享额度都被按比例收费的团队,它排在 OpenRouter 之前。$49 的入口,让受控生产试验的财务账足够清楚。

最适合: 正在成长的 AI 产品,需要托管缓存、角色、密钥、路由和支持,并希望控制平面月预算保持在三位数。
突出优势: Production 每月 $49 起,达到每月 1 million 次请求时,模型用量前的费用为 $130。
价格: Open Source 自托管;Developer Free Forever;Production 每月 $49,每增加 100,000 次请求再收 $9;Enterprise 定制。
免费试用: 长期 Developer 层每月提供 10,000 次请求,但不适合生产。

优势
做得好的地方
8 points

  • 首个托管生产层每月仅需 $49。
  • Production 已包含精确缓存和语义缓存。
  • 按请求区块计价的超额用量,比 token 百分比更容易做预算。
  • Open Source 与 Enterprise 分别覆盖控制需求的两端。
  • 达到 1 million 次请求时,$49 的标题价会在推理费前升至 $130。
  • Developer 到 10,000 次即停止,不支持超额用量,也不是生产路线。
  • Production 与 Pro 名称不一致,给采购带来不必要的歧义。
  • Enterprise 的经济性仍须询价才能判断。

6. OpenRouter:按供应商价格路由的最佳模型市场

如果核心任务是从大量供应商和模型中按价格挑选路线,而不是在原有路线不变时压低网关费用,OpenRouter 是最佳选择。

OpenRouter 价格页展示 Free、Pay-as-you-go 和 Enterprise 层
OpenRouter 价格,核验于 2026 年 8 月 24 日

Free 套餐通过 4 家免费供应商提供 25+ 个免费模型,每天 50 次请求,并配有社区支持。Pay-as-you-go 无最低消费,可使用 500+ 个模型和 80+ 家供应商,但购买共享额度会加收 5.5% 平台费。每次购买额度的最低费用为 $0.80,使用加密货币充值还要收取 5%。

Enterprise 同样覆盖 500+ 个模型和 80+ 家供应商,增加发票结算、托管控制、可选专用限额、合同 SLA 以及共享 Slack 支持频道。价格依据定制用量承诺,并可能包含费率折扣。它属于采购层级,不是公开的按席位订阅。

BYOK 会改变这项选择。Pay-as-you-go 每月包含按标价计算的 $25,000 BYOK 推理额度,不收 OpenRouter 费用,超出后按 5% 收费;Enterprise 把免网关费额度提高到每月 $200,000,之后同样收取 5%。因此,已经拥有供应商直连账户的企业,只要仍在额度内,就能使用 OpenRouter 控制层,而不必支付共享额度的百分比费用。

真正的成本功能是供应商选择。OpenRouter 可以按价格为符合条件的供应商排序、设置最高价格,并在路由失败时回退。它的 beta 响应缓存会对完全相同的请求返回结果且不产生可计费用量,并可跨模型工作,但它不是语义缓存。只有当工作负载在输出质量、数据策略、延迟和可用性上确实允许供应商互换时,按价格排序才会省钱。

若底层 $800 供应商账单完全不变,共享额度会增加 $44,总计 $844。因此,OpenRouter 必须通过更便宜的合格供应商、缓存命中、更低的故障成本或更少的运维工作,收回超过 $44,才能胜过直连。如果已有一家供应商能按合同价格稳定承载工作负载,这个市场只是可选的额外开销。

更完整的费率下限、BYOK 规则、充值风险和路由对比,可参阅 OpenRouter 价格详解。本文的结论更窄:团队真正使用其供应商市场时,OpenRouter 才是降本工具;如果只是给同一请求多套一层 URL,它并不会省钱。

最适合: 会在供应商或模型系列之间真实迁移,并能量化这一选择所带来节省的团队。
突出优势: 覆盖 500+ 个模型与 80+ 家供应商的按价格排序路由,并提供大额免网关费 BYOK 用量。
价格: Free $0;Pay-as-you-go 为模型价格另加共享额度的 5.5%;Enterprise 定制,并可提供费率折扣。
免费试用: 长期 Free 套餐,包含 25+ 个免费模型和每天 50 次请求。

优势
做得好的地方
8 points

  • 在本次入选工具中拥有最广的供应商市场。
  • 路由可以按价格排序、设置价格上限,并支持失败回退。
  • Pay-as-you-go 每月前 $25,000 或 Enterprise 每月前 $200,000 的 BYOK 用量不收网关费。
  • 精确响应缓存命中后,报告的可计费用量为零。
  • 即使底层路线完全不变,共享额度仍要加收 5.5%。
  • $0.80 的最低费用,让小额额度购买的实际比例高于标题费率。
  • 精确缓存无法识别措辞不同但含义相同的请求。
  • 即便模型名称相同,切换供应商也可能改变延迟、策略或输出质量。

不同团队该怎么选 AI网关

希望获得托管路由、又不想支付公开 token 加价的团队,默认可选 Vercel。当这项模型折扣到期,而剩余控制功能节省的金额已不及直连,或团队级策略与 trace 配置让附加费用变得不可忽略时,就应离开 Vercel。

必须自托管,或现有平台团队能以很低的边际成本接手网关时,选择 LiteLLM。如果它带来了新的运维负责人、新的值班告警,或 Enterprise 报价高于托管替代方案的完整账单,就该转回托管。

请求体会完全重复、缓存响应可以安全复用,且 BYOK 合适时,Cloudflare 胜出。若同一意图经常使用不同措辞,而且经过实测的语义缓存能达到质量门槛,则改选 TrueFoundry;当新鲜度、个性化或租户上下文让复用不安全时,应彻底放弃缓存。

只有真实评估证明合格缓存命中足以覆盖套餐费用后,TrueFoundry 才是托管语义复用的赢家。团队需要成本更低的托管生产控制平面,并能接受其请求计价方式时,Portkey 更合适。只有供应商价格排序或 BYOK 统一管理节省的金额超过其费用时,OpenRouter 才会胜出。

温室风格的决策流程,根据运维与缓存需求,将工作负载导向 Vercel、LiteLLM、Cloudflare、TrueFoundry、Portkey 或 OpenRouter
应根据工作负载真正能利用的节省机制选择网关

最可靠的默认答案,甚至可能是不用网关。如果一项稳定、高用量的工作负载只跑一个供应商,原生预算已经够用,故障成本不高,重复内容又很少,就看不到明确的网关节省。只有当某项可明确命名的路由、缓存、治理或运维收益超过全部成本时,才值得加上控制平面。

入选标准

这份排名只给买方可以核验的经济性分配权重:公开网关成本与费用透明度占 35%,能可信减少模型支出的机制占 30%,生产环境门槛占 20%,运维负担与迁移摩擦占 15%。

价格页、套餐对比、功能文档、缓存行为、请求限制,以及 GPT-5.6 Sol 的价格变更,均已于 2026 年 8 月 24 日实时核验。发布流水线为每个入选网关保存了真实价格页截图。本次评估没有用生产流量实际运行这些工具,因此不会把延迟、正常运行时间、缓存命中率或输出质量描述成测试结果。

最终入选 6 款网关,是因为每一款都有独立、可审计的成本任务:Vercel 取消托管平台加价,并且当前对一款主流模型打折;LiteLLM 通过自托管省掉许可证费用;Cloudflare 消除完全重复的调用;TrueFoundry 面向语义重复;Portkey 提供价格清晰的托管升级;OpenRouter 则引入供应商价格竞争。

厂商把某项功能称为“优化”,并不足以让它计入节省。文中的成本计算必须同时具备一项明确的工作负载、一个具名价格和一个清楚的缓存假设。任何企业在套用这份排名前,都应替换成自己的模型组合、合格输出率和运维人员成本,再决定是否签署年度协议。

不建议选择的方案

只为降本而新建部署时,不选 Kong AI Gateway

如果唯一目标是降低推理成本,Kong AI Gateway 不应成为首选。Kong 当前价格为 Konnect 提供 30 天试用;之后,付费 AI Gateway 插件会成为 Plus 的附加项,每个由 AI 插件代理的独立模型每月收费 $100,最多 5 个模型。代理 5 个模型时,仅代理费用就达到每月 $500,还未计算推理用量和其他平台成本。

这并不代表 Kong 平台不好。已经使用 Kong 统一 API、安全和服务治理的企业,可能会发现增加 AI 控制比另购一家供应商更便宜。这里的建议范围更窄:在零加价和核心功能免费的网关已经存在时,不要只为了追逐 token 节省,就把一套广泛的 API 平台引入全新的 AI 技术栈。

没有明确负责人的自研代理

一个轻量内部代理看起来免费,直到它开始负责重试、供应商变更、预算、日志、密钥和故障。只有当工作负载足够稳定、功能面能保持很小,而且已经有明确团队负责这项服务时,才值得自建。否则,代理只是把成本藏进工程时间,同时提供的控制能力还少于托管方案。

单一供应商、响应又无法复用时,不要加任何网关

流量永远不切换,路由广度就没有价值;每个请求都必须重新生成答案,精确缓存和语义缓存也没有价值。如果供应商原生预算与日志已经够用,直连 API 的计费层最少,故障面也最小。

不要把 9 月折扣当成永久方案

Vercel 当前 Sol 促销,是本次排名中最好的即时优惠,也最容易被误用。把 9 月 18 日视为强制重新定价点。即使促销促成了本次迁移测试,架构也必须能在供应商标价下继续成立。

周一就做:给一条工作流建立“每个合格结果成本”表

选择一条上周产生了可观模型账单、并能用二元规则判断是否合格的生产工作流。导出其输入 token、输出 token、供应商支出、重试和合格结果。若某个评估集没有获准通过所选路线,务必剔除其中的个人、机密和客户数据。

下周让 10% 流量经过节省机制与该工作负载匹配的网关:要利用 Sol 托管价格窗口,选 Vercel;已经证明存在完全重复请求,选 Cloudflare;问题措辞不同但语义等价,选 TrueFoundry;现有平台适合自托管,选 LiteLLM;需要低门槛托管控制层,选 Portkey;确实会进行供应商价格竞争,才选 OpenRouter。

在第一条请求发出前,就为隔离密钥设定硬预算,并写好停止条件。合格率下降、缓存安全性不合格、供应商路线违反策略,或网关总费用超过节省金额时,立即停止。周末结算时,把模型支出、平台费、付费控制项、重试和审核成本相加,再除以合格结果数。

最终应形成一个财务与工程都能使用的决定:保留、切换,或移除网关。如果 Vercel 胜出,把 9 月 18 日重新定价写入日历;如果缓存胜出,只对通过测试的请求类别上线缓存;如果没有任何方案胜出,就继续直连,不要为可选的复杂度付费。

常见问题

Cloudflare AI Gateway 要多少钱?

Cloudflare 的核心 AI Gateway 分析、缓存和速率限制在所有套餐中都免费。Workers Free 在全部网关之间合计保存 100,000 条日志;Workers Paid 为每个网关保存 10 million 条。Unified Billing 对购买额度加收 5%,供应商价格本身则不加价透传。Logpush 和 guardrail 推理可能产生独立费用。

哪款 AI 网关最好?

以 2026 年 8 月 24 日为准,Vercel AI Gateway 是综合最佳托管选择,因为它既没有公开 token 加价,又对 GPT-5.6 Sol 提供截至 9 月 18 日的 50% 折扣。已有自托管基础设施的团队更适合 LiteLLM;完全重复缓存选 Cloudflare;托管语义缓存选 TrueFoundry;$49 起的生产入口选 Portkey;按供应商价格排序则选 OpenRouter。

Cloudflare AI Gateway 有免费套餐吗?

有。核心分析、缓存和速率限制免费,Workers Free 日志额度可在全部网关之间合计保存 100,000 条记录;免费账户最多建 10 个网关。供应商推理仍需付费,可选的 Unified Billing、guardrails 或付费日志功能也可能产生费用。

获取面向企业主的 AI Tools Map

把这次网关选择扩展成一套完整的 AI 落地技术栈,并为每款工具设定成本触发点与质量底线。订阅即可免费获取 AI Tools Map

最近更新

2026年9月2日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。