2026 年十大 AI网关:多模型应用选型指南

对比 2026 年 10 款主流 AI网关:LiteLLM、Vercel AI Gateway、Portkey、OpenRouter 等,逐项拆解价格、路由、容错、可观测性、部署边界与企业治理能力,并用费用临界点和“10 分钟退出”测试,帮助多模型应用团队在托管、自托管与模型市场之间做出可逆、可控的生产级选择。

Thursday, September 3, 2026Omid Saffari
2026 年十大 AI网关:多模型应用选型指南

如果团队有明确的平台负责人,LiteLLM 是多模型应用综合表现最好的 AI网关;若想省去运维,Vercel AI Gateway 是更稳妥的托管默认选项。据报道,Stripe 已同意以超过 $8 billion 收购 OpenRouter,这让最关键的选型标准变得很清楚:生产应用必须能绕过网关运行,而且不需要重写代码。

Axios 于 2026 年 8 月 17 日报道,Stripe 已同意以超过 $8 billion 的现金和股票收购 OpenRouter。Axios 同时表示,两家公司尚未置评,正式公告仍有待发布。这一区别很重要,但无论交易最终是否完成,运维层面的教训都不变:只有当网关本身不会成为下一重锁定时,它才真正消除了模型供应商锁定。

简短结论:AI网关该怎么选?

重视控制权,选 LiteLLM;追求托管省心,选 Vercel AI Gateway;需要企业治理,选 Portkey;只有当广泛的模型目录值得额外支付比例费用并引入一家供应商依赖时,才选 OpenRouter。 AI网关位于应用与模型供应商之间,负责承接请求。它可以统一 API、保管凭据、路由流量、失败重试、记录成本并执行策略。

下文的价格和产品限制均已于 2026 年 8 月 18 日 对照各厂商实时页面核验。榜单涵盖 10 款产品;评判重点不是功能卡片能塞下多少标签,而是采购方在生产环境中最先会撞上的边界。

工具最适合起步价免费试用
LiteLLM应用自主管理的控制平面$0 OSS;Enterprise 定制报价30 天 Enterprise 试用
Vercel AI Gateway使用托管服务的产品团队每月 $5 免费额度;token 零加价长期 Free 套餐
Portkey托管式企业治理$0 Developer;$49/月 Production免费 Developer 套餐
Cloudflare AI GatewayCloudflare 原生边缘控制核心功能 $0;Unified Billing 加收 5%核心功能免费
OpenRouter广泛的模型与供应商接入Free $0;Pay as you go 加收 5.5%Free 套餐
Bifrost明确可控的 OSS 重试机制OSS $0;Enterprise 定制报价14 天 Enterprise 试用
Helicone可观测性优先的团队Hobby $0;Pro $79/月Pro 和 Team 均可试用 7 天
Braintrust Gateway由评测决定发布的团队Starter $0;Pro $249/月Gateway 在 beta 期间免费
Requesty简洁的托管路由Free $0;Pay as you go 加收 5%免费套餐,无需银行卡
Kong AI Gateway已采用 Kong 的技术体系Serverless 控制平面 $25/月,另加 $100/模型30 天试用

第一道选择题不是功能多少,而是由谁掌控请求链路。自托管网关把进程、凭据、数据库、日志和策略留在自己的环境里,但值班告警也归自己的团队。托管网关省去了这部分运维负担,不过从此以后,它的宕机、调价、收购和产品路线都会进入每一次模型调用。

成本分界线其实比产品功能页呈现得更清楚。假设自托管网关每月需要八个小时的平台运维,人员完全成本为每小时 $150,那么每月运维成本约为 $1,200。这只是测算示例,并非厂商报价。当每月模型支出达到 $21,818 时,5.5% 的网关费会涨到 $1,200;费率为 5% 时,这一临界点是 $24,000

每月模型支出为两万美元时的网关费用
模型月支出为 $20,000 时,按比例收费仍低于示例中的自托管成本,但差距正在迅速缩小

这笔账只反映预算。部署边界、受监管的数据链路、供应商合同或强制审计要求,都可能让企业在远低于财务盈亏平衡点时就选择自托管。反过来,小型创业公司也不该为了省下一笔还不如一个工程师日成本的费用,凭空造出一项内部平台工作。

为什么 AI网关既是预算项目,也是退出方案

模型迭代很快,因此网关有价值;但如果应用离开网关就无法运行,它也会变成风险。 OpenRouter 收购报道出现前不到三个月,Palo Alto Networks 完成了对 Portkey 的收购,并表示 Portkey 将成为 Prisma AIRS 的核心组成部分。一个季度内,两个独立控制平面都可能并入更大的平台。采购方应把所有权变化视为这个品类的常态,而不是罕见例外。

业务上的直接后果是风险集中。一个多模型应用可能在某条工作流中调用 OpenAI,在另一条工作流中使用 Anthropic,再把高吞吐的后台任务交给开放模型。把三者统一接到一个网关后,代码、账单、策略和可观测性都更简单;但网关的一次调价或策略调整,也会同时波及三条链路。

更安全的架构分为三层:

  • 内部模型客户端只定义应用真正需要的少量操作,例如文本生成、结构化输出、嵌入和工具调用。
  • 网关适配器把这些操作映射到所选网关,不让网关专用请求头渗入其他代码。
  • 供应商直连适配器始终保持配置完备、文档齐全,即使平时不承载生产流量。

这套结构形成了本文所说的**“10 分钟退出”**:运维人员应能通过修改配置并执行一次受控部署,让一项生产工作负载绕过网关,全程无需改动业务逻辑。10 分钟是本文提出的运维目标,不是厂商 SLA。如果绕过网关需要重写客户端、重新设计身份体系,或迁移每一个模型名称,那么网关对应用的控制甚至已经超过模型供应商。

这也是为什么自动 fallback 之类的功能必须仔细审视。只有当备用模型保持应用所需的响应协议、工具 schema、数据策略和成本边界时,fallback 才有意义。如果结构化输出发生变化,或工具调用不兼容,那么即使另一模型成功返回 HTTP 响应,应用层仍然可能失败。

如需进一步拆解网关下方的推理层,最便宜的 AI API 对比将模型价格与路由费用分开分析。如果当前场景是开发工具,而非面向客户的应用,则可查看范围更聚焦的编程智能体 AI 网关指南,其中介绍了 coding agent 的配置与仓库归因。

这份 AI网关榜单如何评选

这份排名先看可逆性和运维适配度,再看模型数量。 在探索阶段,数百个模型的目录确实有用;一旦生产应用已固定三条获批路由,其意义便十分有限。

每款网关都按以下五项标准评估:

  1. **可迁移性:**应用能否保留自己的供应商账户、模型名称、策略和直连路径?
  2. **确定性容错:**运维人员能否控制重试、供应商顺序、fallback 行为,以及终止请求的条件?
  3. **成本可见性:**支出能否归因到具体应用、客户、团队或密钥?费用能否根据公开定价预估?
  4. **治理边界:**网关能否满足采购方对部署、身份、留存、审计和数据驻留的要求?
  5. **运维成熟度:**网关是否已正式可用,能否获得支持和监控,其定价是否适合当前使用阶段?

本文做的是价格与文档核验,并非包装成评测的产品试用。我们不声称实际部署、压测或订阅过这些产品。每个套餐、限制和具体功能都来自 2026 年 8 月 18 日打开的厂商页面;成本对比只是基于这些输入做的算术计算。

入选范围限于如今就能进入多模型应用请求链路的产品。单一云平台的模型目录依然可能是正确选择,但它并非中立路由。仍停留在路线图上的产品,也不能排在采购方现在即可部署和核价的网关之前。

1. LiteLLM:应用自主管理控制平面的综合最佳选择

如果有明确的平台负责人负责运维,LiteLLM 是综合表现最好的 AI网关。 这款开源代理通过一个兼容 OpenAI 的 API 接入 100+ 家供应商,并提供虚拟密钥、团队、支出追踪、预算、速率限制、fallback、请求与响应日志以及 Prometheus 指标。

LiteLLM 价格与套餐对比
LiteLLM

**最适合:**需要自托管、由应用方掌控网关的产品公司
突出优势:$0 OSS 套餐即提供广泛的供应商支持,以及预算、密钥、fallback 和指标
**价格:**Open Source $0;Enterprise 按容量、架构和支持需求提供年度定制报价
**免费试用:**Enterprise 可免银行卡试用 30 天;OSS 始终免费

LiteLLM实时价格页清楚划定了软件边界。Open Source 可免费用于生产环境自托管。Enterprise 不按 token 计价,而是依据请求容量、部署架构和支持需求给出年度报价。Enterprise 还增加 SSO 与 SCIM、OIDC 或 JWT 身份验证、审计日志、密钥管理器集成、密钥轮换、多区域控制平面、隔离网络部署,以及最高 24/7 的支持。

$0 这个标签没有错,但并不完整。代理、Postgres、secret、扩缩容、升级、供应商 API 变化、日志存储、dashboard 和故障事件全都由自己的团队负责。按照每月八小时、每小时 $150 的示例假设,这些工作在基础设施费用之外每月还要花 $1,200。当月度模型支出超过 $21,818 时,LiteLLM 才会比 5.5% 的费率更省钱;不过受监管的部署可能为了控制权而更早选择它,而不是为了节省费用。

文档中的 Docker 快速入门使用 curl -sSL https://docs.litellm.ai/docker-compose.yml | docker compose -f - up -d 启动网关和 Postgres,随后在 4000 端口开放管理界面。这适合用来评估产品,却不是完整的生产架构。同一指南提醒:在添加持久化凭据前,必须替换占位值 LITELLM_SALT_KEY,此后也不能再改;因为使用旧值加密的供应商密钥,无法通过新值恢复。

它在生产中的真正瓶颈,是归属不明确。LiteLLM 可以是优秀的平台组件,却不适合当作业余项目。如果代理只属于“当初把它加进来的人”,一次供应商变化就可能让某位应用工程师在没有预算、值班保障和升级策略的情况下,被迫兼任网关团队。

  1. 先部署一个可随时丢弃的环境

    在非生产账户中使用文档提供的 Docker Compose 快速入门。确认网关和 Postgres 能正常启动,替换占位 secret,并确保该环境与客户流量隔离。

  2. 只开放两条命名路由

    只添加一个主模型和一个兼容的 fallback。使用 support-primarysupport-fallback 这类稳定的内部别名,避免应用代码依赖各供应商公开的模型字符串。

  3. 为应用签发虚拟密钥

    为一个服务创建独立虚拟密钥,分别设置模型权限、月度预算和速率限制。不要把 LiteLLM 主密钥分发给应用工作负载。

  4. 保留直连适配器

    让同一服务可通过 feature flag 直连主供应商。网关链路为默认路径,供应商链路则是经过验证的旁路。

  5. 强制主路由失败

    受控触发路由不可用,确认日志能显示 fallback,然后启用直连适配器并为切换计时。如果旁路无法达到 10 分钟退出目标,应先修正抽象层,再增加流量。

优势
做得好的地方
9 points

  • $0 的生产级 OSS 许可证,不收取按 token 计算的网关费
  • 通过一个兼容 OpenAI 的 API 接入 100+ 家供应商
  • OSS 版即含虚拟密钥、团队预算、速率限制、fallback、日志和 Prometheus
  • 数据链路可自托管,Enterprise 另有隔离网络和多区域选项
  • Enterprise 按容量而非模型支出定价
  • 可用性、升级、数据库健康、secret 和故障事件均由采购方负责
  • Enterprise 价格不公开
  • 快速入门很方便,却可能掩盖生产加固工作
  • 共享代理会成为新的内部故障域

2. Vercel AI Gateway:最省心的托管默认方案

如果产品团队想通过一个端点调用模型,又不愿承担 token 加价,Vercel AI Gateway 是最合适的托管默认方案。 它支持供应商筛选与排序、模型 fallback,并可参考近期 uptime 和 latency 选择供应商。

Vercel AI Gateway 实时定价文档
Vercel AI Gateway

**最适合:**重视快速采用托管服务的创业公司和产品团队
**突出优势:**按供应商公开价计费,网关不对 token 加价
**价格:**Free 每月含 $5 额度;Paid 使用购买的额度,并按供应商公开价计费
**免费试用:**符合条件的模型可长期使用 Free 套餐,但单模型限制更低

当前价格页明确区分了免费与付费状态。Free 每月包含 $5 额度。购买额度后,账户会转为 Pay as you go,开放所有可用模型并提高限制,同时失去每月 $5 的免费额度。两个套餐都按供应商公开价计费,token 零加价。

只有账户转为 Paid 后才能使用 Bring Your Own Key。Vercel 不对 BYOK 收取网关费,但使用自有凭据的请求如果失败,系统可能改用 Vercel 凭据重试,并从网关额度余额扣费。这种机制提高了可用性,却可能违背“所有用量都走现有供应商合同”的财务假设。把 BYOK 当成采购捷径之前,应先核查这一行为。

token 层不加价,但部分控制功能会收费。Custom Reporting 每 1,000 次写入收费 $0.075,每 1,000 次报表查询收费 $5。团队级供应商 allowlist 每 1,000 次成功请求收费 $0.10,而请求级 only 筛选不另收费。团队级零数据留存同样按每 1,000 次请求 $0.10 收费。Trace drain 每 1,000 条 trace 收费 $0.05,另加每 GB $0.50 的出口流量费。

处理一百万次请求时,同时开启团队级 allowlist、团队级 ZDR,并让每个请求生成一条 trace,会额外产生 $250 加 trace 出口流量费。对许多应用而言,这相较模型支出仍不算高;但“零加价”不能理解成“所有控制功能都免费”。

真正的边界在部署所有权。Vercel 负责网关运维,你无法在自己的集群中运行其数据平面。如果接受托管边界,而且看重上线速度,就选它;如果私有部署是硬性要求而非偏好,则选择 LiteLLM 或 Bifrost

优势
做得好的地方
9 points

  • Free、Paid 和 BYOK 用量均不收 token 加价
  • 每月 $5 的 Free 额度,适合范围可控的试点
  • 支持供应商排序、筛选、fallback 和托管模型接入
  • 无需自行运维网关或数据库
  • 使用请求级供应商与 ZDR 控制,可避开团队级附加费
  • 无法自托管网关进程
  • 使用 BYOK 前必须先购买额度
  • BYOK 调用失败后,可能切换到需要付费的 Vercel 凭据
  • 报表、团队级策略和 trace drain 分别计费

3. Portkey:企业级托管治理的最佳选择

如果采购核心是策略、guardrail、预算和私有部署选项,Portkey 是最佳托管方案。 它将通用 API 与重试、超时、fallback、负载均衡、缓存、虚拟密钥和可观测性整合在同一个网关中。

Portkey AI 网关套餐价格
Portkey

**最适合:**采购托管式治理能力的中型企业与大型企业团队
**突出优势:**既有公开的生产套餐,也为私有云和 VPC 托管提供 Enterprise 路径
**价格:**Open Source 自托管;Developer $0;Production $49/月;Enterprise 定制报价
**免费试用:**Developer 对原型开发和评估永久免费

价格页对各档套餐的边界说明得格外直接。Developer 每月记录 10,000 条日志,日志保留三天,指标保留 30 天,而且明确不适合生产环境。Production 每月 $49,包含 100,000 条已记录日志;超过后每增加 100,000 条收费 $9,上限为三百万条;日志保留 30 天,指标保留 90 天。

记录一百万条日志时,Production 每月费用为 $130:$49 基础费,加上九个 $9 的超额区块。对成长中的应用来说,这个价格依然容易接受。同一页面指出,需要自定义安全控制或数据驻留保证时,不建议使用 Production。此类采购方需要转向 Enterprise,获得 10 million+ 条已记录日志、自定义留存、SSO、细粒度预算与限制、私有云、VPC 托管、数据湖导出和高级合规能力。

它的产品边界不在功能,而在采购范围。只需要 base URL 和 fallback 的创业公司,用不上 Portkey 所提供的大部分组织价值;而拥有多个应用、获批模型策略、PII 控制和审计要求的平台团队,每周都会用到同一套功能。

所有权变化值得列入采购问题。Palo Alto Networks 于 2026 年 5 月 29 日完成对 Portkey 的收购,并表示 Portkey 将成为 Prisma AIRS 的核心 AI Gateway。这可能强化安全集成和企业支持,也可能改变产品包装与路线图优先级。应确认合同上出现的是哪个产品名称、独立账户如何映射到 Prisma AIRS,以及未来整合后仍保留哪条导出路径。

优势
做得好的地方
9 points

  • 同时提供开源版、免费 Developer、公开定价的 $49 Production,以及私有 Enterprise 路径
  • 包含 fallback、重试、超时、负载均衡、缓存、密钥和可观测性
  • 自助套餐的日志量与留存限制清晰
  • 提供企业部署和合规选项
  • 一百万条已记录日志的示例成本可预估为 $130
  • Developer 明确不是生产套餐
  • Production 不适用于自定义安全控制或数据驻留保证
  • Enterprise 必须询价
  • 收购后的整合带来了产品包装与路线图问题

4. Cloudflare AI Gateway:低成本边缘控制的最佳选择

如果应用的边缘、安全或 Workers 运行时已经由 Cloudflare 承载,Cloudflare AI Gateway 是最佳低成本方案。 所有套餐都免费提供核心分析、缓存与速率限制。

Cloudflare AI Gateway 定价文档
Cloudflare AI Gateway

**最适合:**已使用 Cloudflare 网络和安全控制的应用
**突出优势:**核心网关 $0,并免费提供 DLP 扫描
**价格:**核心功能 $0;通过 Unified Billing 购买额度加收 5%;guardrail 按 Workers AI 价格计费
**免费试用:**核心功能长期免费,不会到期

Cloudflare 的实时定价文档给出了免费服务的具体存储边界。Workers Free 可在账户下所有网关中共存储 100,000 条日志;Workers Paid 则可为每个网关存储 10 million 条。DLP 扫描免费,不过未订阅 Zero Trust 的账户只能获得两个预定义 DLP profile。Guardrail 评估另按 Workers AI token 推理计费。

通过 Unified Billing 购买额度时收取 5% 费用,第三方推理价格则原价转付,不加收 token 费用。每月购买 $20,000 额度时,费用为 $1,000。这条 5% 只适用于通过 Unified Billing 购买的额度,而不是 $0 的核心网关。

上线前还要注意一个吞吐边界。当前限制页面将 Unified Billing 流量限制为每个网关每 60 秒 200 个请求,超出后返回 429。该限制不适用于 BYOK 流量。Cloudflare 还把每个网关的日志存储速度限制在每秒 500 条,可缓存请求大小限制为 25 MB,缓存 TTL 限制为一个月,每个请求的自定义 metadata 限制为五项。

它的真正边界是与周边平台的适配度。如果团队已经熟悉 Cloudflare 的账户模型、日志、DLP、Workers 和边缘行为,这款产品很有吸引力;如果只是为了省下 $49 的网关订阅费才引入这些概念,吸引力就会下降。标价最低的网关,最终可能带来更高的集成成本。

优势
做得好的地方
9 points

  • 核心分析、缓存和速率限制均为 $0
  • 所有套餐都免费提供 DLP 扫描
  • 与现有 Cloudflare 边缘和安全运维体系高度契合
  • 付费套餐的日志额度较大
  • BYOK 不受 Unified Billing 请求速率限制
  • Unified Billing 对购买的额度加收 5%
  • Unified Billing 每个网关每 60 秒最多处理 200 个请求
  • Free 套餐在整个账户内最多保留 100,000 条日志
  • Guardrail 和更多 DLP profile 可能带来相邻产品费用

5. OpenRouter:最佳模型市场,但不宜作为唯一生产链路

如果模型和供应商范围仍未确定,OpenRouter 是最合适的网关。 它的 Pay as you go 套餐通过一个账户提供 400+ 个模型和 80+ 家供应商。

OpenRouter 套餐价格与网关费用
OpenRouter

**最适合:**快速探索模型、对比供应商,以及接入广泛目录
**突出优势:**可按价格、吞吐、latency、策略和可用性精细路由供应商
**价格:**Free $0;Pay as you go 收取 5.5% 平台费;Enterprise 定制报价并提供折扣
**免费试用:**Free 套餐含 25+ 个模型、4 家供应商,每天 50 个请求

实时价格页列出三个套餐。Free 提供来自四家供应商的 25+ 个免费模型,每天限 50 个请求。Pay as you go 扩展到 400+ 个模型、80+ 家供应商,提供较高的全局限制且没有最低消费,平台费为 5.5%。Enterprise 保留同一目录,并增加费用折扣、发票、SSO 或 SAML、合同 SLA,以及通过共享 Slack 提供的支持 SLA。

BYOK 改变了费用边界。Pay as you go 每月包含按公开价计算的 $25,000 推理用量,免收 BYOK 费用,超出后收取 5%。Enterprise 把这一免收费额度提高到 $200,000,超出后同样收取 5%。已经与供应商签有直接合同的采购方,应把 BYOK 额度与购买的 OpenRouter 额度分开建模。

路由深度是 OpenRouter 的强项。其供应商选择文档称,默认策略先避开过去 30 秒内发生重大故障的供应商,然后按价格倒数的平方为稳定的低价供应商分配权重,并把其余供应商作为 fallback。运维人员也可以改为按价格、吞吐或 latency 排序;指定供应商顺序;关闭 fallback;要求参数支持;拒绝收集数据的供应商;强制使用零数据留存端点;或设置价格上限。

这些控制既能提升 uptime,也能改善成本。但它们同时意味着,默认行为已经成为生产契约的一部分。如果应用需要结构化输出或工具调用,应设置 require_parameters 和 allowlist,而不是假定同一模型 slug 下的所有端点表现一致。

购买 $20,000 额度时,5.5% 相当于每月 $1,100,仍低于示例中的每月 $1,200 自托管成本。然而,按比例收费会随支出持续增长,而成熟稳定的自托管网关,其运维负担可能趋于平缓。因此,当支出超过 $21,818 时,应重新做一次对比。

据报道,Stripe 已达成收购协议。这提高的是依赖成本,并不意味着必须恐慌迁移。OpenRouter 仍是本榜单中目录最广的模型市场。稳妥的应对方式,是保留供应商直连适配器、导出策略,并实际验证旁路。OpenRouter 完整价格分析进一步拆解了费用与 BYOK 边界。

优势
做得好的地方
9 points

  • 付费套餐包含 400+ 个模型和 80+ 家供应商
  • 提供成熟的供应商排序、筛选、策略与 fallback 控制
  • Pay as you go 没有最低消费
  • 在 5% 费用开始前,提供实用的 BYOK 免收费额度
  • 是保持模型探索空间最快的方式
  • 5.5% 的额度购买费会随支出线性增长
  • Free 套餐每天 50 个请求,不足以承载生产流量
  • 除非显式配置策略,否则默认机制可能跨供应商路由
  • 据报道的所有权变化增加了供应商应急准备工作

6. Bifrost:强调重试控制的最佳 OSS 替代方案

如果团队需要明确的重试行为、OpenTelemetry 和更精简的网关边界,Bifrost 是最佳开源替代方案。 OSS 套餐永久免费,可部署为 Docker、Kubernetes 工作负载或 Go binary。

Bifrost OSS 与 Enterprise 网关定价
Bifrost

**最适合:**希望自托管并获得透明容错控制的平台团队
**突出优势:**嵌套式 retry 与 fallback 行为,并为每个请求保留路由轨迹
**价格:**OSS $0;Enterprise 定制报价
**免费试用:**Enterprise 可试用 14 天

Bifrost 价格页把以下功能都放进 OSS:用一个兼容 OpenAI 的 API 接入 1,000+ 个模型、OTel metric 与 trace、可观测性、虚拟密钥预算和限制、自定义路由、自动 fallback、缓存以及 MCP gateway。Enterprise 增加 VPC、本地和隔离网络部署;cluster mode;自适应负载均衡;SAML 与 OIDC;vault 集成;审计日志;RBAC;以及有 SLA 保障的支持。

Bifrost 的重试与 fallback 文档写得格外具体。网络错误和 5xx 响应会在同一供应商上重试。遇到速率限制或单个密钥失败时,可以轮换凭据。只有主路由耗尽 retry budget 后,请求才会转向下一个 fallback;每个 fallback 都获得一份完整的 retry budget。

这种清晰也暴露了它的边界:重试次数可能成倍放大。如果主路由允许三次重试,同时配置两个 fallback,且各自也允许三次重试,那么返回错误前最多会发起 12 次尝试。对交互式应用而言,供应商事故可能就此演变为 latency 事故,同时推高账单。应设置总 latency budget,并让安全或合规错误直接终止链路,而不是 fail open。

Bifrost 最直接的对手是 LiteLLM。LiteLLM 胜在生态熟悉度和成熟控制平面的广度;如果 Go 原生占用、更明确的路由轨迹或 retry 语义更贴合平台团队的运维模式,则 Bifrost 更有优势。若没有预算支持专人维护代理,两者都不合适。

优势
做得好的地方
9 points

  • $0 OSS 套餐
  • 支持 Docker、Kubernetes 和 Go binary 部署
  • OSS 内含 OTel、预算、限制、缓存、路由和 fallback
  • retry、密钥轮换与 fallback 语义明确
  • Enterprise 提供私有部署和身份控制
  • 网关及其故障域均由采购方负责
  • Enterprise 定制定价
  • 嵌套 retry budget 可能放大 latency 和支出
  • 生态规模小于 LiteLLM

7. Helicone:可观测性优先的最佳网关

如果 session 调试与支出解释和路由同样重要,Helicone 是最佳选择。 它把零加价网关与可观测性、缓存、速率限制、自动 fallback、prompt 管理和请求搜索整合在一起。

Helicone 套餐价格与网关限制
Helicone

**最适合:**最迫切需要了解生产模型行为的团队
**突出优势:**网关流量直接进入可观测性与调试产品
**价格:**Hobby 免费;Pro $79/月;Team $799/月;Enterprise 定制报价
**免费试用:**Pro 与 Team 均为 7 天

价格页明确列出了升级触发点。Hobby 包含 10,000 个请求、1 GB 存储、一个席位、一个组织、七天留存,每分钟 10 条日志。Pro 每月 $79,包含不限席位、一个组织、一个月留存、每分钟 1,000 条日志和 10 次 API 调用;请求量和存储量超出套餐额度后按用量计费。

Team 每月 $799,可使用五个组织、三个月留存、每分钟 15,000 条日志、每分钟 60 次 API 调用,并提供 SOC 2 与 HIPAA 支持以及专属 Slack 频道。Enterprise 定制报价,增加不限组织、永久留存、每分钟 30,000 条日志、每分钟 1,000 次 API 调用、SAML SSO、本地部署和定制商务条款。

平台文档介绍了两种运行模式:一是以零加价额度使用 100+ 个模型,二是让需要保留供应商账单的团队使用 BYOK。两种模式都保留请求级可观测性。这正是 Helicone 相较轻量代理的优势:一次失败的用户交互可以沿整个 session 追踪,而不是被压缩成一个供应商错误计数。

Hobby 的边界很快就会出现。每分钟 10 条日志足够检查原型,却不足以支撑许多线上应用。Pro 的每分钟 1,000 条日志,才是适合中等流量的第一档现实生产边界。采购方实际上同时选择了可观测性套餐和网关,因此应该比较组合价值,而不是把路由层当成免费赠品。

优势
做得好的地方
9 points

  • 零加价额度或 BYOK
  • 在同一系统中提供网关、fallback、缓存、限制和可观测性
  • 套餐与采集边界公开
  • 从 Pro 开始不限制席位
  • Enterprise 支持本地部署
  • Hobby 每分钟 10 条日志的采集限制过低
  • Pro 和 Team 超出包含额度后按量收费
  • Team 月费从 $79 跃升到 $799
  • 对只需要简单网关的应用而言,可观测性功能可能过重

8. Braintrust Gateway:评测决定发布时的最佳选择

如果 trace 必须进一步转化为评测、dataset、score 和发布检查,Braintrust Gateway 最为合适。 该网关通过统一 API 支持 OpenAI、Anthropic、Google、AWS 等供应商,并提供缓存、可观测性和多供应商支持。

Braintrust Gateway 文档与快速入门
Braintrust Gateway

**最适合:**依据评测结果治理路由变化的 AI 产品团队
**突出优势:**网关 trace 可直接接入评测平台
**价格:**Starter $0;Pro $249/月;Enterprise 定制报价;托管 Gateway 在 beta 期间免费
**免费试用:**Starter 无需银行卡;Gateway 在 beta 期间免费

Braintrust 的平台定价从 $0 的 Starter 起步。套餐包含 1 GB 已处理数据,超出后每 GB $4;10,000 次 score,超出后每 1,000 次 $2.50;数据保留 14 天;用户、项目、dataset、playground 和 experiment 均不限量。Pro 每月 $249,包含 5 GB 已处理数据,超出后每 GB $3;50,000 次 score,超出后每 1,000 次 $1.50;数据保留 30 天,额外留存数据每 GB 每月收费 $0.50。Enterprise 定制报价。

网关本身处于另一种状态。Braintrust 的 Gateway 文档称,托管端点目前处于 beta 阶段,可免费使用,正式发布前会公布价格。全局端点通过 DNS latency 路由和健康检查覆盖多个托管区域。日志可以把网关 trace 写入组织配置的数据平面。

这项集成改变了采购逻辑。如果团队需要从生产 trace 中抽样、为响应评分、创建回归 dataset,并在质量下降时阻止发布,那么网关可以减少埋点步骤,让证据始终与流量关联。若团队只需要 retry 和支出上限,则很难证明每月 $249 的 Pro 平台比简单网关更值得。

它的边界是未来价格与 beta 状态。免费 beta 可以按生产标准设计,但商业计价方式仍不稳定。使用时必须保留供应商直连旁路,在 GA 前预设内部价格上限,也不能让临时的 $0 网关价格决定永久架构。

优势
做得好的地方
9 points

  • 网关 trace 直接连接评测、dataset、score 与发布工作流
  • 统一接入主流供应商系列
  • 托管网关在 beta 期间免费
  • 提供全局 latency 路由和健康检查
  • Starter 与 Pro 平台套餐均不限制用户数
  • 托管网关仍处于 beta 阶段
  • 网关将在正式发布前调整价格
  • Pro 每月 $249,另有超额用量费
  • 对只需要路由的团队而言,平台深度过剩

9. Requesty:简单易用的按比例计费控制平面

如果小团队不想支付订阅费,又需要路由、缓存、fallback、预算和欧盟数据驻留,Requesty 是按比例计费的最佳托管方案。 Pay as you go 提供来自 20+ 家供应商的 600+ 个模型。

Requesty AI Gateway 价格与套餐对比
Requesty

**最适合:**希望费用与模型用量直接挂钩的创业公司
**突出优势:**无订阅费、席位费和最低消费,核心路由控制也不单独收费
**价格:**Free $0;Pay as you go 加收 5%;Enterprise 定制报价
**免费试用:**Free 套餐每天可对免费模型发起 200 个请求,无需银行卡

价格页显示,Free 每天可对免费模型发起 200 个请求,并提供路由、缓存、fallback、支出分析和欧盟数据驻留。Pay as you go 在基础模型成本上加收 5%,同时包含 BYOK、路由策略、缓存、fallback、支出限制、MCP Gateway、高级可观测性和邮件支持。Enterprise 增加 SSO、RBAC、审计日志、获批模型策略、团队预算、guardrail、PII 检测、service account、专属支持和定制 SLA。

按比例计费让早期预算很简单。模型支出为 $2,000 时,费用是 $100;达到 $20,000 时,费用是 $1,000;达到 $24,000 时,就与示例中的每月 $1,200 自托管成本相等。创业公司可以在流量尚不确定时避免启动平台项目,待用量稳定后再重新评估。

它的边界恰恰来自这种简单计费:即使网关运维工作没有增加,费用仍会随模型支出增长。token 支出较高、已有平台团队和供应商合同的公司,不应无限期接受 5%,而应对比 Requesty 的 Enterprise 报价与自托管代理。

Requesty 排在 Helicone 之后,因为它在本次评选中的核心价值是高效的托管控制,而不是差异化的生产证据闭环。不过,当“不订阅”和“按固定比例计费”比深度评测或企业策略更重要时,它仍可能是更好的采购选择。

优势
做得好的地方
9 points

  • Pay as you go 无订阅费、席位费和最低消费
  • 提供来自 20+ 家供应商的 600+ 个模型
  • 包含路由、缓存、fallback、预算、MCP 和欧盟数据驻留
  • Free 套餐无需银行卡
  • Enterprise 提供身份、审计、策略和 PII 控制
  • 5% 费用随模型支出线性增长
  • Enterprise 定制报价
  • 免费流量仅限免费模型,每天 200 个请求
  • 当平台团队已有预算自行维护代理后,吸引力会下降

10. Kong AI Gateway:现有 Kong 技术体系的最佳选择

如果公司已经用 Kong 治理 API,并希望 AI 流量沿用同一套运维模式,Kong AI Gateway 是最佳选择。 Plus 提供通用 LLM API,最多代理五个不同模型,agent-to-agent 流量和 MCP server proxy 不限量,同时包含 PII 清洗、guardrail、访问控制、token 速率限制、语义缓存和成本分析。

Kong Konnect 与 AI Gateway 定价
Kong AI Gateway

**最适合:**已运行 Kong Konnect 或 Kong Gateway 的企业
**突出优势:**在更广泛的 API、身份、portal 与服务治理平台中实施 AI 策略
**价格:**30 天试用 $0;Plus 按用量计价;Enterprise 年度定制报价
**免费试用:**30 天,无需银行卡,也不限制网关数量

Kong 的实时价格页公开了 Plus 的计费项。Serverless 控制平面每月 $25,Hybrid 为 $200,Dedicated Cloud 为 $500,另收每 GB $0.15。Plus 包含一百万次 API 请求,超出后每增加一百万次收费 $200,月度上限为 10 million 次。

代理 AI 模型时,每个不同 LLM 模型还要每月支付 $100,Plus 最多支持五个模型。因此,一个使用 Serverless 控制平面、接入四个模型的应用,起步价为每月 $425,尚不含模型 token:控制平面 $25,加四个模型代理共 $400。Plus 的付费 AI plugin 另行计费,Enterprise 则已包含。

Enterprise 取消网关和模型数量限制,支持完全自托管 API gateway,并增加审计日志、SSO、专属支持、专业服务和更高 SLA。价格为年度定制报价。

它的边界是平台体量。若 API 治理、控制平面、身份、分析、服务目录和支持本就已纳入预算,Kong 很合理;对从零开发的多模型应用而言,产品需求尚未验证,就要分别按控制平面、模型和请求付费,还要引入更多概念。Vercel、Cloudflare、Requesty 或 OSS 代理都能更快把选择范围缩小。

优势
做得好的地方
9 points

  • 适配现有 Kong 控制与支持模式
  • 通用 LLM API 内置策略、缓存、guardrail 和成本分析
  • 支持 Serverless、Hybrid、Dedicated Cloud,以及 Enterprise 自托管
  • Plus 计费项公开,基础配置成本可计算
  • 企业身份与审计路径成熟
  • Plus 每个被代理模型收费 $100
  • 四模型 Serverless 示例在推理费之前就达到 $425
  • Plus 最多代理五个 AI 模型,每月流量上限为 10 million 个请求
  • 作为从零开发应用的默认方案,过重且昂贵

不同团队分别该选哪款 AI网关?

先找出会阻止上线的约束,再比较费用。 路由功能再强,也弥补不了错误的部署边界;费率再低,也补不上缺失的审计或回滚控制。

创业公司若要上线面向客户的应用,获批模型不多,也不要求私有部署,应选择 Vercel AI Gateway。如果 Cloudflare 已负责边缘和安全层,则改选 Cloudflare;如果 5% 用量费比平台订阅更容易获得预算,则改选 Requesty。

产品公司若有平台负责人、既定容器与数据库标准,而且有硬性数据链路要求,或者按照本文运维假设,每月模型支出正在越过约 $22,000 到 $24,000,应选择 LiteLLM。如果 Bifrost 的 retry 语义、Go 部署方式或 OTel 优先模型更贴合团队,则改选 Bifrost。

需要托管式身份、guardrail、预算、留存、私有部署选项和支持的中型或大型企业,应选择 Portkey。如果 Kong 已是公司的 API 平台,而且整合控制值得支付按模型计费,则改选 Kong。

如果日常工作重心是请求排查、session 调试与支出归因,应选择 Helicone。如果同一批 trace 还必须进入评测和发布检查,则选择 Braintrust Gateway。Braintrust 仍处于 beta,因此必须保留直连旁路并预设内部价格上限。

当小型技术团队仍在对比大量模型,或确实需要供应商市场的广度时,选择 OpenRouter,同时保留供应商直连路径。应用一旦固定少量获批模型,就应把 5.5% 额度费与 Vercel 的 token 零加价、Requesty 的 5%,以及有预算支持的自托管重新对比。

在自托管、托管、治理型与模型市场型 AI 网关之间做选择的决策流程
先判断所有权和治理要求,再用路由功能与费用做最终选择

明确的切换条件很简单:当现有方案缺失的成本或控制能力,已经超过迁移到下一方案并持续运维的负担时,就该更换网关。 不要因为竞品功能列表更长而迁移。只有当当前网关无法满足可量化的 latency budget、部署边界、审计要求、费用上限或退出目标时,才值得迁移。

哪些方案不应成为唯一生产链路?

只要商业或运维边界仍在变化,就不应让任何网关成为唯一链路。 以下三个产品需要警惕,但原因各不相同。

在据报道的所有权交接期间,不要把 OpenRouter 当作唯一生产链路。它的目录和路由依然出色,也没有证据表明条款一定会变差。问题在于风险集中:模型接入、供应商策略、额度和 fallback 行为都绑在同一账户上。应在网关之外保留一个供应商直连密钥和经过验证的适配器。

在仍处于 beta 阶段时,不要把 Braintrust Gateway 当作唯一链路。Braintrust 表示托管网关按生产用途设计,公开追踪 uptime,并在 beta 期间免费;它也明确表示将在正式发布前公布价格。应把 $0 视为试点价,预先定义触发迁移的价格,并保持旁路可随时启用。

当公司尚未使用 Kong 时,不要把 Kong AI Gateway 当作从零开发应用的默认方案。在一个 Serverless Plus 控制平面上代理四个模型,推理费之前的月费就从 $425 起;采购方还要同时接受 Kong 的控制平面与 API 项目体系。对现有 Kong 客户而言,这可能是优秀的整合方案;对新应用来说,却可能只是无谓的平台负担。

此外,一旦有多个应用依赖自研 passthrough,也不要继续把它当成唯一生产路径。代理 base URL 很简单,但要正确处理 streaming、错误归一化、供应商专用参数、fallback、预算、密钥隔离、日志和模型下线,就必须长期维护一个产品。只有独特策略值得永久投入时,才应自研。

下周一就做这件事:证明网关可以撤掉

下周不要从全公司迁移开始。先选择一条具备生产特征的路由,证明它能实现 10 分钟退出。 最终产物应是一项有数据支撑的运维决策,而不是一张看起来更整洁的架构图。

  1. 盘点一条路由

    选择一条面向客户的工作流,记录当前供应商、模型、认证方式、月度支出、p95 latency 目标、结构化输出或工具要求,以及数据策略。所选路由应足以暴露难点,同时又便于回滚。

  2. 把网关放在内部客户端之后

    只把网关适配器移入请求链路。不要让供应商专用请求头、模型别名和 fallback 策略进入业务逻辑。把原来的直连配置与网关配置并排保存。

  3. 设置一个主模型和一个兼容备用模型

    不要一开始就搭建复杂路由树。选择能支持同一响应协议、结构化输出、工具和数据边界的 fallback,并在整条 retry chain 之上设置总 latency 上限。

  4. 强制触发故障

    在受控时间窗内禁用主路由,或故意让它路由错误。确认系统做了哪些尝试、哪些尝试产生费用、最终由哪家供应商响应、整条链路耗时多久,以及应用是否收到预期 schema。

  5. 执行 10 分钟退出

    通过配置和一次受控部署绕过网关。如果服务无法在 10 分钟内恢复到供应商直连路径,记录阻塞切换的依赖,并在扩大 rollout 前解决它。

  6. 只为真正改变决策的控制能力付费

    只有当网关确实挽救了请求、执行了策略、明确了支出归属、满足了部署边界,或降低了可量化的运维成本时,才正式采用。没有 owner 查看的一块 dashboard,不算生产成果。

对多数小型产品团队来说,下周一的试点应从 Vercel AI Gateway 开始,在实际需求证明价值前不启用付费 add-on。若平台团队有硬性私有边界,则使用 LiteLLM,并在代理接收流量前明确 owner。若项目重点是企业治理,应同步启动采购和技术验证,因为留存、身份、部署、支持与退出条款都会影响架构。

据报道的收购只是触发因素,并非决策本身。真正要判断的是:下一次更换模型、供应商或网关时,能否通过一次受控配置更新完成,而不必重写代码并紧急追加预算。

常见问题

哪款 LLM 网关最好?

如果有平台负责人能承担运维,而且公司重视部署控制,LiteLLM 是综合最佳选择;Vercel AI Gateway 是最佳托管默认方案;Portkey 更适合企业级托管治理;在广泛探索模型仍是主要任务时,OpenRouter 更有优势。

常见的 AI 网关有哪些?

目前常见的产品包括 LiteLLM、Vercel AI Gateway、Portkey、Cloudflare AI Gateway、OpenRouter、Bifrost、Helicone、Braintrust Gateway、Requesty 和 Kong AI Gateway。它们涵盖自托管代理、托管网关、模型市场、可观测性优先平台和企业 API 平台。

最好的开源 AI 网关是哪款?

LiteLLM 是最佳开源默认方案,因为其 $0 套餐同时提供 100+ 家供应商、虚拟密钥、预算、速率限制、fallback、日志和 Prometheus。如果决定性要求是明确的嵌套 retry 行为、Go binary 或其 OpenTelemetry 实现,Bifrost 是更好的替代方案。

创业公司和大型企业分别该选哪款 AI 网关?

创业公司通常应从 Vercel、Cloudflare 或 Requesty 起步,避免平白增加内部平台工作。大型企业则应按治理与部署边界选型:托管控制选 Portkey;自有基础设施选 LiteLLM 或 Bifrost;如果组织已经用 Kong 统一承载 API 流量,则选 Kong。

最近更新

2026年9月3日

分类Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Build 文章

查看全部 Build 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。