AI API 价格对比:8 个低成本与免费方案怎么选

对比 8 家服务商的 AI API 价格、免费层、延迟、生产能力与回退方案,以每月 20,000 次请求的统一负载算清实际成本。文章按免费原型、生产文本、批处理、低延迟和多模型切换场景给出选择,并解释为何不能只看 Token 单价,还要把质量、隐私、网关手续费和迁移成本都算进来。

Thursday, September 3, 2026Omid Saffari
AI API 价格对比:8 个低成本与免费方案怎么选

DeepInfra 是本次 AI API 价格对比中标价最低的平台:Mistral Nemo 每 100 万输入 Token 仅需 $0.019,输出 Token 为 $0.03。不过,如果要为生产环境选择低成本默认方案,DeepSeek V4 Flash 更稳妥:价格为 $0.14/$0.28,同时支持 JSON、工具调用和 1M Token 上下文窗口;免费原型则由 Gemini 2.5 Flash-Lite 胜出。真正便宜且可用的 API,不是价格表中最小的数字,而是能满足业务质量、隐私和延迟底线的最低一档。

AI API 价格:先看结论

**对大多数生产级文本任务来说,DeepSeek V4 Flash 是综合表现最好的低成本 AI API。**按标准费率计算,1000 万输入 Token 加 200 万输出 Token 只需 $1.96;同一模型还支持 JSON 输出、工具调用、Responses API 和 1M Token 上下文窗口。这些能力比再省下几角钱更重要。

“最便宜”对应的是 3 种不同需求,因此这里有 3 个赢家:

  • **按纯 Token 单价看,DeepInfra 最便宜。**Mistral Nemo 每 100 万输入 Token 为 $0.019,输出 Token 为 $0.03。
  • **做原型时,Google Gemini 最便宜。**Gemini 2.5 Flash-Lite 提供免费层;进入付费 Standard 层后,每 100 万 Token 的输入价格为 $0.10,输出为 $0.40。
  • **需要可胜任生产工作的低价默认模型时,DeepSeek 最便宜。**V4 Flash 每 100 万缓存未命中输入 Token 为 $0.14,输出为 $0.28,并提供大多数应用后端需要的 API 能力。

下文所有价格均已于 2026 年 8 月 10 日对照服务商当时的实时价格页或文档核验。除非表格另有说明,价格均按每 100 万输入/输出 Token 计算。

工具最适合起步价格免费试用
DeepSeek低成本生产默认方案$0.14 / $0.28未列出长期免费层
Google Gemini免费原型与多模态输入免费;付费 $0.10 / $0.40有,免费层
DeepInfra最低纯 Token 单价$0.019 / $0.03无,需要银行卡或预充值
Groq低价、低延迟响应$0.05 / $0.08未公开说明
Mistral模型厂商直供的小模型 API$0.10 / $0.10仅少数端点免费
SiliconFlow低成本多模型目录$0.04 / $0.18$1 赠送额度
OpenRouter一个密钥,轻松切换模型免费模型为 $0;付费价格随模型而定少量额度与免费模型
OpenAI主流生态内的低成本迁移路径$0.20 / $1.20未列出长期 API 免费层

这张表不是质量排行榜。即便都能接收 chat-completions 请求,价格为 $0.10/$0.10 的 3B 模型与价格为 $0.14/$0.28 的当前生产模型也不是同一种产品。先用标价筛选候选项,再用自己的验收测试决定最终方案。

20,000 次 AI 请求要花多少钱

**在中小规模用量下,本文所有服务商都足够便宜;一次错误的工作流决策,代价往往高于整月 Token 账单。**但统一工作负载仍值得比较,因为它能暴露只看输入单价时看不到的高输出成本和附加费用。

假设某产品每月发出 20,000 次调用,每次包含 500 个输入 Token,并返回 100 个输出 Token。总量就是 1000 万输入 Token 加 200 万输出 Token:

月成本 = 10 × 输入单价 + 2 × 输出单价。

路径经济型模型月成本需要注意
DeepInfraMistral Nemo$0.25标价最低,但模型较老、规模较小
GroqLlama 3.1 8B Instant$0.66速度和价格优先,能力深度有限
SiliconFlowGPT OSS 20B$0.76低价建立在开放权重模型之上
OpenRouterDeepSeek V4 Flash Latest$1.304,另加充值手续费统一账单;手续费 5.5%,最低 $0.80
Google GeminiGemini 2.5 Flash-LiteStandard $1.80;Batch/Flex $0.90免费层内容可能用于改进 Google 产品
DeepSeekDeepSeek V4 Flash$1.96服务商已提示价格将大幅上涨
MistralMistral Small 4$2.70产品能力比 3B 入门档更完整,但输出更贵
OpenAIGPT-5.6 LunaStandard $4.40;Batch/Flex $2.20使用方便,但输出单价是输入的 6 倍
对比纯低价、极速、默认生产与主流 AI API 成本的四档阶梯图
同一组 10M 输入、2M 输出工作负载,在计入质量导致的重试或人工审核前,成本从 $0.25 到 $4.40 不等。

百分比差距看起来很大,换算成实际金额却很小。在这组工作负载下,DeepSeek 比 DeepInfra Mistral Nemo 贵 $1.71,OpenAI Luna 又比 DeepSeek 贵 $2.44。如果更便宜的模型破坏了 Schema、漏掉客户请求,或制造出需要人工复核的队列,省下的钱很快就会消失。

这就是质量底线:在不增加补救工作的前提下,任务能够接受的最低模型表现。只允许 5 个标签的分类端点,底线较低;基于账户数据回答客户问题的客服系统,底线要高得多;允许更新记录的 Agent 要求更高,因为一次错误操作的成本绝不只是再调一次 API。

输出定价尤其值得关注。摘要工具可能读入长文档、只返回短结果,因此成本以输入为主;编程 Agent、销售邮件生成器或对话助手则可能产生大量输出。OpenAI Luna 的输出费率 $1.20 是输入费率 $0.20 的 6 倍;Mistral Small 4 的输出费率 $0.60 是输入费率 $0.15 的 4 倍。小模型的输入输出同价,对输出密集型任务很诱人——前提是它真的能完成任务。

1. DeepSeek:低成本生产环境的首选默认方案

**生产应用既想压低 Token 成本,又不能失去 JSON、工具或长上下文时,DeepSeek 是最值得先测的候选。**V4 Flash 0731 每 100 万缓存未命中输入 Token 为 $0.14,输出 Token 为 $0.28。官方 API 标明支持 1M Token 上下文、最高 384K 输出、JSON 输出、工具调用、Responses API,以及 Anthropic 兼容接口。与价格阶梯底部的大多数模型相比,它的生产能力更完整。

DeepSeek API 模型与价格页面
DeepSeek

真正的限制在于预算稳定性。DeepSeek 自己的价格页写明,近期计划整体调价,而且预计涨幅显著。初创团队可以享受当前 $1.96 的标准化成本,但采购团队若不预留缓冲或第二条路径,就不该把这个数字直接写进年度预测。

**最适合:**生产级信息提取、结构化生成、经济型 Agent 和长上下文任务
**突出优势:**1M 上下文,同时支持 JSON、工具调用、Responses API 和 Anthropic API
**价格:**V4 Flash 每 1M Token 输入 $0.14、缓存命中输入 $0.0028、输出 $0.28
**免费试用:**价格页未列出长期免费层

优势
做得好的地方
7 points

  • 标准化的 10M 输入、2M 输出工作负载只需 $1.96
  • 1M Token 上下文,最高输出 384K
  • 经济档即支持 JSON 输出与工具调用
  • V4 Flash 公布的并发上限为 2,500
  • 服务商已明确警告价格将显著上涨
  • 未公布长期免费层
  • 低成本外部路径仍需按买方场景审查隐私、可靠性和服务区域

DeepSeek 为什么能排第一

当低价模型不能只做文本打标时,DeepSeek 的优势最明显。假设一款 B2B SaaS 产品要从上传的合同中提取续约日期、合同金额、通知期和列明的风险。输出虽可用 Schema 校验,但模型仍要有足够上下文读完长文档,也要能可靠遵循指令、返回全部必填字段。V4 Flash 的成本与 API 能力组合,很适合作为首轮评估对象。

缓存命中输入的价格低至每 100 万 Token $0.0028,这一点很少见。相同的固定指令或参考前缀反复出现时,它会产生价值;但这不代表每个输入 Token 都按 $0.0028 计费,只有缓存命中部分适用该价格。在真实用量证明命中率之前,预算仍应按缓存未命中的 $0.14 计算。

用 1 周评估 DeepSeek

  1. 选择一个边界清晰的任务

    先从信息提取、分类、摘要或只读 Agent 操作开始。发送流量前,先定义字段、允许的输出和失败条件。

  2. 构建 100 条请求的评估集

    从实际工作负载中选取有代表性且已脱敏的请求,覆盖短文本、长文本、歧义、格式错误和边界情况,避免最便宜的路径仅靠简单样本胜出。

  3. 要求机器可校验的输出

    有 Schema 的任务应使用 JSON 输出。每次调用都记录 Schema 有效率、答案通过率、延迟、输入 Token、输出 Token 和缓存命中情况。

  4. 保留当前模型作为回退

    校验失败、低置信度案例,以及任何会产生实质后果的操作,都应交给现有可信路径。第一次上线必须可逆。

  5. 设置价格变动提醒

    DeepSeek 已披露价格将上涨。服务商公布新费率后立即重算标准化工作负载,不要让临时价格变成架构的长期前提。

如果 V4 Flash 能通过任务测试,且组织可以承受价格变动,就选择 DeepSeek。如果固定年度单价、特定处理区域或既有服务商关系比 Token 差价更重要,则应跳过。

2. Google Gemini:最佳免费 AI API

**使用脱敏数据制作原型时,Google Gemini 是最佳免费路径。**Gemini 2.5 Flash-Lite 在 Free 层提供免费的输入和输出 Token。应用转入 Paid 层后,Standard 价格为:每 100 万文本、图片或视频输入 Token $0.10,输出 Token $0.40;Batch 和 Flex 将费率减半至 $0.05/$0.20。

Google Gemini Developer API 价格页面
Google Gemini

免费层带来的隐私影响必须进入核心决策,而不是藏在脚注里。Google 的价格页说明,Free 层内容会用于改进其产品,Paid 层内容则不会。合成提示词、公开文档和开发者测试集适合走免费路径;客户记录、机密文档或尚未发布的代码不应默认使用它。

**最适合:**免费原型、多模态输入、批处理和成本敏感型文档工作流
**突出优势:**输入输出均可免费的路径,以及支持文本、图片、视频和音频输入的付费层
**价格:**Free 层;Paid Standard 文本/图片/视频输入 $0.10,输出 $0.40;Batch/Flex $0.05/$0.20
**免费试用:**有,Free 层提供有限的模型访问权限

优势
做得好的地方
7 points

  • Free 层的输入和输出 Token 均免费
  • Paid Standard 运行标准化工作负载需 $1.80
  • 同一异步工作负载使用 Batch 或 Flex 只需 $0.90
  • Paid 层包含上下文缓存,且不会使用内容改进 Google 产品
  • Free 层内容会用于改进 Google 产品
  • 免费访问受模型和配额限制
  • Standard 音频输入每 100 万 Token 为 $0.30,是文本/图片/视频输入的 3 倍

如何从免费层切换到付费层

创始人验证文档标签功能时,可以先在 Free 层使用公开或生成的文档,确认响应格式并了解 Token 构成,然后再添加付费账户。一旦客户文档进入流程,迁移到 Paid 就不只是用量问题:内容使用条款会发生变化,同时还能获得更高的生产限额、上下文缓存和 Batch 访问权限。

标准化工作负载在 Paid Standard 上需 $1.80,在 Batch 或 Flex 上只需 $0.90。只看标价,Gemini 因而比 DeepSeek 更适合异步任务;但最终仍要看哪个模型能通过任务测试。如果结果不必立即返回,应先评估这项 50% 折扣,再考虑更换服务商。

Gemini 2.5 Flash-Lite 的图片和视频输入,与文本一样都按 Standard 每 100 万 Token $0.10 计费。需要读取收据、截图或商品图片的工作流中,它因此比纯文本小模型更值得考虑。价格页将 Flash-Lite 描述为 Google 最小、最具规模成本效益的模型,所以在升级到更大的 Gemini 模型前,先从这一档测试最合理。

项目需要免费起步、多模态输入或半价异步处理时,可选择 Gemini。敏感数据不要使用 Free;如果验收测试表明必须用更大的模型,也应跳过 Flash-Lite。

3. DeepInfra:纯 Token 单价最低

**DeepInfra 的 Mistral Nemo Instruct 每 100 万 Token 输入 $0.019、输出 $0.03,是本次 AI API 价格对比中的纯单价冠军。**标准化的 20,000 次请求工作负载仅需 $0.25。DeepInfra 还提供价格为 $0.02/$0.04 的 Meta Llama 3.1 8B,以及 $0.09/$0.18 的 DeepSeek V4 Flash,开发者无需另开计费账户,就能沿着同一平台的模型阶梯升级。

DeepInfra 文本生成模型价格页面
DeepInfra

限制来自低价背后的模型。Mistral Nemo 和 Llama 3.1 8B 之所以便宜,是因为它们是规模较小、发布较早的开放模型。规则固定的标签任务可能已经够用;面向客户的工作流则不能直接套用这个低价,必须先用自身评估证明输出可接受。

**最适合:**大批量、低风险分类,打标签,轻量信息提取和模型价格实验
**突出优势:**本次对比中公开的最低文本生成 Token 费率
**价格:**Mistral Nemo 输入 $0.019/输出 $0.03;Llama 3.1 8B $0.02/$0.04
**免费试用:**无;DeepInfra 表示需要银行卡或预充值

优势
做得好的地方
7 points

  • Mistral Nemo 运行标准化工作负载只需 $0.25
  • 模型目录覆盖文本、Embedding、图片、音频和视频
  • 提供 Standard、Priority 和价格更低的 Flex 调度
  • 自动扩缩容,公布的账户并发请求上限为 200
  • 最低费率买到的是小模型,不是通用生产默认方案
  • 需要银行卡或预充值
  • Flex 可能更慢,偶尔也会不可用

输出范围越窄,DeepInfra 越合适

假设本地服务平台要把收到的消息标为 quotereschedulecancelbillingother,输出空间非常有限。系统可以拒绝 5 个值以外的任何结果,并把模糊案例交给回退路径。这类任务值得评估 $0.019/$0.03 的模型。

回答账户专属问题的客服助手则完全不同。它必须检索正确记录、遵循政策、保留语义细节,还要避免自信地给出错误答案。与 DeepSeek 相比,标准化工作负载只省 $1.71;在没有更强验收结果前,这不足以支持把任务迁移到 Mistral Nemo。

DeepInfra 的服务档位还提供了另一种调节手段。Standard 是 1× 基础费率;Priority 为 1.5×,换取高峰期更快调度;Flex 为 0.8×,代价是响应更慢且偶尔不可用。Flex 适合历史数据回填、离线数据增强或可重试的夜间队列。不要只为从一笔本就以美分计的账单里再省 20%,就让交互式客户响应走 Flex。

任务范围窄且验证器可靠,能够持续兑现小模型的成本优势时,选择 DeepInfra。开放式写作、复杂推理,以及会修改客户或业务数据的操作,不应使用价格表中最便宜的一档。

4. Groq:延迟优先时的低价选择

**交互体验必须即时响应时,Groq 是低成本首选。**其生产级 Llama 3.1 8B Instant 路径标称速度约为每秒 560 Token,每 100 万输入 Token $0.05、输出 Token $0.08。标准化工作负载成本为 $0.66,只比 DeepInfra 的纯单价冠军多 $0.41。

Groq 生产模型的速度、价格与上下文对比表
Groq

代价是模型能力深度和目录稳定性。最便宜的路径只是一款 8B 模型。Groq 将生产就绪模型单独列出,并警告预览模型可能在短时间内下线,因此预览行中的价格不能视为生产承诺。

**最适合:**低延迟分类、自动补全、对话界面和快速首轮路由
**突出优势:**最便宜的生产模型输出速度约为每秒 560 Token
**价格:**Llama 3.1 8B Instant 输入 $0.05/输出 $0.08;GPT OSS 20B $0.075/$0.30
**免费试用:**已核查的文档页面未公开说明试用条款

优势
做得好的地方
7 points

  • Llama 3.1 8B 的标准化工作负载成本为 $0.66
  • Llama 3.1 8B 速度约为每秒 560 Token
  • OpenAI 兼容的基础 URL 和熟悉的 API 形式
  • 生产模型与预览模型划分清晰
  • 成本最低的生产选项只是一款 8B 模型
  • 账户专属速率限制需要在控制台查看
  • 预览模型可能在短时间内发生变动

延迟本身也是产品成本

语音或在线聊天产品会因延迟付出代价:用户可能放弃一轮对话,交互也会显得生硬,即使 API 账单仍然很低。当模型能力足够、真正瓶颈是速度时,Groq 很有竞争力。用它做短文本意图路由,决定由哪个工作流处理消息,比让它回答政策复杂的客服问题更合适。

模型页列出的 Llama 3.1 8B 上下文窗口为 131,072 Token,但能容纳长上下文不等于能正确理解长上下文。模型接受很长的 Prompt,并不能保证会准确利用其中每个相关细节。第一次交给 Groq 的工作负载应保持简短、边界清晰且可机器校验。

Groq 的 GPT OSS 20B 路径将模型规模提升一档,速度约为每秒 1,000 Token,价格为 $0.075/$0.30。其标准化成本为 $1.35,仍低于 DeepSeek 的 $1.96;但仍需用同一评估集决定取舍。价格更低,无法证明它在指令遵循、工具或业务匹配上更优秀。

当响应时间能被用户明显感知,而且小型生产模型能通过任务测试时,选择 Groq。需要高阶推理能力,或工作负载依赖没有稳定生产状态的预览模型时,应跳过。

5. Mistral:最便宜的模型厂商直供小模型方案

**如果希望直接向模型厂商购买,并在多档小模型之间升级,Mistral 的路径最清晰。**Ministral 3B 每 100 万 Token 的输入从 $0.10 起,输出也从 $0.10 起;8B 为 $0.15/$0.15,14B 为 $0.20/$0.20。Mistral Small 4 的价格是 $0.15/$0.60,覆盖更完整的文本、Agent 和多模态产品能力。

Mistral API 模型价格页面
Mistral

低价的 3B 档并不是开放式客户任务的默认推荐。它适合能发挥微型模型优势的工作,例如分类、内容审核预路由或字段格式转换。Mistral Small 4 更像一款可靠的通用应用候选模型,标准化工作负载成本为 $2.70。

**最适合:**直连小模型、偏好模型厂商直供、批量转换和带固定重复 Prompt 的缓存任务
突出优势:$0.10/$0.10 的统一入门价格,以及 Batch 50% 折扣和缓存输入 90% 折扣
**价格:**Ministral 3B $0.10/$0.10;Mistral Small 4 $0.15/$0.60
**免费试用:**主要文本模型未列出通用的免费生产层;少数 Labs 或内容审核端点免费

优势
做得好的地方
7 points

  • 3B、8B、14B 和 Small 各档均采用简单的厂商直供定价
  • 大批量异步任务可享 50% Batch 折扣
  • 重复的固定前缀可享 90% 缓存输入折扣
  • Mistral Small 4 支持文本、Agent 和多模态用途
  • $0.10/$0.10 的醒目价格属于 3B 模型
  • Mistral Small 4 的输出价格是输入的 4 倍
  • 主要文本模型未列出覆盖面广的免费生产层

什么场景能发挥 Mistral 模型阶梯的价值

假设电商平台每晚根据商品标题、属性和描述生成目录标签。任务是异步的,每件商品都遵循固定 Schema,而且人工可以在下一次目录发布前抽查错误。这个工作流可以从 Ministral 3B 或 8B 起步,使用 Batch 节省 50%,并把固定的分类体系指令放在缓存前缀中。

换成聊天助手,经济账就不同了。同一标准化工作负载下,Ministral 3B 需 $1.20,Mistral Small 4 则需 $2.70。多出的 $1.50 换来规模更大、适用范围更广的模型。如果 Small 4 能减少回退和人工审核,即使 Token 单价更高,整个系统反而可能更便宜。

重视模型厂商直供或小模型升级阶梯时,选择 Mistral。任务是开放式的、评估又尚未证明 3B 模型能守住质量底线时,不要被其醒目低价吸引。

6. SiliconFlow:低价多模型新选择

**需要的不只是 8B 路径时,SiliconFlow 是这份候选清单里最便宜的多模型托管平台。**GPT OSS 20B 每 100 万输入 Token 为 $0.04,输出为 $0.18,上下文窗口为 131K。标准化工作负载账单为 $0.76,新账户还可获得 $1 额度。

SiliconFlow Serverless 模型价格页面
SiliconFlow

这里最重要的是分清模型名称。GPT OSS 20B 是开放权重的 20B 模型,并非直接使用 OpenAI 的 GPT-5.6 系列。SiliconFlow 也提供 DeepSeek V4 Flash,输入 $0.13、缓存输入 $0.028、输出 $0.28,因此账户不变也能升级到能力更强的路径。

**最适合:**希望在一个服务商账户下使用多款开放模型的成本敏感型开发者
**突出优势:**GPT OSS 20B 价格 $0.04/$0.18,并赠送 $1 初始额度
**价格:**GPT OSS 20B 输入 $0.04/输出 $0.18;DeepSeek V4 Flash $0.13/$0.28
免费试用:$1 免费额度,无最低承诺

优势
做得好的地方
7 points

  • GPT OSS 20B 的标准化工作负载成本为 $0.76
  • 按标价计算,$1 额度足以覆盖一次完整的标准化测试工作负载
  • 公开价格页不设最低承诺
  • 低成本路径覆盖 DeepSeek、Qwen、MiniMax、GPT OSS 等开放模型
  • 最低价格属于开放权重模型,并非专有前沿 API
  • 选择模型后,质量评估责任仍在买方
  • 较新的多模型托管平台可能需要额外采购与可靠性审查

如何用好 $1 评估预算

SiliconFlow 的初始额度很具体。GPT OSS 20B 的标准化工作负载需 $0.76,因此在产生重试或调用其他模型前,$1 额度足以完成一次按价格统一口径的测试。这不等于免费用一个月生产服务,而是让开发者无需预先充值更大金额,就能测量输出格式、延迟和 Token 计费。

对于后台摘要队列,可以先用 GPT OSS 20B,再把失败或低置信度案例交给同一平台的 DeepSeek V4 Flash。这个阶梯的价格清晰:便宜路径为 $0.04/$0.18,DeepSeek 为 $0.13/$0.28。应用仍要记录每次回答所用模型,因为只看混合账单而没有模型级通过率数据,无法判断便宜档是否真正创造了价值。

希望一个低成本托管平台和广泛的开放模型目录能简化评估时,选择 SiliconFlow。如果采购方必须直接与模型开发商签约,或现有网关已能以可接受的总成本提供相同模型,则应跳过。

7. OpenRouter:频繁切换模型的最低成本路径

**如果模型切换的价值足以覆盖一笔不高的计费手续费,OpenRouter 是最合适的经济型网关。**它不加价地传递服务商推理价格,提供免费模型变体,并用一个 API 密钥接入多家服务商。DeepSeek V4 Flash Latest 的标价为输入 $0.08、输出 $0.252;购买额度的手续费另算前,标准化模型用量为 $1.304。

OpenRouter 模型目录与实时 Token 价格
OpenRouter

真正的限制是充值方式。购买额度时,OpenRouter 收取 5.5% 手续费,最低 $0.80。因为 $0.80 除以 5.5% 等于 $14.5455,所以充值约 $14.55 后,最低收费才不再生效。充值 $10 的手续费仍是 $0.80,相当于 8%,而不是 5.5%。

**最适合:**对比模型、保留回退路径,以及无需改写应用就能更换服务商
**突出优势:**底层服务商的推理价格原价传递,不加价
**价格:**免费模型为 $0;付费模型各不相同;DeepSeek V4 Flash Latest 在充值手续费前为 $0.08/$0.252
**免费试用:**新用户少量额度,加上每日上限较低的免费模型

优势
做得好的地方
8 points

  • 一个 API 密钥接入多个服务商和模型
  • 不对底层推理费加价
  • 提供用于评估的免费模型
  • 每月前 1M 次 BYOK 请求免费
  • 购买额度收取 5.5% 手续费,最低 $0.80
  • 终身累计购买 $10 额度前,免费模型每天仅限 50 次请求;之后每天 1,000 次
  • 付费额度闲置 1 年后到期
  • 可靠性方案必须同时考虑网关故障与上游服务商故障

网关费什么时候值得付

开发者想同时测试 DeepSeek、Gemini 和开放模型时,花在独立鉴权、计费、重试行为和响应格式上的工程时间,可能比推理本身更多。OpenRouter 把模型切换变成一项路由配置。如果这种便利能让回退路径随时可用,或让团队快速替换表现不佳的路径,手续费就有合理回报。

小额充值会扭曲经济账。充值 $10 时,最低 $0.80 手续费相当于 8%;充值 $100 时,5.5% 为 $5.50,费率才符合标称比例。小型原型要么接受最低手续费作为便利成本,要么直接使用服务商的免费层。对比 OpenRouter 与直连模型费率时,不能漏掉充值手续费。

BYOK 路径采用另一套规则。每月使用自有服务商密钥的前 1M 次请求免费,之后 OpenRouter 收取该模型/服务商路径在 OpenRouter 上对应成本的 5%。BYOK 可以在集中管理路由的同时保留服务商直连限额,但仍需监控两套计费面与故障面。

当统一集成与快速切换值得支付手续费时,选择 OpenRouter。如果产品只使用一家稳定服务商,直连 API 已满足可用性要求,额外网关又没有运营价值,则应跳过。

8. OpenAI:主流生态内成本最低的迁移路径

**OpenAI 不是 Token 单价冠军,但对已经围绕 OpenAI 构建的产品来说,GPT-5.6 Luna 可能是风险最低的低成本选择。**Standard 下,Luna 每 100 万短上下文输入 Token 为 $0.20,缓存输入为 $0.02,输出为 $1.20。Batch 和 Flex 将输入输出费率减半至 $0.10/$0.60,使标准化工作负载从 $4.40 降到 $2.20。

GPT-5.6 Luna 的 OpenAI API 价格表
OpenAI

迁移成本并不一定出现在 API 账单上。现有 Schema、Prompt、内容审核规则、工具、链路追踪、回退行为和工作负载评估,足以让每月 $2.44 的 Token 差价变得微不足道。如果产品当前的 OpenAI 路径已通过各项检查,更换服务商前应先评估 Luna、缓存与 Batch/Flex。

**最适合:**现有 OpenAI 产品、主流开发者工具链、带固定 Prompt 的缓存任务和异步批处理
**突出优势:**GPT-5.6 Luna 是当前低成本 OpenAI 模型,并提供 50% 的 Batch/Flex 费率
**价格:**Standard 输入 $0.20/缓存输入 $0.02/输出 $1.20;Batch/Flex $0.10/$0.01/$0.60
**免费试用:**未列出长期免费 API 层

优势
做得好的地方
8 points

  • Batch 或 Flex 的标准化成本为 $2.20
  • 缓存输入价格仅为标准输入的 1/10
  • 现有 OpenAI 应用无需迁移服务商,就能评估更便宜的模型
  • Standard、Batch、Flex 和长上下文分别采用清晰费率
  • Standard 输出价格是输入的 6 倍
  • Standard 标准化成本为 $4.40,是本文已排名路径中最高的一项
  • 符合条件的区域处理加价 10%
  • Luna 长上下文采用更高的 $0.40 输入和 $1.80 输出费率

迁移前,先在 OpenAI 内部优化

GPT-5.6 路由评测进一步分析了 Luna、Terra 和 Sol 分别适合什么场景。就这次成本决策而言,第一步更简单:把短小、可重复的任务放到 Luna;缓存固定前缀;非紧急任务使用 Batch 或 Flex;保留当前更强的模型作为回退。

对于 1000 万输入和 200 万输出 Token,Luna Standard 需 $4.40,Batch 或 Flex 需 $2.20,DeepSeek V4 Flash 需 $1.96。优化后的 OpenAI 与直连 DeepSeek 在标准化工作负载上的差距只有 $0.24,仅凭这点差价不足以支持一次服务商迁移。

长上下文与区域设置可能改变结果。Luna 长上下文的 Standard 价格为输入 $0.40、输出 $1.80,符合条件的区域处理另加 10%。应使用与具体请求和处理选项匹配的费率,而不是把短上下文标价套到每个 Token 上。

产品已经在 OpenAI 上稳定运行、重视与主流厂商直连,或 Batch/Flex 已消除大部分价差时,继续选择 OpenAI。可重试的离线任务若符合半价路径条件,则不应使用 Standard。

不同场景该选哪一个

**先按失败后果选择路径,再从能通过测试的模型中挑最便宜的一档。**只要守住这条原则,就能避开大多数虚假节省。

从免费测试、低风险生产流量和主流工作负载,分别导向 Gemini、DeepSeek 与 OpenAI 的决策流程
工作负载的失败后果,决定了最先评估哪一档价格才安全。

**使用脱敏数据的免费原型,选择 Gemini 2.5 Flash-Lite。**它提供最直接的零成本起点,也能顺畅迁移到 $0.10/$0.40 的 Paid Standard。Free 与 Paid 的内容使用条款不同,因此客户数据和机密数据不得进入 Free。

**低风险在线生产任务,先试 DeepSeek V4 Flash。**JSON、工具调用、1M 上下文和 $1.96 的标准化成本,使它成为综合最佳候选。服务商已披露即将涨价,所以必须保留价格缓冲和回退路径。

**范围窄、调用量大的标签任务,先评估 DeepInfra。**只有在允许输出受限、失败又易于检测的场景中,$0.25 的标准化成本才有意义。任务一旦转向开放式,就应立即升级。

**用户能直接感知延迟时,评估 Groq。**Llama 3.1 8B 路径速度为每秒 560 Token,价格 $0.05/$0.08,可以让界面感觉更流畅。应把它作为配有更强回退模型的快车道,而不是自动替换所有模型。

**离线队列应对比 Gemini Batch/Flex、Mistral Batch 和 OpenAI Batch/Flex。**三者均公布了 50% 折扣。最终选择哪个服务商,取决于谁的模型能通过队列任务验收,而不是谁的未折扣 Standard 单价最低。

**需要方便切换时,选择 OpenRouter。**特别是当产品需要回退、模型又频繁变动时,网关手续费可能比维护多套集成更便宜。若只依赖一家稳定服务商,直连计费更简单。

**现有 OpenAI 应用先试 Luna,再考虑迁移。**Batch/Flex 将标准化成本降到 $2.20,只比 DeepSeek 高 $0.24。已有评估体系和运营流程的价值,很容易超过这点差价。

一旦低价路径跌破工作负载的验收门槛,结论就会反转。只要 Schema 有效率、答案通过率、延迟、隐私条款和恢复能力均符合要求,就保留便宜模型;其中任何一项失守,就升级一档。不要为了省几美分,不断给弱模型叠加 Prompt 补丁。

开发者向客户提供 API 驱动的体验时,还必须负责鉴权、计费、审核和失败处理。v0 API 构建指南解释了为什么底层模型或 Agent 只是完整产品的一层。

这些 AI API 是怎么选出来的

**这份排名奖励的是成本最低且可靠的采购决策,而不是孤立的最低输入单价。**每家服务商的价格与分析均于 2026 年 8 月 10 日对照其实时官方页面完成。本文没有订阅这些 API,也没有把它们描述成已经投入生产实测的服务。

评选采用以下标准:

  • **有效入门价格:**当前在售的具体模型,其输入与输出费率
  • **质量底线:**该模型档位是否适合范围受限的任务,或更广泛的生产工作流
  • **运营能力:**JSON、工具、上下文、批处理、缓存、速率限制与回退影响
  • **隐私与合同影响:**免费数据如何处理、价格是否稳定,以及是否另收网关费
  • **切换成本:**迁移 Prompt、Schema、评估集、监控和计费所需的工作

共有 8 家服务商入选,因为每一家都对应一种清晰而独特的购买决策。如果某家的最低价生产文本路径远高于这里的价格带、无法按 Token 统一折算,或与其他选项角色重复却没有更明确优势,就会被排除。图片、视频、语音和 Embedding 等专用 API 也未纳入,因为它们的计费单位无法与文本输入输出 Token 直接比较。

成本计算是基于一个明确工作负载做出的原创分析,不是 Benchmark。只有用自己的代表性请求、验证器和审核流程测试,才能得到业务真正的单次合格输出成本。

这些用法应该避开

把 OpenRouter 免费模型当作生产依赖

不要让 OpenRouter 免费模型成为在线客户流量背后的唯一路径。账户累计购买至少 $10 额度前,每天只有 50 次免费模型请求;之后为每天 1,000 次。这是评估额度,不是可靠的容量方案。

用 Gemini Free 处理客户或机密数据

不要通过 Gemini Free 发送敏感内容。Google 表示 Free 层内容会用于改进其产品,Paid 层内容则不会。标准化工作负载的 Paid Standard 账单只有 $1.80,不值得为了这点金额突破隐私边界。

让 DeepInfra Mistral Nemo 承担开放式客户任务

不要把 $0.019/$0.03 的路径直接用于开放式客服、法律解读或自主操作。这个费率属于小模型。它应服务于受约束且可验证的任务,并保留更强的回退模型;只有验收数据足够好,才能扩大范围。

使用 DeepSeek 却没有应对涨价的回退方案

不要把 $0.14/$0.28 当成固定年费率。DeepSeek 已表示价格将显著上涨。它仍可能是当前最佳默认方案,但预算和架构都必须准备第二条路径。

用 OpenAI Standard 处理可重试的离线任务

可以等待的任务,不要支付 Luna 的 $0.20/$1.20 Standard 费率。Batch 和 Flex 为 $0.10/$0.60,无需更换服务商,就能把标准化成本从 $4.40 降到 $2.20。

下周一就做这件事

**下周只迁移一种边界清晰的任务,不要搬走整个应用。**100 条请求的评估足以在生产流量接入前暴露明显的 Schema、延迟和路由故障,但它不能替代持续监控。

  1. 抽取 100 条代表性请求

    只选一种任务,样本覆盖正常、困难、有歧义和格式错误的输入。使用任何免费层前,先移除个人、机密和客户数据。

  2. 运行 3 条路径

    对比当前服务商、DeepSeek V4 Flash 和 Gemini 2.5 Flash-Lite。只有当纯价格或延迟是明确目标时,再加入 DeepInfra 或 Groq。

  3. 记录 4 项结果

    记录 Schema 有效率、答案通过率、端到端延迟,以及精确的输入/输出 Token 成本。人工审核时间应作为单独的运营指标。

  4. 只路由一个胜出的任务类型

    仅把测试通过且边界清晰的任务交给更便宜的服务商。校验失败、输入有歧义及后果较重的操作,继续走原有路径。

  5. 服务商每次变更都重新计价

    保存公式与工作负载假设。DeepSeek 涨价、模型弃用,或免费层与网关限额变化时,都要重新计算。

这一步能把一张费率清单变成可逆的预算决策,也会产出公开价格表无法给出的关键数字:业务自己的单次合格结果成本。

常见问题

哪家的 AI API 最便宜?

在本次对比中,DeepInfra 的纯文本生成价格最低:Mistral Nemo 每 100 万输入 Token $0.019、输出 Token $0.03。如果工作负载需要 JSON、工具和长上下文,DeepSeek V4 Flash 才是更合适的低成本生产默认方案。

有免费的 AI API 吗?

有。Google Gemini 的 Free 层提供免费输入和输出 Token,OpenRouter 也提供免费模型。Gemini Free 可能使用内容改进 Google 产品;OpenRouter 免费模型每天限 50 次请求,终身累计购买至少 $10 额度后提升到每天 1,000 次。

AI API 价格一般是多少?

以每月 20,000 次调用、合计 10M 输入和 2M 输出 Token 计算,本文路径从 DeepInfra Mistral Nemo 的 $0.25,到 OpenAI GPT-5.6 Luna Standard 的 $4.40。Batch、Flex、缓存、网关费、重试,以及最终能通过质量底线的模型,都会改变实际账单。

ChatGPT API 多少钱?

ChatGPT 订阅与 OpenAI API 分开计费。本文对比的低成本 OpenAI 模型是 GPT-5.6 Luna:短上下文 Standard 每 100 万输入 Token $0.20、输出 $1.20;通过 Batch 或 Flex 则为 $0.10/$0.60。

下载 AI 业务工作流审计清单,用 1 周时间把这套成本阶梯转化为可执行的服务商评估。

最近更新

2026年9月3日

分类Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Build 文章

查看全部 Build 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。