Groq API 价格全解析(2026):升级门槛不在 Token 成本,而在吞吐量
2026年8月核验的 Groq API 价格指南:覆盖 Free 与 Developer 限额、全部生产模型费率、Batch 和缓存规则、Compound 工具隐性成本,并用 GPT-OSS 120B 负载算清何时升级,以及 Groq、Together AI、Fireworks AI 的同模型成本差异。

Groq API 价格从 $0 起:只要各模型的 Free 限额还没卡住工作流,就无需付费;一旦超限,Developer 不收订阅费,只按用量计费。以本文测算的 GPT-OSS 120B 负载为例,Free 每日 Token 上限对应的付费流量每月仅 $1.44——真正迫使你升级的是吞吐量,而不是 Token 成本。
Groq API 价格速览
Groq 没有需要记住的自助式月度席位价。用户要在三种方案中选择:受速率限制的 Free、按量付费的 Developer,以及容量定制的 Enterprise。
以下价格和限额已于 2026年8月15日对照 Groq 实时价格页、Supported Models、Billing FAQs和速率限制文档逐项核验。

Token 是模型的计费单位。输入 Token 包括发给模型的指令、对话历史、文档和工具定义;输出 Token 则是模型生成的内容。Groq 分别按每百万 Token 报出输入和输出价格,因此月度成本是输入、输出、音频及所有内置工具用量之和。
Developer 没有月度或年度订阅承诺。Groq 要求绑定付款方式,按实际用量计量,通常采用后付费账单。它也没有单独的超额费率:Free 会在触及相应限额后拦截超额流量,Developer 则继续按同一模型费率计费,直到账号限制或 Spend Limit 将其拦截。Enterprise Performance 的机制不同:买方购买的是预置的输入和输出容量,而不是按公开的 On Demand Token 费率付费。
Groq 免费套餐:共享限额一旦影响生产,就该升级
Groq 的 Free 套餐足以支撑原型、内部助手,以及相当数量的低流量自动化任务。但只要速率限制错误会直接影响客户,它就不再适合作为免费的生产基础设施。
限额按组织计算,而不是按 API Key 分配。多建几个 Key 并不会增加容量。Groq 还会同时执行多维限制:每分钟请求数、每日请求数、每分钟 Token 数和每日 Token 数。最先触及的上限会让下一次调用收到 HTTP 429。
目前生产级文本模型公布的 Free 限额包括:
- **GPT-OSS 120B 和 GPT-OSS 20B:**30 RPM、1,000 RPD、8,000 TPM,以及 200,000 TPD。
- **Llama 3.3 70B Versatile:**30 RPM、1,000 RPD、12,000 TPM,以及 100,000 TPD。
- **Llama 3.1 8B Instant:**30 RPM、14,400 RPD、6,000 TPM,以及 500,000 TPD。
- **Compound 和 Compound Mini:**30 RPM、250 RPD,以及 70,000 TPM。
- **Whisper Large V3 和 Turbo:**20 RPM、2,000 RPD、每小时 7,200 音频秒,以及每日 28,800 音频秒。
Groq 将公开表格定位为高层概览。每个组织当前真正适用的额度,应以 Console 内的 Limits 页面为准。
每日 Token 上限往往比请求次数更早触发。假设一次 GPT-OSS 120B 请求包含 2,000 个输入 Token 和 500 个输出 Token,总计 2,500 个 Token;在 200,000 TPD 的限制下,每天最多可发出 80 次此类请求。8,000 TPM 则只容得下同一分钟内的 3 次;第 4 次同等规模的请求会越过 Token 上限,即使套餐标称为 30 RPM。
这正是从免费转向付费的分界点。同一请求在 Developer 上只需 $0.0006;每天 80 次、连续 30 天,月成本约为 $1.44。为了 Free 上限而扭曲生产工作流,在财务上几乎没有意义。升级购买的是容量,而此时模型账单甚至低于大多数 SaaS 附加项。

哪些人始终不必付费
如果 Groq 只用于本地开发、偶尔评估、个人内部脚本,或流量始终低于相应 Token 与请求上限的演示项目,可能永远都不需要 Developer。只要 429 错误可以排队重试,且没有人被承诺持续服务,Free 同样合理。
当工作流面对真实用户、有明确截止时间,或队列无法承受共享上限时,就该付费。Developer 还提供 Batch、Flex、聊天支持和 Spend Limits。真正划开产品边界的是这些运营控制,而不是另一套模型目录。
Groq 模型价格完整清单
Groq 当前的生产目录很精简:四个文本模型、两个语音转文本模型,以及两个 Compound 系统。另有一套独立的预览目录,其中的模型可能在很短时间内下线。
生产级文本模型
- **Llama 3.1 8B Instant 的每百万 Token 输入价格为 $0.05,输出为 $0.08。**这是最便宜的生产级文本路径。Developer 基础额度为 250,000 TPM 和 1,000 RPM,上下文窗口为 131,072 Token。
- **GPT-OSS 20B 的每百万 Token 输入价格为 $0.075,输出为 $0.30。**缓存输入为每百万 Token $0.0375。Developer 基础额度为 250,000 TPM 和 1,000 RPM,上下文窗口为 131,072 Token。
- **GPT-OSS 120B 的每百万 Token 输入价格为 $0.15,输出为 $0.60。**缓存输入为每百万 Token $0.075。Developer 基础额度为 250,000 TPM 和 1,000 RPM,上下文窗口为 131,072 Token。
- **Llama 3.3 70B Versatile 的每百万 Token 输入价格为 $0.59,输出为 $0.79。**Developer 基础额度为 300,000 TPM 和 1,000 RPM,上下文窗口为 131,072 Token。
如果项目需要更大的开放权重模型,同时又在意同模型的供应商备选路线,可以从 GPT-OSS 120B 开始生产评估。只有验收测试证明小模型不会损害结果质量时,才下调到 GPT-OSS 20B 或 Llama 3.1 8B。只有当 Llama 3.3 70B 的输出价值足以覆盖其相对 GPT-OSS 120B 高出 3.93 倍的输入费率和 1.32 倍的输出费率时,才值得切换。
这些倍数无法证明哪个模型更好。它们只是划定了结果必须如何收回溢价:减少重试、缩短回答、降低人工审核成本,或提供便宜路线所不具备的能力。
语音转文本模型
- **Whisper Large V3 每音频小时收费 $0.111。**Developer 基础容量为每小时 200,000 音频秒和 300 RPM,单个文件最大 100 MB。
- **Whisper Large V3 Turbo 每音频小时收费 $0.04。**Developer 基础容量为每小时 400,000 音频秒和 400 RPM。
处理 1,000 音频小时时,Whisper Large V3 的项目成本为 $111,Turbo 为 $40,相差 $71。低价模型应是默认起点,但音频团队最终应保留能通过转写验收标准的那一个。需要返工修正的便宜转写,并不等于更便宜的最终结果。
Compound 系统与预览模型
Groq Compound 和 Compound Mini 将生产模型与服务端工具组合起来,并不适用单一固定的 Token 费率。Groq 会把底层模型费和工具费传递给用户,因此 Compound 账单需要拆分成本栈,不能只用一个每 Token 估价。
实时预览目录目前列出:
- **Qwen3.6 27B:**每百万 Token 输入 $0.60,输出 $3.00。
- **Safety GPT-OSS 20B:**每百万 Token 输入 $0.075,输出 $0.30。
- **Llama Prompt Guard 2 22M:**每百万 Token 输入和输出均为 $0.03。
- **Llama Prompt Guard 2 86M:**每百万 Token 输入和输出均为 $0.04。
- **Canopy Labs Orpheus V1 English:**每百万字符 $22。
- **Canopy Labs Orpheus Arabic Saudi:**每百万字符 $40。
- **MiniMax M2.7:**Enterprise 价格需咨询销售。
预览意味着用于评估,而不是生产承诺。Groq 明确表示,这些模型可能在很短时间内停止提供。因此,依赖 Qwen3.6 27B 的预算在产品触达客户前,还必须准备并测试好切换到其他供应商或模型的路线。
Groq 当前的 Supported Models 页面没有列出 DeepSeek 或 Kimi 模型。仍把这些名称计作 Groq 可用路线的旧文章与计算器已经过时。如果必须使用 DeepSeek,应通过当前仍提供它的供应商估价,而不是默认 Groq 目录里还有;另见独立的 DeepSeek 价格分析。
按结果计算成本,才能选对模型
Groq 的 Token 费率很低,因此在用量足够大之前,流量形态往往比模型选择更影响成本。清晰的比较方法,是固定一种请求,再逐一计算各条路线。
以一次包含 2,000 个输入 Token 和 500 个输出 Token 的标准请求为例。每月 100,000 次请求,在不计缓存、Batch、工具和重试时:
- **Llama 3.1 8B Instant:**总计 $14,即每次请求 $0.00014。
- **GPT-OSS 20B:**总计 $30,即每次请求 $0.0003。
- **GPT-OSS 120B:**总计 $60,即每次请求 $0.0006。
- **Llama 3.3 70B Versatile:**总计 $157.50,即每次请求 $0.001575。
- **Qwen3.6 27B preview:**总计 $270,即每次请求 $0.0027。
真正有用的分母不是“请求”,而是“通过验收的结果”。如果小模型需要重试、输出更长,或把更多工作推给人工审核,那么便宜的请求反而可能构成昂贵的工作流。应将通过验收的结果与 Token 一起跟踪,让模型靠实际产出证明价值,而不是仅凭标价胜出。
不存在某个付费用量临界点,能让一种 Groq 模型自动变得比另一种更便宜。所有公开 On Demand 费率都是线性的,也没有基础费用。无论请求一次还是一百万次,GPT-OSS 20B 的测算成本都始终是 GPT-OSS 120B 的一半。只有当结果质量或运行表现改变完成任务所需的工作量时,选择才会翻转。
对有融资的创始人而言,可以让 GPT-OSS 20B 做分类,让 GPT-OSS 120B 处理模糊案例。对中型企业 CTO 而言,应在每条请求日志中保留模型和 Token 字段,让采购团队看见每个通过验收工作流的成本。对资深运营负责人而言,要衡量修正和重试,而不能把一次成功演示当成生产路线已经成立的证据。
异步任务用 Batch 比缓存更省,但两种折扣不能叠加
结果可以等待时,Groq Batch 提供目前公开的最低费率。它比同步 API 价格低 50%,在标准的按模型限额之外运行,并允许选择 24 小时到 7 天的处理窗口。
对 100,000 次请求的 GPT-OSS 120B 测算负载,各方案成本为:
- 同步且无缓存:$60。
- 同步,50% 的输入 Token 命中缓存:$52.50。
- 同步,80% 的输入 Token 命中缓存:$48。
- Batch:$30。
当前最影响预算的一条规则非常明确:**Batch 与 Prompt Caching 折扣不能叠加。**无论是否命中缓存,所有 Batch Token 都按 50% 的 Batch 费率计费。如果表格把 $30 的 Batch 总额再减半算成 $15,结果就是错的。
Prompt Caching 对同步 GPT-OSS 流量仍然有用。它自动启用,不收单独的功能费,并将缓存输入价格降低 50%。目前支持 GPT-OSS 20B、GPT-OSS 120B 和 GPT-OSS Safeguard 20B。缓存命中要求前缀完全一致;可缓存前缀的最小长度因模型而异,范围为 128 到 1,024 Token;未使用的缓存数据会在两小时后过期。命中仅为尽力而为,并不保证发生。
将稳定的系统指令和工具定义放在 Prompt 开头,把可变的用户数据放在后面,然后从响应中读取缓存 Token 用量。在生产数据实际呈现之前,预测的缓存命中率不能当作预算事实。
Batch 还存在不同的运营边界。一个 JSONL 文件最多可含 50,000 行,最大 200 MB。未能在所选处理窗口内完成的任务会过期,不过 Groq 只对成功完成的请求收费。Batch 文件和结果可在 Groq 系统中保留最长 30 天,因此敏感工作负载应先审核数据保留要求,再让成本节省决定路线。
$60 的 Token 如何变成 $560 的 Compound 账单
Compound 的隐性成本不在模型,而在工具循环。
Groq 对 Basic Search 的定价是每 1,000 次请求 $5,Advanced Search 为 $8,Visit Website 为 $1,Code Execution 则是每小时 $0.18。这些费用都叠加在底层模型 Token 成本之上。
仍以 100,000 次标准 GPT-OSS 120B 请求为例,模型 Token 成本为 $60。若每次请求都调用一次 Basic Search,搜索费用会增加 $500,总账单达到 $560;若每次请求都调用一次 Advanced Search,总额为 $860;若每次请求都调用一次 Visit Website,总额为 $160。

对智能体团队而言,这一项最容易造成预算意外。若智能体每轮都搜索,再怎么优化 Token 也救不了这个工作流。第一道控制应是工具策略:明确何时必须搜索,限制工具循环次数,在模型外缓存可长期复用的结果,并记录每个通过验收结果对应的工具调用数。
付费没有年度锁定,但有几处运营边界
Developer 按用量计费,并不是换了名字的年度 SaaS 合同。更容易被忽略的条款,是扣款时间、限额如何生效,以及余额如何处理。
新的 Developer 账号采用阶梯式计费。累计终身用量依次达到 $1、$10、$100、$500 和 $1,000 时,Groq 可以开具账单;跨过 $1,000 门槛后,再转为常规月度账单。账单地址在印度的账号采用 $1、$10 两个门槛,之后每累计 $100 循环扣费。用量未达到至少 $0.50 时,Groq 不要求付款。
这套安排可能让采用初期出现多笔小额银行卡扣款。它们不是附加费,但财务团队应提前了解这一规律,以免将其误判为重复扣款。
Spend Limits 会拦截流量,但用量上报存在短暂延迟
付费套餐可设置一个覆盖全组织的月度 Spend Limit。它适用于所有 API Key 和端点,每月首日重置;系统检测到触及上限后,会拦截新请求。Groq 支持在预算上限的 50%、75% 和 90% 等节点发出提醒。
费用跟踪会延迟 10 到 15 分钟更新。因此,流量突发可能在拦截开始前,让最终账单略微超过设定金额。Groq 建议初始上限比预计月用量高 20% 到 30%。对于关键路径,这一缓冲也能降低正常流量尖峰把预算控制变成服务中断的风险。
Service Credits 会过期,预付购买不可退款
Groq Service Credits 自购买或发放之日起一年后过期,除非另有期限说明。它们不可转让、不可兑换现金且不可退款;关闭账号会让余额立即失效。
Groq 的 Billing FAQ 说明,一般退款请求由支持团队逐案处理。但这不会取代更具体的 Service Credit 条款:无论购买还是赠送的 Credits,余额一经发放即为最终交易。购买额度应对应实际预测,而不是一个模糊的未来迁移计划。
Flex 用容量保证换取更高上限
Flex 面向付费客户开放,Token 价格与 On Demand 相同,速率上限则是 On Demand 的 10 倍。代价是容量仅按尽力而为(best-effort)模式提供。Flex 满载时,可能迅速返回 HTTP 498 和 capacity_exceeded。
Flex 适合可重试队列、评估和能够承受快速失败的批量任务。不要把它作为不可重复客户操作的唯一通道。On Demand 的速度更可预测,但高峰期可能增加排队延迟。当这种波动不可接受时,Enterprise Performance 才是提供合同保障的选项:Enterprise 协议包含 99.9% 可用性 SLA 和 99% 延迟保证。
未缓存 GPT-OSS 120B:Groq、Together AI 与 Fireworks AI 同价
仅看公开 Token 价格,Groq 并没有在 GPT-OSS 120B 上胜出。Groq、Together AI 和 Fireworks AI 对同一模型的标价均为每百万 Token 输入 $0.15、输出 $0.60。
统一按 1亿个输入 Token 和 2,000万个输出 Token 计算。在没有缓存折扣时,各家供应商的成本均为 $27。这个平局很有价值,因为它迫使决策者转而比较缓存经济性、速率限制、部署选项、可靠性和实测延迟。
Together AI
Together AI 是一家多模型推理服务商,其 Serverless GPT-OSS 120B 路线的价格为每百万 Token 输入 $0.15、输出 $0.60。Serverless 产品没有最低消费或预置费用。

Together 当前的 GPT-OSS 120B 价格行没有公布缓存输入费率。其文档说明,未设置缓存价格的模型会对所有输入按标准费率计费。因此,即使提示词重复,上述统一负载的总额仍是 $27。对于受支持的 Serverless 模型,Together 的 Batch 价格最高可比标准价低 50%;当该具体模型符合条件时,它仍适合异步任务。
如果更广的模型目录,或从 Serverless 迁移到预留基础设施的路径,比 Groq 特有的运行表现更重要,可以选择 Together。在实际工作负载暴露差异前,不要仅凭价格在两者之间迁移,因为未缓存的 GPT-OSS 项目完全同价。
Fireworks AI
Fireworks AI 列出的 GPT-OSS 120B 费率为每百万 Token 输入 $0.15、缓存输入 $0.014、输出 $0.60,并提供 $1 的 Serverless 注册额度。

当 50% 的输入命中缓存时,同一标准负载在 Fireworks 上总计 $20.20,在 Groq 上为 $23.25,在 Together 上为 $27。只要其公开缓存费率确实适用于实测工作负载,Fireworks 就是重复输入较多的 GPT-OSS 120B 场景中的公开价格赢家。异步任务仍由 Groq Batch 更低,同一标准流量只需 $13.50。
GPT-OSS 由 OpenAI 开发,但 OpenAI API 及其消费者应用均不提供该模型。直接与 OpenAI API 比较会同时更换供应商和模型,破坏价格归一化。应先比较同一模型在不同托管供应商上的表现,再按通过验收的结果评估其他专有模型。更广泛的模型与供应商选择,可参考最便宜 AI API 清单。
供应商选择可以归纳为:
- **选择 Groq:**实测路线中,同步吞吐量与运营控制更优,或 50% 的 Batch 费率让延迟任务成本最低。
- **选择 Fireworks:**重复的 GPT-OSS 上下文能够稳定获得公开的 $0.014 缓存输入费率。
- **选择 Together:**更广的 Serverless 到 Dedicated 路线更重要,且工作负载无法受益于 GPT-OSS 缓存费率。
谁适合选择 Groq,谁应该跳过
如果开放模型已经达到质量门槛,且响应速度会影响产品体验,Groq 是很强的选择。若模型需求、容量保证或部署控制超出当前自助目录,它的吸引力就会下降。
- Free 套餐足以在添加付款方式前评估生产模型。
- Developer 没有基础订阅费,也没有年度锁定。
- 所有生产级文本模型的公开 On Demand 费率均低于每百万 Token $1。
- Batch 将符合条件的异步任务成本降低 50%,且不占用标准模型限额。
- GPT-OSS 的 Prompt Caching 自动启用,并将缓存输入费率减半。
- Spend Limits 可在月度预算失控前,拦截整个组织的用量。
- Free 限额按组织共享,Token 上限可能远早于请求次数上限触发。
- Batch 和缓存折扣不能叠加。
- Compound 工具费可能大幅超过模型 Token 成本。
- Prompt Caching 仅支持列出的 GPT-OSS 系列,并依赖完全一致的前缀复用。
- 尽力而为(best-effort)容量不足时,Flex 可能返回 HTTP 498。
- 预览模型可能在很短时间内被移除,不能让生产系统形成无法迁移的依赖。
有融资的创始人应在快速开放模型既能保持产品响应,又能保留同模型备选路线时选择 Groq。中型企业 CTO 应先集中管理 Key、记录模型与工具用量,并设置组织预算上限,再启用 Developer。资深运营负责人应关注每个通过验收结果的成本,而不是被“每美元可买多少 Token”的醒目标题吸引。
如果应用必须使用其目录中没有的专有模型、要求尽力而为路线也具备容量保证,或依赖没有稳定替代品的预览模型,就不应把 Groq 当作唯一供应商。Enterprise Performance 可以为受支持的模型提供合同容量,但它采用定制预置定价,并不是更便宜的公开套餐。
明确的决策规则是:**只有当当前生产模型通过验收测试,且同步运行表现或 Batch 成本优于同模型备选供应商时,才选择 Groq。**若两项都不成立,低 Token 费率不足以成为迁移理由。
Groq 价格历史说明:预算必须按实时数据核验
即使按量付费的计费结构不变,Groq 的功能和模型级价格也会调整。Developer 于 2025年2月上线时,宣传的 Batch 折扣是同步价格的 25%;当前 Batch 文档给出的折扣已是 50%。
Groq 还在 2025年10月下调 GPT-OSS 价格,并开始为该系列加入 Prompt Caching。目前 GPT-OSS 120B 的费率为 $0.15/$0.60,GPT-OSS 20B 为 $0.075/$0.30,缓存输入价格均为标准输入费率的一半。
目录变动与价格历史同样重要。旧版价格文章曾列出的 Kimi、DeepSeek 等路线,已不在当前 Supported Models 页面中。预算应记录核验日期、模型 ID 和备选路线,不能把复制来的价格当作永久不变。
周一就做:给一个通过验收的工作流定价并设上限
周一选取一个边界清晰的工作流,做出一份工程和财务都能检查的预算。不要从全供应商迁移开始。
记录流量形态
导出具有代表性的一周数据:请求数、输入 Token、输出 Token、缓存命中 Token、模型 ID、工具调用、重试次数,以及通过验收的结果数。将同步流量与可以等待的任务分开。
计算三条路线
按实时模型费率计算 On Demand;对符合条件的延迟任务按 50% 计算 Batch;工具则单列成本。不要给 Batch 再套用缓存折扣,也不要假设一个尚未被用量字段验证的缓存命中率。
划定付费边界
如果 Free 限额打断了路线,就迁移到 Developer。将月度 Spend Limit 设在预测值上方 20% 到 30%,并在 50%、75% 和 90% 处设置提醒。为 10 到 15 分钟的上报延迟留出空间。
保持一条可用的备选路线
通过另一家供应商,用同一模型运行一个小型评估集。记录端点、实测验收率和切换触发条件,避免目录变化或容量错误演变成紧急迁移。
最终应得到每个通过验收工作流对应的一组预算项:模型 Token、工具、重试和人工审核。实时模型目录、速率限制或价格页发生变化时,重新测算。
常见问题
Groq AI 要多少钱?
Groq Free 的价格是 $0。Developer 不收基础订阅费,按不同模型的实际用量计费。目前生产级文本模型的价格区间为:Llama 3.1 8B Instant 每百万 Token 输入 $0.05、输出 $0.08;Llama 3.3 70B Versatile 输入 $0.59、输出 $0.79。
Groq 可以免费使用吗?
可以,但必须遵守各模型的组织级限额。GPT-OSS 120B 和 20B 当前在 Free 上均为 30 RPM、1,000 RPD、8,000 TPM,以及 200,000 TPD。超过任一适用限额会返回 HTTP 429。
哪些 Groq AI 模型可以免费使用?
Free 套餐在各模型规定的上限内开放受支持目录。需要可持续的评估时,应使用生产模型。Groq 说明预览模型仅供评估,并可能在很短时间内停止提供。
Groq 每月多少钱?
Groq 没有公开的月度或年度自助订阅费。月成本需要按当前费率汇总输入、输出、音频、工具和服务层级用量。本文测算的每月 100,000 次 GPT-OSS 120B 请求,同步成本为 $60,未计缓存和工具费用。
Groq 提供学生折扣吗?
在 2026年8月核验的价格页和计费页面中,Groq 没有列出学生专属折扣。学生及其他轻量用户可以在速率限额内使用通用的 $0 Free 套餐。
Groq 的退款政策是什么?
一般计费退款请求由 Groq 支持团队逐案处理。Service Credits 的规定更严格:无论购买还是赠送的 Credits,均不可退款、不可转让,并会在一年后过期,除非另有期限说明。
Groq 定价调整过吗?
调整过。Batch 于 2025年2月上线时比同步价格低 25%,如今折扣为 50%。Groq 在 2025年10月下调 GPT-OSS 价格,并为该系列加入了缓存。模型目录和具体费率都会变化,应以实时页面为准。
Groq 与 OpenAI 的价格怎么比?
OpenAI 不通过自家 API 提供 GPT-OSS,因此直接比较会更换模型。按统一的 GPT-OSS 120B 负载计算,在缓存折扣前,Groq、Together AI 和 Fireworks AI 处理 1亿个输入 Token 与 2,000万个输出 Token 的成本均为 $27。
获取 AI Tools Map for Business Owners
AI Tools Map for Business Owners 将模型价格转化为采用路线,明确每款工具必须达到的质量底线、运营角色和成本触发点。免费订阅,获取下一期。
2026年9月3日







