Together AI 价格详解(2026):PTU 买的是容量,不是折扣

拆解 Together AI 价格:从 Serverless、每分钟 $0.05 的 PTU,到 Dedicated Inference 和 GPU 集群。用真实负载测算缓存、Batch 与容量利用率,判断何时预留资源、何时继续按 Token 付费,并比较 Fireworks AI、Groq 和 OpenRouter。

Wednesday, September 2, 2026Omid Saffari
Together AI 价格详解(2026):PTU 买的是容量,不是折扣

看懂 Together AI 价格,成本最低的起点是 Serverless。最新的 $0.05/PTU-minute 方案并不是相对其 Token 单价打折:连续预留 1 个 PTU,按 30 天计算要 $2,160。购买它应当是为了锁定容量和获得 99% 可用性 SLA,而不是为了让闲置 Token 更便宜。

Together AI 价格一览

采用 Together AI,最合理的方式是分阶段投入:先从预付费 Serverless 用量开始;流量稳定、对可靠性敏感后,再迁移到 Provisioned Throughput;只有工作负载确实需要单租户控制或自定义模型时,才预留专用硬件。最昂贵的误区,是把这些阶段当成阶梯式用量折扣。它们计量的对象不同,转移的运营风险也不同。

Together AI 实时价格页,展示 Serverless、Provisioned Throughput、Dedicated Inference、GPU 集群、Sandbox、存储和微调
Together AI 价格,核验于 2026 年 8 月 22 日

Together AI 并不采用简单的 Free、Pro、Business 套餐阶梯。它销售的是 Serverless Token 和媒体生成结果、预留 Token 容量、托管式专用 GPU、原生 GPU 集群、Sandbox 算力、存储与微调服务。同一个产品可能同时触发多个计费项。例如,一个 Agent 既可能产生模型 Token 费用,也会消耗 Sandbox 的 CPU 和内存;微调端点即使没有请求,也可能持续计费。

产品当前公开价承诺期限最适合
Serverless inference文本模型每百万 Token $0–$15;媒体按图片、视频、分钟或字符计费先购买 $5 预付额度,之后按用量计费原型、波动流量、模型评估
Provisioned Throughput$0.05/PTU-minute;按 30 天计算,每个 PTU $2,160至少 1 个月需要预留容量和 99% 可用性 SLA 的稳定生产流量
Dedicated InferenceH100 $5.49/GPU-hour;B200 $8.99/GPU-hour运行期间持续计费;预留条款需询价微调或自定义模型、可预测延迟、单租户控制
GPU 集群H100 按需 $3.99/GPU-hour,预留 91–180 天为 $3.19;H200 和 B200 更贵按需,或公开的 7–180 天预留期自行运维训练或推理栈的团队
Sandbox 与存储$0.0446/vCPU-hour、$0.0149/GiB RAM-hour、$0.16/GiB-month 存储按用量计费Agent 代码执行与持久化数据
微调标准方案每百万处理 Token $0.48–$8;专项模型 $3–$100,另有任务最低收费按任务计费;托管另收费能以业务价值覆盖训练与部署成本的定制行为

本文所有价格和限制,均于 2026 年 8 月 22 日对照 Together AI 的实时价格页、账单文档和产品文档完成核验。这个日期很重要:当前页面与 6 月份的价格报道已有明显差异,新增了 MiniMax M3、Kimi K3、GLM-5.2,更低的实时专用硬件价格,以及新的 Provisioned Throughput 层。

第一条决策原则很简单:需求不确定或存在突发峰值时,用 Serverless;固定模型承载稳定基础负载,而且预留容量对业务有价值时,再考虑 PTU;需要自定义模型、单租户硬件或配置控制时,选择 Dedicated Inference;只有公司愿意自行运营底层算力,而不是购买托管式推理结果时,才选择 GPU 集群。

决策流程:突发工作负载使用 Serverless,稳定且需要 SLA 的工作负载使用 PTU,自定义模型使用 Dedicated Inference
应根据工作负载形态选择计费方式,而不是只看月度账单

这一区别让 Together AI 很适合已经获得融资、希望沿着同一套 API 从试验走向预留基础设施的创业者。对只追求最低即时 Token 单价的独立开发者,或连未来 1 个月需求都无法预测的团队,它就没那么合适。Serverless 卖的是灵活性,承诺用量则是另一笔采购。

Together AI API 价格:Serverless 是默认起点,模型选择决定账单

Serverless 是正确起点,因为除 $5 平台访问额度外,没有部署成本,也没有最低用量。请求发送到共享资源池,按已完成的工作付费。账单高低更取决于模型、Token 输入输出方向、缓存费率和输出长度,而不是发票上的 Together AI 品牌名。

当前聊天模型目录的价格跨度很大。LFM2.5-8B-A1B 每百万输入 Token $0.03、输出 Token $0.12。DeepSeek V4 Flash 0731 的输入为 $0.14、缓存输入 $0.03、输出 $0.28。gpt-oss-120B 的输入为 $0.15、输出 $0.60。在页面所列文本模型的高价端,Kimi K3 每百万 Token 的输入为 $3、缓存输入 $0.30、输出 $15。

这里的 DeepSeek 价格指 Together 托管服务的特定计费标准。单独的 DeepSeek 价格分析讨论模型直供成本;核算 Together 账单时,应以 Together 的实时页面为准。

LFM 的 $0.12 输出价与 Kimi K3 的 $15 输出价相差 125 倍。只优化供应商、不做模型路由,就像一边争取一点运费折扣,一边把所有包裹都改走空运。成本控制的第一步,是为每项任务分配能够达到质量底线的最便宜模型。

用一个 Agent 工作负载就能看清差异。假设 1,000 次调用,每次消耗 8,000 个输入 Token,并生成 1,000 个输出 Token,总计 800 万输入 Token 和 100 万输出 Token:

  • DeepSeek V4 Flash 0731 合计 $1.40,即每次调用 $0.0014。
  • gpt-oss-120B 合计 $1.80,即每次调用 $0.0018。
  • MiniMax M3 合计 $3.60,即每次调用 $0.0036。
  • GLM-5.2 合计 $15.60,即每次调用 $0.0156。
  • Kimi K3 合计 $39,即每次调用 $0.039。

最大的成本差并不来自供应商开销,而是来自所选模型,以及它生成了多少昂贵的输出。只返回一个标签的客服分类器,不需要和撰写长篇回复的研究 Agent 使用同样的输出预算。先给边界明确的任务设置硬性输出上限,再去寻找更便宜的端点。

因此,比较大模型 API 价格时,更广泛的最低价 AI API 对比只有在工作负载标准化之后才有意义。如果 Prompt 长度、回复长度、缓存假设或模型都不同,供应商对比只能得到一个整齐却无法指导预算的数字。

缓存输入可降低重复前缀的高额成本

Prompt 大量重复时,缓存输入是自助方案中最有效的折扣。Together 会识别没有变化的前缀,例如长篇系统指令或稳定的参考上下文;对于支持的模型,这些 Token 按更低费率计费。

仍以上述 1,000 次调用为例,假设 800 万输入 Token 中有 80% 符合缓存计价条件。MiniMax M3 从 $3.60 降至 $2.064,GLM-5.2 从 $15.60 降至 $8.304,Kimi K3 从 $39 降至 $21.72,降幅分别为 42.7%、46.8% 和 44.3%。

它对运营的影响比折扣百分比更大。资深运营人员应把稳定前缀与请求专属上下文分开,分别记录缓存与未缓存 Token,并监测哪些 Prompt 修改会让缓存失效。即使流量不变,改写 Prompt 也可能推高支出;在缓存数据解释原因之前,这很容易被误判为价格问题。

只有模型和工作流都符合条件,Batch 才更便宜

Together AI 的 Batch API 以异步完成为代价,为部分 Serverless 模型提供最高 50% 的折扣。它适合离线分类、合成数据、评测和批量摘要,不适合实时聊天、结账助手,或正在等待下一条回复的客服流程。

当前 Batch 规则允许一个 100 MB 输入文件最多包含 50,000 个请求,每个模型最多可排队 300 亿个 Token。完成窗口固定为 24 小时,但只是尽力而为的目标。Together 建议每批包含 1,000–10,000 个请求。成功响应会计费,失败请求不收费;取消 Batch 也不会抹去已经完成的响应费用。

“50%”并非普遍适用。只有部分 Serverless 模型能获得折扣,有些模型完全无法使用 Batch。Dedicated 端点可以接收 Batch 任务,但不享受该折扣。制定预测前,应查看实时的 Batch 模型列表

以当前符合折扣条件的案例计算:Llama 3.3 70B 的输入和输出费率均为 $1.04;800 万输入加 100 万输出 Token 共计 $9.36,满足 50% 折扣条件的 Batch 为 $4.68。省钱的原因是该任务能接受延迟完成,而不是所有 Serverless 请求都突然降价。

图片、视频、音频和存储采用不同计量单位

Serverless 不只覆盖文本。实时图片目录中,不同模型按每张图片或每百万像素计价,范围为 $0.0017–$0.134。视频生成价格为每段 $0.115–$3.20。语音转文本按每分钟音频 $0.0015–$0.0045,文本转语音按每百万字符 $4–$65。Multilingual e5 large instruct Embedding 每百万 Token $0.02,Llama Guard 4 12B 内容审核每百万 Token $0.20。

这些区间不能互相替换。Together 明确说明,页面展示的图片和视频价格采用最低分辨率或最短时长;生成步数超过默认值也可能增加费用。产品经理若要为 100,000 段短视频做预算,必须明确模型、时长、分辨率、音频设置和重试率。直接用最便宜的缩略图价格乘以产量,会低估这一成本项。

对多数新工作负载,Serverless 仍是合理默认项。真正的边界不是 Token 单价,而是共享容量、动态速率限制,以及缺少与 Provisioned 产品同等级的公开可用性承诺。一旦这些问题成为面向客户的风险,下一步要决定的是容量,而不是笼统地“升级套餐”。

Together AI PTU:Provisioned Throughput 把容量变成月度承诺

只有预留 Token 容量确实解决业务问题时,Provisioned Throughput 才值得购买。Together AI 于 2026 年 7 月 8 日推出这一层,定位介于尽力而为的 Serverless 与可全面配置的 Dedicated Inference 之间。它提供 99% 可用性 SLA、至少 1 个月的承诺期,公开牌价为每个 Provisioned Throughput Unit(PTU)每分钟 $0.05。

PTU 不是 Token 包,而是为客户保留、绑定某个受支持模型的每分钟 Token 速率。输入、缓存输入和输出消耗容量的速度不同。当前实时页面公开了 3 套标准:

每个 PTU 每分钟,MiniMax M3 可处理 166,667 个输入 Token、833,333 个缓存输入 Token,或 41,667 个输出 Token;Kimi K3 分别为 16,667、166,667 或 3,333;GLM-5.2 分别为 35,714、192,308 或 11,364。混合请求会按这些容量组合消耗。

按每分钟 $0.05 计算,1 个 PTU 每小时 $3、每天 $72,30 天为 $2,160。Together 计算器脚注则按平均月份连续预置约 43,800 分钟,得出约 $2,190。财务应以实际合同和自然月为准,不应假定每个月都固定为 $2,160。

PTU 占用率测试

最能说明问题的算法,是把 1 个 PTU 的容量换算为 Together 自身 Serverless 计价。若一个 MiniMax M3 PTU 在 30 天内只用于输入,它大约能提供 72 亿个输入 Token;按 Serverless 每百万 $0.30 计算,这些容量价值约 $2,160。若只用于输出,则可提供约 18 亿个输出 Token;按每百万 $1.20 计算,同样约为 $2,160。缓存输入路径在四舍五入后也会落到同一点。

Kimi K3 和 GLM-5.2 也按相同逻辑校准。按公开价格,PTU 在 30 天内接近满载时,才与公开 Serverless 成本持平。官方计算器可能显示相对某个所选商业模型大幅节省,但它明确对比的是 PTU 支出与外部模型的牌价,并不能证明 Together 的 PTU 普遍比其自身 Serverless 便宜。

这就是 PTU 占用率测试:只有预留单元被完全使用时,容量价值才等于 Serverless 价值。利用率为 50% 时,MiniMax M3 的有效费率翻倍:每百万输入 Token $0.60、缓存输入 $0.12、输出 $2.40;利用率为 25% 时则增至 $1.20、$0.24 和 $4.80。利用率为 70% 时,有效费率约为 Serverless 的 1.43 倍,输入约 $0.43、输出约 $1.71。

MiniMax M3 PTU 占用率仪表盘,展示利用率为 25%、50% 和 100% 时的有效输出价格
$2,160 的 PTU 只有在 30 天满载时,才与 Together Serverless 价格持平

这并不代表 PTU 是坏产品,而是明确了它究竟卖什么。运行面向客户 Agent 的中型企业 CTO,可能愿意接受 20% 闲置容量,因为预留通道可以降低限流风险,99% 可用性 SLA 也有合同价值。只有工作日有需求的创业者,则不应为夜间和周末付费,除非容量保障保护的收入足以覆盖这笔溢价。

公开页面表示,更高承诺级别可获得折扣,但未公布价目表。谈判折扣会把盈亏平衡点降到 100% 占用率以下。在销售把费率写进订单之前,预算模型仍应采用公开牌价,并把任何折扣视为额外收益。

99% SLA 仍需结合业务解读

按 30.4 天的月份计算,99% 月度可用性目标允许大约 7 小时 18 分钟停机。它强于尽力而为的访问,但 Groq 企业 Performance 层公布的是 99.9%,因此 99% 并非本次候选方案中最强的承诺。企业应比较书面补偿、维护排除条款、区域架构和故障切换路径,而不是看到 3 个字符加一个百分号就停止评估。

当应用具有稳定基础负载、可预测的模型选择,而且共享资源池限流会破坏对客户的承诺时,Provisioned Throughput 最容易证明其合理性。若流量会波动 10 倍、模型每周更换,或离线工作可迁移到 Batch,预留就会把不确定性变成付费闲置时间。

这个选择会改变周一的预算讨论

在 7 月 8 日之前,使用 Together 的团队需要从按 Token 计费的共享 Serverless,大步跨到专用 GPU 基础设施。PTU 增加了中间预算项:不用承担 GPU 选型和自建 Serving 栈,也能预留模型吞吐量。财务可以批准固定月度容量额度,工程团队则继续使用同一套推理 API。

随之而来的是新的运营指标。只看 Token 支出已经不够;负责人还需要掌握峰值每秒请求数、输入与输出 Token 配比、缓存命中率、容量占用率、被限流的请求和被接受的结果。如果 Dashboard 无法展示这 6 项指标,公司就无法判断 PTU 是保障还是浪费。

1 个 MiniMax M3 PTU 可承载约 600,000 次 Agent 调用

若每次调用使用 8,000 个未缓存输入 Token,并生成 1,000 个输出 Token,那么 1 个 PTU 在 30 天内大约可承载 600,000 次 MiniMax M3 调用。此前相同工作负载的 Serverless 单次价格是 $0.0036,因此 600,000 次调用正好为 $2,160。满载时,容量计费与 Token 计费按设计在此交汇。

容量计算同时包含请求的输入和输出。按 MiniMax M3 每分钟 166,667 个输入 Token 的标准,8,000 个输入 Token 消耗约 0.048 PTU-minute;按每分钟 41,667 个输出 Token 计算,1,000 个输出 Token 再消耗约 0.024 PTU-minute。完整请求共消耗约 0.072 PTU-minute。用当月 43,200 PTU-minute 除以这一请求占用量,结果约为 600,000 次调用。

由此可得到能够直接用于决策的运营预算:

占用率为 80% 时,PTU 大约支持 480,000 次调用。等量 Serverless 账单为 $1,728,意味着每月多付 $432 的预留溢价;PTU 比实际消耗的 Serverless 工作贵 25%。如果预留容量和 99% SLA 能保护超过 $432 的收入、支持工时或声誉成本,面向客户的产品就可以接受这笔溢价。

占用率为 70% 时,大约支持 420,000 次调用。Serverless 成本为 $1,512,容量溢价为 $648。占用率为 50% 时,可支持 300,000 次调用,Serverless 成本为 $1,080,相当于 PTU 账单的一半都花在闲置容量上。

缓存会改变一个单元能容纳的调用数。若 80% 输入命中缓存,每次请求消耗约 0.04128 PTU-minute,而不是 0.072。满载时,1 个 PTU 可承载约 104.65 万次相同调用;与此同时,Serverless 单次价格也会从 $0.0036 降到 $0.002064,因此满负载成本仍会在 $2,160 附近汇合。

所以缓存带来的业务收益既包括单位成本,也包括吞吐量。长且稳定的系统前缀,让同一份预留容量承载更多客户工作;破坏缓存复用的 Prompt 修改,则会同时压缩 PTU 余量并抬高 Serverless 支出。

再把决策放大到一个预算项。10 个 PTU 按 30 天计算为 $21,600,满载可承载约 600 万次未缓存的示例调用;占用率为 70% 时可承载 420 万次。等量 Serverless 账单为 $15,120,因此预留容量和 SLA 的月度溢价为 $6,480。

$6,480 才是 CTO 应该论证的数字。如果共享资源池限流可能损失超过 $6,480 的毛利、支持成本或合同罚款,预留就有价值;否则,继续使用 Serverless,就能把同样的 $6,480 留给产品开发。泛泛地说“我们每月 Token 花费 $15,000”,永远无法得出这个结论。

Dedicated Inference 没有同样清晰的公开 Token 盈亏平衡点,因为输出吞吐量取决于模型、量化方式、Batch 形态、硬件数量和配置。任何文章若只是把 GPU 月价除以一个通用 Token 费率,就宣称找到了普遍交叉点,实际上隐藏了决定答案的变量。应先在目标端点测量候选模型,再按实际利用率比较每个被接受结果的成本。

Dedicated Inference 与 GPU 集群解决的是不同问题

当控制权比自助灵活性更重要时,Dedicated Inference 才是合适选择。Together 提供单租户硬件,支持自定义模型、自动扩缩容和突发流量处理。实时价格为 NVIDIA HGX H100 每 GPU-hour $5.49,HGX B200 每 GPU-hour $8.99;H200、B300、GB200 NVL72 和 GB300 NVL72 需要联系销售询价。

若连续运行 30 天,1 块 H100 为 $3,952.80,1 块 B200 为 $6,472.80。这只是单 GPU 成本,尚未计入多 GPU 需求。端点只要处于运行状态,就会持续计费,与请求量无关,因此闲置部署仍是实时发生的预算项。

不要用旧版专用端点文档预测硬件账单。当前文档中的 H100、H200 和 B200 数字与实时价格页冲突;实时价格页是更新的来源,也是本文核验所依据的页面。这正是基础设施价格必须注明日期的原因。

以下情况能够证明 Dedicated Inference 的支出合理:微调或上传的模型无法在共享 Serverless 上运行;p99 延迟需要稳定硬件;模型 Serving 需要自定义设置;或者稳定的高利用率让预留 GPU 在经济上更优。如果端点每天大部分时间都在等待,它就不划算。

GPU 集群更接近底层,也可能因错误原因显得便宜

GPU 集群把更多技术栈交给买方。当前按需价格为:H100 每 GPU-hour $3.99,H200 为 $5.99,B200 为 $8.19。按 30 天折算,1 块 H100 为 $2,872.80,但它并不是 $3,952.80 的 Dedicated H100 的廉价替代品。集群买方要承担更多部署、Serving、编排、可观测性和利用率管理工作。

预留时间越长,集群费率越低。H100 在 7–30 天、31–90 天和 91–180 天三个档位分别降至 $3.69、$3.45 和 $3.19;H200 在相同档位从 $4.99 降至 $4.15,再到 $3.99;B200 则从 $7.99 降至 $7.79,再到 $6.79。181 天及以上的期限需要询价。

折扣伴随着严格限制。Together 的 GPU 账单文档规定,完整预留费用会在资源配置完成后一次性收取或扣除。预留不可退款、不可部分退款,也不能暂停。如果集群扩容超过预留容量,超出的容量按更高的按需费率计费。

对于 91–180 天的 H100 预留,按 720 小时标准化的月成本为每块 GPU $2,296.80,比按需方案低 $576。只有 GPU 得到有效利用,这笔节省才有价值。一个 4-GPU 预留若有一半时间闲置,不会因为小时单价较低就变得经济。

存储也有独立生命周期。共享存储为 $0.16/GiB-month,因此 1 TiB 每月约 $163.84。集群终止后,Volume 仍会保留并继续计费,直到有人将其删除。这便于围绕持久数据重建算力,但也会让被遗忘的 Volume 变成隐形支出。

微调可能训练很便宜,持续托管却很昂贵

微调包含两类独立成本:训练任务,以及之后的模型部署。训练费用可能看起来很低,但保持模型在线的成本可能成为月度支出的主体。

Together 的标准训练费用按“数据集 Token × Epoch 数”计算,另加可选的“评估 Token × 评估次数”。参数量不超过 16B 的模型,Supervised Fine-tuning 使用 LoRA 每百万处理 Token $0.48,Full Fine-tuning 为 $0.54;Direct Preference Optimization(DPO)使用 LoRA 为 $1.20,Full Tuning 为 $1.35。

对于 17B–69B 模型,上述 4 项费率依次为 $1.50、$1.65、$3.75 和 $4.12。对于 70B–100B 模型,则为 $2.90、$3.20、$7.25 和 $8。标准任务最低收费为 $4。

更大或指定模型采用专项定价。DeepSeek V4 Flash 的 LoRA Supervised Fine-tuning 每百万处理 Token $6,DPO 为 $15,最低收费 $12。gpt-oss-120B 分别为 $5 和 $12.50,最低收费 $6。Kimi K2.6 或 K2.7-Code 分别为 $15 和 $37.50,最低收费 $60。GLM-5.2 分别为 $40 和 $100,最低收费 $60。

这种模型间价差会彻底改变一个看似简单的实验。一个包含 2,000 万 Token 的数据集训练 3 个 Epoch,共处理 6,000 万 Token。若采用不超过 16B 的标准 LoRA Supervised Fine-tuning,训练费为 $28.80;采用专项定价的 GLM-5.2 LoRA,同样的处理量则为 $2,400。数据集大小没有变化,变化的是基础模型价格。

训练任务依然不是完整生命周期成本。微调模型需要部署容量和充足的预付余额。按当前价格,1 块 Dedicated H100 连续运行 30 天为 $3,952.80。团队可能只花 $28.80 创建一个小型 Adapter,之后每月为了维持 1 块 H100 在线,却要支付超过前者 137 倍的费用。

原型预算往往就在这里失控。数据科学家汇报的是训练任务,财务后来看到的却是 Serving 账单。批准实验时,应同时附上部署计划:预计在线时长、GPU 数量、自动扩缩容下限、请求量和关停负责人。

取消训练的退款范围也比许多买方预期更窄。Together 会对已完成步骤收费,只退还尚未完成的部分。按照服务条款,标准平台费用默认不退款。应把训练任务视为已消耗的算力,而不是可撤销的软件订阅。

Sandbox 与 Code Interpreter 是独立的 Agent 计费项

Code Sandbox 每 vCPU-hour $0.0446,另加每 GiB RAM-hour $0.0149。一个配置 2 vCPU、8 GiB、运行 160 小时的 Sandbox 费用约为 $33.34。Code Interpreter 采用另一种计量方式,每个 60 分钟 Session 收费 $0.03。

对 Agent 产品来说,这些费用与模型推理并列发生。如果每月 10,000 次 Agent 运行都开启一个 1 小时 Interpreter Session,仅这一项就是 $300,尚未计算模型 Token。如果 Session 可以安全复用,产品架构就能改变每个完成任务的成本;如果工作结束后仍保持开启,闲置执行就会成为规模较小的“闲置 GPU”。

因此,正确的计量单位是每个被接受结果的成本,而不是每百万 Token 的成本。示例中的 MiniMax M3 调用为 $0.0036;再加 1 个 $0.03 的 Code Interpreter Session,在重试和其他工具调用之前,这条路径就至少为 $0.0336。必须监测完整链路。

即使模型显示 $0 Token,Together AI 也不是免费服务

Together AI 目前没有免费试用,使用平台前至少需要购买 $5 预付额度。因此,“是否有免费套餐”的答案很明确:API 不提供零付费账户。

实时目录确实列出了 Ternary Bonsai 27B,输入和输出每百万 Token 都是 $0。只要该项目仍然可用,持续推理成本可以是 $0,但账户仍须先支付 $5 才能获得访问权限。这 $5 并非月度订阅费,购买的预付额度目前不会过期。

谁可能永远不必在首笔 $5 之外继续付费?只使用当前零价模型、始终处于速率限制内、且从不启动付费服务的业余用户或评测者,可能一直不动用已购余额。但这是非常狭窄的情形,并不是生产级免费层。模型可用性、容量和价格都可能变化,产品不应向客户承诺某个促销或零价端点会永远作为后端。

过去的注册赠送额度已经结束。Together 当前支持政策要求用户至少购买 $5,并绑定支付方式。普通预付费账户没有负余额机制;余额归零后,API 访问会暂停,直到再次充值。合同客户则按订单条款执行。

额度不会过期,但也不是可退款的储蓄账户

购买的额度目前没有到期日,这比 1 年到期政策更友好,但不代表多充值没有代价。Together 的条款规定,已付费用默认不可退款,付款义务不可取消;除非订单另有规定,不会按不足整月的时间折算。

自动充值需要谨慎配置。账单文档列出的默认充值金额为 $25,并警告:如果阈值设置得高于当前余额,系统可能立即重复购买,直到填平差额。阈值应与预期消耗挂钩,每次购买都要告警,并在额度余额之外维护项目级预算。

Build Tiers 根据累计消费提高限制

Together 的 5 个 Build Tier 是按累计消费划分的速率限制档位,而不是按月购买的功能套餐。Tier 1 从 $5 开始,列明每分钟 600 个 LLM 请求;Tier 2 从 $50 开始,为 1,800;Tier 3 从 $100 开始,为 3,000;Tier 4 从 $250 开始,为 4,500;Tier 5 从 $1,000 开始,为 6,000。

Embedding 限制从 Tier 1 的 3,000 RPM,提高到 Tier 4 和 Tier 5 的 10,000 RPM。Rerank 配额在 5 个档位中从 500,000 增至 5,000,000。这些数字并非对所有模型的统一承诺。Together 可以施加模型专属限制,当前 Serverless 文档也说明,动态限制会根据实时容量和近期成功流量调整。

这套组合会直接影响产品发布。即使是 Tier 5 账户,热门模型容量更紧,或流量远高于近期水平时,仍可能收到 429 响应。Serverless 免去了资源部署,却不能解决所有突发流量。Batch、PTU 或 Dedicated Inference 都可作为出口,但成本和延迟取舍各不相同。

Together AI 价格中的隐性成本:闲置计费与政策边界

Together AI 明面上的 Token 单价总体清晰。真正昂贵的意外,往往出现在产品之间的缝隙:承诺期限、闲置资源,以及被误认为普遍成立的假设。

**PTU 日历算法:**每分钟 $0.05,按 30 天计算为 $2,160。实时计算器脚注采用约 43,800 分钟,结果约为 $2,190。每个 PTU 相差的 $30,放大到 100 个 PTU 就是 $3,000。应采用合同规定的计费口径。

**PTU 未充分利用:**公开 PTU 以 30 天满载时的 Together Serverless 价值为校准点。占用率为 50% 时,有效 Token 成本翻倍。容量和 SLA 仍可能让这笔溢价物有所值,但溢价必须清晰可见。

**Dedicated 闲置时间:**Dedicated Inference 在分配的硬件运行期间持续计费,即使请求数为 0。微调模型的托管成本必须进入月度预测,不能只算在实验工单里。

**不可退款的预留:**GPU 集群预留会收取整个期限的费用,不能暂停,也不能部分退款。预测错误会直接变成承诺支出。

**按需突发超额:**扩容超过预留 GPU 容量的部分,按更高的按需费率计费。即使基础负载稳定,低估突发量仍可能带来意外账单。

**持久化存储:**集群终止后,存储仍然存在并持续计费,直到被删除。每次拆除集群,都必须明确选择保留还是删除。

**Batch 适用条件:**折扣因模型而异,24 小时窗口只是尽力而为;取消后,已经完成的响应仍会计费。未查看实时列表前,不要直接给全部离线预算套用 50% 折扣。

**多媒体默认值:**图片和视频价格可能对应最低分辨率、最短时长或默认步数。生产质量设置和重试会改变每个可用素材的成本。

**自动充值行为:**过高的阈值可能触发即时购买,普通费用也不可退款。自动充值应当是带告警的生产连续性控制,而不是配置后就不再过问的便利功能。

**输出漂移:**Prompt 或模型更新若生成更长回复,即使请求量不变,支出也会增加。应分别跟踪输入、缓存输入、输出和被接受的结果。

**速率限制漂移:**Serverless 限制可能动态变化,也可能按模型单独设置。通过累计消费升到 Tier 5,并不等于预留了底层资源池。

这里没有可直接套用的标准年度自助折扣。Serverless 是预付费按量使用,PTU 至少承诺 1 个月,GPU 预留公开了 7–30 天、31–90 天和 91–180 天档位,更长期限需要联系销售。年度锁定风险存在于定制订单或连续的基础设施预留中,而不是某个公开的年度应用套餐。

AI API 价格对比:Together AI 替代方案先用同一模型统一口径

Together AI 并非在每个共享模型上都最便宜。以 gpt-oss-120B 为例,其公开 Serverless 价格与 Fireworks AI、Groq 完全相同:每百万输入 Token $0.15、输出 Token $0.60。一个包含 100 万输入和 250,000 输出 Token 的任务,在计入缓存输入优势或账户专属协议之前,3 家供应商均为 $0.30。

这种价格持平很有价值。Token 单价不再是决策因素,买方必须真正比较缓存价格、速率限制、延迟、供应商控制、故障切换机制、部署路径和 SLA 封装方式。

Fireworks AI 基础费率相同,缓存输入更便宜

Fireworks AI 的 gpt-oss-120B Standard Serverless 价格为:每百万输入 Token $0.15、缓存输入 $0.015、输出 $0.60。未缓存的标准化任务与 Together 同为 $0.30。Fireworks 还宣传提供 $1 初始额度。

Fireworks AI Serverless 价格文档,展示 gpt-oss-120B 费率
Fireworks AI Serverless 价格

如果工作负载包含大量可复用前缀,Fireworks 在这项狭义对比中胜出,因为其当前 gpt-oss 缓存输入价格既明确又低。它还提供 Standard、Priority 和 Fast 3 个 Serverless 层,形成另一组延迟与价格取舍。缺点是,这些额外服务层让本应简单的费率比较更加复杂;其专用 GPU 定价也不是 Together PTU 的同类产品。

当核心需求是缓存密集型的开源模型 Serverless,而且 Fireworks 的服务层控制适合应用时,选择 Fireworks。如果更看重通过同一套 API 继续使用 PTU、Dedicated Inference、微调、Sandbox 或原生集群,Together 的战略价值更大。

Groq 以相同 Token 单价出售速度

Groq 的 gpt-oss-120B 同样是输入 $0.15、输出 $0.60,因此标准化任务也是 $0.30。其当前模型页面列出的生成速度约为每秒 500 个 Token;Developer 方案对该模型的限制为每分钟 250,000 个 Token、每分钟 1,000 个请求。

Groq 支持模型文档,展示 gpt-oss-120B 的价格、速度和速率限制
Groq 模型价格与限制

如果产品承诺的核心是低生成延迟,Groq 是更有针对性的候选项。其企业 Performance 层提供 Provisioned Throughput 和 99.9% 可用性 SLA,但未公布价格。因此,自助 Token 成本容易比较,预留容量成本却无法在没有报价的情况下统一核算。

对于交互式应用,如果受支持模型范围和速度比 Together 更广的训练与基础设施栈重要,应选择 Groq。若工作负载需要在同一账户中使用 Together 的微调、GPU 集群、Sandbox 或公开 PTU 路径,则应跳过 Groq。

OpenRouter 可能更便宜,但要接受聚合平台的取舍

OpenRouter 当前的 gpt-oss-120B 价格为:每百万输入 Token $0.03、缓存输入 $0.03、输出 $0.17。包含 100 万输入和 250,000 输出 Token 的标准化任务,在购买额度手续费前为 $0.0725。若购买的额度全部用完,分摊其 5.5% 手续费后约为 $0.0765;但小额充值会主要受 $0.80 最低手续费影响。

OpenRouter gpt-oss-120B 模型页面,展示实时 Token 价格和供应商路由
OpenRouter gpt-oss-120B 价格

OpenRouter 通过在上游供应商之间路由,在这个即时价格示例中胜出。它还提供自动故障切换和更广的模型目录,但这与预留 Together 容量或选定单一基础设施供应商不是同一种产品。路由选择、数据政策、延迟、上游可用性和供应商变化,都会成为架构的一部分。

它的免费层比 Together 更容易使用:当前价格页列出超过 25 个免费模型,每天可请求 50 次。代价包括较低的免费限额、5.5% 按量付费平台费,以及在 1 年后让未用额度过期的权利。Together 目前表示,购买的额度不会过期。

如果最重要的是广泛模型访问、故障切换和当前路由即时价格,选择 OpenRouter。如果更重视直接控制供应商,以及可预测地转向预留容量、模型训练或专用基础设施,Together 比最低路由请求价格更合适。

统一口径后的结论很直接:对于 gpt-oss-120B,Together、Fireworks 和 Groq 的未缓存 Token 单价持平;OpenRouter 在这份价格快照中更低,但它改变了供应关系。最终选择取决于运营要求,而不是“某个平台更便宜”这种笼统说法。

谁适合选择 Together AI,谁应该跳过

如果一家公司的开源模型工作负载会从不确定的调用量,逐步发展成明确的容量计划,Together AI 是合适的平台。但它并不是每个追求低价 API 的开发者都应默认选择的方案。

**独立技术开发者应从 Serverless 开始,并把首次购买控制在 $5。**把边界明确的任务路由到 DeepSeek V4 Flash、gpt-oss-120B,或其他能达到质量底线的模型。在生产日志证明需求稳定之前,不要购买 PTU 或专用硬件。如果唯一目标只是广泛试用模型或获得免费访问,OpenRouter 可能是更简单的第一个账户。

**已获融资的创业者,如果部署阶梯能减少未来迁移工作,就应考虑 Together。**Serverless 可用于验证产品,PTU 能在同一套 API 后面预留稳定的开源模型,Dedicated Inference 则可托管微调或自定义模型。当产品路线已经指向预留容量时,这种连续性比一点点 Token 价差更有价值。

**中型企业 CTO 购买 PTU,应是为了服务承诺,而不是因为账单很大。**先预测占用率,把 99% SLA 与对客户的承诺比较,再用交易损失或支持升级成本衡量容量预留的价值。如果应用要求 99.9% 可用性,仅有 99% 并不足够;应设计故障切换,或重新谈判合同。

**资深运营人员应先把离线用量迁到 Batch,再预留容量。**符合条件的分类、数据补充、评测和合成数据任务最高可省 50%。这是以接受延迟换来的直接折扣;PTU 买的是容量,应放在后面考虑。

**研究或模型团队只有在明确利用率负责人后,才应使用 Dedicated Inference 或 GPU 集群。**训练、自定义 Serving 和底层控制可以证明这套资源合理。但如果团队无法监控 GPU-hour、闲置副本、突发用量和持久化 Volume,它就是在购买自己无法治理的基础设施。

**出现以下 4 种情况之一,就应跳过 Together AI:**唯一优先级是最低路由 Token 价格;流量波动太大,不适合 1 个月预留;所需模型只在其他平台提供;或者公司需要更强的公开 SLA,又不愿与销售谈判。Fireworks、Groq、OpenRouter 或模型直供商可能更合适。

优势
做得好的地方
9 points

  • 一个账户即可覆盖 Serverless、预留 Token 容量、Dedicated Inference、微调、GPU 集群、Sandbox 算力和存储。
  • 多个开源模型的当前 Serverless 费率有竞争力,受支持端点的缓存输入折扣也很可观。
  • 购买的预付额度目前不会过期。
  • Provisioned Throughput 以公开的 $0.05/PTU-minute 价格,补上了共享推理与 Dedicated Inference 之间的路径。
  • 没有零付费免费试用;访问平台必须购买 $5 额度。
  • 在谈判折扣之前,公开 PTU 牌价只有满载时才与 Together Serverless 持平。
  • 对关键客户链路而言,99% PTU 可用性 SLA 可能仍然不够,除非设计故障切换。
  • 请求量为 0 时,Dedicated、预留 GPU、存储和微调部署仍可能持续计费。
  • 实时价格可能与旧版产品文档冲突,因此采购必须记录来源日期。

周一就做:预留之前先测量 1 个工作负载

周一选择 1 个边界明确的生产工作流,建立连续 7 天的成本记录。目标不是测试所有模型,而是判断该负载应使用 Serverless、Batch、PTU,还是专用容量。

  1. 定义 1 个可接受结果

    选择结果可评分的任务:有效分类、通过测试的代码修改、获批的客服草稿,或完成的数据抽取。每个被接受结果的成本,才是业务指标。

  2. 记录完整用量形态

    连续 7 天记录请求数、未缓存输入、缓存输入、输出、重试、峰值每秒请求数、429 响应、延迟、Sandbox 时间和被接受结果。将工作日峰值与夜间、周末分开。

  3. 计算 Serverless 基线

    把实时模型费率应用到实测 Token 组合。将符合条件的离线任务迁到 Batch 后重新计算。限制不必要的输出,并保持 Prompt 前缀稳定,让基线计入实际可获得的缓存节省。

  4. 执行 PTU 占用率测试

    将峰值请求速率、缓存命中率和 Token 组合输入实时 PTU 计算器,对比所需 PTU 数量与平均用量。占用率为 80% 时,公开牌价对应 25% 的有效 Token 溢价;判断预留容量和 99% SLA 是否值得这笔成本。

  5. 只因明确需求而升级

    需要自定义模型、单租户控制或稳定硬件性能时,迁移到 Dedicated Inference。只有团队自行负责 Serving 或训练栈时,才使用 GPU 集群。关停和存储清理负责人,应与预算负责人同时写入方案。

最终决策应该浓缩成财务与工程都能采用的一句话:“这个工作负载继续使用 Serverless”“这条离线链路迁到 Batch”,或“这条客户链路预留 N 个 PTU,因为容量保障值得承担实测的闲置溢价”。这是周一就能执行的动作,而不是因一句价格宣传就启动基础设施迁移。

Together AI 价格常见问题

Together AI 的 1,000 个 Token 多少钱?

将模型的每百万 Token 费率除以 1,000,并分别计算输入与输出。MiniMax M3 每 1,000 个未缓存输入 Token 为 $0.0003,每 1,000 个输出 Token 为 $0.0012;Kimi K3 每 1,000 个 Token 的输入为 $0.003,输出为 $0.015。

Together AI 每月多少钱?

Serverless 没有固定月费;购买 $5 访问额度后,月度成本随用量变化。1 个 PTU 按 30 天计算为 $2,160;若按价格页采用的平均月份 43,800 分钟假设,则约为 $2,190。1 块持续运行的 Dedicated H100,按当前每小时 $5.49 计算,720 小时为 $3,952.80。

Together AI 免费吗?

不免费。Together AI 目前不提供免费试用,访问平台至少需要购买 $5 预付额度。实时目录虽列出输入和输出 Token 费率均为 $0 的 Ternary Bonsai 27B,但账户仍须完成 $5 购买。

Together AI 会赠送免费额度吗?

没有长期注册赠送活动。此前的注册促销已经结束,目前访问平台需要购买 $5 额度。Together 另有仅限邀请的研究额度计划,面向正式课程之外开展项目的学生,但并不广泛开放。

Together AI 免费层有哪些限制?

Together AI 没有常规免费层。购买 $5 余额后,账户进入 Build Tier 1;当前列出的限制为每分钟 600 个 LLM 请求、每分钟 3,000 个 Embedding 请求,以及 500,000 的 Rerank 限额。模型专属和动态限制可能更低。

Together AI 最好的替代方案有哪些?

Fireworks AI 是最接近的综合型开源模型推理与微调替代方案;Groq 适合受支持的低延迟模型;OpenRouter 则在广泛模型路由和故障切换方面最强。对于 gpt-oss-120B,Together、Fireworks 和 Groq 当前每百万 Token 都是输入 $0.15、输出 $0.60;OpenRouter 在这份快照中的路由价格更低,但会增加额度购买手续费和聚合平台这一层。

Together AI 提供学生折扣吗?

Together AI 没有公布长期学生价格档位。其仅限邀请的研究额度计划,会向开展正式课程之外项目的学生提供小额资助,并要求获得者在成果中注明 Together AI。

Together AI 的退款政策是什么?

Together 的条款规定,费用默认不可退款,付款义务不可取消,也不按比例折算,除非订单另有约定。GPU 预留不可退款。取消微调任务时,已完成步骤照常收费,只退还尚未完成的部分。

Together AI 额度会过期吗?

购买的预付额度目前不会过期。这与能否退款是两回事:额度可以一直使用,却不代表可以退款;发票逾期后再购买的额度,也不能抵扣之前的欠款。

Together AI 价格在 2026 年有变化吗?

有。Together AI 于 2026 年 7 月 8 日推出 Provisioned Throughput,以每 PTU-minute $0.05、至少 1 个月承诺和 99% 可用性 SLA 提供预留 Token 容量。Serverless 模型目录和专用硬件费率自 6 月以来也有变化,因此本文标注了 8 月 22 日的核验日期。

Provisioned Throughput 比 Together Serverless 便宜吗?

不一定。按公开牌价,1 个满载 PTU 在 30 天内提供的价值,几乎正好等于其 Together Serverless 容量。利用不足会抬高有效 Token 价格。PTU 买的是预留容量和 SLA;承诺用量的谈判折扣可以改善费率,但 Together 没有公布该折扣表。

获取面向企业主的 AI Tools Map

AI Tools Map for Business Owners 把模型价格转化为可执行的采用路径,并标出每款工具的质量底线、路由角色和成本触发点。免费订阅,获取下一期

最近更新

2026年9月2日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。