Together AI pricing 2026: PTU는 할인보다 용량을 삽니다
Together AI pricing을 서버리스 토큰부터 PTU, Dedicated Inference, GPU 클러스터까지 분석합니다. 2026년 최신 요금 기준으로 $5 선불 액세스, $0.05/PTU-minute, 점유율별 손익분기점과 숨은 비용을 한 번에 확인하세요.

Together AI pricing에서 가장 저렴한 선택은 서버리스입니다. 새로 나온 $0.05/PTU-minute 옵션도 자체 토큰 요금보다 싸게 제공하는 정가 할인 상품은 아닙니다. PTU 1개를 30일 내내 예약하면 $2,160입니다. 사용하지 않는 토큰을 싸게 사기 위해서가 아니라, 보장된 용량과 99% 가동 시간 SLA가 필요할 때 구매해야 합니다.
Together AI pricing 한눈에 보기
Together AI는 단계적으로 도입하는 편이 가장 합리적입니다. 선불 서버리스 사용량으로 시작하고, 트래픽이 일정하거나 안정성이 중요한 구간은 Provisioned Throughput으로 옮긴 뒤, 단일 테넌트 제어 또는 커스텀 모델이 꼭 필요한 워크로드에만 전용 하드웨어를 예약합니다. 이 단계를 사용량 할인으로 오해하면 큰 비용이 발생합니다. 각 상품은 측정 단위가 다르고 고객에게 이전하는 운영 리스크도 다릅니다.

Together AI에는 단순한 Free, Pro, Business 요금제가 없습니다. 서버리스 토큰과 미디어 출력, 예약형 토큰 용량, 관리형 전용 GPU, 원시 GPU 클러스터, 샌드박스 컴퓨팅, 스토리지, 파인튜닝을 각각 판매합니다. 하나의 제품에서 여러 과금 단위가 동시에 발생할 수도 있습니다. 예를 들어 에이전트는 모델 토큰, 샌드박스 CPU와 메모리, 요청이 없을 때도 비용이 발생하는 파인튜닝 엔드포인트를 함께 사용할 수 있습니다.
이 글의 모든 가격과 한도는 2026년 8월 22일 Together AI의 실시간 가격 페이지, 결제 문서, 제품 문서에서 확인했습니다. 이 날짜가 중요한 이유가 있습니다. 현재 페이지는 6월의 가격 정보와 이미 크게 달라졌습니다. MiniMax M3, Kimi K3, GLM-5.2가 추가됐고 실시간 전용 하드웨어 요금은 낮아졌으며 새로운 Provisioned Throughput 계층도 생겼습니다.
첫 번째 판단 기준은 간단합니다. 수요가 불확실하거나 순간적으로 몰리면 서버리스를 사용합니다. 특정 모델이 안정적인 기본 부하를 처리하고 예약 용량에 사업적 가치가 있다면 PTU를 검토합니다. 커스텀 모델, 단일 테넌트 하드웨어 또는 구성 제어가 필요하면 Dedicated Inference를 선택합니다. 회사가 관리형 추론 결과를 구매하는 대신 기반 컴퓨팅을 직접 운영하려는 경우에만 GPU 클러스터를 선택해야 합니다.

이 차이 덕분에 실험부터 예약형 인프라까지 하나의 API 경로를 원하는 투자 유치 스타트업 창업자에게 Together AI는 매력적입니다. 반면 가장 낮은 순간 토큰 가격만 찾는 1인 개발자나 한 달 수요조차 예측하기 어려운 팀에는 덜 매력적입니다. 유연성은 서버리스 상품에서 사고, 약정은 별도로 구매하는 구조입니다.
기본은 서버리스 추론이며, 청구액은 모델 선택이 좌우합니다
서버리스는 프로비저닝 비용이 없고, $5 플랫폼 액세스 구매 외에는 최소 사용량도 없으므로 가장 적절한 출발점입니다. 공유 플릿에 요청을 보내고 완료된 작업만큼 지불합니다. 청구서에서 Together AI라는 이름보다 훨씬 중요한 것은 모델, 토큰 방향, 캐시 요금, 출력 길이입니다.
현재 채팅 카탈로그의 가격 폭은 매우 넓습니다. LFM2.5-8B-A1B는 입력 토큰 1 million개당 $0.03, 출력 토큰 1 million개당 $0.12입니다. DeepSeek V4 Flash 0731은 입력 $0.14, 캐시 입력 $0.03, 출력 $0.28입니다. gpt-oss-120B는 입력 $0.15, 출력 $0.60입니다. 표시된 텍스트 목록의 상단에서는 Kimi K3가 1 million tokens당 입력 $3, 캐시 입력 $0.30, 출력 $15입니다.
Together가 호스팅하는 DeepSeek 요금은 해당 공급자에만 적용되는 과금 단위입니다. 별도의 DeepSeek 가격 분석은 모델을 직접 사용할 때의 경제성을 다룹니다. Together 청구액을 계산할 때는 Together의 실시간 페이지를 사용해야 합니다.
LFM의 출력 요금 $0.12와 Kimi K3의 출력 요금 $15 사이에는 125배 차이가 있습니다. 모델 라우팅을 무시한 채 공급자만 최적화하는 것은 모든 소포를 항공으로 보내면서 운임의 작은 할인만 협상하는 것과 같습니다. 첫 번째 비용 절감 수단은 각 작업의 품질 하한선을 넘는 가장 저렴한 모델을 배정하는 것입니다.
에이전트 워크로드 예시로 살펴보겠습니다. 호출 1,000회가 각각 입력 토큰 8,000개를 쓰고 출력 토큰 1,000개를 생성한다고 가정합니다. 총 입력 토큰은 8 million개, 출력 토큰은 1 million개입니다.
- DeepSeek V4 Flash 0731의 총비용은 $1.40, 호출당 $0.0014입니다.
- gpt-oss-120B의 총비용은 $1.80, 호출당 $0.0018입니다.
- MiniMax M3의 총비용은 $3.60, 호출당 $0.0036입니다.
- GLM-5.2의 총비용은 $15.60, 호출당 $0.0156입니다.
- Kimi K3의 총비용은 $39, 호출당 $0.039입니다.
가장 큰 차이를 만드는 것은 공급자 오버헤드가 아니라 선택한 모델과 비싼 출력의 양입니다. 라벨 하나만 반환하는 고객 지원 분류기에 긴 답변을 작성하는 리서치 에이전트와 같은 출력 예산을 배정할 필요는 없습니다. 더 저렴한 엔드포인트를 찾기 전에 범위가 정해진 작업의 출력 상한부터 강제해야 합니다.
따라서 더 폭넓은 최저가 AI API 비교도 작업 조건을 동일하게 맞춘 뒤에야 의미가 있습니다. 프롬프트 길이, 응답 길이, 캐시 가정 또는 모델이 서로 다른 공급자를 비교하면 보기 좋은 숫자는 얻을 수 있어도 예산 판단에는 쓸 수 없습니다.
캐시 입력은 비용이 큰 반복 프리픽스를 줄여 줍니다
프롬프트가 반복될 때 캐시 입력은 셀프서비스에서 가장 강력한 할인 수단입니다. 긴 시스템 지침이나 고정된 참조 컨텍스트처럼 바뀌지 않는 프리픽스를 Together가 인식하고, 지원 모델에서 해당 토큰에 더 낮은 요금을 적용하는 방식입니다.
같은 1,000회 호출 워크로드에서 8 million 입력 토큰의 80%가 캐시 요금 적용 대상이라고 가정합니다. MiniMax M3는 $3.60에서 $2.064로, GLM-5.2는 $15.60에서 $8.304로, Kimi K3는 $39에서 $21.72로 낮아집니다. 각각 42.7%, 46.8%, 44.3% 절감됩니다.
운영상 의미는 할인율보다 큽니다. 숙련된 운영자는 고정 프리픽스와 요청별 컨텍스트를 분리하고, 캐시된 토큰과 캐시되지 않은 토큰을 따로 기록하며, 캐시를 무효화하는 프롬프트 변경을 감시해야 합니다. 트래픽이 그대로여도 프롬프트를 고치면 비용이 오를 수 있습니다. 캐시 데이터를 보기 전에는 가격 문제처럼 보이는 현상입니다.
Batch는 모델과 워크플로가 조건을 충족할 때만 저렴합니다
Together AI의 Batch API는 비동기 완료를 받아들이는 대신 일부 서버리스 모델에 최대 50% 할인을 제공합니다. 오프라인 분류, 합성 데이터, 평가, 대량 요약에 알맞습니다. 다음 응답을 기다리는 실시간 채팅, 결제 도우미 또는 고객 서비스 흐름에는 맞지 않습니다.
현재 Batch 계약에서는 100 MB 입력 파일 하나에 요청을 최대 50,000개까지 넣을 수 있고, 모델당 대기열 토큰은 최대 30 billion개입니다. 완료 시간은 24시간으로 고정되지만 최선형 목표입니다. Together는 1,000-10,000개 요청으로 구성한 배치를 권장합니다. 성공한 응답에는 비용이 청구되고 실패한 요청에는 청구되지 않으며, 배치를 취소해도 이미 완료된 응답의 비용은 사라지지 않습니다.
50%라는 문구가 모든 경우에 적용되지는 않습니다. 할인을 받는 것은 선택된 서버리스 모델뿐이며, 일부 모델은 Batch에서 전혀 실행할 수 없습니다. 전용 엔드포인트도 배치 작업을 받을 수 있지만 할인은 적용되지 않습니다. 예측 모델을 만들기 전에 실시간 Batch 모델 목록을 확인해야 합니다.
현재 할인 대상 예시로, Llama 3.3 70B에서 입력 8 million개와 출력 1 million개 토큰은 입력·출력 요금 $1.04 기준 $9.36입니다. 50% 할인 조건을 충족하는 배치라면 $4.68입니다. 모든 서버리스 요청이 싸진 것이 아니라 작업이 지연 완료를 허용하기 때문에 의미 있는 절감이 생깁니다.
이미지·영상·오디오·스토리지는 단위가 서로 다릅니다
서버리스는 텍스트에만 머물지 않습니다. 실시간 이미지 카탈로그의 표시 모델은 이미지 또는 메가픽셀당 $0.0017-$0.134, 영상 목록은 생성 영상당 $0.115-$3.20입니다. 음성 인식은 오디오 분당 $0.0015-$0.0045이고, 음성 합성은 1 million characters당 $4-$65입니다. Multilingual e5 large instruct 임베딩은 1 million tokens당 $0.02, Llama Guard 4 12B 모더레이션은 1 million tokens당 $0.20입니다.
이 범위는 서로 바꿔 쓸 수 없습니다. Together는 표시된 이미지·영상 가격이 가장 낮은 해상도나 재생 시간을 기준으로 하며, 기본 생성 스텝을 넘으면 추가 비용이 발생할 수 있다고 안내합니다. 짧은 영상 100,000개를 생성할 예산을 짜는 제품 관리자는 정확한 모델, 재생 시간, 해상도, 오디오 설정, 재시도율을 알아야 합니다. 가장 싼 썸네일 가격에 프로덕션 수량만 곱하면 실제 항목 비용을 과소평가하게 됩니다.
대부분의 새 워크로드에는 여전히 서버리스가 기본 선택입니다. 한계는 토큰 요금이 아니라 공유 용량, 동적 속도 제한, 그리고 Provisioned 상품과 같은 공개 가동 시간 약정이 없다는 점입니다. 이 문제가 고객 대상 리스크가 되는 순간부터는 일반적인 업그레이드가 아니라 용량을 판단해야 합니다.
Provisioned Throughput은 용량을 월 약정으로 바꿉니다
예약 토큰 용량이 실제 사업 문제를 해결할 때만 Provisioned Throughput을 구매할 가치가 있습니다. Together AI는 2026년 7월 8일, 최선형 서버리스와 완전히 구성 가능한 Dedicated Inference 사이의 중간 계층으로 이 상품을 출시했습니다. 99% 가동 시간 SLA, 최소 1개월 약정, 분당 Provisioned Throughput Unit(PTU) $0.05라는 공개 정가를 제공합니다.
PTU는 토큰 묶음이 아닙니다. 지원 모델 하나에 대해 고객 전용으로 확보한 분당 토큰 처리율입니다. 입력, 캐시 입력, 출력은 서로 다른 비율로 이 용량을 소모합니다. 현재 실시간 페이지에는 공개된 세 가지 스케줄이 있습니다.
MiniMax M3는 PTU당 분당 입력 토큰 166,667개, 캐시 입력 토큰 833,333개 또는 출력 토큰 41,667개를 제공합니다. Kimi K3는 입력 16,667개, 캐시 입력 166,667개 또는 출력 3,333개입니다. GLM-5.2는 입력 35,714개, 캐시 입력 192,308개 또는 출력 11,364개입니다. 입력과 출력이 섞인 요청은 이 용량을 혼합해 소모합니다.
분당 $0.05이면 PTU 1개는 시간당 $3, 하루 $72, 30일간 $2,160입니다. Together 계산기의 각주는 연속 평균 월 프로비저닝에 약 43,800분을 적용하며, 이때 약 $2,190이 됩니다. 재무팀은 모든 달을 고정 $2,160로 간주하지 말고 정확한 계약과 해당 월의 달력을 사용해야 합니다.
PTU 점유율 테스트
핵심 계산은 PTU 1개의 용량을 Together 자체 서버리스 요금으로 썼다면 얼마인지 비교하는 것입니다. MiniMax M3 PTU를 30일 동안 입력에만 할당하면 약 7.2 billion 입력 토큰을 처리할 수 있습니다. 서버리스 요금 1 million개당 $0.30을 적용하면 약 $2,160의 가치입니다. 출력에만 할당하면 약 1.8 billion 출력 토큰을 처리하며, 1 million개당 $1.20을 적용해도 약 $2,160입니다. 캐시 입력 경로 역시 반올림 오차 안에서 같은 지점에 도달합니다.
Kimi K3와 GLM-5.2도 같은 방식으로 보정됩니다. 공개 PTU 용량은 30일 내내 거의 완전히 점유해야 공개 서버리스 가격과 손익이 같아집니다. 공개 계산기에서 선택한 상용 모델 대비 큰 절감액이 표시될 수 있지만, 이는 명시적으로 그 외부 모델의 정가와 PTU 비용을 비교한 것입니다. Together 자체 서버리스 요금보다 언제나 싸다는 뜻은 아닙니다.
PTU 점유율 테스트의 결론은 이렇습니다. 예약 단위를 완전히 사용할 때만 용량 가치와 서버리스 가치가 같습니다. 사용률 50%에서는 MiniMax M3의 실효 요금이 입력 1 million tokens당 $0.60, 캐시 입력 $0.12, 출력 $2.40으로 2배가 됩니다. 25%에서는 $1.20, $0.24, $4.80으로 4배가 됩니다. 70%에서는 실효 요금이 서버리스의 약 1.43배로, 입력 약 $0.43, 출력 약 $1.71입니다.

그렇다고 PTU가 나쁜 상품이라는 뜻은 아닙니다. 상품의 성격을 정확히 보여 줄 뿐입니다. 고객 대상 에이전트를 운영하는 중견기업 CTO라면 예약 구간이 스로틀링 위험을 줄이고 99% 가동 시간 SLA가 계약상 가치가 있을 때 유휴 용량 20%를 합리적으로 받아들일 수 있습니다. 평일에만 수요가 있는 창업자는 용량 보장이 그 프리미엄보다 큰 매출을 보호하지 않는 한 밤과 주말까지 비용을 내서는 안 됩니다.
공개 페이지는 더 긴 약정에 할인이 적용될 수 있다고 안내하지만 할인표는 공개하지 않습니다. 협상 할인은 손익분기 점유율을 100% 아래로 낮춥니다. 영업팀이 주문서에 요율을 명시하기 전까지는 공개 정가로 계산하고, 할인은 추가 이익으로 취급해야 합니다.
99% SLA도 사업 관점에서 해석해야 합니다
월 가동 시간 목표 99%는 30.4일 기준 약 7시간 18분의 중단을 허용합니다. 최선형 액세스보다는 강하지만 Groq의 엔터프라이즈 Performance 계층은 99.9%를 공개하므로, 이 비교군에서 99%는 가장 강한 약정이 아닙니다. 퍼센트 기호가 붙은 세 글자만 보고 멈추지 말고 서면 보상, 유지보수 제외 조항, 리전 설계, 대체 경로를 비교해야 합니다.
Provisioned Throughput은 애플리케이션에 안정적인 기본 부하와 예측 가능한 모델 선택이 있고, 공유 플릿 스로틀링으로 고객 약속이 깨질 수 있을 때 가장 타당합니다. 트래픽이 10배씩 흔들리거나 모델이 매주 바뀌거나 오프라인 작업을 Batch로 옮길 수 있다면 설득력이 떨어집니다. 이런 경우 예약은 불확실성을 유료 유휴 시간으로 바꿉니다.
월요일 예산 회의의 질문이 달라집니다
2026년 7월 8일 이전에는 Together를 선택한 팀이 공유형 토큰당 서버리스에서 전용 GPU 인프라로 크게 뛰어야 했습니다. PTU는 그 사이에 새로운 예산 항목을 추가합니다. GPU 크기를 산정하거나 커스텀 서빙 스택을 떠맡지 않고도 모델 처리량을 예약할 수 있습니다. 엔지니어링은 같은 추론 API를 유지하면서 재무팀은 고정된 월 용량 한도를 승인할 수 있습니다.
그 결과 새로운 운영 지표가 필요해집니다. 토큰 비용만으로는 부족합니다. 담당자는 초당 최대 요청 수, 입력·출력 토큰 비율, 캐시 적중률, 용량 점유율, 스로틀된 요청, 승인된 결과를 파악해야 합니다. 대시보드에서 이 여섯 가지를 보여 주지 못하면 PTU가 보호 장치인지 낭비인지 판단할 수 없습니다.
MiniMax M3 PTU 1개로 실사용 에이전트 호출 약 600,000회를 처리합니다
각 호출이 캐시되지 않은 입력 토큰 8,000개와 출력 토큰 1,000개를 사용한다면 PTU 1개로 30일 동안 MiniMax M3 호출 약 600,000회를 처리할 수 있습니다. 앞서 서버리스 호출당 $0.0036로 계산한 것과 같은 워크로드이므로, 서버리스 호출 600,000회도 $2,160입니다. 완전히 점유하면 용량 단위와 토큰 단위 비용이 설계대로 만납니다.
용량 계산에는 요청의 입력과 출력이 모두 들어갑니다. 입력 토큰 8,000개는 MiniMax M3의 분당 입력 토큰 166,667개 스케줄에서 약 0.048 PTU-minute를 소모합니다. 출력 토큰 1,000개는 분당 출력 토큰 41,667개에서 0.024 PTU-minute를 더 소모합니다. 따라서 전체 요청은 약 0.072 PTU-minute를 사용합니다. 한 달의 43,200 PTU-minute를 이 요청 단위로 나누면 약 600,000회가 됩니다.
이 수치로 바로 의사결정에 쓸 수 있는 운영 예산을 만들 수 있습니다.
점유율 80%에서는 PTU가 약 480,000회 호출을 지원합니다. 같은 작업의 서버리스 청구액은 $1,728이므로 월 예약 프리미엄은 $432입니다. PTU가 실제로 소비한 서버리스 작업보다 25% 비쌉니다. 예약 용량과 99% SLA가 매출, 지원 시간 또는 평판 비용 $432 이상을 보호한다면 고객 대상 제품은 이 프리미엄을 받아들일 수 있습니다.
점유율 70%에서는 약 420,000회 호출을 지원합니다. 서버리스는 $1,512이므로 용량 프리미엄은 $648입니다. 50%에서는 300,000회 호출을 지원하고 서버리스는 $1,080이므로 PTU 청구액의 절반이 유휴 용량 비용으로 남습니다.
캐시는 한 단위에 들어가는 호출 수도 바꿉니다. 입력의 80%가 캐시되면 요청당 사용량이 약 0.072에서 0.04128 PTU-minute로 줄어듭니다. 그러면 PTU 1개로 같은 호출을 완전 점유 기준 약 1.0465 million회 처리할 수 있습니다. 서버리스 가격도 동시에 호출당 $0.0036에서 $0.002064로 내려가므로, 완전 부하 비용은 여전히 $2,160 부근에 수렴합니다.
따라서 캐시의 사업적 이점은 단가 절감뿐 아니라 처리량 증가에도 있습니다. 길고 고정된 시스템 프리픽스가 있으면 같은 예약 용량으로 더 많은 고객 작업을 처리할 수 있습니다. 프롬프트 변경으로 캐시 재사용이 깨지면 PTU 여유 용량이 줄고 서버리스 비용도 동시에 오릅니다.
이제 예산 항목 규모로 확장해 보겠습니다. PTU 10개는 30일 기준 $21,600이며, 완전히 점유하면 캐시되지 않은 예시 호출을 약 6 million회 처리합니다. 70%에서는 4.2 million회입니다. 같은 작업의 서버리스 청구액은 $15,120이므로 예약 용량과 SLA에 대한 월 프리미엄은 $6,480입니다.
CTO가 설명해야 할 숫자는 바로 $6,480입니다. 공유 플릿 스로틀링으로 위협받는 총마진, 지원 부담 또는 계약상 위약금이 $6,480보다 크다면 예약은 제값을 합니다. 그렇지 않다면 서버리스를 이용해 같은 $6,480을 제품 개발에 남길 수 있습니다. 막연히 "토큰에 $15,000을 쓰고 있다"는 주장만으로는 이 결론에 도달할 수 없습니다.
Dedicated Inference는 출력 처리량이 모델, 양자화, 배치 형태, 하드웨어 수, 구성에 따라 달라지므로 공개 토큰 손익분기점을 이처럼 깔끔하게 계산할 수 없습니다. GPU 월 가격을 하나의 일반 토큰 요금으로 나눈 뒤 보편적 교차점을 선언하는 글은 답을 좌우하는 변수를 숨기는 셈입니다. 대상 엔드포인트에서 후보 모델을 측정한 후, 관측된 사용률에서 승인된 결과당 비용을 비교해야 합니다.
Dedicated Inference와 GPU 클러스터는 서로 다른 문제를 풉니다
셀프서비스의 유연성보다 제어가 중요할 때 Dedicated Inference가 맞습니다. Together는 단일 테넌트 하드웨어를 할당하고 커스텀 모델, 오토스케일링, 트래픽 급증 처리를 지원합니다. 실시간 가격은 NVIDIA HGX H100이 $5.49/GPU-hour, HGX B200이 $8.99/GPU-hour입니다. H200, B300, GB200 NVL72, GB300 NVL72는 영업 문의가 필요합니다.
30일 연속 사용 시 H100 1개는 $3,952.80, B200 1개는 $6,472.80입니다. 멀티 GPU 요구사항을 적용하기 전의 GPU당 수치입니다. 엔드포인트는 요청량과 관계없이 실행되는 동안 과금되므로, 유휴 배포도 실제 예산 항목입니다.
하드웨어 비용을 예측할 때 오래된 전용 엔드포인트 문서를 사용하면 안 됩니다. 현재 문서에는 실시간 가격 페이지와 충돌하는 H100, H200, B200 수치가 남아 있습니다. 이 글에서는 더 최신 출처인 현재 가격 페이지를 확인했습니다. 인프라 가격에 날짜가 필요한 이유가 바로 여기에 있습니다.
파인튜닝하거나 업로드한 모델을 공유 서버리스에서 실행할 수 없을 때, p99 지연 시간에 안정적인 하드웨어가 필요할 때, 모델 서빙에 커스텀 설정이 필요할 때, 또는 꾸준히 높은 사용률 덕분에 예약 GPU가 경제적으로 우세할 때 Dedicated Inference는 비용의 가치를 합니다. 하루 대부분을 기다리는 엔드포인트라면 손해입니다.
GPU 클러스터가 더 저렴해 보이는 데는 함정이 있습니다
GPU 클러스터는 스택의 더 많은 부분을 구매자에게 넘깁니다. 현재 온디맨드 요금은 GPU-hour당 H100 $3.99, H200 $5.99, B200 $8.19입니다. 30일 기준 H100 환산 비용은 $2,872.80이지만, 이것이 $3,952.80인 Dedicated H100의 저렴한 대체재라는 뜻은 아닙니다. 클러스터 구매자가 배포, 서빙, 오케스트레이션, 관측성, 사용률 관리의 더 많은 부분을 맡습니다.
예약 클러스터 요금은 약정 기간이 길수록 내려갑니다. H100은 7-30일 $3.69, 31-90일 $3.45, 91-180일 $3.19로 떨어집니다. H200은 같은 구간에서 $4.99, $4.15, $3.99입니다. B200은 $7.99, $7.79, $6.79입니다. 181일 이상은 견적이 필요합니다.
할인에는 분명한 제약이 따릅니다. Together의 GPU 결제 문서에 따르면 전체 예약 요금은 프로비저닝 시 선결제되거나 한 번에 차감됩니다. 예약은 환불되지 않고 부분 환불도 불가능하며 일시 중지할 수도 없습니다. 클러스터가 예약 용량을 초과해 확장되면 추가 용량은 온디맨드 요금으로 청구됩니다.
91-180일 H100 예약은 720시간으로 환산한 한 달 GPU당 $2,296.80입니다. 온디맨드 환산액보다 $576 저렴합니다. 하지만 GPU를 유용하게 계속 점유할 때만 이 절감에 가치가 있습니다. GPU 4개 예약 중 절반이 놀고 있다면 시간당 항목이 낮다는 이유로 경제성이 생기지 않습니다.
스토리지에도 별도 수명 주기가 있습니다. 공유 스토리지는 $0.16/GiB-month이므로 1 TiB는 월 약 $163.84입니다. 볼륨은 클러스터를 종료한 뒤에도 누군가 삭제할 때까지 유지되며 계속 과금됩니다. 영구 데이터 주변에 컴퓨팅을 다시 만드는 데는 유용하지만, 방치된 볼륨이 조용히 비용을 만드는 구조이기도 합니다.
파인튜닝은 학습 비용이 낮아도 유지 비용이 클 수 있습니다
파인튜닝 비용은 학습 작업과 이후 모델 배포라는 두 부분으로 나뉩니다. 학습 항목은 아주 작아 보일 수 있지만, 결과물을 호스팅하는 비용이 월 지출의 대부분을 차지할 수 있습니다.
Together는 데이터셋 토큰에 에포크 수를 곱하고, 선택적 평가 토큰에 평가 실행 횟수를 곱해 표준 학습 비용을 계산합니다. 최대 16B 파라미터 모델의 지도 파인튜닝은 1 million processed tokens당 LoRA $0.48, 전체 파인튜닝 $0.54입니다. Direct Preference Optimization(DPO)은 LoRA $1.20, 전체 튜닝 $1.35입니다.
17B-69B 모델의 네 가지 요금은 각각 $1.50, $1.65, $3.75, $4.12입니다. 70B-100B 모델은 $2.90, $3.20, $7.25, $8입니다. 표준 작업의 최소 요금은 $4입니다.
더 큰 모델과 지정 모델에는 특화 요금이 적용됩니다. DeepSeek V4 Flash LoRA는 지도 파인튜닝이 1 million processed tokens당 $6, DPO가 $15이며 최소 요금은 $12입니다. gpt-oss-120B는 $5와 $12.50이고 최소 요금은 $6입니다. Kimi K2.6 또는 K2.7-Code는 $15와 $37.50이고 최소 요금은 $60입니다. GLM-5.2는 $40과 $100이고 최소 요금은 $60입니다.
이러한 모델별 가격 차이는 단순해 보이는 실험의 비용을 바꿉니다. 토큰 20 million개인 데이터셋을 3에포크 학습하면 60 million tokens가 처리됩니다. 표준 최대 16B LoRA 지도 학습은 $28.80이지만, 특화 GLM-5.2 LoRA에서는 같은 처리 토큰 수에 $2,400이 듭니다. 데이터셋 크기는 그대로이고 기본 모델 가격만 달라졌습니다.
학습 작업만으로 전체 수명 주기 비용이 끝나지는 않습니다. 파인튜닝 모델에는 배포 용량과 충분한 선불 잔액이 필요합니다. 현재 Dedicated H100 1개를 30일 동안 계속 실행하면 $3,952.80입니다. 작은 어댑터를 만드는 데 $28.80을 쓴 뒤, H100 하나를 유지하는 데 매월 그 금액의 137배 이상을 지출할 수 있습니다.
프로토타입 예산은 대개 여기서 무너집니다. 데이터 과학자는 학습 실행 비용을 보고하지만, 재무팀은 나중에 서빙 청구서를 받습니다. 실험을 승인할 때 예상 온라인 시간, GPU 수, 오토스케일링 최저치, 요청량, 종료 담당자를 포함한 배포 계획을 붙여야 합니다.
취소한 학습 작업의 환불 범위는 많은 구매자가 예상하는 것보다 좁습니다. Together는 완료된 스텝을 청구하고 완료되지 않은 작업만 환불합니다. 그 밖의 표준 플랫폼 요금은 약관상 기본적으로 환불되지 않습니다. 학습 작업은 되돌릴 수 있는 소프트웨어 구독이 아니라 이미 소비된 컴퓨팅으로 봐야 합니다.
Sandbox와 Code Interpreter는 별도의 에이전트 과금 항목입니다
Code Sandbox는 vCPU-hour당 $0.0446와 RAM GiB-hour당 $0.0149를 합산해 과금합니다. 2 vCPUs와 8 GiB를 사용하는 샌드박스를 160시간 실행하면 약 $33.34입니다. Code Interpreter는 별도 단위로 60-minute session당 $0.03입니다.
에이전트 제품에서는 이 비용이 모델 추론 비용 옆에 붙습니다. 월 에이전트 실행 10,000회가 각각 1시간 인터프리터 세션을 열면, 모델 토큰을 제외하고도 인터프리터 항목만 $300입니다. 세션을 안전하게 재사용할 수 있다면 제품 아키텍처가 완료 작업당 비용을 바꿉니다. 일이 끝난 뒤에도 세션이 열려 있으면 유휴 실행은 더 작은 규모의 유휴 GPU 용량과 같은 문제가 됩니다.
따라서 올바른 측정 단위는 1 million tokens당 비용이 아니라 승인된 결과당 비용입니다. 예시 MiniMax M3 호출은 $0.0036이지만 $0.03 Code Interpreter 세션 하나를 더하면, 재시도나 다른 툴 호출 전에도 전체 경로가 최소 $0.0336입니다. 전체 경로를 계측해야 합니다.
토큰 요금이 $0인 모델이 있어도 Together AI는 무료가 아닙니다
Together AI는 현재 무료 체험을 제공하지 않으며 플랫폼에 액세스하려면 최소 $5 선불 크레딧을 구매해야 합니다. 따라서 무료 플랜 여부에 대한 답은 분명합니다. API를 결제 없이 사용할 수 있는 무료 계정은 없습니다.
실시간 카탈로그에는 Ternary Bonsai 27B가 입력 1 million tokens당 $0, 출력 1 million tokens당 $0으로 올라와 있습니다. 해당 목록이 유지되는 동안 지속적인 추론 비용은 $0일 수 있지만, 계정 액세스를 위해서는 여전히 $5를 구매해야 합니다. 이 $5는 월 구독료로 설명되지 않습니다. 현재 구매한 선불 크레딧에는 만료일이 없습니다.
처음 낸 $5 외에 추가 결제가 전혀 필요 없는 사용자는 누구일까요? 현재 무료 모델만 쓰고, 속도 제한 안에 머물며, 유료 서비스를 시작하지 않는 취미 사용자나 평가자는 구매 잔액을 그대로 둘 수 있습니다. 이는 프로덕션 무료 계층이 아니라 매우 제한적인 사례입니다. 모델 제공 여부, 용량, 가격은 바뀔 수 있으므로 제품이 프로모션 또는 무료 엔드포인트를 영구 백엔드로 유지하겠다고 고객에게 약속해서는 안 됩니다.
과거에 제공하던 무료 가입 크레딧은 종료됐습니다. Together의 현재 지원 정책에 따르면 사용자는 최소 $5를 구매하고 결제 수단을 연결해야 합니다. 일반 선불 액세스에서는 마이너스 잔액이 허용되지 않으며, 구매 잔액이 0이 되면 크레딧을 추가할 때까지 API 액세스가 중단됩니다. 계약 고객에게는 주문 조건이 적용됩니다.
크레딧은 만료되지 않지만 환불 가능한 저축 계좌도 아닙니다
구매한 크레딧에는 현재 만료일이 없습니다. 연간 만료 정책보다는 유리하지만, 과도한 충전이 아무 문제 없다는 뜻은 아닙니다. Together 약관상 주문서에 달리 명시되지 않는 한 지불한 요금은 기본적으로 환불되지 않고, 결제 의무는 취소할 수 없으며, 월 중 일부 기간도 일할 계산되지 않습니다.
자동 충전은 신중하게 설정해야 합니다. 결제 문서에는 기본 충전액이 $25로 나와 있고, 현재 잔액보다 높은 임계값을 설정하면 차이가 메워질 때까지 즉시 반복 구매가 발생할 수 있다고 경고합니다. 예상 소진량에 맞춰 임계값을 설정하고, 구매할 때마다 알림을 보내며, 크레딧 잔액과 별도로 프로젝트 예산을 관리해야 합니다.
Build Tier는 누적 지출에 따라 한도가 올라갑니다
Together의 Build Tier 다섯 단계는 월별 기능 플랜이 아니라 누적 지출을 기준으로 한 속도 제한 구간입니다. Tier 1은 $5부터 시작하며 분당 LLM 요청 600회를 표시합니다. Tier 2는 $50부터 1,800회, Tier 3은 $100부터 3,000회, Tier 4는 $250부터 4,500회, Tier 5는 $1,000부터 6,000회입니다.
임베딩 한도는 Tier 1의 3,000 RPM에서 Tier 4와 5의 10,000 RPM까지 올라갑니다. 리랭크 허용량은 다섯 단계에 걸쳐 500,000에서 5,000,000으로 증가합니다. 모든 모델에 공통으로 보장되는 수치는 아닙니다. Together는 모델별 제한을 적용할 수 있고, 현재 서버리스 문서도 실시간 용량과 최근의 성공 트래픽에 반응하는 동적 한도를 설명합니다.
출시 시점에는 이 조합을 고려해야 합니다. Tier 5 계정도 인기 모델의 용량이 더 빡빡하거나 트래픽이 최근 패턴을 크게 뛰어넘으면 429 응답을 받을 수 있습니다. 서버리스는 프로비저닝을 해결하지만 모든 버스트를 해결하지는 않습니다. 대안은 Batch, PTU, Dedicated Inference이며 각각 비용과 지연 시간의 절충점이 다릅니다.
숨은 비용은 대부분 유휴 과금과 정책 경계에서 나옵니다
Together AI의 눈에 보이는 토큰 가격은 대체로 명확합니다. 큰 비용의 함정은 상품 사이, 약정, 유휴 리소스, 보편적으로 보이지만 실제로는 그렇지 않은 가정에 숨어 있습니다.
PTU 달력 계산: 분당 $0.05를 30일에 적용하면 $2,160입니다. 실시간 계산기의 각주는 약 43,800분을 적용하므로 약 $2,190이 됩니다. PTU당 $30의 차이는 100 PTU에서 $3,000이 됩니다. 계약서의 과금 기준을 사용해야 합니다.
PTU 미사용: 공개 PTU는 30일 내내 완전히 점유해야 Together 서버리스 가치와 같도록 보정되어 있습니다. 점유율 50%에서는 실효 토큰 비용이 2배가 됩니다. 용량과 SLA 가치가 이 프리미엄을 정당화할 수는 있지만, 프리미엄 자체는 명확히 보여야 합니다.
전용 리소스의 유휴 시간: Dedicated Inference는 요청이 0이어도 할당된 하드웨어가 실행되는 동안 과금됩니다. 파인튜닝 모델 호스팅은 실험 티켓뿐 아니라 월 예측에도 포함해야 합니다.
환불 불가 예약: GPU 클러스터 예약은 전체 기간 비용이 청구되며 일시 중지하거나 부분 환불할 수 없습니다. 예측 오류가 확정 지출로 바뀝니다.
온디맨드 버스트 초과분: 예약 GPU 용량을 넘어 확장하면 더 높은 온디맨드 요금이 적용됩니다. 안정적인 기본 부하가 있어도 버스트 가정을 너무 낮게 잡으면 예상 밖 비용이 생길 수 있습니다.
영구 스토리지: 스토리지는 클러스터가 종료된 뒤에도 남아 삭제할 때까지 계속 과금됩니다. 클러스터를 해체할 때마다 유지 또는 삭제를 명시적으로 결정해야 합니다.
Batch 적용 조건: 할인은 모델별로 다르고 24시간 완료 시간은 최선형이며, 취소 후에도 완료된 응답에는 비용이 청구됩니다. 실시간 목록을 확인하지 않은 채 전체 오프라인 예산에 50%를 적용하면 안 됩니다.
멀티미디어 기본값: 이미지·영상 가격은 최저 해상도, 재생 시간 또는 기본 스텝 수를 기준으로 할 수 있습니다. 프로덕션 품질 설정과 재시도는 사용 가능한 에셋당 비용을 바꿉니다.
자동 충전 동작: 공격적인 임계값은 즉시 구매를 일으킬 수 있고 일반 요금은 환불되지 않습니다. 자동 충전은 방치형 편의 기능이 아니라 알림을 갖춘 프로덕션 연속성 제어로 다뤄야 합니다.
출력 드리프트: 더 긴 응답을 만드는 프롬프트 또는 모델 업데이트는 요청량이 그대로여도 지출을 높입니다. 입력, 캐시 입력, 출력, 승인된 결과를 따로 추적해야 합니다.
속도 제한 드리프트: 서버리스 한도는 동적이며 모델마다 다를 수 있습니다. 누적 지출로 Tier 5를 달성해도 기반 플릿이 예약되는 것은 아닙니다.
표준 셀프서비스 연간 할인은 따로 모델링할 것이 없습니다. 서버리스는 선불 사용량 기반이고, PTU는 최소 1개월 약정이며, GPU 예약은 7-30일, 31-90일, 91-180일 구간을 공개합니다. 더 긴 약정은 영업팀을 거칩니다. 연간 종속 리스크는 공개 연간 앱 플랜이 아니라 커스텀 주문서나 연속된 인프라 예약에 존재합니다.
Together AI 대안: 같은 모델과 조건으로 비교해야 합니다
Together AI가 모든 공유 모델에서 유일하게 저렴한 것은 아닙니다. gpt-oss-120B의 공개 서버리스 가격은 Fireworks AI, Groq와 정확히 같습니다. 입력 토큰 1 million개당 $0.15, 출력 토큰 1 million개당 $0.60입니다. 입력 1 million개와 출력 250,000개 토큰을 쓰는 작업은 캐시 입력 혜택이나 계정별 계약을 적용하기 전 기준으로 세 공급자 모두 $0.30입니다.
이처럼 가격이 같다는 점은 오히려 유용합니다. 토큰 가격을 결정 요인에서 제외하고 캐시 요금, 속도 제한, 지연 시간, 공급자 제어, 폴백 동작, 배포 경로, SLA 구성을 비교하게 만들기 때문입니다.
Fireworks AI는 기본 요금이 같고 캐시 요금은 더 낮습니다
Fireworks AI의 gpt-oss-120B Standard 서버리스 요금은 1 million tokens당 입력 $0.15, 캐시 입력 $0.015, 출력 $0.60입니다. 캐시를 적용하지 않은 동일 조건 작업은 Together와 같은 $0.30입니다. Fireworks는 시작 크레딧 $1도 홍보합니다.

현재 Fireworks의 gpt-oss 캐시 입력 요금은 명확하고 낮으므로, 재사용 가능한 프리픽스가 큰 워크로드에서는 이 좁은 비교에서 Fireworks가 앞섭니다. Standard, Priority, Fast 서버리스 계층도 제공해 지연 시간과 가격 사이에서 선택할 수 있습니다. 다만 추가 계층 때문에 단순해 보이는 요금 비교가 복잡해지고, 전용 GPU 가격은 Together의 PTU와 다른 상품이라는 한계가 있습니다.
캐시 비중이 높은 오픈 모델 서버리스가 핵심 요구사항이고 서비스 계층 제어가 애플리케이션에 맞으면 Fireworks를 선택할 만합니다. 같은 API에서 PTU, 전용 모델 추론, 파인튜닝, 샌드박스 또는 원시 클러스터로 이어지는 경로의 전략적 가치가 더 크다면 Together를 선택하는 편이 낫습니다.
Groq는 같은 토큰 가격에 속도를 제공합니다
Groq의 gpt-oss-120B 요금도 입력 $0.15, 출력 $0.60으로 같아서 동일 조건 작업은 $0.30입니다. 현재 모델 페이지에는 약 500 tokens per second, Developer 플랜에서 분당 250,000 tokens와 분당 1,000 requests 한도가 표시됩니다.

낮은 생성 지연 시간이 제품의 핵심 약속이라면 Groq가 더 날카로운 후보입니다. 엔터프라이즈 Performance 계층은 프로비저닝된 처리량과 99.9% 가용성 SLA를 추가하지만 공개 가격은 없습니다. 따라서 셀프서비스 토큰 비용은 쉽게 비교할 수 있어도 예약 용량 비용은 견적 없이는 같은 조건으로 맞출 수 없습니다.
지원 모델 범위와 속도가 Together의 광범위한 학습·인프라 스택보다 중요한 인터랙티브 경로에는 Groq가 적합합니다. 하나의 계정에서 Together의 파인튜닝, GPU 클러스터, 샌드박스 또는 공개 PTU 경로가 필요하다면 적합하지 않습니다.
OpenRouter는 더 저렴할 수 있지만 애그리게이터의 절충이 따릅니다
현재 OpenRouter의 gpt-oss-120B 요금은 1 million tokens당 입력 $0.03, 캐시 입력 $0.03, 출력 $0.17입니다. 입력 1 million개와 출력 250,000개인 동일 조건 작업은 크레딧 구매 수수료 전 $0.0725입니다. 구매한 크레딧을 모두 사용한다고 보고 5.5% 수수료를 배분하면 약 $0.0765가 되지만, 소액 충전에서는 최소 수수료 $0.80의 영향이 더 큽니다.

OpenRouter는 업스트림 공급자 사이를 라우팅해 순간 가격 예시에서 앞섭니다. 자동 폴백과 훨씬 넓은 모델 카탈로그도 제공합니다. 그러나 Together 용량을 예약하거나 단일 인프라 공급자를 선택하는 것과 같은 상품은 아닙니다. 라우팅 선택, 데이터 정책, 지연 시간, 업스트림 가용성, 공급자 변경이 아키텍처의 일부가 됩니다.
무료 계층도 Together보다 접근하기 쉽습니다. 현재 가격 페이지에는 25개가 넘는 무료 모델과 하루 50회 요청이 표시됩니다. 그 대신 낮은 무료 한도, 사용량 기반 결제에 붙는 5.5% 플랫폼 수수료, 사용하지 않은 크레딧을 1년 뒤 만료시킬 수 있는 권리라는 절충이 있습니다. Together는 현재 구매한 크레딧이 만료되지 않는다고 안내합니다.
광범위한 모델 접근, 폴백, 현재의 라우팅 순간 가격이 가장 중요하면 OpenRouter를 선택할 만합니다. 직접적인 공급자 제어, 예측 가능한 예약 용량 경로, 모델 학습 또는 전용 인프라가 최저가 라우팅 요청보다 중요하면 Together가 적합합니다.
같은 조건으로 맞춘 결론은 명확합니다. gpt-oss-120B에서 Together, Fireworks, Groq는 캐시를 제외한 토큰 가격이 같습니다. 이 시점의 OpenRouter는 더 저렴하지만 공급 관계가 달라집니다. 선택을 뒤집는 것은 어느 플랫폼이 일반적으로 더 싸다는 주장이 아니라 운영 요구사항입니다.
Together AI가 맞는 팀과 피해야 할 팀
Together AI는 불확실한 호출로 시작한 오픈 모델 워크로드가 계획된 용량 운영으로 성장할 것으로 예상하는 회사에 적합합니다. 저비용 API가 필요한 모든 개발자에게 자동으로 정답인 플랫폼은 아닙니다.
1인 기술 개발자는 서버리스로 시작하고 첫 구매를 $5로 유지해야 합니다. 범위가 정해진 작업을 DeepSeek V4 Flash, gpt-oss-120B 또는 품질 하한선을 넘는 다른 모델로 라우팅합니다. 프로덕션 로그에서 안정적인 수요가 입증되기 전에는 PTU와 전용 하드웨어를 피해야 합니다. 목적이 폭넓은 모델 체험이나 무료 액세스뿐이라면 OpenRouter가 더 깔끔한 첫 계정일 수 있습니다.
투자 유치 스타트업 창업자는 배포 단계가 향후 마이그레이션 작업을 줄여 줄 때 Together를 써야 합니다. 서버리스로 제품을 검증하고, 같은 API 뒤에서 PTU로 안정적인 오픈 모델을 예약하며, Dedicated Inference로 파인튜닝 또는 커스텀 모델을 호스팅할 수 있습니다. 제품 로드맵이 이미 예약 용량을 향한다면 이 연속성이 작은 토큰 가격 차이보다 가치 있습니다.
중견기업 CTO는 청구액이 크다는 이유가 아니라 서비스 약정을 위해 PTU를 구매해야 합니다. 점유율을 예측하고 99% SLA를 고객 약속과 비교하며, 거래 손실이나 지원 에스컬레이션을 기준으로 용량 예약의 가치를 계산합니다. 애플리케이션에 99.9% 가용성이 필요하다면 99%라는 문구만으로는 부족합니다. 폴백을 설계하거나 계약을 협상해야 합니다.
숙련된 운영자는 용량을 예약하기 전에 오프라인 작업부터 Batch로 옮겨야 합니다. 분류, 보강, 평가, 합성 데이터 작업은 대상 모델에서 최대 50% 할인을 받을 수 있습니다. 지연 시간을 받아들이고 얻는 직접 할인입니다. PTU는 용량 구매이므로 그다음에 검토해야 합니다.
리서치 또는 모델 팀은 사용률 담당자가 있을 때만 Dedicated Inference나 GPU 클러스터를 사용해야 합니다. 학습, 커스텀 서빙, 저수준 제어가 스택을 정당화할 수 있습니다. GPU-hour, 유휴 레플리카, 버스트 사용량, 영구 볼륨을 모니터링하지 못하는 팀은 통제할 수 없는 인프라를 사는 셈입니다.
다음 네 조건 중 하나라도 해당하면 Together AI를 피해야 합니다. 라우팅된 최저 토큰 가격만 중요하거나, 트래픽이 너무 불규칙해 1개월 예약이 맞지 않거나, 필요한 모델이 다른 곳에 있거나, 영업 협상 없이 더 강한 공개 SLA가 필요할 때입니다. Fireworks, Groq, OpenRouter 또는 모델 직접 공급자가 더 적합할 수 있습니다.
- 한 계정에서 서버리스, 예약 토큰 용량, 전용 추론, 파인튜닝, GPU 클러스터, 샌드박스 컴퓨팅, 스토리지를 이용할 수 있습니다.
- 현재 서버리스 요금은 여러 오픈 모델에서 경쟁력이 있고, 지원 엔드포인트의 캐시 입력 할인 폭도 큽니다.
- 구매한 선불 크레딧은 현재 만료되지 않습니다.
- Provisioned Throughput은 공유 추론과 전용 추론 사이에 공개된 $0.05/PTU-minute 경로를 제공합니다.
- 결제 없는 무료 체험이 없으며 플랫폼 액세스에 $5 구매가 필요합니다.
- 공개 PTU 정가는 협상 할인 전 기준으로 완전히 점유해야 Together 서버리스와 비용이 같아집니다.
- 폴백이 없다면 99% PTU 가동 시간 SLA는 중요한 고객 경로에 충분하지 않을 수 있습니다.
- Dedicated, 예약 GPU, 스토리지, 파인튜닝 배포는 요청량이 0이어도 계속 과금될 수 있습니다.
- 실시간 가격과 오래된 제품 문서가 충돌할 수 있으므로 구매팀은 날짜가 명시된 출처를 사용해야 합니다.
월요일 실행안: 예약 전에 워크로드 하나를 측정합니다
월요일에는 범위가 정해진 프로덕션 워크플로 하나를 골라 7일간의 비용 기록을 만듭니다. 모든 모델을 시험하는 것이 목적은 아닙니다. 이 부하를 서버리스, Batch, PTU, 전용 용량 중 어디에 배치할지 알아내는 것이 목표입니다.
승인된 결과 하나를 정의합니다
유효한 분류, 테스트를 통과한 코드 변경, 승인된 지원 답안 초안, 완료된 추출처럼 채점할 수 있는 결과를 가진 작업을 선택합니다. 승인된 결과당 비용이 사업 지표입니다.
전체 사용량 형태를 기록합니다
7일 동안 요청 수, 캐시되지 않은 입력, 캐시 입력, 출력, 재시도, 초당 최대 요청 수, 429 응답, 지연 시간, 샌드박스 시간, 승인된 결과를 수집합니다. 평일 피크와 야간·주말을 구분합니다.
서버리스 기준 비용을 계산합니다
측정한 토큰 구성에 실시간 모델 요금을 적용합니다. 대상 오프라인 작업을 Batch로 옮긴 뒤 다시 계산합니다. 불필요한 출력을 제한하고 고정 프롬프트 프리픽스를 유지해 실제로 달성 가능한 캐시 절감을 기준 비용에 포함합니다.
PTU 점유율 테스트를 실행합니다
최대 요청률, 캐시 적중률, 토큰 구성을 실시간 PTU 계산기에 넣습니다. 필요한 PTU 수와 평균 사용량을 비교합니다. 점유율 80%에서 공개 정가는 25%의 실효 토큰 프리미엄을 포함합니다. 예약 용량과 99% SLA가 그 값을 하는지 판단합니다.
요구사항의 이름을 댈 수 있을 때만 상위 단계로 갑니다
커스텀 모델, 단일 테넌트 제어 또는 안정적인 하드웨어 성능이 필요할 때 Dedicated Inference로 이동합니다. 팀이 서빙 또는 학습 스택을 직접 소유할 때만 GPU 클러스터로 이동합니다. 예산 담당자 옆에 종료 및 스토리지 정리 담당자를 지정합니다.
최종 결정은 재무팀과 엔지니어링팀이 함께 쓸 수 있는 한 문장입니다. "이 워크로드는 서버리스에 남긴다", "이 오프라인 구간은 Batch로 옮긴다", 또는 "용량 보장이 측정된 유휴 프리미엄만큼 가치 있으므로 이 고객 경로에 N PTU를 예약한다"입니다. 가격 문구만 보고 인프라를 이전하는 일이 아니라 월요일에 바로 실행할 수 있는 조치입니다.
Together AI pricing 자주 묻는 질문
Together AI에서 토큰 1,000개는 얼마인가요?
모델의 1 million당 요금을 1,000으로 나누고 입력과 출력을 따로 계산합니다. MiniMax M3는 캐시되지 않은 입력 토큰 1,000개당 $0.0003, 출력 토큰 1,000개당 $0.0012입니다. Kimi K3는 토큰 1,000개당 입력 $0.003, 출력 $0.015입니다.
Together AI의 월 비용은 얼마인가요?
서버리스에는 고정 월 구독료가 없습니다. $5 액세스 구매 후 월비용은 사용량에 따라 달라집니다. PTU 1개는 30일 기준 $2,160이며, 가격 페이지의 평균 월 가정인 43,800분을 쓰면 약 $2,190입니다. 현재 시간당 $5.49 요금으로 Dedicated H100 1개를 720시간 계속 실행하면 $3,952.80입니다.
Together AI는 무료인가요?
아닙니다. Together AI는 현재 무료 체험을 제공하지 않으며 플랫폼 액세스에 최소 $5 선불 크레딧 구매가 필요합니다. 실시간 카탈로그에는 Ternary Bonsai 27B의 입력·출력 토큰 요금이 $0으로 표시되지만, 계정에는 여전히 $5 구매가 필요합니다.
Together AI는 무료 크레딧을 제공하나요?
상시 가입 혜택으로는 제공하지 않습니다. 과거 가입 프로모션은 종료됐고, 현재 액세스에는 $5 구매가 필요합니다. Together는 정규 수업 밖에서 프로젝트를 진행하는 학생을 위한 초대 전용 리서치 크레딧 프로그램도 운영하지만 널리 제공되는 제도는 아닙니다.
Together AI 무료 계층의 한도는 얼마인가요?
일반적인 무료 계층은 없습니다. $5 잔액을 구매하면 계정은 Build Tier 1이 되며, 현재 분당 LLM 요청 600회, 분당 임베딩 요청 3,000회, 리랭크 한도 500,000을 표시합니다. 모델별·동적 한도는 이보다 낮을 수 있습니다.
Together AI의 가장 좋은 대안은 무엇인가요?
Fireworks AI는 광범위한 오픈 모델 추론과 파인튜닝에서 가장 가까운 대안이고, Groq는 지원되는 저지연 모델에 매력적이며, OpenRouter는 폭넓은 모델 라우팅과 폴백에 강합니다. gpt-oss-120B에서 Together, Fireworks, Groq의 현재 1 million tokens당 입력 요금은 $0.15, 출력 요금은 $0.60으로 같습니다. 이 시점의 OpenRouter 라우팅 가격은 더 낮지만 크레딧 구매 수수료와 애그리게이터 계층이 추가됩니다.
Together AI에 학생 할인이 있나요?
Together AI는 상시 학생 요금제를 공개하지 않습니다. 초대 전용 리서치 크레딧 프로그램은 정규 수업 밖에서 프로젝트를 진행하는 학생에게 소규모 지원금을 제공하며, 결과물에 Together AI를 명시하도록 요구합니다.
Together AI의 환불 정책은 무엇인가요?
Together 약관상 주문서에 달리 명시되지 않는 한 요금은 기본적으로 환불되지 않고, 결제 의무는 취소할 수 없으며 일할 계산되지 않습니다. GPU 예약도 환불되지 않습니다. 파인튜닝 작업을 취소하면 완료된 스텝은 청구하고 완료되지 않은 부분만 환불합니다.
Together AI 크레딧은 만료되나요?
구매한 선불 크레딧은 현재 만료되지 않습니다. 환불 가능 여부와는 별개입니다. 크레딧은 환불되지 않아도 계속 사용할 수 있으며, 청구서가 발행된 뒤 구매한 크레딧으로 기존 연체 잔액을 정산할 수는 없습니다.
2026년에 Together AI 가격이 바뀌었나요?
그렇습니다. Together AI는 2026년 7월 8일 Provisioned Throughput을 출시해 분당 $0.05/PTU의 예약 토큰 용량, 최소 1개월 약정, 99% 가동 시간 SLA를 추가했습니다. 현재 서버리스 카탈로그와 전용 하드웨어 요금도 6월 이후 바뀌었으므로 이 글에는 8월 22일 확인 날짜를 명시했습니다.
Provisioned Throughput이 Together 서버리스보다 저렴한가요?
자동으로 저렴해지는 것은 아닙니다. 공개 정가에서 PTU 1개를 완전히 점유하면 30일 가치가 해당 Together 서버리스 용량과 거의 정확히 같습니다. 사용률이 낮으면 실효 토큰 가격이 오릅니다. PTU는 예약 용량과 SLA를 구매하는 상품입니다. 약정 할인을 협상하면 요율이 좋아질 수 있지만 Together는 그 할인표를 공개하지 않습니다.
비즈니스 오너를 위한 AI Tools Map 받기
AI Tools Map for Business Owners는 모델 가격을 실제 도입 스택으로 바꿔 줍니다. 각 툴의 품질 하한선, 라우팅 역할, 비용 전환 기준을 담았습니다. 다음 에디션을 무료로 받아보세요.
2026년 9월 2일







