Groq 무료 플랜과 API 가격 총정리(2026): 업그레이드는 토큰 비용이 아니라 처리량이 결정합니다

Groq 무료 플랜의 실제 한도와 Developer 종량제 요금, 모델별 토큰 가격을 한눈에 비교합니다. GPT-OSS 120B 예시부터 Batch·캐싱·Compound 툴 비용, Together AI·Fireworks AI 비교까지 실무 예산 기준을 정리했습니다.

Thursday, September 3, 2026Omid Saffari
Groq 무료 플랜과 API 가격 총정리(2026): 업그레이드는 토큰 비용이 아니라 처리량이 결정합니다

Groq 무료 플랜은 모델별 한도가 워크플로를 막기 전까지 비용이 $0입니다. 그다음 단계인 Developer에는 구독료가 없고 사용량만큼만 과금됩니다. GPT-OSS 120B 예시 워크로드에서 Free의 일일 토큰 한도를 유료 트래픽으로 환산하면 월 $1.44에 불과합니다. 결국 업그레이드를 재촉하는 것은 토큰 비용이 아니라 처리량입니다.

Groq 무료 플랜과 API 가격 한눈에 보기

Groq에는 따로 기억해 둘 셀프서비스 월별 좌석 요금이 없습니다. 선택지는 속도 제한이 있는 Free 플랜, 종량제 Developer 플랜, 맞춤형 용량을 제공하는 Enterprise입니다.

아래 가격과 한도는 2026년 8월 15일 기준으로 Groq 실시간 가격 페이지, 지원 모델, 결제 FAQ, 속도 제한 문서에서 확인했습니다.

모델 및 내장 툴 요금이 표시된 Groq 실시간 가격 페이지
2026년 8월에 확인한 Groq 가격
플랜가격용량적합한 용도
Free$0모델별 조직 한도평가 및 가벼운 내부 사용
Developer기본 구독료 없음, 사용량 과금기본 텍스트 모델 한도 최대 300K TPM 및 1K RPM셀프서비스 프로덕션
Enterprise맞춤형 프로비저닝 용량계약에 따른 입력 및 출력 번들SLA가 필요한 핵심 경로

토큰은 모델 과금의 기준 단위입니다. 입력 토큰에는 모델로 보내는 지시문, 대화 기록, 문서, 툴 정의가 포함되고, 출력 토큰은 모델이 생성한 내용입니다. Groq는 입력과 출력을 각각 100만 토큰 단위로 제시하므로 월 비용은 입력, 출력, 오디오, 내장 툴 사용료를 모두 합해 계산합니다.

Developer에는 월간 또는 연간 구독 약정이 없습니다. Groq에 결제 수단을 등록하면 사용량이 측정되며, 일반적으로 후불 청구됩니다. 별도의 초과 요금도 없습니다. Free에서는 해당 한도를 넘은 트래픽이 차단되지만, Developer에서는 계정 제한이나 Spend Limit에 걸릴 때까지 같은 모델 요율로 계속 과금됩니다. Enterprise Performance는 방식이 다릅니다. 공개된 온디맨드 토큰 요율 대신 프로비저닝된 입력 및 출력 용량을 구매합니다.

Groq 무료 플랜, 공유 한도가 프로덕션 의존성이 되기 전까지는 충분합니다

Groq의 Free 플랜만으로도 프로토타입, 내부용 도우미, 트래픽이 적은 자동화를 의외로 넉넉하게 운영할 수 있습니다. 하지만 속도 제한 오류가 고객에게 노출되는 순간, 더는 무료 인프라로 보기 어렵습니다.

한도는 API 키별이 아니라 조직 전체에 적용됩니다. 키를 더 만든다고 용량이 늘어나지는 않습니다. Groq는 분당 요청 수, 일일 요청 수, 분당 토큰 수, 일일 토큰 수를 동시에 제한합니다. 가장 먼저 도달한 상한이 다음 호출을 HTTP 429로 차단합니다.

현재 프로덕션 텍스트 모델에 공개된 Free 한도는 다음과 같습니다.

  • GPT-OSS 120B 및 GPT-OSS 20B: 30 RPM, 1,000 RPD, 8,000 TPM, 200,000 TPD.
  • Llama 3.3 70B Versatile: 30 RPM, 1,000 RPD, 12,000 TPM, 100,000 TPD.
  • Llama 3.1 8B Instant: 30 RPM, 14,400 RPD, 6,000 TPM, 500,000 TPD.
  • Compound 및 Compound Mini: 30 RPM, 250 RPD, 70,000 TPM.
  • Whisper Large V3 및 Turbo: 20 RPM, 2,000 RPD, 시간당 오디오 7,200초, 일일 오디오 28,800초.

Groq는 이 공개 표를 개괄적인 요약으로 설명합니다. 개별 조직에 현재 적용되는 정확한 허용량은 Console의 Limits 페이지에서 확인해야 합니다.

요청 수보다 일일 토큰 상한에 먼저 닿는 경우가 많습니다. 입력 2,000토큰과 출력 500토큰을 사용하는 GPT-OSS 120B 요청을 예로 들어보겠습니다. 요청당 총 2,500토큰이므로 200,000 TPD 한도에서는 하루 80건을 처리할 수 있습니다. 8,000 TPM 기준으로는 1분에 3건까지 가능하며, 비슷한 네 번째 요청은 플랜에 30 RPM이라고 표시되어 있어도 토큰 한도를 넘습니다.

이 지점이 무료와 유료의 손익분기점입니다. Developer에서 같은 요청의 비용은 $0.0006이므로 하루 80건을 30일 사용해도 약 $1.44입니다. 프로덕션 워크플로를 Free 한도에 억지로 맞출 재무적 이유는 거의 없습니다. 업그레이드로 확보하는 것은 용량이며, 이때도 모델 비용은 대부분의 SaaS 부가 기능보다 저렴합니다.

GPT-OSS 120B 예시 워크로드를 기준으로 Groq Free에서 Developer와 Enterprise로 이어지는 의사결정 흐름
2,500토큰 예시 요청은 Free에서 하루 80건에 도달하지만, 같은 월간 트래픽의 Developer 비용은 약 $1.44입니다

계속 무료로 써도 되는 경우

Groq를 로컬 개발, 간헐적인 평가, 개인용 내부 스크립트, 또는 트래픽이 해당 토큰 및 요청 상한보다 낮은 데모에 사용한다면 Developer가 전혀 필요하지 않을 수 있습니다. 429 오류가 발생해도 재시도까지 기다릴 수 있고 연속 서비스를 약속한 대상이 없다면 Free가 적합합니다.

워크플로에 사용자가 있거나 마감이 있거나, 공유 한도를 견디지 못하는 큐가 있다면 유료로 전환해야 합니다. Developer에는 Batch, Flex, 채팅 지원, Spend Limits도 추가됩니다. 실질적인 경계는 다른 모델 카탈로그가 아니라 이런 운영 제어 기능입니다.

현재 제공되는 모든 Groq 모델 가격

현재 Groq의 프로덕션 카탈로그는 텍스트 모델 4개, 음성 텍스트 변환 모델 2개, Compound 시스템 2개로 간결합니다. 별도의 프리뷰 카탈로그에는 예고 없이 사라질 수 있는 모델이 포함됩니다.

프로덕션 텍스트 모델

  • Llama 3.1 8B Instant는 100만 토큰당 입력 $0.05, 출력 $0.08입니다. 프로덕션 텍스트 경로 중 가장 저렴합니다. Developer 기본 허용량은 250,000 TPM 및 1,000 RPM이며, 컨텍스트 윈도는 131,072토큰입니다.
  • GPT-OSS 20B는 100만 토큰당 입력 $0.075, 출력 $0.30입니다. 캐시된 입력은 100만 토큰당 $0.0375입니다. Developer 기본 허용량은 250,000 TPM 및 1,000 RPM이며, 컨텍스트 윈도는 131,072토큰입니다.
  • GPT-OSS 120B는 100만 토큰당 입력 $0.15, 출력 $0.60입니다. 캐시된 입력은 100만 토큰당 $0.075입니다. Developer 기본 허용량은 250,000 TPM 및 1,000 RPM이며, 컨텍스트 윈도는 131,072토큰입니다.
  • Llama 3.3 70B Versatile은 100만 토큰당 입력 $0.59, 출력 $0.79입니다. Developer 기본 허용량은 300,000 TPM 및 1,000 RPM이며, 컨텍스트 윈도는 131,072토큰입니다.

대형 오픈 웨이트 모델이 필요하면서 동일 모델을 제공하는 대체 공급자도 중요하다면, GPT-OSS 120B로 프로덕션 평가를 시작하십시오. 수용 기준을 확인했을 때 더 작은 모델도 결과 품질을 유지하는 경우에만 GPT-OSS 20B 또는 Llama 3.1 8B로 낮추는 편이 좋습니다. Llama 3.3 70B는 그 결과가 GPT-OSS 120B 대비 입력 3.93배, 출력 1.32배의 요율을 정당화할 때만 선택하십시오.

이 배수가 어느 모델이 더 낫다는 사실을 입증하는 것은 아닙니다. 재시도 감소, 응답 단축, 검수 작업 절감, 또는 더 저렴한 경로에는 없는 기능으로 그 차액을 얼마나 회수해야 하는지를 보여줄 뿐입니다.

음성 텍스트 변환 모델

  • Whisper Large V3는 오디오 1시간당 $0.111입니다. Developer 기본 용량은 시간당 오디오 200,000초 및 300 RPM이며, 최대 파일 크기는 100 MB입니다.
  • Whisper Large V3 Turbo는 오디오 1시간당 $0.04입니다. Developer 기본 용량은 시간당 오디오 400,000초 및 400 RPM입니다.

오디오 1,000시간을 처리하면 Whisper Large V3는 $111, Turbo는 $40으로, 차이는 $71입니다. 저렴한 모델부터 검토하되, 오디오 팀은 전사 결과의 수용 기준을 통과하는 모델을 선택해야 합니다. 수정이 필요한 저가 전사 결과는 결국 더 저렴하지 않습니다.

Compound 시스템과 프리뷰 모델

Groq Compound와 Compound Mini는 프로덕션 모델에 서버 측 툴을 결합합니다. 단일 고정 토큰 요율은 없습니다. Groq가 기반 모델과 툴 비용을 그대로 청구하므로, Compound 비용은 토큰당 단일 추정치가 아니라 별도의 비용 항목으로 계산해야 합니다.

현재 실시간 프리뷰 카탈로그에는 다음 모델이 나옵니다.

  • Qwen3.6 27B: 100만 토큰당 입력 $0.60, 출력 $3.00.
  • Safety GPT-OSS 20B: 100만 토큰당 입력 $0.075, 출력 $0.30.
  • Llama Prompt Guard 2 22M: 100만 토큰당 입력 및 출력 $0.03.
  • Llama Prompt Guard 2 86M: 100만 토큰당 입력 및 출력 $0.04.
  • Canopy Labs Orpheus V1 English: 100만 자당 $22.
  • Canopy Labs Orpheus Arabic Saudi: 100만 자당 $40.
  • MiniMax M2.7: 영업 문의를 통한 Enterprise 가격.

프리뷰는 평가용이며 프로덕션 제공을 약속하지 않습니다. Groq는 이런 모델을 예고 없이 중단할 수 있다고 밝힙니다. 따라서 Qwen3.6 27B에 의존하는 예산이라면 고객에게 제공하기 전에 다른 공급자나 모델로 전환할 경로도 검증해 두어야 합니다.

현재 Groq의 Supported Models 페이지에는 DeepSeek이나 Kimi 모델이 없습니다. 이 이름들을 여전히 활성 Groq 경로로 계산하는 예전 글과 계산기는 낡은 정보입니다. DeepSeek이 필요하다면 Groq 카탈로그에 남아 있다고 가정하지 말고 현재 제공 중인 공급자를 기준으로 가격을 산정하십시오. 별도의 판단은 DeepSeek 가격 분석에서 다룹니다.

모델은 요청당 가격이 아니라 결과당 비용으로 결정합니다

Groq의 토큰 요율은 매우 낮아서 사용량이 커지기 전에는 모델 선택보다 트래픽 형태가 비용에 더 큰 영향을 줍니다. 가장 명확한 비교법은 요청 하나의 조건을 고정한 뒤 각 경로의 비용을 계산하는 것입니다.

입력 2,000토큰과 출력 500토큰을 사용하는 표준 요청을 가정하겠습니다. 캐싱, Batch, 툴, 재시도를 제외하고 월 100,000건을 처리하면 다음과 같습니다.

  • Llama 3.1 8B Instant: 총 $14, 요청당 $0.00014.
  • GPT-OSS 20B: 총 $30, 요청당 $0.0003.
  • GPT-OSS 120B: 총 $60, 요청당 $0.0006.
  • Llama 3.3 70B Versatile: 총 $157.50, 요청당 $0.001575.
  • Qwen3.6 27B 프리뷰: 총 $270, 요청당 $0.0027.

의미 있는 분모는 요청 수가 아니라 승인된 결과 수입니다. 작은 모델이 재시도하거나 더 긴 출력을 만들거나 사람의 검수 부담을 늘린다면, 저렴한 요청이 오히려 비싼 워크플로가 될 수 있습니다. 모델이 표시 가격만으로 선택되지 않고 실제 가치를 입증하도록 토큰과 함께 승인된 결과를 추적하십시오.

사용량이 늘면 특정 Groq 모델이 자동으로 더 저렴해지는 유료 구간의 손익분기점은 없습니다. 공개된 모든 온디맨드 요율은 선형이며 기본료가 없기 때문입니다. GPT-OSS 20B의 예시 비용은 요청 1건일 때도 100만 건일 때도 GPT-OSS 120B의 절반입니다. 결과 품질이나 운영 방식이 필요한 작업량을 바꿀 때만 판단이 뒤집힙니다.

투자를 유치한 창업자라면 분류에는 GPT-OSS 20B를 쓰고 모호한 사례에는 GPT-OSS 120B를 적용할 수 있습니다. 중견기업 CTO라면 조달 부서가 승인된 워크플로당 비용을 확인할 수 있도록 모든 요청 로그에 모델 및 토큰 필드를 남겨야 합니다. 시니어 운영자는 성공한 데모 한 번을 프로덕션 경로의 증거로 삼지 말고 수정과 재시도를 측정해야 합니다.

비동기 작업에는 캐싱보다 Batch가 유리하며, 할인은 중복 적용되지 않습니다

결과를 기다릴 수 있다면 Groq Batch가 공개된 요율 중 가장 저렴합니다. 동기식 API 가격보다 50% 저렴하고, 표준 모델별 한도 밖에서 실행되며, 처리 기간은 24시간에서 7일까지 선택할 수 있습니다.

월 100,000건의 GPT-OSS 120B 예시 워크로드에서는 다음 선택지를 비교할 수 있습니다.

  • 캐시 없는 동기식 처리: $60.
  • 입력 토큰의 50%를 캐시로 제공하는 동기식 처리: $52.50.
  • 입력 토큰의 80%를 캐시로 제공하는 동기식 처리: $48.
  • Batch: $30.

예산을 좌우하는 현재 규칙은 명확합니다. Batch와 프롬프트 캐싱 할인은 중복 적용되지 않습니다. 모든 Batch 토큰은 캐시 상태와 관계없이 50% 할인된 Batch 요율로 청구됩니다. $30인 Batch 합계를 다시 절반으로 줄여 $15로 계산한 스프레드시트는 잘못된 것입니다.

프롬프트 캐싱은 동기식 GPT-OSS 트래픽에 여전히 유용합니다. 자동으로 작동하고 별도 기능 요금이 없으며, 캐시된 입력 요금은 50% 할인됩니다. 현재 GPT-OSS 20B, GPT-OSS 120B, GPT-OSS Safeguard 20B를 지원합니다. 캐시 히트가 발생하려면 접두사가 정확히 일치해야 하며, 캐시 가능한 최소 접두사는 모델에 따라 128~1,024토큰입니다. 사용하지 않은 캐시 데이터는 2시간 후 만료됩니다. 캐시 히트는 베스트 에포트 방식이며 보장되지 않습니다.

안정적인 시스템 지시문과 툴 정의를 프롬프트 앞에 놓고, 변하는 사용자 데이터는 그 뒤에 배치하십시오. 그런 다음 응답에서 캐시된 토큰 사용량을 확인합니다. 예상 캐시 비율은 프로덕션 사용 데이터로 입증되기 전까지 예산상의 사실이 아닙니다.

Batch에는 별도의 운영 조건이 있습니다. JSONL 파일 하나에는 최대 50,000줄을 담을 수 있고 크기는 200 MB까지 허용됩니다. 선택한 처리 기간 안에 끝나지 않은 작업은 만료되지만, Groq는 성공적으로 완료된 요청에만 요금을 부과합니다. Batch 파일과 결과는 Groq 시스템에 최대 30일간 남을 수 있으므로, 민감한 워크로드는 비용 절감을 판단하기 전에 데이터 보존 정책을 검토해야 합니다.

$60의 토큰 비용이 $560의 Compound 청구서가 되는 이유

Compound의 숨은 비용은 모델이 아니라 툴 루프입니다.

Groq는 1,000회 요청당 Basic Search $5, Advanced Search $8, Visit Website $1을 청구하고, Code Execution은 시간당 $0.18입니다. 이 비용은 기반 모델 토큰 요금에 더해집니다.

표준 GPT-OSS 120B 요청 100,000건을 가정해 보겠습니다. 모델 토큰은 $60입니다. 모든 요청이 Basic Search를 한 번씩 실행하면 검색 비용 $500이 추가되어 총 청구액은 $560이 됩니다. 매번 Advanced Search를 한 번씩 쓰면 총 $860, Visit Website를 한 번씩 쓰면 총 $160입니다.

GPT-OSS 토큰 비용 60달러와 Basic Search 비용 500달러를 비교한 막대
예시 요청 100,000건에서 요청마다 Basic Search를 한 번 사용하면 $60의 토큰 비용에 $500이 추가됩니다

에이전트 팀이 가장 놀라기 쉬운 예산 항목입니다. 매 턴 검색하는 에이전트 워크플로는 토큰을 최적화해도 비용 문제를 해결할 수 없습니다. 먼저 툴 정책을 세워야 합니다. 검색이 필요한 조건을 정의하고, 툴 루프에 상한을 두고, 재사용할 수 있는 결과는 모델 외부에 캐시하며, 승인된 결과당 툴 호출 수를 기록하십시오.

유료 플랜은 연간 약정이 없지만 운영상 주의점이 있습니다

Developer는 사용량 기반으로 과금되며, 연간 SaaS 계약을 다른 형태로 포장한 상품이 아닙니다. 눈에 잘 띄지 않는 조건은 결제 시점, 한도의 작동 방식, 크레딧 처리 방식에 관한 것입니다.

새 Developer 계정에는 단계별 청구가 적용됩니다. 누적 사용액이 $1, $10, $100, $500, $1,000을 넘을 때 Groq가 청구서를 발행할 수 있습니다. $1,000 기준을 넘으면 일반적인 월별 청구로 전환됩니다. 인도 청구 주소를 등록한 계정은 $1과 $10 기준을 거친 뒤 $100씩 반복해서 청구됩니다. 사용액이 최소 $0.50에 도달하기 전까지 Groq는 결제를 요구하지 않습니다.

이 일정 때문에 도입 초기에는 카드에 소액 결제가 여러 번 잡힐 수 있습니다. 추가 수수료는 아니지만, 재무팀이 중복 결제로 오인하지 않도록 결제 패턴을 미리 알아둘 필요가 있습니다.

Spend Limit은 짧은 반영 지연 후 트래픽을 차단합니다

유료 플랜에서는 조직 전체에 적용되는 월별 Spend Limit을 하나 설정할 수 있습니다. 모든 API 키와 엔드포인트를 포함하고, 매월 1일에 초기화되며, 한도 도달이 감지되면 새 요청을 차단합니다. Groq는 상한의 50%, 75%, 90% 같은 지점에 알림을 설정할 수 있도록 지원합니다.

지출 추적에는 10~15분의 업데이트 지연이 있습니다. 따라서 차단이 시작되기 전에 트래픽이 몰리면 최종 청구액이 설정값을 조금 넘을 수 있습니다. Groq는 예상 월 사용액보다 20%~30% 높은 한도에서 시작할 것을 권합니다. 핵심 경로에서는 이 여유분이 정상적인 트래픽 급증으로 인해 예산 통제가 장애로 바뀔 가능성도 줄여줍니다.

크레딧은 만료되며 선불 구매는 최종 판매입니다

Groq Service Credits는 별도 조건이 명시되지 않는 한 구매 또는 발급 후 1년이 지나면 만료됩니다. 양도할 수 없고, 현금으로 바꿀 수 없으며, 환불도 불가능합니다. 계정을 폐쇄하면 잔액은 즉시 만료됩니다.

Groq의 Billing FAQ에 따르면 일반 환불 요청은 지원팀이 사례별로 처리합니다. 그러나 이 정책이 구체적인 Service Credit 약관보다 우선하지는 않습니다. 구매 및 프로모션 크레딧은 최종 판매 잔액으로 남습니다. 막연한 향후 이전 계획이 아니라 실제 예측에 맞춰 크레딧을 구매하십시오.

Flex는 보장된 용량 대신 더 높은 상한을 제공합니다

Flex는 유료 고객에게 On Demand와 같은 토큰 가격으로 제공되며, 온디맨드 속도 제한의 10배를 지원합니다. 대신 용량은 베스트 에포트 방식입니다. Flex가 가득 차면 HTTP 498과 capacity_exceeded 오류로 빠르게 실패할 수 있습니다.

재시도 가능한 큐, 평가, 빠른 실패를 감당할 수 있는 대량 작업에 Flex를 사용하십시오. 반복할 수 없는 고객 작업의 유일한 경로로 두어서는 안 됩니다. On Demand는 예측 가능한 속도를 제공하지만 사용량이 몰릴 때 큐 지연이 생길 수 있습니다. 이 변동성을 허용할 수 없다면 Enterprise Performance로 계약해야 하며, 엔터프라이즈 계약에는 99.9% 가용성 SLA와 99% 지연 시간 보장이 포함됩니다.

캐시를 제외한 GPT-OSS 120B 토큰 가격은 Groq, Together AI, Fireworks AI가 같습니다

공개 토큰 가격만 놓고 보면 Groq가 GPT-OSS 120B에서 더 저렴하지 않습니다. Groq, Together AI, Fireworks AI 모두 같은 모델에 대해 100만 토큰당 입력 $0.15, 출력 $0.60을 제시합니다.

입력 토큰 1억 개와 출력 토큰 2,000만 개로 정규화한 워크로드를 사용해 보겠습니다. 캐시 할인 없이 각 공급자의 비용은 모두 $27입니다. 이 동률이 중요한 이유는 공급자 선택의 기준을 캐시 경제성, 속도 제한, 배포 방식, 신뢰성, 실제 측정 지연 시간으로 돌려놓기 때문입니다.

Together AI

Together AI는 여러 모델을 제공하는 추론 공급자입니다. 서버리스 GPT-OSS 120B 경로는 100만 토큰당 입력 $0.15, 출력 $0.60이며, 서버리스 상품에는 최소 이용료나 프로비저닝 비용이 없습니다.

GPT-OSS 120B 요율이 표시된 Together AI 실시간 서버리스 가격 페이지
Together AI의 GPT-OSS 120B 가격

현재 Together의 GPT-OSS 120B 항목에는 캐시 입력 요율이 공개되어 있지 않습니다. 문서에 따르면 캐시 가격이 없는 모델은 모든 입력에 표준 요율을 적용합니다. 따라서 정규화한 워크로드에서는 프롬프트가 반복되어도 총비용이 $27로 유지됩니다. Together는 지원되는 서버리스 모델의 Batch 가격을 최대 50% 낮춰 제공하므로, 해당 모델이 대상이라면 비동기 작업에도 여전히 유효한 선택지입니다.

Groq 특유의 운영 특성보다 폭넓은 모델 카탈로그나 서버리스에서 전용 인프라로 확장하는 경로가 더 중요하다면 Together를 선택하십시오. 두 공급자 사이의 캐시 없는 GPT-OSS 비용은 같으므로, 실제 워크로드에서 차이가 드러나기 전에는 가격만 보고 옮길 이유가 없습니다.

Fireworks AI

Fireworks AI는 GPT-OSS 120B를 100만 토큰당 입력 $0.15, 캐시 입력 $0.014, 출력 $0.60으로 제공하며, 서버리스 가입 크레딧은 $1입니다.

표준 및 캐시 토큰 가격이 표시된 Fireworks AI GPT-OSS 120B 모델 페이지
Fireworks AI의 GPT-OSS 120B 가격

입력 캐시 비중이 50%라면 정규화한 총비용은 Fireworks $20.20, Groq $23.25, Together $27입니다. 측정한 워크로드에 공개된 캐시 요율이 적용된다는 전제에서, 입력이 많이 반복되는 GPT-OSS 120B 작업은 Fireworks가 공개 가격 기준으로 가장 저렴합니다. 같은 정규화 트래픽을 비동기로 처리할 때는 Groq Batch가 $13.50으로 여전히 더 낮습니다.

GPT-OSS는 OpenAI가 개발했지만 OpenAI API나 소비자용 앱에서는 제공하지 않습니다. 따라서 OpenAI API와 직접 비교하면 공급자와 모델이 모두 바뀌어 가격을 정규화할 수 없습니다. 먼저 같은 모델을 호스팅하는 공급자끼리 비교한 다음, 서로 다른 독점 모델은 승인된 결과를 기준으로 평가하십시오. 더 넓은 모델 및 공급자 비교는 가장 저렴한 AI API 목록에서 확인할 수 있습니다.

공급자 선택 기준은 명확합니다.

  • Groq 선택: 측정한 경로에서 동기식 처리량과 운영 제어가 앞서거나, 50% 할인된 Batch가 지연 가능한 작업에 가장 저렴할 때.
  • Fireworks 선택: 반복되는 GPT-OSS 컨텍스트에 공개된 $0.014 캐시 입력 요율이 꾸준히 적용될 때.
  • Together 선택: 서버리스에서 전용 인프라로 이어지는 폭넓은 경로가 중요하고, GPT-OSS 캐시 요율의 이점이 없는 워크로드일 때.

Groq가 맞는 경우와 피해야 할 경우

오픈 모델이 이미 품질 기준을 통과했고 응답 속도가 제품에 영향을 준다면 Groq는 좋은 선택입니다. 필요한 모델, 용량 보장, 배포 제어가 현재 셀프서비스 카탈로그의 범위를 벗어나면 매력은 떨어집니다.

강점
잘하는 것
12 points

  • 결제 수단을 추가하기 전에 Free 플랜으로 프로덕션 모델을 충분히 평가할 수 있습니다.
  • Developer에는 기본 구독료나 연간 약정이 없습니다.
  • 모든 프로덕션 텍스트 모델의 공개 온디맨드 요율이 100만 토큰당 $1 미만입니다.
  • Batch는 표준 모델 한도를 사용하지 않으면서 대상 비동기 작업의 비용을 50% 줄입니다.
  • GPT-OSS 프롬프트 캐싱은 자동으로 작동하며 캐시 입력 요금을 절반으로 줄입니다.
  • Spend Limits로 조직 전체 사용량이 월 예산을 벗어나기 전에 차단할 수 있습니다.
  • Free 한도는 조직 전체가 공유하며, 요청 수보다 토큰 상한에 훨씬 먼저 도달할 수 있습니다.
  • Batch와 캐싱 할인은 중복 적용되지 않습니다.
  • Compound 툴 비용이 모델 토큰 지출을 크게 넘어설 수 있습니다.
  • 프롬프트 캐싱은 명시된 GPT-OSS 제품군만 지원하며 접두사가 정확히 재사용되어야 합니다.
  • 베스트 에포트 용량을 사용할 수 없으면 Flex가 HTTP 498을 반환할 수 있습니다.
  • 프리뷰 모델은 예고 없이 제거될 수 있으므로, 이식할 수 없는 프로덕션 의존성을 맡길 수 없습니다.

투자를 유치한 창업자는 빠른 오픈 모델이 제품의 반응성을 유지하고 팀이 같은 모델의 대체 경로를 준비할 수 있을 때 Groq를 선택하는 편이 좋습니다. 중견기업 CTO는 키를 중앙 관리하고 모델 및 툴 사용량을 기록하며 조직 한도를 설정한 후에 Developer를 도입해야 합니다. 시니어 운영자는 화려한 토큰당 처리량 문구가 아니라 승인된 결과당 비용에 집중해야 합니다.

애플리케이션에 Groq 카탈로그에 없는 독점 모델이 필요하거나, 베스트 에포트 경로로는 감당할 수 없는 용량 보장이 필요하거나, 안정적인 대체 모델이 없는 프리뷰 모델이 필요하다면 Groq를 유일한 공급자로 선택하지 마십시오. Enterprise Performance는 지원 모델에 계약된 용량을 제공할 수 있지만, 저렴한 공개 플랜이 아니라 맞춤형 프로비저닝 가격입니다.

판단 기준은 다음 한 문장으로 정리됩니다. 현재 프로덕션 모델이 수용 테스트를 통과하고, 동기식 운영 특성이나 Batch 비용 중 하나가 동일 모델의 대체 경로보다 나을 때만 Groq를 선택하십시오. 둘 다 아니라면 낮은 토큰 요율만으로 이전할 이유가 없습니다.

Groq 가격 변동에 대응하려면 실시간 확인이 필요합니다

Groq 가격은 결제 구조가 종량제로 유지되는 동안에도 기능과 모델 단위로 바뀝니다. 2025년 2월 Developer 출시 당시 Batch는 동기식 가격보다 25% 저렴하다고 안내됐습니다. 현재 Batch 문서의 할인율은 50%입니다.

Groq는 2025년 10월에 GPT-OSS 가격을 인하하고 제품군에 프롬프트 캐싱을 추가하기 시작했습니다. 현재 GPT-OSS 120B는 $0.15/$0.60, GPT-OSS 20B는 $0.075/$0.30이며, 캐시 입력은 표준 입력 요율의 절반입니다.

카탈로그 변동도 가격 이력만큼 중요합니다. 예전 가격 자료에 등장했던 Kimi와 DeepSeek 경로 등은 현재 Supported Models 페이지에 없습니다. 예산에는 확인 날짜, 모델 ID, 대체 경로를 함께 남겨야 하며, 복사해 온 가격이 영구적이라고 가정해서는 안 됩니다.

월요일에 할 일: 승인된 워크플로 하나의 비용을 계산하고 상한을 설정하십시오

월요일에는 범위가 명확한 워크플로 하나를 골라 엔지니어링팀과 재무팀이 함께 검토할 수 있는 예산을 만드십시오. 공급자 전체를 이전하는 일부터 시작할 필요는 없습니다.

  1. 트래픽 형태 파악

    대표성이 있는 1주일치 요청 수, 입력 토큰, 출력 토큰, 캐시 히트 토큰, 모델 ID, 툴 호출, 재시도, 승인 결과를 내보냅니다. 동기식 트래픽과 기다릴 수 있는 작업은 분리하십시오.

  2. 세 가지 경로의 비용 계산

    실시간 모델 요율을 적용한 On Demand, 지연 가능한 대상 작업에 50%를 적용한 Batch, 별도 항목으로 분리한 툴 비용을 계산합니다. Batch에 캐시 절감액을 적용하지 말고, 사용량 필드로 측정하지 않은 캐시 비율을 가정하지 마십시오.

  3. 유료 전환 기준 설정

    Free 한도가 경로를 끊으면 Developer로 옮깁니다. 예상치보다 20%30% 높은 월별 Spend Limit을 설정한 뒤 50%, 75%, 90% 지점에 알림을 배치하십시오. 1015분의 보고 지연을 감안해 여유를 두어야 합니다.

  4. 대체 경로 하나를 즉시 쓸 수 있게 유지

    소규모 평가 세트로 다른 공급자 한 곳에서 같은 모델을 실행합니다. 카탈로그 변경이나 용량 오류가 긴급 이전으로 번지지 않도록 엔드포인트, 관측된 수용률, 경로 전환 조건을 기록하십시오.

결과물은 승인된 워크플로 하나를 기준으로 모델 토큰, 툴, 재시도, 사람의 검수를 각각 나눈 예산입니다. 실시간 모델 카탈로그, 속도 제한, 가격 페이지가 바뀌면 다시 계산하십시오.

자주 묻는 질문

Groq AI 가격은 얼마인가요?

Groq Free는 $0입니다. Developer에는 기본 구독료가 없고 모델별 사용량에 따라 과금됩니다. 현재 프로덕션 텍스트 가격은 Llama 3.1 8B Instant의 100만 토큰당 입력 $0.05, 출력 $0.08부터 Llama 3.3 70B Versatile의 입력 $0.59, 출력 $0.79까지입니다.

Groq는 무료로 사용할 수 있나요?

예, 모델별 조직 한도 안에서는 무료입니다. GPT-OSS 120B 및 20B의 현재 Free 한도는 30 RPM, 1,000 RPD, 8,000 TPM, 200,000 TPD입니다. 해당 한도를 넘으면 HTTP 429가 반환됩니다.

무료로 쓸 수 있는 Groq AI 모델은 무엇인가요?

Free 플랜에서는 지원 카탈로그를 모델별 상한 안에서 이용할 수 있습니다. 지속 가능한 평가에는 프로덕션 모델을 사용하십시오. Groq에 따르면 프리뷰 모델은 평가용이며 예고 없이 중단될 수 있습니다.

Groq 월 이용료는 얼마인가요?

공개된 셀프서비스 월간 또는 연간 구독료는 없습니다. 월별 입력, 출력, 오디오, 툴, 서비스 티어 사용량에 현재 요율을 적용해 합산하면 됩니다. GPT-OSS 120B 요청 100,000건을 사용한 예시 워크로드의 동기식 비용은 캐시나 툴 요금을 제외하고 $60입니다.

Groq에 학생 할인이 있나요?

2026년 8월에 확인한 가격 및 결제 페이지에는 학생 전용 할인이 나와 있지 않습니다. 학생을 비롯한 가벼운 사용자는 속도 제한 안에서 일반 $0 Free 플랜을 이용할 수 있습니다.

Groq의 환불 정책은 어떻게 되나요?

일반 결제 환불 요청은 Groq 지원팀이 사례별로 처리합니다. Service Credits에는 더 엄격한 조건이 적용됩니다. 구매 및 프로모션 크레딧은 환불 및 양도가 불가능하며, 별도 조건이 없으면 1년 후 만료됩니다.

Groq 가격이 바뀌었나요?

예. Batch는 2025년 2월에 동기식 가격 대비 25% 할인으로 출시됐고 현재 할인율은 50%입니다. Groq는 2025년 10월에 GPT-OSS 가격을 낮추고 제품군에 캐싱을 추가했습니다. 카탈로그와 모델별 요율은 바뀌므로 실시간 페이지를 확인하십시오.

Groq와 OpenAI 가격은 어떻게 다른가요?

OpenAI는 자체 API로 GPT-OSS를 제공하지 않으므로 직접 비교하면 모델이 달라집니다. GPT-OSS 120B로 정규화하면 캐시 할인 전 기준으로 입력 1억 토큰과 출력 2,000만 토큰의 비용은 Groq, Together AI, Fireworks AI 모두 $27입니다.

사업자를 위한 AI 툴 지도를 받아보세요

사업자를 위한 AI 툴 지도는 모델 가격을 실제 도입 경로로 바꿔 보여줍니다. 각 툴이 충족해야 할 품질 기준, 운영 역할, 비용 전환점을 한눈에 확인할 수 있습니다. 구독하고 다음 호를 무료로 받아보세요.

마지막 업데이트

2026년 9월 3일

카테고리AI

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

AI의 다른 글

AI 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.