무료 AI API부터 최저가까지: 8개 서비스 가격 비교
무료 AI API부터 프로덕션용 최저가 모델까지 8개 서비스를 비교했습니다. 2026년 8월 실제 가격과 무료 티어, 운영 한계, 월 20,000건 요청 비용을 한눈에 확인하고 품질·개인정보 보호·지연시간 기준을 통과하는 최적의 API를 직접 선택하세요.

DeepInfra는 이번 비교에서 표시 가격이 가장 낮습니다. Mistral Nemo는 입력 토큰 100만 개당 $0.019, 출력 토큰 100만 개당 $0.03입니다. 하지만 실제 프로덕션 환경에서 쓸 저가형 기본 모델로는 JSON, 툴 호출, 1M 토큰 컨텍스트 윈도우를 제공하면서 $0.14/$0.28인 DeepSeek V4 Flash가 더 강력합니다. 무료 AI API로 프로토타입을 만들 때는 Gemini 2.5 Flash-Lite가 앞섭니다. 결국 가장 저렴하면서도 쓸 만한 API란 워크로드가 요구하는 품질, 개인정보 보호, 지연시간의 최소 기준을 통과하는 가장 낮은 가격대의 서비스입니다.
무료 AI API와 최저가 서비스: 한눈에 보는 결론
대부분의 프로덕션 텍스트 워크로드에는 DeepSeek V4 Flash가 가장 합리적인 저가 AI API입니다. 표준 요금으로 입력 토큰 1,000만 개와 출력 토큰 200만 개를 처리해도 $1.96이며, 같은 모델에서 JSON 출력, 툴 호출, Responses API, 1M 토큰 컨텍스트 윈도우까지 지원합니다. 몇 센트를 더 아끼는 것보다 이 기능 조합이 훨씬 중요합니다.
‘최저가’의 의미는 작업에 따라 달라지므로 승자도 세 곳으로 나뉩니다.
- 순수 토큰 단가가 가장 낮은 곳은 DeepInfra입니다. Mistral Nemo의 요금은 입력 토큰 100만 개당 $0.019, 출력 토큰 100만 개당 $0.03입니다.
- 프로토타입 비용이 가장 낮은 곳은 Google Gemini입니다. Gemini 2.5 Flash-Lite는 무료 티어를 제공하며, 유료 Standard 티어에서는 토큰 100만 개당 입력 $0.10, 출력 $0.40입니다.
- 기능을 갖춘 프로덕션 기본 모델 중 가장 저렴한 곳은 DeepSeek입니다. V4 Flash는 캐시 미스 토큰 100만 개당 입력 $0.14, 출력 $0.28이며, 대부분의 애플리케이션 백엔드에 필요한 API 기능을 제공합니다.
아래의 모든 가격은 2026년 8월 10일 각 공급자의 실제 가격표 또는 문서 페이지에서 확인했습니다. 별도 표기가 없는 한 입력/출력 토큰 100만 개당 가격입니다.
LLM API 가격을 비교할 때 이 표를 품질 순위로 읽어서는 안 됩니다. 둘 다 채팅 완성 요청을 받더라도 $0.10/$0.10인 3B 모델과 $0.14/$0.28인 최신 프로덕션 모델은 서로 다른 제품입니다. 표시 가격으로 후보를 추린 뒤, 자체 합격 기준으로 최종 모델을 선택해야 합니다.
AI API 가격 비교: 요청 20,000건의 실제 비용
소규모와 중간 규모에서는 여기 소개한 모든 서비스가 충분히 저렴하므로, 잘못된 워크플로 결정 한 번이 토큰 요금보다 더 큰 비용을 만듭니다. 그래도 표준화한 워크로드를 비교할 필요가 있습니다. 입력 단가 하나만 보면 가려지는 출력 중심 요금과 수수료가 드러나기 때문입니다.
한 제품이 매달 20,000회 호출한다고 가정합니다. 호출마다 입력 토큰 500개를 보내고 출력 토큰 100개를 받습니다. 합계는 입력 토큰 1,000만 개와 출력 토큰 200만 개입니다.
월 비용 = 10 × 입력 가격 + 2 × 출력 가격.

비율로 보면 차이가 크지만 실제 금액은 작습니다. 이 워크로드에서 DeepSeek는 DeepInfra Mistral Nemo보다 $1.71 더 비싸고, OpenAI Luna는 DeepSeek보다 $2.44 더 비쌉니다. 저렴한 모델이 스키마를 깨뜨리거나 고객 요청을 놓치거나 수동 검토 대기열을 만든다면, 절약한 금액은 금세 사라집니다.
이때 필요한 것이 품질 하한선입니다. 추가 보완 작업 없이 해당 업무에서 받아들일 수 있는 모델 동작의 최소 기준을 뜻합니다. 허용 라벨이 5개인 분류 엔드포인트는 기준이 낮습니다. 계정 데이터를 근거로 고객에게 답하는 지원 시스템은 훨씬 높습니다. 레코드를 변경할 수 있는 에이전트라면 잘못된 행동의 대가가 API 호출 한 번으로 끝나지 않으므로 기준이 한층 더 높아집니다.
출력 요금도 따로 살펴봐야 합니다. 요약기는 긴 문서를 읽고 짧게 답하므로 입력 비중이 클 수 있습니다. 반면 코딩 에이전트, 영업 이메일 생성기, 대화형 어시스턴트는 출력을 훨씬 많이 만들 수 있습니다. OpenAI Luna의 출력 요금 $1.20은 입력 요금 $0.20의 6배이며, Mistral Small 4의 출력 요금 $0.60은 입력 요금 $0.15의 4배입니다. 초소형 모델의 동일한 입력/출력 단가는 출력이 많은 작업에서 매력적으로 보이지만, 그 모델이 작업을 끝낼 수 있을 때만 의미가 있습니다.
1. DeepSeek: 가장 합리적인 저가 프로덕션 기본 모델
프로덕션 앱이 JSON, 툴, 긴 컨텍스트를 포기하지 않으면서 토큰 비용을 낮추려면 DeepSeek를 가장 먼저 검토할 만합니다. V4 Flash 0731은 캐시 미스 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28입니다. API에는 1M 토큰 컨텍스트 길이, 최대 384K 출력, JSON 출력, 툴 호출, Responses API, Anthropic 호환 경로가 명시되어 있습니다. 최저가 구간에 가까운 다른 모델보다 프로덕션 기능 범위가 넓습니다.

문제는 예산의 안정성입니다. DeepSeek의 가격 페이지는 가까운 시일 안에 전체 요금을 인상할 계획이며, 인상 폭이 상당할 것으로 예상된다고 밝힙니다. 스타트업은 현재의 표준화 비용 $1.96을 활용할 수 있지만, 구매 담당자가 완충 예산이나 대체 경로 없이 이 금액을 연간 전망에 고정해서는 안 됩니다.
추천 용도: 프로덕션 추출, 구조화 생성, 경제적인 에이전트, 긴 컨텍스트 작업
핵심 강점: 1M 컨텍스트와 JSON, 툴 호출, Responses API, Anthropic API 지원
가격: V4 Flash 기준 입력 $0.14, 캐시 적중 입력 $0.0028, 출력 $0.28/1M 토큰
무료 체험: 가격 페이지에 상시 무료 티어 안내 없음
- 표준화한 입력 10M, 출력 2M 워크로드의 비용이 $1.96
- 1M 토큰 컨텍스트와 최대 384K 출력
- 저가 티어에서 JSON 출력과 툴 호출 지원
- V4 Flash의 공개 동시 처리 한도가 2,500
- 공급자가 이미 상당한 가격 인상을 예고함
- 상시 무료 티어가 공개되지 않음
- 저비용 외부 경로라도 구매자의 사용 사례에 맞는 개인정보 보호, 안정성, 리전 검토가 필요함
DeepSeek가 1순위가 되는 경우
저렴한 모델이 텍스트 라벨링 이상의 일을 해야 할 때 DeepSeek가 강점을 보입니다. 업로드된 계약서에서 갱신일, 계약 금액, 통지 기간, 명시된 위험 요소를 추출하는 B2B SaaS 제품을 예로 들 수 있습니다. 출력은 스키마로 검사할 수 있지만, 긴 문서를 읽을 컨텍스트와 필수 필드를 빠짐없이 반환할 지시 이행 능력도 필요합니다. V4 Flash는 첫 평가에 알맞은 비용과 API 기능을 함께 갖췄습니다.
캐시 적중 요금은 입력 토큰 100만 개당 $0.0028로 유난히 낮습니다. 동일한 고정 지침이나 참조용 접두사가 반복될 때 효과가 큽니다. 그렇다고 모든 입력 토큰이 $0.0028이 되는 것은 아닙니다. 이 요금은 캐시 적중분에만 적용됩니다. 실제 사용 데이터로 적중률을 입증하기 전에는 캐시 미스 요금 $0.14를 기준으로 예산을 잡아야 합니다.
1주일 DeepSeek 평가법
범위가 분명한 작업 하나를 고릅니다
추출, 분류, 요약 또는 읽기 전용 에이전트 작업부터 시작합니다. 트래픽을 보내기 전에 필드, 허용 출력, 실패 조건을 정합니다.
요청 100건으로 평가 세트를 만듭니다
워크로드를 대표하는 정제된 요청을 사용합니다. 짧은 입력, 긴 입력, 모호한 입력, 잘못된 형식, 엣지 케이스를 모두 넣어 최저가 경로가 쉬운 사례만 보고 이기지 못하게 합니다.
기계로 검사할 수 있는 출력을 요구합니다
작업에 스키마가 있다면 JSON 출력을 사용합니다. 호출마다 유효 스키마 비율, 승인 답변 비율, 지연시간, 입력 토큰, 출력 토큰, 캐시 적중을 기록합니다.
현재 모델을 폴백으로 유지합니다
검증 실패, 신뢰도가 낮은 사례, 중대한 결과를 낳을 수 있는 행동은 기존의 신뢰할 수 있는 경로로 보냅니다. 첫 배포는 되돌릴 수 있어야 합니다.
가격 변경 알림을 설정합니다
DeepSeek는 가격 인상 계획을 공개했습니다. 일시적 가격을 아키텍처의 전제로 굳히지 말고, 새 요금이 게시되면 표준화한 워크로드를 다시 계산합니다.
V4 Flash가 해당 작업을 통과하고 조직이 가격 변동을 감수할 수 있다면 DeepSeek를 선택할 만합니다. 고정된 연간 단가, 특정 처리 리전 또는 기존 공급자 관계가 토큰 가격 차이보다 중요하다면 건너뛰는 편이 낫습니다.
2. Google Gemini: 가장 좋은 무료 AI API
정제된 데이터로 프로토타입을 만들 때는 Google Gemini가 가장 좋은 무료 경로입니다. Gemini 2.5 Flash-Lite는 Free 티어에서 입출력 토큰을 무료로 제공합니다. Paid로 전환하면 Standard 요금은 텍스트, 이미지 또는 동영상 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.40이며, Batch와 Flex는 이를 절반인 $0.05/$0.20으로 낮춥니다.

무료 티어에는 의사결정 단계에서 반드시 고려해야 할 개인정보 문제가 있습니다. 각주로 넘길 사안이 아닙니다. Google의 가격 페이지에 따르면 Free 티어의 콘텐츠는 제품 개선에 사용되지만 Paid 티어의 콘텐츠는 그렇지 않습니다. Free는 합성 프롬프트, 공개 문서, 개발자 테스트 세트에 적합합니다. 고객 기록, 기밀 문서, 미공개 코드의 기본 경로로 삼아서는 안 됩니다.
추천 용도: 무료 프로토타입, 멀티모달 입력, 배치 처리, 비용에 민감한 문서 워크플로
핵심 강점: 무료 입출력 경로와 유료 텍스트·이미지·동영상·오디오 입력
가격: Free 티어, Paid Standard 텍스트/이미지/동영상 입력 $0.10 및 출력 $0.40, Batch/Flex $0.05/$0.20
무료 체험: 있음, 모델 이용이 제한된 Free 티어
- Free 티어에서 입력 및 출력 토큰 무료
- Paid Standard 기준 표준화 워크로드 비용 $1.80
- 같은 비동기 워크로드는 Batch 또는 Flex에서 $0.90
- Paid 티어는 컨텍스트 캐싱을 제공하며 콘텐츠를 Google 제품 개선에 사용하지 않음
- Free 티어 콘텐츠는 Google 제품 개선에 사용됨
- 무료 이용 가능 모델과 할당량이 제한됨
- Standard의 오디오 입력은 토큰 100만 개당 $0.30으로 텍스트/이미지/동영상 입력의 3배
무료에서 유료로 전환해야 하는 시점
문서 태깅 기능을 검증하는 창업자는 공개 문서나 생성한 문서로 Free 티어를 이용해 응답 형식을 확인하고, 결제를 연결하기 전에 토큰 사용 패턴을 파악할 수 있습니다. 고객 문서가 흐름에 들어오는 순간 Paid 전환은 단순히 사용량의 문제가 아닙니다. 콘텐츠 사용 조건이 달라지고, 더 높은 프로덕션 한도와 컨텍스트 캐싱, Batch 이용 권한도 얻게 됩니다.
표준화한 워크로드에서 Paid Standard 비용은 $1.80이고 Batch 또는 Flex는 $0.90입니다. 비동기 작업의 표시 가격만 놓고 보면 Gemini가 DeepSeek보다 저렴합니다. 다만 올바른 선택은 여전히 어떤 모델이 실제 작업을 통과하는지에 달렸습니다. 결과를 즉시 받을 필요가 없다면 공급자를 바꾸기 전에 50% 절감 경로부터 평가해야 합니다.
Gemini는 2.5 Flash-Lite에서 이미지와 동영상도 텍스트와 동일한 Standard 입력 요금 $0.10으로 받습니다. 영수증, 스크린샷, 제품 이미지를 읽는 워크플로라면 텍스트 전용 소형 모델보다 더 유력한 후보입니다. 가격 페이지는 Flash-Lite를 Google의 대규모 처리용 모델 가운데 가장 작고 비용 효율적인 모델로 설명합니다. 더 큰 Gemini 모델로 올라가기 전에 시작하기 알맞은 티어입니다.
무료로 시작해야 하거나 멀티모달 입력, 반값 비동기 처리가 필요하다면 Gemini를 선택할 만합니다. 민감한 데이터에는 Free 티어를 피하고, 합격 기준상 더 큰 모델이 필요하다면 Flash-Lite를 건너뛰어야 합니다.
3. DeepInfra: 순수 토큰 단가가 가장 낮은 API
DeepInfra는 Mistral Nemo Instruct 기준 입력 $0.019, 출력 $0.03/100만 토큰으로 순수 가격 부문 1위입니다. 요청 20,000건으로 표준화한 워크로드 비용은 $0.25입니다. DeepInfra에는 Meta Llama 3.1 8B가 $0.02/$0.04, DeepSeek V4 Flash가 $0.09/$0.18로도 올라와 있어, 별도의 결제 계정 없이 같은 호스팅 서비스 안에서 모델 등급을 높일 수 있습니다.

가격 뒤에 어떤 모델이 있는지가 한계입니다. Mistral Nemo와 Llama 3.1 8B가 저렴한 이유는 작고 오래된 오픈 모델이기 때문입니다. 규칙이 엄격한 라벨링 작업이라면 그것으로 충분할 수 있습니다. 하지만 고객에게 직접 노출되는 워크플로는 자체 평가로 출력 품질을 확인하기 전까지 낮은 가격만 따라가서는 안 됩니다.
추천 용도: 대량·저위험 분류, 태깅, 가벼운 추출, 모델 가격 실험
핵심 강점: 이번 비교에서 공개된 텍스트 생성 토큰 요금 중 최저가
가격: Mistral Nemo 입력 $0.019/출력 $0.03, Llama 3.1 8B $0.02/$0.04
무료 체험: 없음, DeepInfra는 카드 등록 또는 선결제가 필요하다고 안내함
- Mistral Nemo 기준 표준화 워크로드 비용 $0.25
- 텍스트, 임베딩, 이미지, 오디오, 동영상 모델을 아우르는 대규모 카탈로그
- Standard, Priority, 더 저렴한 Flex 스케줄링 제공
- 자동 확장과 계정당 동시 요청 200건의 공개 한도
- 최저 요금으로 이용하는 것은 소형 모델이지 범용 프로덕션 기본 모델이 아님
- 카드 등록 또는 선결제가 필요함
- Flex는 더 느릴 수 있고 간혹 사용할 수 없음
출력 범위가 좁다면 DeepInfra가 유리합니다
지역 서비스 마켓플레이스가 들어오는 메시지를 quote, reschedule, cancel, billing, other로 분류한다고 가정합니다. 출력 범위가 좁으므로 5개 값 외의 결과를 거부하고 모호한 사례를 폴백으로 보낼 수 있습니다. 이런 작업이라면 $0.019/$0.03 모델을 평가해 볼 가치가 있습니다.
계정별 질문에 답하는 고객 지원 어시스턴트는 다릅니다. 올바른 레코드를 가져오고 정책을 따르며 맥락을 보존하면서, 틀린 답을 확신에 차서 말하지 않아야 합니다. 표준화 워크로드에서 DeepSeek보다 $1.71을 아낀다는 이유만으로, 더 강한 합격 결과도 없이 이 일을 Mistral Nemo에 맡기는 것은 타당하지 않습니다.
DeepInfra의 서비스 티어도 비용을 조절하는 수단입니다. Standard는 기본 요금의 1×, Priority는 피크 시간대에 더 빠른 스케줄링을 제공하는 대신 1.5×입니다. Flex는 느린 응답과 간헐적 이용 불가를 감수하면 0.8×입니다. Flex는 백필, 오프라인 데이터 보강, 재시도 가능한 야간 대기열에 적합합니다. 이미 센트 단위인 요금에서 20%를 더 줄이겠다고 대화형 고객 응답에 적용해서는 안 됩니다.
범위가 좁은 작업과 강력한 검증기로 소형 모델의 절감 효과를 반복해서 얻을 수 있다면 DeepInfra를 선택할 만합니다. 개방형 글쓰기, 복잡한 추론, 고객이나 비즈니스 데이터를 바꾸는 행동에는 최저가 모델을 피해야 합니다.
4. Groq: 지연시간이 중요할 때 저렴한 선택
즉각적인 반응이 중요한 대화형 작업에는 저비용 Groq가 적합합니다. 프로덕션용 Llama 3.1 8B Instant 경로의 속도는 약 초당 560토큰으로 표시되며, 입력 토큰 100만 개당 $0.05, 출력 토큰 100만 개당 $0.08입니다. 표준화 워크로드 비용은 $0.66으로, 순수 가격 1위인 DeepInfra보다 $0.41만 높습니다.

대신 모델의 깊이와 카탈로그 안정성을 양보해야 합니다. 최저가 경로는 8B 모델입니다. Groq는 프로덕션 준비 모델을 별도로 구분하고 프리뷰 모델이 예고 없이 중단될 수 있다고 경고합니다. 따라서 프리뷰 항목의 가격을 프로덕션 약속으로 받아들여서는 안 됩니다.
추천 용도: 지연시간이 짧은 분류, 자동 완성, 대화형 UI, 빠른 1차 라우팅
핵심 강점: 가장 저렴한 프로덕션 모델에서 약 초당 560개의 출력 토큰
가격: Llama 3.1 8B Instant 입력 $0.05/출력 $0.08, GPT OSS 20B $0.075/$0.30
무료 체험: 확인한 문서 페이지에는 공개된 체험 조건이 없음
- Llama 3.1 8B 기준 표준화 워크로드 비용 $0.66
- Llama 3.1 8B에서 약 초당 560토큰
- OpenAI 호환 기본 URL과 익숙한 API 형식
- 프로덕션 모델과 프리뷰 모델을 명확히 구분함
- 최저가 프로덕션 모델이 8B에 불과함
- 계정별 속도 제한은 대시보드에서 확인해야 함
- 프리뷰 모델 제공 여부가 예고 없이 바뀔 수 있음
지연시간도 제품 비용입니다
API 청구액이 낮더라도 음성이나 라이브 채팅 제품은 응답이 늦으면 사용자가 대화를 이탈하고 상호작용이 어색해지는 대가를 치릅니다. 모델 성능이 충분하고 속도가 제약이라면 Groq는 설득력 있는 선택입니다. 정책이 복잡한 고객 지원 답변보다 메시지를 어느 워크플로로 보낼지 정하는 짧은 의도 라우터가 더 잘 맞습니다.
모델 페이지에는 Llama 3.1 8B의 컨텍스트 윈도우가 131,072토큰으로 표시되어 있지만, 컨텍스트 용량이 곧 컨텍스트 품질은 아닙니다. 긴 프롬프트를 받을 수 있다고 해서 관련된 모든 세부 정보를 정확히 활용한다는 보장은 없습니다. 첫 Groq 워크로드는 짧고 범위가 명확하며 기계로 검사할 수 있게 구성해야 합니다.
Groq의 GPT OSS 20B 경로는 약 초당 1,000토큰과 $0.075/$0.30으로 모델 크기를 한 단계 높입니다. 표준화 비용은 $1.35로 여전히 DeepSeek의 $1.96보다 낮지만, 같은 평가 세트로 선택을 확정해야 합니다. 가격이 낮다는 사실만으로 지시 이행, 툴, 비즈니스 적합성이 더 낫다고 볼 수는 없습니다.
응답 시간이 사용자에게 직접 느껴지고 소형 프로덕션 모델이 작업을 통과한다면 Groq를 선택할 만합니다. 고급 추론이 필요하거나 안정적인 프로덕션 상태가 없는 프리뷰 모델에 의존해야 한다면 피해야 합니다.
5. Mistral: 소형 모델 랩과 직접 연결되는 최저가 경로
Mistral은 소형 모델을 개발사에서 직접 이용할 때 가장 깔끔한 단계별 선택지를 제공합니다. Ministral 3B는 입력과 출력 토큰 100만 개당 각각 $0.10부터 시작하고, 8B 모델은 $0.15/$0.15, 14B 모델은 $0.20/$0.20입니다. Mistral Small 4는 $0.15/$0.60이며 텍스트, 에이전트, 멀티모달 전반에 걸쳐 더 폭넓은 제품 기능을 제공합니다.

저렴한 3B 항목을 개방형 고객 업무의 기본 모델로 추천하는 것은 아닙니다. 분류, 모더레이션 사전 라우팅, 제한된 필드 변환처럼 초소형 모델의 장점이 살아나는 곳에 써야 합니다. 일반 애플리케이션에는 Mistral Small 4가 더 현실적인 후보이며, 표준화 워크로드 비용은 $2.70입니다.
추천 용도: 소형 모델 직접 이용, 개발사와의 직접 계약 선호, 배치 변환, 반복 프롬프트 캐싱
핵심 강점: 동일한 입출력 $0.10/$0.10 시작 요금과 Batch 50%, 캐시 입력 90% 할인
가격: Ministral 3B $0.10/$0.10, Mistral Small 4 $0.15/$0.60
무료 체험: 주요 텍스트 모델에는 일반적인 무료 프로덕션 티어가 안내되어 있지 않으며, 일부 Labs 또는 모더레이션 엔드포인트만 무료
- 3B, 8B, 14B, Small 티어 전반의 단순한 개발사 직접 가격 체계
- 대규모 비동기 작업에 Batch 50% 할인
- 반복되는 고정 접두사에 캐시 입력 90% 할인
- Mistral Small 4가 텍스트, 에이전트, 멀티모달 사용을 지원함
- $0.10/$0.10이라는 대표 가격은 3B 모델의 요금임
- Mistral Small 4 출력 가격이 입력의 4배
- 주요 텍스트 모델에 폭넓은 무료 프로덕션 티어가 안내되어 있지 않음
Mistral의 단계별 모델 구성이 효과적인 경우
이커머스 플랫폼이 매일 밤 상품명, 속성, 설명으로 카탈로그 태그를 생성한다고 가정합니다. 결과는 비동기식이고 각 항목은 고정된 스키마를 따르며, 다음 카탈로그 반영 전에 사람이 표본 오류를 확인할 수 있습니다. 이 워크플로는 Ministral 3B 또는 8B에서 시작해 Batch로 50%를 절감하고, 고정 분류 체계 지침을 캐시된 접두사로 유지할 수 있습니다.
채팅 어시스턴트라면 경제성이 달라집니다. 표준화 워크로드 기준 Ministral 3B는 $1.20, Mistral Small 4는 $2.70입니다. $1.50의 차이로 더 크고 폭넓은 용도로 설계된 모델을 이용합니다. Small 4가 폴백과 검토를 줄인다면 토큰 요금이 높아도 시스템 전체로는 더 저렴할 수 있습니다.
모델 개발사와 직접 거래하거나 단계별 소형 모델 구성이 중요하다면 Mistral을 선택할 만합니다. 작업이 개방형이고 평가를 통해 품질 하한선을 지킬 수 있다는 점을 입증하지 못했다면 3B 대표 가격에 끌려가서는 안 됩니다.
6. SiliconFlow: 저비용 멀티 모델 시장의 신흥 서비스
8B보다 큰 경로가 필요하다면 SiliconFlow가 이번 후보 중 가장 저렴한 멀티 모델 호스팅 서비스입니다. GPT OSS 20B는 131K 컨텍스트 윈도우와 함께 입력 토큰 100만 개당 $0.04, 출력 토큰 100만 개당 $0.18입니다. 표준화 워크로드의 청구액은 $0.76이며, 신규 계정에는 $1 크레딧이 제공됩니다.

여기서는 모델 이름을 정확히 구분해야 합니다. GPT OSS 20B는 오픈 웨이트 20B 모델이며 OpenAI GPT-5.6 제품군을 직접 이용하는 서비스가 아닙니다. SiliconFlow에는 DeepSeek V4 Flash도 입력 $0.13, 캐시 입력 $0.028, 출력 $0.28로 올라와 있으므로, 계정을 바꾸지 않고도 더 강한 모델로 한 단계 높일 수 있습니다.
추천 용도: 하나의 공급자 계정으로 여러 오픈 모델을 쓰려는 비용 민감형 개발자
핵심 강점: GPT OSS 20B $0.04/$0.18과 시작 크레딧 $1
가격: GPT OSS 20B 입력 $0.04/출력 $0.18, DeepSeek V4 Flash $0.13/$0.28
무료 체험: 무료 크레딧 $1, 최소 약정 없음
- GPT OSS 20B 기준 표준화 워크로드 비용 $0.76
- 표시 가격 기준 $1 크레딧으로 표준화 테스트 워크로드 한 번 이상 처리 가능
- 공개 가격 페이지에 최소 약정이 없음
- DeepSeek, Qwen, MiniMax, GPT OSS 등 여러 오픈 모델을 저렴하게 제공함
- 최저가는 독점 프런티어 API가 아니라 오픈 웨이트 모델에 적용됨
- 모델 선택에 따른 품질 평가 책임은 여전히 구매자에게 있음
- 신생 멀티 모델 호스팅 서비스이므로 조달과 안정성을 더 검토해야 할 수 있음
$1로 구성하는 평가 예산
SiliconFlow의 시작 크레딧은 드물게도 범위가 명확합니다. GPT OSS 20B의 표준화 워크로드 비용이 $0.76이므로, 재시도나 다른 모델 사용 전이라면 $1 크레딧으로 가격 표준화 실행 한 번을 온전히 처리할 수 있습니다. 무료 프로덕션 한 달을 뜻하지는 않습니다. 더 큰 잔액을 미리 약정하지 않고 출력 형식, 지연시간, 토큰 집계를 측정할 수 있다는 의미입니다.
백오피스 요약 대기열이라면 GPT OSS 20B로 시작하고, 실패하거나 신뢰도가 낮은 사례를 같은 플랫폼의 DeepSeek V4 Flash로 보낼 수 있습니다. 모델 요금 덕분에 이 단계가 명확합니다. 저렴한 경로는 $0.04/$0.18, 그다음 DeepSeek는 $0.13/$0.28입니다. 혼합 청구액만으로는 저렴한 티어가 실제로 도움이 되는지 알 수 없으므로, 애플리케이션은 어떤 모델이 답했는지 계속 기록해야 합니다.
하나의 저비용 호스팅 서비스와 폭넓은 오픈 모델 카탈로그로 평가를 단순화할 수 있다면 SiliconFlow를 선택할 만합니다. 구매자가 모델 개발사와의 직접 계약을 요구하거나, 이미 동일한 모델을 적절한 총비용으로 제공하는 게이트웨이를 쓰고 있다면 건너뛰는 편이 낫습니다.
7. OpenRouter: 모델 전환 비용을 가장 낮추는 방법
작은 결제 수수료보다 모델 전환 편의성이 더 중요하다면 OpenRouter가 가장 적합한 저가 게이트웨이입니다. 공급자의 추론 가격을 별도 마진 없이 그대로 적용하고, 무료 모델을 제공하며, 하나의 API 키 뒤에 여러 공급자를 연결합니다. DeepSeek V4 Flash Latest는 입력 $0.08, 출력 $0.252/100만 토큰으로 표시되어 있어, 크레딧 구매 수수료 전 표준화 모델 비용은 $1.304입니다.

문제는 크레딧 충전 방식입니다. OpenRouter는 크레딧 구매 시 5.5%의 수수료를 부과하며 최소 금액은 $0.80입니다. $0.80을 5.5%로 나눈 값이 $14.5455이므로 약 $14.55부터 최소 금액의 영향이 사라집니다. 따라서 $10 크레딧을 사면 5.5%가 아니라 8%에 해당하는 $0.80의 수수료를 냅니다.
추천 용도: 모델 비교, 폴백 경로 유지, 애플리케이션을 다시 작성하지 않는 공급자 전환
핵심 강점: 추론 가격에 별도 마진 없이 공급자 요금을 그대로 적용
가격: 무료 모델 $0, 유료 모델은 각각 다름, DeepSeek V4 Flash Latest $0.08/$0.252(크레딧 수수료 전)
무료 체험: 신규 사용자를 위한 소액 한도와 일일 한도가 낮은 무료 모델
- 하나의 API 키로 여러 공급자와 모델 이용
- 기본 추론 요금에 별도 마진 없음
- 평가용 무료 모델 제공
- 매달 첫 1M건의 BYOK 요청 무료
- 크레딧 구매 수수료 5.5%, 최소 $0.80
- 평생 크레딧 구매액이 $10에 도달하기 전까지 무료 모델은 하루 50건, 이후에는 하루 1,000건으로 제한됨
- 유료 크레딧은 사용하지 않으면 1년 뒤 만료됨
- 안정성 계획에 게이트웨이와 상위 공급자의 장애를 모두 반영해야 함
게이트웨이 수수료가 제값을 하는 경우
DeepSeek, Gemini, 오픈 모델을 시험하는 개발자는 공급자마다 인증, 결제, 재시도 동작, 응답 형식을 따로 다루느라 추론 자체보다 더 많은 개발 시간을 쓸 수 있습니다. OpenRouter에서는 라우팅 설정만 바꾸면 모델을 전환할 수 있습니다. 이 편의성 덕분에 폴백을 준비해 두거나 성능이 약한 경로를 빠르게 교체할 수 있다면 수수료는 합리적입니다.
소액 충전은 경제성을 왜곡합니다. $10을 충전하면 최소 수수료 $0.80은 8%입니다. $100에서는 5.5%가 $5.50이므로 안내된 비율대로 적용됩니다. 소형 프로토타입이라면 최소 수수료를 편의 비용으로 받아들이거나 공급자의 직접 무료 티어를 써야 합니다. OpenRouter의 모델 요금을 직접 공급자의 요금과 비교하면서 크레딧 수수료를 빠뜨려서는 안 됩니다.
BYOK 경로에는 다른 규칙이 적용됩니다. 자체 공급자 키를 사용한 요청은 매달 첫 1M건까지 무료이며, 이후 OpenRouter는 해당 모델/공급자 경로가 OpenRouter에서 발생시켰을 비용의 5%를 부과합니다. BYOK를 이용하면 직접 공급자의 한도를 유지하면서 라우팅을 중앙화할 수 있지만, 결제와 장애 지점을 두 곳 모두 모니터링해야 한다는 사실은 달라지지 않습니다.
하나의 통합 경로와 빠른 모델 전환이 수수료 이상의 가치가 있다면 OpenRouter를 선택할 만합니다. 제품이 안정적인 공급자 하나만 사용하고 직접 API가 이미 가동시간 요구를 충족하며 추가 게이트웨이가 운영상 이점을 주지 않는다면 건너뛰는 편이 낫습니다.
8. OpenAI: 주류 플랫폼에서 가장 부담 적은 비용 절감 경로
OpenAI가 토큰 최저가는 아니지만, 이미 OpenAI 기반으로 만든 제품에는 GPT-5.6 Luna가 위험을 가장 적게 늘리는 저가 경로일 수 있습니다. Luna의 Standard 요금은 짧은 컨텍스트 입력 토큰 100만 개당 $0.20, 캐시 입력 $0.02, 출력 $1.20입니다. Batch와 Flex에서는 입출력 요금이 $0.10/$0.60으로 절반이 되어 표준화 워크로드 비용이 $4.40에서 $2.20으로 낮아집니다.

마이그레이션 비용은 API 청구서에 찍히지 않아도 존재합니다. 기존 스키마, 프롬프트, 모더레이션 규칙, 툴, 추적, 폴백 동작, 워크로드 평가를 고려하면 월 $2.44의 토큰 차이는 사소할 수 있습니다. 현재 OpenAI 경로가 검사를 통과하는 제품이라면 공급자를 교체하기 전에 Luna, 캐싱, Batch/Flex부터 평가해야 합니다.
추천 용도: 기존 OpenAI 제품, 주류 개발자 도구, 캐시 가능한 고정 프롬프트, 비동기 배치 작업
핵심 강점: GPT-5.6 Luna라는 최신 저비용 OpenAI 모델과 Batch/Flex의 50% 요금 조합
가격: Standard 입력 $0.20/캐시 $0.02/출력 $1.20, Batch/Flex $0.10/$0.01/$0.60
무료 체험: 상시 무료 API 티어 안내 없음
- Batch 또는 Flex에서 표준화 비용 $2.20
- 캐시 입력 요금이 표준 입력 요금의 10분의 1
- 기존 OpenAI 애플리케이션은 공급자를 이전하지 않고 저렴한 모델을 평가할 수 있음
- Standard, Batch, Flex, 긴 컨텍스트 작업의 요금이 명확히 구분됨
- Standard 출력 가격이 입력의 6배
- Standard의 표준화 비용은 $4.40으로 순위에 오른 경로 중 가장 높음
- 적용 가능한 리전 처리는 10% 할증됨
- Luna 긴 컨텍스트 요금은 입력 $0.40, 출력 $1.80으로 더 높음
마이그레이션 전에 OpenAI 안에서 최적화하세요
GPT-5.6 라우팅 리뷰에서는 Luna, Terra, Sol이 각각 언제 맞는지 더 자세히 다룹니다. 여기서 비용을 결정할 때 첫 단계는 더 단순합니다. 짧고 반복되는 작업은 Luna에 배치하고, 고정 접두사를 캐시하며, 급하지 않은 작업은 Batch 또는 Flex로 보내고, 현재의 더 강한 모델을 폴백으로 남깁니다.
입력 토큰 1,000만 개와 출력 토큰 200만 개에 Luna Standard는 $4.40, Batch 또는 Flex는 $2.20, DeepSeek V4 Flash는 $1.96입니다. 최적화한 OpenAI와 직접 이용하는 DeepSeek의 차이는 표준화 워크로드에서 $0.24에 불과합니다. 이 금액만으로는 공급자 이전을 정당화하기 어렵습니다.
긴 컨텍스트와 리전 설정에 따라 결과는 달라질 수 있습니다. Luna의 긴 컨텍스트 Standard 요금은 입력 $0.40, 출력 $1.80이며, 적용 가능한 리전 처리는 10% 할증됩니다. 모든 토큰에 짧은 컨텍스트 대표 가격을 적용하지 말고 요청과 처리 방식에 맞는 요금을 사용해야 합니다.
제품이 이미 OpenAI에서 제대로 작동하거나, 주류 공급자와 직접 거래하는 관계가 중요하거나, Batch/Flex가 가격 차이 대부분을 없앤다면 OpenAI를 선택할 만합니다. 재시도 가능한 오프라인 작업이 반값 경로의 조건을 충족한다면 Standard를 피해야 합니다.
어떤 AI API를 선택해야 할까요?
먼저 실패 결과의 크기로 경로를 정하고, 그다음 기준을 통과하는 가장 저렴한 모델을 계산하세요. 이 원칙 하나면 잘못된 절감 판단 대부분을 막을 수 있습니다.

정제된 데이터로 무료 프로토타입을 만든다면 Gemini 2.5 Flash-Lite를 선택하세요. 비용 없이 시작하기 가장 간단하고, Paid Standard의 $0.10/$0.40으로 옮기기도 쉽습니다. Free와 Paid는 콘텐츠 사용 조건이 다르므로 고객 데이터와 기밀 데이터는 Free에 보내지 않아야 합니다.
위험이 낮은 실제 프로덕션에는 DeepSeek V4 Flash부터 평가하세요. JSON, 툴 호출, 1M 컨텍스트, 표준화 비용 $1.96의 조합으로 종합적인 1순위 후보입니다. 공급자가 가격 인상을 예고했으므로 완충 예산과 폴백을 유지해야 합니다.
범위가 좁은 대량 라벨링에는 DeepInfra부터 평가하세요. 표준화 비용 $0.25는 허용 출력을 제한하고 실패를 저렴하게 감지할 수 있을 때만 의미가 있습니다. 작업이 개방형으로 바뀌면 즉시 상위 모델로 이동해야 합니다.
사용자가 체감하는 지연시간에는 Groq를 평가하세요. 초당 560토큰인 Llama 3.1 8B 경로는 $0.05/$0.08의 가격으로 인터페이스를 빠르게 느껴지게 할 수 있습니다. 모든 모델을 자동으로 대체하기보다는 더 깊이 있는 폴백을 둔 고속 경로로 사용해야 합니다.
오프라인 대기열이라면 Gemini Batch/Flex, Mistral Batch, OpenAI Batch/Flex를 비교하세요. 세 곳 모두 50% 절감을 명시합니다. 가장 낮은 미할인 Standard 가격이 아니라 대기열의 합격 기준을 통과하는 모델을 제공하는 곳이 최선입니다.
간편한 모델 전환에는 OpenRouter를 선택하세요. 특히 폴백과 모델 교체가 제품 운영의 일부라면, 여러 통합을 유지하는 비용보다 수수료가 저렴할 수 있습니다. 안정적인 공급자 하나만 쓴다면 직접 결제가 더 단순합니다.
기존 OpenAI 애플리케이션이라면 이전하기 전에 Luna부터 시험하세요. Batch/Flex의 표준화 비용은 $2.20으로 DeepSeek보다 $0.24만 높습니다. 기존 평가와 운영 체계의 가치는 이 차이를 쉽게 넘어설 수 있습니다.
저렴한 경로가 워크로드의 합격 기준 아래로 떨어지면 선택도 바뀌어야 합니다. 스키마 유효성, 승인 답변, 지연시간, 개인정보 보호 조건, 복구 동작이 요구사항을 만족하는 동안만 저가 모델을 유지하세요. 하나라도 깨지면 상위 모델로 올라가야 합니다. 몇 센트를 아끼려고 프롬프트 보완책을 계속 덧붙이지 마세요.
API 기반 경험을 고객에게 제공하는 개발자는 인증, 결제, 검토, 장애 처리까지 책임져야 합니다. v0 API 구축 가이드는 기반 모델이나 에이전트가 제품의 한 계층일 뿐인 이유를 보여 줍니다.
AI API 8곳은 어떻게 선정했나요?
이 순위는 가장 낮은 입력 단가 하나가 아니라, 믿고 구매할 수 있는 가장 저렴한 선택에 점수를 줍니다. 각 공급자의 실제 공식 페이지를 기준으로 2026년 8월 10일 가격을 확인하고 분석했습니다. API를 구독하거나 프로덕션에서 직접 테스트한 것처럼 제시하지 않았습니다.
선정 기준은 다음과 같습니다.
- 실용적인 시작 가격: 이름이 명시되어 현재 판매 중인 모델의 입력 및 출력 요금
- 품질 하한선: 해당 모델 티어가 제한된 작업 또는 더 폭넓은 프로덕션 워크플로에 적합할 가능성
- 운영 기능: JSON, 툴, 컨텍스트, 배치, 캐싱, 속도 제한, 폴백에 미치는 영향
- 개인정보 및 계약상 결과: 무료 데이터 처리 방식, 가격 안정성, 별도 게이트웨이 수수료 적용 여부
- 전환 비용: 프롬프트, 스키마, 평가 세트, 모니터링, 결제를 이전하는 데 필요한 작업
8개 공급자는 각각 서로 다른 구매 판단을 대표하므로 후보에 포함했습니다. 가장 저렴한 프로덕션 텍스트 경로가 이 가격대보다 훨씬 높거나, 토큰 단위로 가격을 표준화할 수 없거나, 더 뚜렷한 이점 없이 다른 선택지와 역할이 겹치는 공급자는 제외했습니다. 이미지, 동영상, 음성, 임베딩 특화 API 역시 단위가 텍스트 입출력 토큰과 비교되지 않아 제외했습니다.
비용 계산은 하나의 명시적인 워크로드를 사용한 독자 분석이며 벤치마크가 아닙니다. 승인된 결과당 실제 비용은 대표 요청, 검증기, 검토 절차를 직접 적용해야만 알 수 있습니다.
피해야 할 선택
OpenRouter 무료 모델을 프로덕션의 유일한 경로로 사용하기
실제 고객 트래픽 뒤에 OpenRouter 무료 모델 하나만 두지 마세요. 계정의 평생 크레딧 구매액이 최소 $10에 도달하기 전에는 무료 모델을 하루 50건, 이후에는 하루 1,000건까지 요청할 수 있습니다. 이는 평가용 한도이지 안정적인 처리 용량 계획이 아닙니다.
고객 데이터나 기밀 데이터를 Gemini Free로 보내기
민감한 콘텐츠를 Gemini Free로 보내지 마세요. Google은 Free 티어 콘텐츠를 제품 개선에 사용하지만 Paid 티어 콘텐츠는 사용하지 않는다고 밝힙니다. 표준화한 Paid Standard 청구액은 $1.80이므로, 그 금액을 아끼려고 개인정보 경계를 넘는 것은 합리적이지 않습니다.
DeepInfra Mistral Nemo를 범위 제한 없이 고객 응대에 사용하기
$0.019/$0.03 경로를 개방형 고객 지원, 법률 해석, 자율 행동에 곧바로 투입하지 마세요. 이 요금은 소형 모델의 가격입니다. 제한되고 검증 가능한 작업에 사용하고, 합격 데이터로 범위를 넓힐 근거가 생길 때까지 더 강한 폴백을 유지해야 합니다.
가격 변경 폴백 없이 DeepSeek를 사용하기
$0.14/$0.28을 고정 연간 요금으로 취급하지 마세요. DeepSeek는 상당한 인상이 예정되어 있다고 밝힙니다. 현재 가장 좋은 기본 후보일 수는 있지만 예산과 아키텍처에 두 번째 경로가 필요합니다.
재시도 가능한 오프라인 작업에 OpenAI Standard를 사용하기
기다릴 수 있는 작업에 Luna의 Standard 요금 $0.20/$1.20을 지불하지 마세요. Batch와 Flex는 $0.10/$0.60으로, 공급자를 바꾸지 않고도 표준화 워크로드 비용을 $4.40에서 $2.20으로 줄입니다.
월요일에 바로 할 일
다음 주에는 애플리케이션 전체가 아니라 범위가 분명한 작업 유형 하나만 옮기세요. 요청 100건 평가는 프로덕션 트래픽을 투입하기 전에 명백한 스키마, 지연시간, 라우팅 실패를 찾기에는 충분하지만, 지속적인 모니터링을 대신하지는 못합니다.
대표 요청 100건을 추립니다
작업 하나를 고르고 일반, 고난도, 모호함, 잘못된 형식의 입력을 표본으로 만듭니다. 무료 티어를 사용하기 전에 개인·기밀·고객 데이터를 제거합니다.
경로 세 곳을 실행합니다
현재 공급자, DeepSeek V4 Flash, Gemini 2.5 Flash-Lite를 비교합니다. 순수 가격 또는 지연시간이 명확한 목표일 때만 DeepInfra나 Groq를 추가합니다.
결과 네 가지를 채점합니다
유효 스키마 비율, 승인 답변 비율, 엔드투엔드 지연시간, 정확한 입출력 토큰 비용을 기록합니다. 사람의 검토 시간은 별도의 운영 지표로 유지합니다.
통과한 작업 유형 하나만 라우팅합니다
합격한 범위 내 작업만 저렴한 공급자로 보냅니다. 검증 실패, 모호한 입력, 결과의 위험이 더 큰 행동에는 기존 경로를 유지합니다.
공급자가 바뀔 때마다 가격을 다시 계산합니다
수식과 워크로드 가정을 저장합니다. DeepSeek가 가격을 올리거나 모델이 폐기되거나 무료 티어 및 게이트웨이 한도가 바뀌면 다시 계산합니다.
이렇게 해야 단순한 요금 목록이 되돌릴 수 있는 예산 결정으로 바뀝니다. 공개 가격표로는 알 수 없는 단 하나의 수치, 즉 승인된 결과당 비용도 얻게 됩니다.
자주 묻는 질문
API가 가장 저렴한 AI는 무엇인가요?
이번 비교에서 순수 텍스트 생성 가격이 가장 낮은 곳은 DeepInfra입니다. Mistral Nemo가 입력 토큰 100만 개당 $0.019, 출력 토큰 100만 개당 $0.03입니다. 워크로드에 JSON, 툴, 긴 컨텍스트가 필요하다면 DeepSeek V4 Flash가 더 나은 저가 프로덕션 기본 모델입니다.
무료 AI API가 있나요?
있습니다. Google Gemini는 Free 티어에서 입출력 토큰을 무료로 제공하고, OpenRouter는 무료 모델을 제공합니다. Gemini Free의 콘텐츠는 Google 제품 개선에 사용될 수 있습니다. OpenRouter 무료 모델은 하루 50건으로 제한되며, 평생 크레딧 구매액이 최소 $10에 도달하면 하루 1,000건으로 늘어납니다.
AI API 비용은 얼마인가요?
월 20,000회 호출, 입력 10M 토큰과 출력 2M 토큰을 기준으로 순위에 오른 경로의 비용은 DeepInfra Mistral Nemo의 $0.25부터 OpenAI GPT-5.6 Luna Standard의 $4.40까지입니다. Batch, Flex, 캐싱, 게이트웨이 수수료, 재시도, 품질 하한선을 통과하는 모델에 따라 최종 청구액이 달라집니다.
ChatGPT API 가격은 얼마인가요?
ChatGPT 구독과 OpenAI API 요금은 별도입니다. 여기서 비교한 저가 OpenAI 모델 GPT-5.6 Luna의 짧은 컨텍스트 Standard 요금은 입력 $0.20, 출력 $1.20/100만 토큰이며, Batch 또는 Flex에서는 $0.10/$0.60입니다.
AI 비즈니스 워크플로 감사 체크리스트를 내려받아 이 비용 사다리를 1주일 공급자 평가 계획으로 바꿔 보세요.
2026년 9월 3일







