LLM 라우팅으로 추론 비용 줄이기: 2026년 AI 모델 게이트웨이 6선
Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey, OpenRouter의 가격과 캐싱, 운영 비용을 실제 수치로 비교해 LLM 라우팅으로 추론 비용을 줄일 최적의 AI 모델 게이트웨이 핵심 선택 기준을 정리했습니다.

현재 추론 비용을 줄이는 데 가장 유리한 관리형 게이트웨이는 Vercel AI Gateway입니다. LLM 라우팅을 적용하면 매달 입력 토큰 1억 개와 출력 토큰 2,000만 개를 쓰는 GPT-5.6 Sol 워크로드 비용이 OpenAI 직접 이용 시 $800에서 Vercel의 현행 Default 티어 기준 $400로 내려갑니다. 다만 Vercel의 50% 할인이 2026년 9월 18일 종료되므로, 이 $400 절감액은 지금 활용할 기회이지 연간 절감액을 보장하는 수치는 아닙니다.
한시적 프로모션보다 더 중요한 원칙이 있습니다. AI 모델 게이트웨이가 부과하는 요금과 운영 부담보다 라우팅, 응답 캐싱, 예산 강제로 줄이는 공급자 비용이 더 커야 실제 청구액이 감소합니다. 별도 운영이 필요 없는 기본 선택은 Vercel, 자체 호스팅은 LiteLLM, 완전히 동일한 요청의 캐싱은 Cloudflare, 관리형 시맨틱 캐싱은 TrueFoundry, $49부터 시작하는 거버넌스는 Portkey, 공급자 마켓플레이스는 OpenRouter가 적합합니다.
한눈에 보는 LLM 라우팅용 AI 모델 게이트웨이
아래의 모든 플랜명, 공개 가격, 한도는 2026년 8월 24일 각 업체의 실제 페이지에서 확인했습니다. 무료 프로토타입이 실제 제약을 모른 채 비싼 프로덕션 의존성으로 굳어질 수 있으므로, 상시 무료 플랜과 기간이 정해진 평가판은 ‘무료 체험’ 항목에서 구분했습니다.
시작 가격만 보고는 승자를 알 수 없습니다. LiteLLM 라이선스는 무료여도 컨트롤 플레인 운영에 실제 엔지니어링 시간이 들어갑니다. Cloudflare의 핵심 기능은 무료지만 Unified Billing에는 5%가 붙습니다. TrueFoundry는 시맨틱 재사용으로 모델 호출 전체를 없앨 수 있지만, 첫 프로덕션 티어가 월 $499입니다. 올바른 비교 기준은 게이트웨이가 제 역할을 마친 뒤 전체 청구서에 남는 금액입니다.
순위보다 먼저 계산할 AI 추론 비용 절감 공식
실제 예산 공식은 남은 공급자 비용 + 게이트웨이 요금 + 유료 제어 기능 + 운영 비용입니다. 동일한 수의 합격 결과를 얻을 때 이 합계가 직접 연결보다 낮아야 게이트웨이를 도입할 이유가 생깁니다. 지원 모델 수, 세련된 대시보드, 폭넓은 장애 조치는 분명 장점이지만, 비용이나 값비싼 실패를 워크플로에서 제거하기 전까지는 절감액이 아닙니다.
표준화한 청구액 하나로 차이를 살펴보겠습니다. OpenAI가 현재 공개한 GPT-5.6 Sol 가격은 입력 토큰 100만 개당 $4, 출력 토큰 100만 개당 $20입니다. 따라서 입력 토큰 1억 개와 출력 토큰 2,000만 개를 사용하는 워크플로는 캐시 입력 할인, 툴, 긴 컨텍스트 배수를 적용하기 전에 $800가 듭니다. 입력 비용 $400에 출력 비용 $400를 더한 금액입니다.
Vercel의 8월 가격 업데이트에 따르면, 할인된 Default 서비스 티어에서 같은 모델의 가격은 9월 18일까지 입력 $2, 출력 $10입니다. 이 표준 월간 비용은 $400로 낮아져 50% 줄어듭니다. 현재 Flex는 입력 $1·출력 $5, Priority는 입력 $4·출력 $20이며, 모두 요청당 토큰이 272,000개 이하일 때의 100만 토큰 기준 가격입니다.

모델 단가는 첫 번째 절감 수단일 뿐입니다. 정확히 일치하는 응답 캐시가 적중하면 공급자 호출 자체를 건너뛸 수 있습니다. 더 저렴한 모델로 라우팅하면 단가는 낮아지지만, 결과물이 여전히 합격 기준을 충족해야 합니다. 예산 한도는 폭주한 에이전트를 멈출 수 있습니다. 토큰 할인은 아니지만 한 달 중 가장 큰 절감이 될 수도 있습니다. 따라서 재시도와 검토까지 포함한 합격 결과당 비용을 운영 지표로 삼아야 하며, 토큰당 비용만 따로 봐서는 안 됩니다.
기초가 되는 공급자 가격 후보군은 가장 저렴한 AI API 비교에서 확인할 수 있습니다. 이 순위는 그보다 한 단계 위에서 게이트웨이가 실제로 공급자 비용을 더 낮출 수 있는지 살펴봅니다.
1. Vercel AI Gateway: 관리형 비용 절감의 종합 1위
토큰 마크업 없는 관리형 게이트웨이에서 당장 실질적인 비용 절감까지 원하는 팀이라면 Vercel AI Gateway가 가장 좋은 선택입니다.

가장 강력한 근거는 이례적으로 명확합니다. 현재 가격 페이지는 Free와 Paid 모두 공급자 정가를 마크업 없이 적용한다고 밝힙니다. 여기에 현행 GPT-5.6 Sol 프로모션이 Default 모델 단가를 다시 50% 낮춥니다. 자금 여력이 있는 창업자가 호출량이 많은 추출 또는 지원 워크플로 하나를 옮기면, 자체 호스팅 프록시를 운영하지 않고도 표준 모델 비용을 $800에서 $400로 절반까지 줄일 수 있습니다.
Free 티어에는 월 $5 크레딧이 포함되며, 대상 모델 일부를 이용할 수 있고 모델별 속도 제한이 더 낮으며 BYOK는 지원하지 않습니다. Paid 티어는 구매한 크레딧을 사용하고, 제공되는 모든 모델과 더 높은 한도를 열어 주며, Vercel 게이트웨이 요금이나 약정 없이 BYOK를 지원합니다. 크레딧을 구매하면 Paid로 전환되므로 월 $5의 Free 크레딧은 더 이상 적용되지 않습니다.
BYOK에는 운영 문서에 꼭 남겨야 할 과금 예외가 있습니다. 고객의 공급자 자격 증명으로 보낸 요청이 실패하면, Vercel은 안정성을 위해 자체 시스템 자격 증명으로 다시 시도할 수 있으며 이 폴백 비용은 팀의 게이트웨이 크레딧 잔액에서 차감됩니다. 모든 요청이 협상된 공급자 계정에만 남기를 기대한다면 BYOK를 Vercel 크레딧이 절대 움직이지 않는다는 보장으로 받아들이지 말고, 잔액을 모니터링하면서 폴백 트래픽을 대조해야 합니다.
‘마크업 0’이라는 문구에는 유료 제어 기능도 포함되지 않습니다. Custom Reporting은 태그, 사용자 ID 또는 할당량 엔터티 쓰기 1,000건당 $0.075, 리포팅 쿼리 1,000건당 $5입니다. 팀 전체 공급자 허용 목록은 Pro와 Enterprise에서 성공한 요청 1,000건당 $0.10이지만, 요청별 공급자 필터에는 추가 비용이 없습니다. 팀 전체 제로 데이터 보존(ZDR) 강제에도 요청 1,000건당 $0.10이 추가되며, 요청별 ZDR은 Pro와 Enterprise에서 무료입니다.
트레이스 드레인은 트레이스 1,000건당 $0.05에 송신 데이터 GB당 $0.50가 추가되고, Pro에 포함된 무료 할당량은 없습니다. 성공한 요청이 100만 건이면 팀 전체 허용 목록에 $100, 팀 전체 ZDR에 다시 $100, 트레이스 100만 건에 송신 비용 전 $50가 붙습니다. 그래도 가장 저렴한 선택일 수 있지만, 구매자는 토큰 마크업 문구가 아니라 실제 설정을 반영한 청구서를 비교해야 합니다.
솔직한 제약은 시간입니다. Sol 할인은 훌륭한 마이그레이션 기회지만 영구 아키텍처의 근거로는 부족합니다. 프로모션 이후에도 마크업 없는 라우팅, 예산, 폴백, 관측성이 팀에서 직접 맡아야 할 업무를 대체한다면 Vercel은 여전히 매력적입니다. 반대로 제품이 안정적인 공급자 모델 하나만 사용하고 이런 제어가 필요 없다면 할인 종료 후 직접 결제가 다시 앞설 수 있습니다.
추천 대상: 관리형 라우팅, 지출 제어, 공개 토큰 마크업 0을 원하는 소규모 또는 중견 팀.
핵심 강점: 현행 GPT-5.6 Sol Default 요금은 9월 18일까지 표준 직접 이용료 $800를 $400로 낮춥니다.
가격: Free는 대상 모델에 월 $5를 포함합니다. Paid는 마크업 없이 공급자 정가에 구매 크레딧을 쓰며, 리포팅·정책·트레이스 요금은 별도입니다.
무료 체험: 기간 한정 체험이 아닌 상시 Free 티어입니다.
- Free와 Paid 모두 공개 토큰 마크업이 없습니다.
- 현재의 Sol 할인으로 표준 워크로드에서 측정 가능한 50% 절감 효과가 생깁니다.
- Paid는 게이트웨이 요금 없이 BYOK를 지원합니다.
- 팀 전체 허용 목록 요금 없이 요청별 공급자 필터를 사용할 수 있습니다.
- 결정적인 Sol 할인은 2026년 9월 18일 종료됩니다.
- 크레딧을 구매하면 매달 지급되는 $5 Free 크레딧이 사라집니다.
- BYOK 요청이 실패하면 시스템 자격 증명 폴백이 Vercel 크레딧을 소모할 수 있습니다.
- 리포팅, 팀 전체 정책, 트레이스에 별도 사용료가 붙을 수 있습니다.
가장 안전한 도입 방식은 언제든 비교를 되돌릴 수 있게 구성하는 것입니다.
합격 여부를 판정할 수 있는 워크플로 하나를 분리합니다
유효한 구조화 추출이나 승인된 고객 지원 답변처럼 합격 조건을 셀 수 있는 작업 하나를 고릅니다. 별도의 게이트웨이 키를 발급해 비용과 실패가 제품의 나머지 트래픽에 묻히지 않게 합니다.
직접 연결 기준선을 고정합니다
공급자 직접 경로에서 대표성 있는 1주 동안 입력 토큰, 출력 토큰, 재시도, 지연 시간, 합격 결과를 기록합니다. 합격률이 떨어지지 않을 때만 현재 단가 절감에 의미가 있습니다.
범위를 제한해 10%만 라우팅합니다
같은 모델과 서비스 티어를 유지한 채 해당 워크플로의 10%를 Vercel로 보냅니다. 구성 오류가 무제한 지출로 번지지 않도록 표본 규모에 맞춘 키별 예산을 설정합니다.
네 가지 비용 항목을 모두 대조합니다
모델 사용료, 유료 리포팅이나 정책 제어, 트레이스, 검토 또는 재시도 비용을 합산합니다. 실패한 BYOK 요청이 시스템 크레딧을 썼는지도 확인합니다.
9월의 결정을 내립니다
합격 결과당 비용이 직접 연결보다 낮고, 관리형 제어 기능이 프로모션 이후 가격만큼의 가치를 낼 때만 경로를 유지합니다. 예산 캘린더에 9월 18일을 넣고 기한 전에 가격을 다시 계산합니다.
2. LiteLLM: 플랫폼 팀이 이미 있다면 최적의 자체 호스팅 게이트웨이
공용 인프라를 이미 운영하고 있으며 게이트웨이 라이선스 비용을 $0로 만들고 싶은 기업에는 LiteLLM이 가장 적합한 자체 호스팅 게이트웨이입니다.

Open Source 플랜은 영구 무료이며 자체 호스팅 방식입니다. 하나의 OpenAI 호환 API로 100개 이상의 공급자를 연결하고, 가상 키, 사용자와 팀, 지출 추적, 예산, 속도 제한, 폴백, 로깅, Prometheus를 제공합니다. 컨테이너, 메트릭, 시크릿, 온콜을 이미 운영하는 중견 기업의 플랫폼 조직이라면 월간 게이트웨이 라이선스를 추가하지 않고 공급자 로직을 통합할 수 있습니다.
다만 무료라는 말은 라이선스 범위에서 끝납니다. 컴퓨팅 자원, 필요한 데이터 저장소, 배포 파이프라인, 업그레이드, 보안 검토, 관측성, 게이트웨이 장애에 대응할 담당자는 회사가 직접 마련해야 합니다. 이런 업무가 이미 플랫폼 팀의 한계 업무에 포함돼 있거나 자체 호스팅이 필수일 때만 LiteLLM이 비용 면에서 이깁니다.
Enterprise 플랜은 연간 게이트웨이 요청 용량, 배포 아키텍처, 지원 요구사항을 기준으로 산정하는 맞춤형 연간 계약이며 토큰 양으로 가격을 매기지 않습니다. SSO와 SCIM, OIDC 또는 JWT 제어, 감사 로그, 시크릿 관리자 연동과 키 순환, 조직 관리, 멀티 리전 옵션, 공식 지원, 에어갭 배포가 추가됩니다. 공개 페이지에서 신용카드 없이 30일간 Enterprise를 체험할 수 있지만 구체적인 금액은 공개하지 않습니다.
이 가격 기준은 손익분기 계산을 바꿉니다. 토큰 지출은 매우 크지만 요청 용량은 보통인 팀이라면 고가 모델에 붙는 비율형 수수료를 피할 수 있습니다. 모델 지출이 적고 플랫폼 조직도 없는 팀이라면 관리형 게이트웨이 요금보다 직원의 시간을 더 많이 소모할 수 있습니다. 선택이 뒤집히는 기준은 요청량만이 아니라, LiteLLM을 운영하는 월간 증분 비용이 대체할 호스팅 플랫폼 비용과 운영 업무보다 적은지 여부입니다.
데이터 플레인을 자체 환경 안에 둬야 하는 규제 산업의 기업에도 LiteLLM이 잘 맞습니다. 순수 모델 청구액이 줄지 않더라도 이 통제력만으로 선택을 정당화할 수 있습니다. 이때 비용 절감은 공급자 라우팅, 예산, 중앙 제어에서 따라오는 부차적 효과이며, 자체 호스팅이 본질적으로 저렴하다는 증거는 아닙니다.
추천 대상: 기존 플랫폼 조직이 있거나 자체 호스팅이 필요하거나, 비율형 게이트웨이 요금을 거부할 만큼 규모가 큰 팀.
핵심 강점: $0 오픈소스 라이선스로 예산, 가상 키, 폴백, 로그와 100개 이상의 공급자를 지원합니다.
가격: Open Source는 영구 $0, Enterprise는 요청 용량·아키텍처·지원을 기준으로 한 맞춤형 연간 견적입니다.
무료 체험: 신용카드 없이 Enterprise 30일 체험이 가능하며, Open Source는 자체 호스팅 시 영구 무료입니다.
- 오픈소스 라이선스 비용과 토큰당 게이트웨이 세금이 없습니다.
- 100개 이상의 공급자를 대상으로 예산, 키, 폴백, 로그를 중앙에서 관리합니다.
- Enterprise는 거버넌스와 에어갭 배포를 지원합니다.
- 고가 모델의 사용량이 늘어도 토큰 지출 때문에 Enterprise 라이선스가 자동으로 비싸지지 않습니다.
- Open Source에서는 인프라, 업그레이드, 안정성, 사고 대응을 구매자가 책임집니다.
- Enterprise 가격이 공개되지 않아 웹사이트 정보만으로는 조달 비용을 모델링할 수 없습니다.
- 플랫폼 역량이 없는 소규모 팀은 무료 라이선스를 가장 비싼 운영 방식으로 만들 수 있습니다.
3. Cloudflare AI Gateway: 바이트까지 동일한 반복 트래픽에 최적
안전하게 재사용할 수 있고 바이트까지 동일한 요청이 트래픽에서 의미 있는 비중을 차지하며 BYOK를 쓸 수 있다면 Cloudflare AI Gateway가 가장 효과적으로 비용을 줄입니다.

Cloudflare의 핵심 기능은 가격을 계산하기가 유난히 쉽습니다. 대시보드 분석, 캐싱, 속도 제한은 모든 플랜에서 무료입니다. Workers Free는 모든 게이트웨이를 합해 로그 100,000건을 저장하고 계정당 게이트웨이 10개를 허용합니다. Workers Paid는 게이트웨이당 로그 1,000만 건과 게이트웨이 20개를 허용합니다. Logpush는 Paid 전용이며 월 요청 1,000만 건이 포함되고, 이후 100만 건마다 $0.05입니다.
실제 절감 장치는 캐싱이며 제약도 명확합니다. Cloudflare의 기본 캐시 키는 공급자, 엔드포인트, 모델, 공급자 인증 헤더, 전체 요청 본문을 포함합니다. 메시지, 툴, 모델 매개변수 가운데 무엇이든 달라지면 별도 항목이 생성됩니다. 캐시 적중 시 공급자 호출을 건너뛰지만, 뜻이 같아도 표현이 다른 두 프롬프트는 팀이 안전성을 입증할 수 있는 맞춤형 캐시 키를 의도적으로 설계하지 않는 한 일치하지 않습니다.
최소 캐시 수명은 60초, 최대는 1개월이며 캐시 가능한 요청은 최대 25 MB입니다. 반복 분류 작업, 여러 사용자가 공유하는 정적 설명, 결정론적 배치 프롬프트에 잘 맞습니다. 개인화 지원, 변하는 원천 데이터, 확률적인 창작 결과에는 기본 선택으로 부적합합니다. 저렴하지만 오래된 답변이 새 모델 호출보다 더 큰 피해를 줄 수 있기 때문입니다.
적중률만큼 결제 경로도 중요합니다. BYOK를 쓰면 핵심 게이트웨이는 무료로 유지되고 공급자에게 직접 결제합니다. Unified Billing은 공급자 추론 가격을 그대로 전달하지만 구매 크레딧에 5%를 더하므로 $100 크레딧의 가격은 $105입니다. 또한 게이트웨이당 60초에 요청 200건으로 제한됩니다. Cloudflare에 따르면 이 속도 제한은 BYOK에는 적용되지 않습니다.
표준 $800 청구액에 동일 요청이 정확히 25%라는 가정을 적용해 보겠습니다. 이 반복 요청들이 같은 토큰 구성을 갖고 안전하게 재사용할 수 있다면 BYOK 캐싱 후 공급자 비용은 $600가 되어 $200를 절감합니다. Unified Billing은 남은 $600에 5%를 더하므로 총액은 $630, 순절감액은 $170입니다. 적중률이 낮으면 이점이 사라질 수 있고, 안전한 적중률이 높으면 Cloudflare를 이기기 어렵습니다.
DLP 스캔은 모든 플랜에서 무료이며 Zero Trust 구독이 없는 계정에는 사전 정의 프로필 2개가 제공됩니다. Guardrails는 무료가 아닙니다. 평가에 Workers AI 모델을 사용하며 Workers AI 토큰 요금이 청구됩니다. 회계 범위를 올바로 정해야 하는 또 하나의 사례입니다. 캐시는 무료여도 안전 계층에 별도 추론 비용이 생길 수 있습니다.
추천 대상: 결정론적인 반복 요청이 있고 캐시 안전성을 측정할 의지가 있는 Cloudflare 사용자.
핵심 강점: 무료 정확 응답 캐싱으로 적중 시 공급자 호출을 완전히 없앨 수 있습니다.
가격: 핵심 분석, 캐싱, 속도 제한은 무료입니다. Unified Billing은 5%를 더하며 로깅, Logpush, Guardrails에는 별도 한도나 사용료가 있습니다.
무료 체험: 기간 한정 체험이 아니라 핵심 기능과 Workers Free 로그 저장 공간이 상시 무료입니다.
- 핵심 게이트웨이 분석, 캐싱, 속도 제한이 $0입니다.
- 정확 캐시가 적중하면 프롬프트 토큰 일부만 할인하는 것이 아니라 공급자 호출 자체가 사라집니다.
- BYOK는 Unified Billing의 5% 수수료와 관리형 자격 증명 속도 제한을 피합니다.
- 캐시 동작과 절대 한도가 명확히 문서화돼 있습니다.
- 기본 캐시는 완전 일치를 요구하므로 대화 표현이 달라지면 적중하지 않습니다.
- Unified Billing에는 5%가 추가되고 게이트웨이당 60초에 요청 200건으로 제한됩니다.
- 무료 로그 저장 공간은 여러 게이트웨이가 공유하며 100,000건에서 끝납니다.
- 안전하지 않은 맞춤형 키는 오래됐거나 다른 컨텍스트의 콘텐츠를 반환할 수 있습니다.
4. TrueFoundry AI Gateway: 관리형 시맨틱 캐시 최적 선택
표현은 다르지만 안전하게 재사용할 수 있는 동일한 질문이 자주 들어온다면 TrueFoundry AI Gateway가 가장 좋은 관리형 선택입니다.

차별점은 시맨틱 캐싱입니다. TrueFoundry의 캐시 문서에 따르면 정확 모드는 전체 요청을 해시하고, 시맨틱 모드는 마지막 메시지를 임베딩해 이전 요청과 의미를 비교합니다. 다른 모든 요청 매개변수는 여전히 일치해야 합니다. 전체 응답 캐시가 적중하면 LLM 호출을 피하고 LLM 비용도 0이 됩니다. 따라서 “비밀번호를 어떻게 재설정하나요?”라는 질문을 여러 표현으로 받는 지원 조직은 표현마다 비용을 내는 대신 승인된 답변 하나를 재사용할 수 있습니다.
캐시는 사용자 또는 가상 계정별로 자동 격리되며, 선택적 네임스페이스로 테넌트나 환경을 분리할 수 있습니다. 한 고객의 캐시 답변이 다른 고객에게 전달된다면 높은 적중률은 아무 의미가 없으므로 중요한 기능입니다. 자체 호스팅 시맨틱 캐시에는 Redis와 임베딩 모델이 필요하지만, SaaS 경로에서는 해당 인프라를 관리해 줍니다.
공개 가격 페이지에는 4개 티어가 있습니다. Developer는 월 $0에 요청 50,000건과 사용자 3명을 제공합니다. Pro는 월 $499에 요청 100만 건과 사용자 10명을 제공합니다. 요청 200만 건과 API 키 5개를 추가하면 월 $499가 더 듭니다. Pro Plus는 월 $2,999에 요청 100만 건과 사용자 25명을 제공하며, 추가 사용량은 영업팀 견적 대상입니다. Enterprise는 요청·사용자 용량에 따른 맞춤 가격이며 VPC와 에어갭 배포를 지원합니다.
가격 페이지는 7일 무료 체험을 안내하고, 게이트웨이 페이지는 1,600개 이상의 모델에 대해 매월 첫 요청 50,000건을 카드 없이 무료로 제공합니다. Pro로 옮기기 전에 현실적인 캐시 적중률을 측정하기에는 충분합니다. 그렇다고 인위적으로 만든 FAQ 세트에서 프로덕션 절감액을 추정해도 된다는 뜻은 아닙니다.
모델 청구액만 놓고 보면 지출 규모가 크지 않을 때 넘어야 할 문턱이 높습니다. 표준 공급자 청구액 $800와 비교하면, 월 $499인 Pro가 추론 비용만으로 이기려면 모델 지출을 최소 $499, 즉 약 62.4% 줄여야 합니다. 적중률이 더 낮아도 거버넌스, 격리, 관측성, 인력 시간 때문에 Pro를 정당화할 수 있지만, 이들은 별개의 이점으로 명시해야 합니다.
실질적인 위험은 잘못된 재사용입니다. 시맨틱 임계값이 너무 느슨하면 관련 있어 보이지만 현재 사용자의 컨텍스트나 정책을 위반하는 과거 답변이 반환될 수 있습니다. 안전한 테스트는 같은 합격 데이터셋으로 캐시 답변과 새 답변을 평가하고, 테넌트별로 구분하며, 실시간 계정 정보나 법률·의료·변동 재고가 관련된 질문은 캐싱하지 않습니다.
추천 대상: 의도는 반복되지만 표현은 다양한 고객 지원, 지식, FAQ 워크로드.
핵심 강점: 사용자 또는 가상 계정을 자동 격리하고 선택적 네임스페이스를 제공하는 관리형 시맨틱 전체 응답 캐싱.
가격: Developer $0, Pro 월 $499, Pro Plus 월 $2,999, Enterprise는 맞춤형이며 위와 같은 공개 요청·사용자 한도가 적용됩니다.
무료 체험: 7일 체험과 월 요청 50,000건을 제공하는 상시 Developer 티어가 있습니다.
- 정확 캐시가 놓치는 호출 전체도 시맨틱 캐싱으로 제거할 수 있습니다.
- 캐시 항목이 기본적으로 사용자 또는 가상 계정별로 격리됩니다.
- Developer는 범위를 정한 적중률 평가에 충분한 월간 요청을 제공합니다.
- Enterprise는 VPC와 에어갭 배포를 지원합니다.
- Pro의 월 $499 최저선만큼 상당한 절감이나 거버넌스 가치가 필요합니다.
- Pro Plus는 월 요청 100만 건으로 표기돼 있으면서도 $2,999입니다.
- 시맨틱 오탐은 비용 절감을 품질 또는 데이터 경계 문제로 바꿀 수 있습니다.
- 자체 호스팅 시맨틱 캐싱에는 Redis와 임베딩 모델 운영이 추가됩니다.
5. Portkey: $49부터 시작하는 관리형 거버넌스
프로토타입 단계를 벗어났지만 $499짜리 프로덕션 게이트웨이를 정당화하기 어려운 팀에는 Portkey가 진입 비용이 가장 낮은 관리형 선택입니다.

플랜의 첫 단계는 자체 호스팅 방식이며 요청 한도가 없는 Open Source입니다. 범용 API, 재시도와 타임아웃, 라우팅, Guardrails, 자동 폴백, 기본 대시보드, 로드 밸런싱, 커뮤니티 지원이 포함됩니다. 페이지에는 이 경로의 라이선스 가격이 명시돼 있지 않으므로 LiteLLM과 같은 방식으로 평가해야 합니다. 통제력은 높지만 인프라와 운영자 비용은 구매자 몫입니다.
호스팅형 Developer 티어는 Free Forever로, 월 요청 10,000건을 허용하고 초과 사용은 지원하지 않으며 프로덕션이 아니라 프로토타입과 엔터프라이즈 개념 증명을 위한 플랜으로 명시돼 있습니다. Production은 월 $49에 요청 100,000건을 포함하고, 300만 건까지 요청 100,000건을 추가할 때마다 월 $9가 붙습니다. 단순 캐싱과 시맨틱 캐싱, 역할 기반 접근, 서비스 계정 키, 프로덕션 지원이 포함됩니다.
월 요청 100만 건일 때 모델 사용료 전 Production 비용은 $130입니다. 포함된 100,000건에 $49, 나머지 900,000건에 $9짜리 초과 블록 9개가 붙습니다. 이것이 유용한 비교 지점입니다. 표준 워크로드에서 수수료 없는 게이트웨이를 이기려면 Portkey가 캐싱, 라우팅, 예산 강제 또는 운영 업무를 통해 $130보다 큰 비용을 회수해야 합니다.
Enterprise는 요청 용량에 따른 맞춤 가격을 적용합니다. SSO, 세분화된 예산과 속도 제한, 프라이빗 클라우드 또는 VPC 옵션, 강화된 규정 준수 제어가 추가됩니다. 규제 대상 조직이라면 공급자 청구액이 그대로여도 거버넌스를 위해 이 티어를 선택할 수 있습니다.
조달 메모에 남길 만한 이름 문제가 있습니다. 실제 가격 페이지에서는 $49 티어를 Production이라고 부르지만 현재 문서에서는 같은 $49 티어를 Pro라고 부릅니다. 가격 페이지에는 Portkey가 이제 Prisma AIRS AI Gateway라는 설명도 있습니다. 플랜 확인을 자동화하거나 이 이름을 기준으로 갱신 정책을 작성하기 전에 주문서에서 명칭을 일치시켜야 합니다.
Portkey는 공개 자료만으로 절감 메커니즘을 감사하기가 TrueFoundry만큼 쉽지 않아 시맨틱 캐시의 깊이에서는 그보다 아래에 놓였습니다. 반면 공유 크레딧을 구매할 때마다 비율형 수수료를 내는 대신 예측 가능한 호스팅 기본료를 원하는 팀에는 OpenRouter보다 앞섭니다. $49의 진입점 덕분에 제한된 프로덕션 시험 비용을 명확히 계산할 수 있습니다.
추천 대상: 월 세 자릿수의 컨트롤 플레인 예산으로 호스팅형 캐싱, 역할, 키, 라우팅, 지원이 필요한 성장 중인 AI 제품.
핵심 강점: Production은 $49부터 시작하며, 모델 사용료 전 월 요청 100만 건의 비용은 $130입니다.
가격: Open Source는 자체 호스팅, Developer는 Free Forever, Production은 월 $49에 요청 100,000건 추가당 $9, Enterprise는 맞춤 가격입니다.
무료 체험: 상시 Developer 티어가 월 요청 10,000건을 제공하지만 프로덕션에는 적합하지 않습니다.
- 첫 호스팅형 프로덕션 티어가 월 $49부터 시작합니다.
- Production에 단순 캐싱과 시맨틱 캐싱이 포함됩니다.
- 예측 가능한 요청 블록 단위 초과 요금은 토큰 비율형 요금보다 예산을 세우기 쉽습니다.
- Open Source와 Enterprise 경로가 서로 반대되는 통제 요구를 충족합니다.
- 요청 100만 건이면 추론 비용 전부터 $49라는 문구가 $130로 올라갑니다.
- Developer는 초과 사용 없이 10,000건에서 멈추며 프로덕션 경로가 아닙니다.
- Production과 Pro라는 이름의 불일치로 불필요한 조달 혼선이 생깁니다.
- Enterprise의 경제성은 영업 견적을 받아야 알 수 있습니다.
6. OpenRouter: 가격순 공급자 라우팅에 최적인 마켓플레이스
같은 경로에서 게이트웨이 비용을 최소화하기보다 여러 공급자와 모델 가운데 가격을 기준으로 선택하는 일이 핵심이라면 OpenRouter가 가장 적합합니다.

Free 플랜은 무료 공급자 4곳을 통해 25개 이상의 무료 모델을 제공하며, 하루 요청 50건과 커뮤니티 지원이 포함됩니다. Pay-as-you-go는 최소 지출 없이 500개 이상의 모델과 80개 이상의 공급자를 열어 주지만 공유 크레딧에 5.5% 플랫폼 수수료를 더합니다. 크레딧 구매 수수료의 최저 금액은 $0.80이며 암호화폐 충전에는 5%가 부과됩니다.
Enterprise도 500개 이상의 모델과 80개 이상의 공급자를 제공하며, 인보이스 결제, 관리형 제어, 선택적 전용 한도, 계약상 SLA, 공용 Slack 지원 채널이 추가됩니다. 맞춤형 사용량 약정을 기준으로 가격을 정하고 수수료 할인을 포함할 수 있습니다. 공개된 사용자당 구독제가 아니라 조달용 티어입니다.
BYOK를 쓰면 판단이 달라집니다. Pay-as-you-go에서는 정가 기준 월 $25,000까지의 BYOK 추론에 OpenRouter 요금이 없고, 그 이상부터 5%를 부과합니다. Enterprise는 무료 한도를 월 $200,000로 높이고 이후 5%를 적용합니다. 이미 공급자 직접 계정을 보유한 기업이라면 한도 내에서 공유 크레딧 비율 수수료 없이 OpenRouter의 제어 계층을 사용할 수 있습니다.
비용 절감 기능의 핵심은 공급자 선택입니다. OpenRouter는 조건을 충족하는 공급자를 가격순으로 정렬하고 최대 가격을 강제하며, 경로 실패 시 폴백할 수 있습니다. 베타 응답 캐시는 완전히 동일한 요청에 과금 없이 응답하고 모델 간에도 작동하지만 시맨틱 캐시는 아닙니다. 공급자 간 교체 가능성이 워크로드의 품질, 데이터 정책, 지연 시간, 가용성 요건을 충족할 때만 가격순 정렬이 비용을 절감합니다.
변경 없는 $800 공급자 청구액에 공유 크레딧을 쓰면 $44가 추가돼 총액은 $844입니다. 따라서 직접 결제보다 유리하려면 더 저렴한 적격 공급자, 캐시 적중, 낮아진 실패 비용, 단순해진 운영을 통해 $44보다 큰 금액을 회수해야 합니다. 이미 공급자 하나가 계약된 가격으로 안정적으로 워크로드를 처리한다면 마켓플레이스는 선택적 오버헤드입니다.
상세 수수료 하한, BYOK 규칙, 충전 위험, 라우팅 비교는 OpenRouter 가격 상세 분석에 정리돼 있습니다. 여기서의 실용적인 결론은 더 좁습니다. 팀이 실제로 마켓플레이스를 활용할 때 OpenRouter는 절감 도구이며, 같은 요청 앞에 URL 하나를 더 놓는 것만으로는 그렇지 않습니다.
추천 대상: 공급자 또는 모델 제품군을 실제로 오가며 그 선택에서 발생한 절감액을 측정할 수 있는 팀.
핵심 강점: 500개 이상의 모델과 80개 이상의 공급자를 대상으로 가격순 라우팅하며, BYOK 무료 한도도 큽니다.
가격: Free $0, Pay-as-you-go는 모델 가격에 공유 크레딧 5.5% 추가, Enterprise는 수수료 할인 가능한 맞춤형 가격입니다.
무료 체험: 25개 이상의 무료 모델과 하루 요청 50건을 제공하는 상시 Free 플랜입니다.
- 이 후보군에서 가장 폭넓은 공급자 마켓플레이스를 제공합니다.
- 라우팅에서 가격순 정렬, 가격 상한, 폴백을 설정할 수 있습니다.
- BYOK는 Pay-as-you-go에서 월 $25,000, Enterprise에서 월 $200,000까지 게이트웨이 요금이 없습니다.
- 정확 응답 캐시 적중은 청구 가능한 사용량을 0으로 기록합니다.
- 기본 경로가 그대로여도 공유 크레딧에는 5.5%가 붙습니다.
- 최저 $0.80 수수료 때문에 소액 크레딧 구매는 표시된 비율보다 비쌉니다.
- 정확 캐싱은 표현이 다른 요청을 포착하지 못합니다.
- 모델명이 같아도 공급자를 바꾸면 지연 시간, 정책, 결과 품질이 달라질 수 있습니다.
어떤 팀이 어떤 AI 게이트웨이를 선택해야 할까요?
관리형 라우팅과 공개 토큰 마크업 0을 원한다면 기본 선택은 Vercel입니다. 현재 모델 할인이 끝난 뒤 남은 제어 기능이 직접 연결보다 더 큰 비용을 절감하지 못하거나, 팀 전체 정책과 트레이스 설정 때문에 부가 요금이 커지면 Vercel이 아닌 다른 선택으로 바뀝니다.
자체 호스팅이 필수이거나 기존 플랫폼 팀이 적은 한계 비용으로 게이트웨이를 흡수할 수 있다면 LiteLLM을 선택합니다. LiteLLM 때문에 새 운영 담당자와 새 호출 대기 업무가 생기거나 Enterprise 견적이 호스팅 대안의 총비용보다 커지면 관리형으로 바꾸는 편이 낫습니다.
요청 본문이 정확히 반복되고, 캐시 응답을 안전하게 재사용할 수 있으며, BYOK가 맞는다면 Cloudflare가 이깁니다. 표현은 달라도 의도가 같고 측정된 시맨틱 캐시가 품질 기준을 통과한다면 TrueFoundry로 선택이 바뀝니다. 최신성, 개인화, 테넌트 컨텍스트 때문에 재사용이 위험하다면 다시 캐시를 쓰지 않는 쪽으로 돌아가야 합니다.
TrueFoundry의 관리형 시맨틱 재사용은 실제 평가에서 티어 비용을 충당할 만큼 합격한 캐시 적중이 입증된 뒤에만 유리합니다. 더 저렴한 호스팅형 프로덕션 컨트롤 플레인이 필요하고 요청량 기반 가격이 맞는다면 Portkey가 적합합니다. 공급자 가격순 선택이나 BYOK 통합으로 수수료 이상을 절감할 수 있다면 OpenRouter가 이깁니다.

가장 강력한 기본값은 여전히 게이트웨이를 쓰지 않는 것일 수도 있습니다. 한 공급자의 안정적인 모델을 대규모로 사용하고, 공급자 자체 예산 기능이 충분하며, 실패 비용이 낮고, 반복 콘텐츠도 거의 없다면 게이트웨이로 절감할 부분이 뚜렷하지 않습니다. 구체적인 라우팅, 캐시, 거버넌스, 운영 편익이 총비용을 넘어설 때만 컨트롤 플레인을 추가하세요.
선정 기준
이 순위는 구매자가 검증할 수 있는 경제성에 가중치를 부여했습니다. 공개 게이트웨이 비용과 수수료 투명성 35%, 모델 지출을 없애는 신뢰할 만한 메커니즘 30%, 프로덕션 진입 장벽 20%, 운영 부담과 마이그레이션 마찰 15%입니다.
가격 페이지, 플랜 비교, 기능 문서, 캐시 동작, 요청 한도, GPT-5.6 Sol 변경 사항은 2026년 8월 24일 실제로 확인했습니다. 게시 파이프라인은 순위에 든 게이트웨이마다 실제 가격 페이지 스크린샷을 캡처합니다. 이번 조사에서는 프로덕션 트래픽으로 툴을 직접 테스트하지 않았으므로 지연 시간, 가동 시간, 캐시 적중률, 결과 품질에 관한 어떤 수치도 테스트 결과로 제시하지 않습니다.
최종 후보 6개는 각각 감사 가능한 비용 절감 역할이 뚜렷해 선정했습니다. Vercel은 관리형 플랫폼 마크업을 없애고 현재 주요 모델을 할인합니다. LiteLLM은 자체 호스팅으로 라이선스 비용을 없앱니다. Cloudflare는 완전히 동일한 반복 호출을 제거합니다. TrueFoundry는 의미가 반복되는 호출을 겨냥합니다. Portkey는 가격이 명확한 관리형 상위 단계를 판매합니다. OpenRouter는 공급자 간 가격 경쟁을 노출합니다.
업체가 어떤 기능을 최적화라고 설명했다는 이유만으로 절감액에 포함하지 않았습니다. 비용 계산에는 명시된 워크로드, 알려진 가격, 명시적인 캐시 가정을 사용했습니다. 이 순위를 적용할 기업은 연간 계약을 체결하기 전에 해당 입력값을 자체 모델 구성, 합격 결과 비율, 운영자 비용으로 바꿔 계산해야 합니다.
피해야 할 선택
비용 절감이 최우선인 신규 구축에서의 Kong AI Gateway
추론 비용 절감만이 목표라면 Kong AI Gateway는 첫 번째 선택이 아닙니다. Kong의 현재 가격에 따르면 Konnect는 30일 체험을 제공하지만, 이후 유료 AI Gateway 플러그인은 Plus의 애드온이 되며 AI 플러그인이 프록시하는 고유 모델 하나당 월 $100를 부과하고 모델을 5개로 제한합니다. 모델 5개면 추론 사용료와 기타 플랫폼 비용을 내기 전부터 월 프록시 비용이 $500입니다.
그렇다고 Kong이 나쁜 플랫폼이라는 뜻은 아닙니다. 이미 API, 보안, 서비스 거버넌스를 Kong으로 표준화한 기업이라면 AI 제어 기능을 추가하는 비용이 다른 공급자를 도입하는 것보다 낮을 수 있습니다. 조언의 범위는 더 좁습니다. 마크업 없는 게이트웨이와 핵심 기능 무료 게이트웨이가 존재하는 상황에서 토큰 절감만을 위해 신규 AI 스택에 범용 API 플랫폼을 도입하지 마세요.
담당자가 없는 자체 제작 프록시
얇은 내부 프록시는 재시도, 공급자 변경, 예산, 로그, 시크릿, 사고를 책임지기 전까지만 무료처럼 보입니다. 표면적을 작게 유지할 만큼 워크로드가 안정적이고 서비스를 이미 맡은 팀이 명확할 때만 구축하세요. 그렇지 않으면 관리형 대안보다 제어 기능은 적으면서 엔지니어링 시간 속에 비용을 숨기는 프록시가 됩니다.
재사용 가능한 응답이 없는 단일 공급자 워크로드의 모든 게이트웨이
트래픽이 이동하지 않으면 폭넓은 라우팅은 가치가 없습니다. 모든 요청에 새 답변이 필요하면 정확 캐시와 시맨틱 캐시 모두 가치가 없습니다. 공급자 자체의 예산 및 로그 기능으로 충분하다면 직접 API가 과금 계층도 가장 적고 장애 표면도 가장 작습니다.
9월 할인에 기반한 영구 계획
Vercel의 현행 Sol 프로모션은 이 순위에서 지금 당장 가장 좋은 조건인 동시에 가장 오용하기 쉬운 조건입니다. 9월 18일을 강제 재산정 날짜로 취급하세요. 프로모션이 마이그레이션 테스트의 계기더라도 아키텍처는 공급자 정가에서도 살아남아야 합니다.
월요일 실행안: 워크플로 하나를 합격 결과당 비용표에 올리세요
지난주에 의미 있는 모델 비용을 발생시켰고 이진 합격 규칙으로 판정할 수 있는 프로덕션 워크플로 하나를 고릅니다. 입력 토큰, 출력 토큰, 공급자 비용, 재시도, 합격 결과를 내보냅니다. 선택한 경로에서 사용하도록 승인되지 않은 개인 정보, 기밀 정보, 고객 데이터는 평가 세트에 포함하지 않습니다.
다음 주 트래픽의 10%를 워크로드 메커니즘과 맞는 게이트웨이로 라우팅합니다. 관리형 Sol 가격 기회에는 Vercel, 검증된 완전 일치 반복에는 Cloudflare, 표현은 다르지만 의미가 같은 질문에는 TrueFoundry, 기존 자체 호스팅 플랫폼에는 LiteLLM, 진입 비용이 낮은 관리형 제어 계층에는 Portkey, 실제 공급자 가격 경쟁에는 OpenRouter를 사용합니다.
분리한 키에 엄격한 예산을 설정하고 첫 요청 전에 중단 조건을 정의합니다. 합격 결과 비율이 떨어지거나, 캐시 안전성이 깨지거나, 공급자 경로가 정책을 위반하거나, 전체 게이트웨이 비용이 절감액을 넘으면 중단합니다. 주말에는 모델 지출, 플랫폼 요금, 유료 제어 기능, 재시도, 검토 비용을 모두 더한 뒤 합격 결과 수로 나눕니다.
월요일의 결과물은 재무팀과 엔지니어링팀이 함께 볼 수 있는 하나의 결정, 즉 유지·전환·제거입니다. Vercel이 이기면 캘린더에 9월 18일 가격 재산정을 추가합니다. 캐시가 이기면 테스트를 통과한 요청 유형에만 배포합니다. 어느 쪽도 이기지 못하면 직접 연결을 유지하고 불필요한 복잡성에 돈을 쓰지 않습니다.
자주 묻는 질문
Cloudflare AI Gateway 비용은 얼마인가요?
Cloudflare의 핵심 AI Gateway 분석, 캐싱, 속도 제한은 모든 플랜에서 무료입니다. Workers Free는 모든 게이트웨이를 합해 로그 100,000건을 저장하고, Workers Paid는 게이트웨이당 1,000만 건을 저장합니다. 공급자 가격은 마크업 없이 전달되지만 Unified Billing은 구매 크레딧에 5%를 더합니다. Logpush와 Guardrails 추론에는 별도 비용이 생길 수 있습니다.
가장 좋은 AI 게이트웨이는 무엇인가요?
2026년 8월 24일 기준 최고의 종합 관리형 선택은 Vercel AI Gateway입니다. 공개 토큰 마크업 0과 9월 18일까지 적용되는 GPT-5.6 Sol 50% 할인을 함께 제공하기 때문입니다. 자체 호스팅 인프라를 이미 운영하는 팀에는 LiteLLM, 완전 일치 캐싱에는 Cloudflare, 관리형 시맨틱 캐싱에는 TrueFoundry, $49 프로덕션 진입에는 Portkey, 공급자 가격순 선택에는 OpenRouter가 더 적합합니다.
Cloudflare AI Gateway에 무료 플랜이 있나요?
있습니다. 핵심 분석, 캐싱, 속도 제한은 무료이며 Workers Free 로그 할당량으로 모든 게이트웨이를 합해 레코드 100,000건을 저장할 수 있습니다. 무료 계정의 게이트웨이 한도는 10개입니다. 공급자 추론 비용은 계속 발생하며, Unified Billing, Guardrails 또는 유료 로깅 기능을 선택하면 비용이 추가될 수 있습니다.
비즈니스 오너를 위한 AI Tools Map 받기
이 게이트웨이 선택을 모든 툴의 비용 기준과 품질 하한이 담긴 완전한 도입 스택으로 확장하세요. 무료 AI Tools Map을 구독하세요.
2026년 9월 2일



