Grok 4.5 리뷰: 코딩 성능보다 $2/$6 비용 효율로 승부하는 에이전트 모델

Grok 4.5 리뷰에서 $2/$6 토큰 가격, 200K 이상이면 두 배가 되는 비용, Cursor 요금 계산과 코딩 벤치마크를 분석했습니다. 어떤 팀이 도입해야 하고 누가 건너뛰어야 하는지, 실제 에이전트 운영에서 확인할 핵심 기준까지 한눈에 정리합니다.

Thursday, September 3, 2026Omid Saffari
Grok 4.5 리뷰: 코딩 성능보다 $2/$6 비용 효율로 승부하는 에이전트 모델

Grok 4.5 리뷰의 결론부터 말하면, 이 모델은 입력 토큰 백만 개당 $2, 출력 토큰 백만 개당 $6이지만 새로운 코딩 성능 1위는 아닙니다. 모든 벤치마크에서 이기는 것보다 에이전트 비용과 토큰 효율이 중요하고, 프롬프트를 가격 급등 기준인 200K 미만으로 유지할 수 있을 때 선택할 모델입니다.

Grok 4.5 리뷰 결론을 한눈에 보기

Grok 4.5는 가장 저렴한 코딩 모델과 벤치마크 선두 모델 사이에서 가격 대비 가치가 돋보이는 선택지입니다. Cursor의 Composer 2.5보다는 비싸고 SpaceXAI가 공개한 자체 엔지니어링 차트 대부분에서 Claude Fable 5보다 낮은 점수를 받았습니다. 그럼에도 Cursor에서 출력 가격이 Fable의 $50가 아닌 $6이기 때문에 장시간 실행되는 에이전트에는 충분히 매력적입니다.

가격, 기능, 이용 방법을 보여 주는 SpaceXAI Grok 4.5 모델 문서
Grok 4.5 모델 문서

가장 명확하게 비교할 수 있는 곳은 현재 Cursor의 요금 화면입니다. 자체 모델과 외부 프런티어 모델을 같은 기준으로 보여 주기 때문입니다. 아래 가격은 모두 토큰 백만 개당 금액입니다.

Cursor 내 모델가장 적합한 용도입력캐시 읽기출력선택 기준
Grok 4.5비용에 민감한 장시간 에이전트$2$0.50$6프런티어급 역량과 에이전트 비용의 최적 균형
Composer 2.5가장 저렴한 일상 코딩$0.50$0.20$2.50최대 성능보다 가격이 중요할 때 선택
Claude Fable 5공개된 코딩 평가에서 가장 높은 통과율$10$1$50실패 비용이 토큰 비용보다 클 때 프리미엄을 지불
GPT-5.6 SolOpenAI 중심의 프로덕션 스택$5$0.50$30생태계 적합성이 더 높은 요금을 정당화할 수 있음

한 달에 신규 입력 토큰 1,000만 개와 출력 토큰 200만 개를 사용한다고 가정하면 계산은 간단합니다. Grok 4.5는 $32, Composer 2.5는 $10, Claude Fable 5는 $200, GPT-5.6 Sol은 $110입니다. Cursor는 Teams와 Enterprise에서 타사 모델에 토큰 백만 개당 $0.25를 추가로 부과하지만, 자체 모델인 Grok과 Composer에는 이 요금이 없습니다.

따라서 Grok 4.5의 위치가 가장 선명하게 드러나는 곳은 Cursor입니다. 최저가도 최고 득점 모델도 아니지만, 둘 사이의 비용 압박을 풀어 주는 선택지입니다.

Grok 4.5와 경쟁 모델의 토큰 요금을 보여 주는 Cursor 모델 및 가격 페이지
Cursor 모델 가격

결론은 여기까지입니다. 이제 실제 워크로드가 이 판단의 어느 쪽에 놓이는지 검증하면 됩니다.

Grok 4.5는 어떤 모델이며 어디에서 사용할 수 있나

Grok 4.5는 단순히 새로 추가된 채팅 프리셋이 아니라 코딩, 에이전트형 작업, 지식 업무를 위해 설계된 추론 모델입니다. Cursor와 SpaceXAI는 이를 공동 학습한 전문가 혼합 모델로 설명합니다. 즉, 매 단계마다 전체 네트워크를 사용하는 대신 각 토큰에 맞는 전문 모델 구성 요소 일부를 선택해 활성화합니다.

출시는 두 단계로 진행됐습니다. Cursor는 7월 8일 Grok 4.5를 공개했고, 이어 SpaceXAI가 7월 16일 정식 출시 내용을 발표했습니다. Cursor에 따르면 학습 데이터에는 수조 개 토큰 규모의 개발자-에이전트 상호작용 데이터와 함께 STEM 과제, 연구 논문, 폭넓은 지식 업무가 포함됐습니다.

현재 모델 ID는 grok-4.5입니다. 텍스트와 이미지를 입력받아 텍스트를 출력하며, 컨텍스트 창은 500,000토큰입니다. 추론 강도는 low, medium, high를 지원하고 기본값은 high입니다. 기본 툴로는 Responses API 또는 Chat Completions를 통한 함수 호출, 웹 검색, X 검색, 코드 실행을 제공합니다.

신규 모델치고는 이용 경로가 이례적으로 넓습니다. SpaceXAI API로 사용할 수 있고 Grok Build의 기본 모델이며, Cursor의 모든 요금제에서 실행됩니다. Word, PowerPoint, Excel 추가 기능을 구동하고 OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic에도 등록돼 있습니다. Cursor 안에서는 데스크톱, 웹, iOS, CLI, SDK를 모두 지원합니다.

이처럼 폭넓은 지원 덕분에 도입 장벽은 낮습니다. 다만 모델과 그 모델을 둘러싼 제품은 구분해야 합니다. 직접 API로 쓰는 Grok 4.5와 Cursor 안의 Grok 4.5는 캐시 요금이 다르고, Grok Build는 모델 위에 에이전트 루프를 더합니다. 앞서 분석한 Grok Build의 경제성은 정액제 진입 비용의 영향을 크게 받았습니다. Grok 4.5에서는 모델과 에이전트 모두 종량제로 이용할 경로가 한층 분명해져 비용 논의의 기준이 달라집니다.

벤치마크가 보여 주는 것은 1위가 아니라 가격 대비 가치다

Grok 4.5는 SpaceXAI가 공개한 엔지니어링 벤치마크 5개 중 1개에서 1위를 차지하고, 다른 1개에서는 선두와 거의 비슷한 점수를 냈습니다. 나머지 3개에서는 Claude Fable 5에 뒤집니다. 공급자가 직접 공개한 수치를 외면하지 않는 한, 이를 새로운 코딩 최강자라고 부르기는 어렵습니다.

벤치마크Grok 4.5공개된 최고 점수Grok 순위실무적 의미
DeepSWE 1.062.0%Fable 5, 66.1%3위경쟁력은 있지만 1위는 아님
DeepSWE 1.153%Fable 5, 70%4위신뢰성 격차가 뚜렷함
SWE Marathon29.0%Grok 4.5, 29.0%1위장기 작업 해결에서 가장 좋은 결과
Terminal Bench 2.183.3%Fable 5, 84.3%3위, GPT-5.5보다 0.1 낮음사실상 선두권
SWE Bench Pro64.7%Fable 5, 80.4%3위쓸 만하지만 선두와 큰 격차

SpaceXAI의 출시 차트에 따르면 경쟁 모델 수치는 각 공급자의 시스템 카드 또는 벤치마크 리더보드에서 가져왔습니다. 따라서 이 표는 방향을 판단하는 데는 유용하지만, 실제 워크로드를 대상으로 한 평가를 대신할 수는 없습니다. 실행 환경, 추론 설정, 재시도, 토큰 예산에 따라 코딩 점수가 구매 결정을 바꿀 만큼 달라질 수 있습니다.

격차는 분명합니다. Grok은 DeepSWE 1.0에서 Fable 5보다 4.1점, DeepSWE 1.1에서 17점, Terminal Bench 2.1에서 1점, SWE Bench Pro에서 15.7점 낮습니다. 확실하게 이긴 항목은 SWE Marathon입니다. Grok의 29.0%는 Opus 4.8의 26.0%, Fable 5의 24.0%를 앞섭니다.

토큰 효율 주장은 더 설득력 있습니다. SpaceXAI에 따르면 SWE Bench Pro 과제당 Grok의 평균 출력은 15,954토큰으로, Opus 4.8 max의 67,020토큰보다 약 4.2배 적습니다. 공급자가 발표한 데이터이기는 하지만, 올바른 경제성 단위가 토큰 하나의 표시 가격이 아니라 완료된 과제라는 점은 정확히 짚습니다.

독립 측정치를 보면 결론이 과장되지 않습니다. Artificial Analysis에서 Grok 4.5는 54점으로 높은 평가를 받았고, GPT-5.5 xhigh는 55점을 기록했습니다. 캐시·입력·출력을 7:2:1로 혼합한 토큰 백만 개당 가격은 Grok이 $1.35, GPT-5.5가 $4.35입니다. 같은 실시간 비교에서 출력 속도는 Grok이 초당 약 70토큰, GPT-5.5가 약 76토큰으로 측정됐습니다.

SpaceXAI가 제시하는 속도는 초당 출력 80토큰이지만, 독립 측정 결과는 약 70토큰입니다. 이 차이가 실패를 뜻하지는 않습니다. 다만 실제 제공 속도는 달라질 수 있으며 출시 시점의 처리량이 서비스 수준을 보장하지 않는다는 점은 기억해야 합니다.

벤치마크 결론은 단순합니다. Grok 4.5는 경제성을 검토할 만큼 프런티어 성능에 가깝지만, 가격표만 보고 품질 게이트를 없앨 정도로 강하지는 않습니다.

Grok 4.5 가격의 실제 구조

Grok 4.5의 대표 가격인 $2/$6은 컨텍스트 토큰이 200,000 미만일 때만 정확합니다. 이 기준을 넘으면 SpaceXAI는 해당 요청 전체의 신규 입력, 캐시 입력, 출력 요금을 두 배로 올립니다.

SpaceXAI 직접 API신규 입력캐시 입력출력
200K 컨텍스트 미만$2$0.30$6
200K 컨텍스트 이상$4$0.60$12

이 구분이 중요한 이유는 500,000토큰 컨텍스트 창이 담을 수 있는 최대 용량일 뿐, 그만큼을 저렴하게 쓸 수 있다는 뜻은 아니기 때문입니다. 입력 토큰 250K를 담고 출력 토큰 50K를 생성하는 요청은 장문 컨텍스트 요금으로 $1.60입니다. 같은 토큰 수에 200K 미만 요금을 적용하면 $0.80입니다. 웹 검색, 코드 실행, 재시도 비용을 더하기도 전에 이 기준 하나로 토큰 청구액이 두 배가 됩니다.

200K 컨텍스트 미만과 이상에서 달라지는 Grok 4.5 가격 급등 구조
200K 기준을 넘으면 해당 요청의 모든 직접 토큰 요금이 두 배가 됩니다.

캐시는 반대로 비용을 낮출 수 있습니다. 신규 입력 토큰 1,000만 개와 출력 토큰 200만 개를 쓰는 워크로드의 비용은 $32입니다. 직접 API에서 입력의 절반이 캐시로 처리되면 $23.50로 내려가 $8.50, 약 26.6%를 절약할 수 있습니다.

이 절감 효과가 저절로 생기지는 않습니다. SpaceXAI는 Responses API에서 prompt_cache_key를 설정하거나, Chat Completions에서 x-grok-conv-id를 사용해 대화가 같은 서버로 라우팅되도록 권장합니다. 이렇게 하지 않으면 캐시가 비어 있는 서버로 연결돼 예상한 캐시 적중이 다시 정가 입력 요금으로 계산될 수 있습니다.

툴 사용에는 별도 요금이 붙습니다. 웹 검색, X 검색, 코드 실행은 각각 1,000회당 $5입니다. 이런 호출을 25번 하는 실행은 호출 뒤에서 소비되는 모델 토큰을 제외하고도 $0.125가 추가됩니다. 첨부 파일 검색은 1,000회당 $10, 컬렉션 검색은 1,000회당 $2.50입니다.

프로덕션에서 무엇이 문제를 일으키나

프로덕션에서 가장 먼저 생기는 문제는 모델 지능이 아니라 소리 없는 요금 재산정입니다. 저장소 규모의 프롬프트가 조금씩 커져 200K를 넘으면 요청의 모든 토큰에 장문 컨텍스트 요금이 적용되고, $2/$6을 기준으로 만든 비용 모델은 즉시 틀어집니다.

두 번째는 캐시에 대한 낙관입니다. 반복되는 에이전트 턴은 캐시 효율이 높아 보이지만, 이전 접두사를 재사용할 수 있도록 라우팅돼야만 직접 API의 캐시 입력 요금 $0.30을 적용받습니다. SpaceXAI가 명시적으로 권장한 캐시 키는 첫 요청부터 과금 설계에 포함해야 합니다.

세 번째는 컨텍스트 누적입니다. 장시간 실행되는 에이전트는 계획, 툴 출력, diff, 테스트, 이전 설명을 계속 다시 읽습니다. 500,000토큰 창은 실패 시점을 늦출 뿐, 오래된 모든 턴을 계속 들고 다니는 방식을 합리적으로 만들지는 않습니다. SpaceXAI는 긴 루프에 컨텍스트 압축을 권장합니다. 즉, 에이전트가 가격 급등 구간에 들어가거나 자기 기록 속에서 집중력을 잃기 전에 오래된 세부 정보를 더 작은 작업 상태로 바꿔야 합니다.

네 번째는 공급자 벤치마크를 릴리스 게이트로 삼는 것입니다. 공개된 Grok 4.5의 결과는 SWE Marathon 1위부터 DeepSWE 1.1에서 Fable 5보다 17점 낮은 기록까지 편차가 큽니다. 프로덕션 품질은 사용 중인 저장소, 실행 러너, 테스트 범위, 툴 권한, 성공의 정의에 따라 달라집니다.

다섯 번째는 서비스별 이용 가능 지역입니다. 현재 Cursor의 Grok 4.5 페이지에는 이 모델을 유럽연합에서 아직 사용할 수 없다고 나옵니다. 이는 Cursor의 제한이지 모든 SpaceXAI 이용 경로가 차단됐다는 증거는 아닙니다. 하지만 지금 EU 팀이 Cursor 이전 계획의 중심에 이 모델을 놓지 못하게 하기에는 충분한 제약입니다.

Grok 4.5가 맞는 사용자와 건너뛰어야 할 사용자

200K 미만을 유지하면서 결과를 자체 검증할 수 있는 비용 민감형 에이전트 루프에는 Grok 4.5가 적합합니다. 공개된 코딩 평가에서 가장 높은 통과율에 프리미엄을 지불할 가치가 있거나 Composer 2.5만으로도 충분하거나 Cursor 사용자가 EU에 있다면 건너뛰는 편이 낫습니다.

상황선택이유선택이 바뀌는 조건
장시간 실행되는 API 에이전트, 프롬프트 200K 미만Grok 4.5입력 $2, 캐시 입력 $0.30, 출력 $6Fable이 충분히 많은 실패를 줄여 프리미엄을 회수할 때
비용 상한이 엄격한 일상적인 Cursor 코딩Composer 2.5입력 $0.50, 출력 $2.50Grok의 통과율이 재시도를 충분히 줄여 더 높은 요금을 상쇄할 때
실패 비용이 토큰보다 훨씬 큼Claude Fable 5공개된 벤치마크 5개 중 4개에서 선두대표 과제 세트에서 Grok이 같은 성과를 낼 때
Cursor에서 Fast 변형 모델이 필요함Grok 4.5 Fast입력 $4, 출력 $18로 이용 가능표준 Grok이 목표 지연 시간을 충족할 때
요청이 정기적으로 200K를 넘음먼저 압축하거나 라우팅해당 요청 전체에서 Grok 직접 요금이 두 배로 상승긴 컨텍스트가 검색이나 오케스트레이션 비용을 충분히 줄여 차액을 회수할 때
Cursor 사용자가 EU에 있음기다리거나 이용 가능한 모델 선택Cursor가 Grok 4.5를 해당 지역에서 이용 불가로 표시Cursor가 지역별 이용 상태를 변경할 때
Grok 4.5, Fable 5, Composer 2.5 선택 또는 대기를 위한 의사결정 지도
에이전트 비용, 통과율의 가치, 속도 등급, 컨텍스트 크기, 지역에 따라 선택이 달라집니다.
강점
잘하는 것
8 points

  • $2 입력 및 $6 출력 요금으로 Cursor에서 Fable 5나 GPT-5.6 Sol보다 프런티어급에 가까운 에이전트 작업을 상당히 저렴하게 수행할 수 있습니다.
  • 500,000토큰 컨텍스트 창은 상당한 규모의 저장소와 긴 작업 기록을 담을 여유를 제공합니다.
  • 함수 호출, 웹 검색, X 검색, 코드 실행, 구조화 출력, 2개의 표준 API 인터페이스를 지원해 통합 작업이 줄어듭니다.
  • 공급자 데이터에서 SWE Marathon의 실질적인 1위와 SWE Bench Pro에서 Opus 4.8 max보다 크게 낮은 출력 토큰 사용량을 확인할 수 있습니다.
  • Grok 4.5는 SpaceXAI 자체 차트의 엔지니어링 벤치마크 5개 중 4개에서 선두가 아닙니다.
  • 직접 API 요청이 200K 컨텍스트에 도달하면 모든 토큰 요금이 두 배가 됩니다.
  • 안정적인 캐시 절감 효과를 내려면 명시적인 라우팅 관리가 필요합니다.
  • 독립 측정 속도는 공급자가 제시한 초당 80토큰보다 낮고, Cursor는 제외된 벤치마크 하나에서 학습 데이터 오염이 있었다고 공개했습니다.

안전한 평가 계획

올바른 도입 테스트는 따로 떼어 낸 프롬프트가 아니라 동일한 품질 기준을 통과한 완료 작업을 비교해야 합니다. 모델마다 과제 세트, 에이전트 러너, 툴 권한, 검수 절차를 동일하게 유지해야 합니다.

  1. 대표 과제 세트를 고정한다

    실제로 위임하려는 업무에서 과제를 고릅니다. 테스트가 포함된 버그 수정, 저장소 전체를 아우르는 변경, 툴을 사용하는 리서치 과제를 포함하고, 필요하다면 문서 또는 스프레드시트 결과물도 추가합니다. 어떤 모델도 과제를 보기 전에 통과와 실패의 기준부터 정해야 합니다.

  2. 추론과 컨텍스트 조건을 통제한다

    모든 Grok 실행에 같은 추론 설정을 사용하고 정확한 프롬프트 크기를 기록하며, 200K 미만 과제와 장문 컨텍스트 과제를 구분합니다. 특정 모델에만 파일을 더 보여 주거나 다른 툴 예산을 주어서는 안 됩니다.

  3. 캐시 효과를 측정 가능하게 만든다

    반복 대화에는 prompt_cache_key 또는 x-grok-conv-id를 설정합니다. 재현 가능한 청구액을 기준으로 비용을 비교할 수 있도록 신규 입력과 캐시 입력을 따로 기록합니다.

  4. 완료 작업의 경제성으로 통과 여부를 결정한다

    통과율, 사람의 수정 횟수, 재시도, 총 토큰, 툴 호출, 실제 소요 시간을 기록합니다. 같은 릴리스 기준을 낮추지 않으면서 승인된 결과당 비용이 기존 모델보다 낮을 때만 Grok을 도입합니다.

투자를 유치한 창업자라면 개발자 검토 시간이 이 기준이 될 수 있습니다. 중견기업 CTO라면 외부로 유출된 결함과 감사 가능성일 수 있습니다. 시니어 운영 담당자라면 Excel 또는 리서치 결과물이 사실 검토를 통과하는지가 중요할 수 있습니다. 혼자 제품을 만드는 기술 빌더에게는 낮은 요금으로 완료 작업을 늘리면서 에이전트 검토라는 두 번째 직업까지 떠안지 않을 수 있는지가 기준인 경우가 많습니다.

자주 묻는 질문

Grok 4.5는 좋은 모델인가요?

낮은 토큰 비용으로 강력한 에이전트 역량이 필요할 때는 좋은 모델입니다. 다만 코딩 정확도를 최우선으로 할 때 가장 안전한 기본 선택은 아닙니다. SpaceXAI가 공개한 엔지니어링 벤치마크 5개 중 4개에서는 Fable 5가 앞서고, Grok의 가장 분명한 강점은 비용 효율적인 장기 작업이기 때문입니다.

Grok 4.5 가격은 얼마인가요?

SpaceXAI 직접 API는 200K 미만 컨텍스트에서 신규 입력 토큰 백만 개당 $2, 캐시 입력 토큰 백만 개당 $0.30, 출력 토큰 백만 개당 $6입니다. 200K 이상이면 해당 요청 전체에 $4, $0.60, $12가 적용됩니다. Cursor의 자체 모델 풀에서는 입력 $2, 캐시 읽기 $0.50, 출력 $6으로 표시됩니다.

Grok 4.5는 어디에서 사용할 수 있나요?

SpaceXAI 문서에 따르면 API, Grok Build, Cursor, Word, PowerPoint, Excel, OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic에서 사용할 수 있습니다. Cursor는 데스크톱, 웹, iOS, CLI, SDK 전반에서 지원하지만, 현재 유럽연합에서는 이용할 수 없다고 안내합니다.

Claude Code + Codex 설정 체크리스트가 필요하신가요? 뉴스레터에서 받아보세요.

마지막 업데이트

2026년 9월 3일

카테고리AI

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

AI의 다른 글

AI 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.