Claude 비용 +27%, GPT-5.5는 2배: 가격 충격을 버틴 하네스

Opus 4.7의 새 토크나이저는 표시 가격을 그대로 둔 채 Claude 비용을 최대 27% 높였습니다. GPT-5.5의 2배 인상과 Copilot 과금 전환까지, 프롬프트 캐싱·모델 라우팅·지출 상한으로 AI 비용 충격을 흡수한 실제 운영 구조를 분석합니다.

Saturday, September 5, 2026Omid Saffari
Claude 비용 +27%, GPT-5.5는 2배: 가격 충격을 버틴 하네스

Anthropic은 5월 14일경 Opus 4.7을 출시하면서 표시 가격을 4.6과 같은 입력 $5/M, 출력 $25/M로 유지했습니다. 하지만 같은 텍스트에서도 네이티브 토큰을 32–45% 더 생성하는 새 토크나이저가 적용됐습니다. 가격표에는 드러나지 않은 12–27%의 실질적인 Claude 비용 인상입니다. 같은 주 GPT-5.5는 공개적으로 요금을 2배 올렸습니다. 그런데 제가 운영하는 6개 루틴의 비용은 거의 움직이지 않았습니다. 운이 아니라 아키텍처 덕분입니다.

세 벤더, 세 가지 방식, 같은 방향

불과 한 주 사이 세 벤더가 서로 다른 세 가지 수단으로 AI의 실제 비용을 올렸습니다. 가격표에서 확인할 수 있었던 인상은 그중 하나뿐입니다.

OpenAI는 정면으로 가격을 올렸습니다. GPT-5.5의 100만 토큰당 입력 가격은 $2.50에서 $5.00로, 출력 가격은 $15에서 $30로 올라 양쪽 모두 정확히 2x가 됐습니다. 같은 워크로드를 유지한 채 5.4에서 5.5로 전환한 OpenRouter 사용자 집단에서는 프롬프트 길이 분포에 따라 실제 비용이 +49–92% 늘었습니다. 이는 가장 솔직한 형태의 가격 인상입니다. 숫자가 바뀌었으니 구매팀과 협상할 수도 있고, 다른 모델로 라우팅할 수도 있습니다.

Anthropic의 방식은 눈에 보이지 않았습니다. Opus 4.7의 표시 가격은 4.6과 같고 가격 페이지도 그대로였습니다. 달라진 것은 토크나이저입니다. 새 모델은 동일한 입력 텍스트에서 네이티브 토큰을 32–45% 더 생성합니다. Anthropic은 이를 1.0–1.35x의 인플레이션 범위로 공개했고, OpenRouter는 2K 미만에서 ~45%, 프로덕션 규모인 10K 초과에서 ~32–34%로 측정했습니다. 결과적으로 2K를 넘는 모든 구간의 실제 비용은 +12–27%가 됐고, 그보다 짧은 구간은 오히려 조금 저렴해졌습니다. 대응할 발표도, 이탈이 몰리는 계기도, 구매 절차를 재검토할 신호도 없습니다. 다음 달 청구서의 금액만 커집니다.

GitHub는 과금 구조 자체를 바꿨습니다. 6월 1일부터 Copilot의 프리미엄 요청 단위는 공개 API 요율에 따라 토큰 단위로 계산되는 AI Credits로 전환되며, 캐시된 토큰도 포함됩니다. 기본 플랜 가격은 그대로입니다. 모델별 배율까지 겹치는 만큼, 긴 컨텍스트의 리팩터링 루프를 돌리는 연간 플랜의 에이전트 사용자가 가장 큰 영향을 받습니다.

핵심은 어느 벤더가 악역인가가 아닙니다. 이제 가격표만으로는 청구액을 가늠할 수 없다는 점입니다. 표시된 AI 토큰 가격은 여전히 확인해야 하지만 그것만으로는 부족합니다. 자체 워크로드가 실제로 생성하는 네이티브 토큰을 샘플링하지 않은 LLM 비용 모델은 허구에 가깝습니다.

Claude 비용을 조용히 끌어올린 토크나이저 변경

이번 주 등장한 세 가지 인상 방식 가운데, AI 비용을 바라보는 운영자의 기준을 소리 없이 바꿔 놓은 Anthropic의 방식이 가장 경계할 만합니다.

수치도 이제 충분히 교차 검증됐습니다. OpenRouter의 전환 사용자 분석은 실제 프로덕션 트래픽에서 네이티브 토큰이 32–45% 더 생성된다고 측정했습니다. Simon Willison은 같은 프롬프트를 Anthropic 토크나이저에 직접 넣어 시스템 프롬프트에서 ~1.46x의 인플레이션을 확인했습니다. Anthropic의 4.7 릴리스 노트에도 1.0–1.35x 범위가 명시돼 있습니다. 서로 독립적인 세 차례의 측정이 같은 방향을 가리킵니다. 샘플링 오류도, 벤치마크의 특이점도 아닌 실제 변화입니다.

운영상 특히 위험한 이유는 변화가 전달되는 방식에 있습니다. 명시적인 가격 인상에는 날짜가 찍힙니다. 법무팀은 계약을 검토하고, 재무팀은 전망을 다시 짜며, 엔지니어링팀은 대안을 벤치마크합니다. 반면 토크나이저 변경은 이미 배포한 모든 것에 소급 적용되는 인상입니다. 코드베이스의 모든 프롬프트, 지난 6개월 동안 다듬은 모든 시스템 메시지, 캐시된 모든 컨텍스트 블록이 새 모델 엔드포인트를 호출하는 순간 32–45% 무거워집니다. CFO에게 보여 줄 별도 항목도 없습니다. 청구서의 숫자가 전보다 커질 뿐입니다.

벤더 입장에서는 공지된 인상보다 훨씬 유리한 수단입니다. 고객 이탈이 한꺼번에 발생하지 않고, 비교 페이지에서 경쟁사에 밀릴 일도 없으며, "Anthropic 가격 27% 인상" 같은 헤드라인이 이어지지도 않습니다. 겉으로는 모델 업그레이드입니다. 실제로도 모델 업그레이드입니다. 그 아래에서 경제성만 조용히 달라집니다.

운영자에게는 중요한 지렛대가 무엇인지 달라졌다는 뜻입니다. 표시 가격 협상은 이미 시간 대비 효과가 낮았습니다. 이제는 그마저 의미가 없습니다. 요율표가 더 이상 실제 가격이 결정되는 곳이 아니기 때문입니다.

가격 충격을 삼켜 버린 하네스: 실제 운영 구조

저는 브리프 생성, 초안 작성, 문체 맞춤 편집, 팩트 체크, 이미지 기획, 최종 QA까지 6개의 퍼블리싱 루틴을 하나의 통제 관문으로 모읍니다. 업그레이드 당일에는 그중 2개가 Opus를 호출했습니다. 그래도 강제 $20/day 상한과 인스턴스당 $1 상한은 지켜졌고, 글 한 편당 비용 변화도 한 자릿수에 그쳤습니다.

우연이 아닙니다. 이번 주 소식이 나오기 전부터 마련해 둔 네 가지 지렛대의 결과입니다. 저는 앞서 Agent SDK의 별도 과금 전환을 다뤘고, Claude Code의 주간 한도 상향도 분석한 뒤 벤더발 비용 변동은 이제 예외가 아니라 기본값이라고 판단했습니다. 방식이 달라도 같은 하네스로 대응할 수 있습니다.

지렛대 1 – 안정적인 캐시 프리픽스. 각 루틴 앞에는 마크다운 계약서(~3500 토큰)와 카테고리별 문체 블록(~1500 토큰)을 1시간짜리 임시 캐시 프리픽스로 붙입니다. 캐시 토큰의 90% 할인 덕분에 토크나이저 인플레이션은 거의 전부 짧은 가변 구간에만 반영됩니다. OpenRouter 분석에 따르면 캐시는 10–25K 프롬프트에서 추가 토큰의 9%, 50–128K에서 77%, 128K 초과에서 93%를 흡수합니다. 제 초안 작성 루틴은 ~14K이므로 인플레이션의 약 9%를 캐시가 흡수합니다. 다만 14K 중 5K는 캐시된 고정 텍스트이며, 그렇지 않았다면 이 부분도 전체 인플레이션을 고스란히 받았을 것입니다. 이 구조적 선택이 방어 효과의 70%를 담당합니다.

지렛대 2 – 모델 라우팅. 초안 작성은 Sonnet, 브리프 종합과 카테고리 태깅은 Haiku에서 실행합니다. Opus는 드물게 필요한 심층 리서치 단계에만 사용합니다. 프런티어 모델을 기본값으로 두지 않았기 때문에 한 벤더의 가격 변경이 전체 청구액을 흔들 수 없습니다. 라우터는 향후 선택지를 남겨 두는 계층이기도 합니다. GPT-5.5 가격이 2배가 됐을 때도 하네스를 다시 작성하지 않고 원하는 루틴 하나를 경쟁 모델로 옮길 수 있었습니다.

지렛대 3 – 프롬프트 길이 규율. Opus 4.7에서 가장 큰 타격을 받는 구간은 2K–10K입니다. 전환 사용자 데이터 기준 실제 비용이 +27–69% 늘었습니다. 공교롭게도 이 구간에는 느슨한 프롬프트 엔지니어링의 흔적이 많이 쌓입니다. 지나치게 많은 퓨샷 예시, 중복된 역할 정의, 제거하지 않은 오래된 컨텍스트가 대표적입니다. 쓸모없는 컨텍스트를 압축하는 일은 이제 단순한 정리가 아니라 곧바로 비용 절감으로 이어지는 작업입니다.

지렛대 4 – 하나의 지출 통제 지점. 모든 유료 모델 호출은 단 하나의 함수를 거칩니다. 호출 전에는 오늘 지출이 $20 미만인지 확인하고, 호출 후에는 이번 인스턴스 비용이 $1 미만인지 검사합니다. 하나라도 실패하면 루틴을 중단하고 제게 경고를 보냅니다. 벤더가 밤사이 토큰 수를 2배로 늘려도 글 한 편당 비용 변화가 27%가 아니라 한 자릿수에 머무는 이유는 이 상한이 최후의 안전장치이기 때문입니다. 상한이 모델을 더 저렴하게 만들지는 않습니다. 대신 최악의 비용을 일정 범위 안에 묶어 둡니다.

솔직히 말하면 전체 하중을 버티는 핵심 지렛대는 캐시 프리픽스입니다. 나머지 3개는 보험입니다. 지금도 많은 팀이 하듯 요청마다 프롬프트를 즉석 조립했다면 32–45%의 인상분이 청구서에 그대로 반영됐을 것이고, 저는 업그레이드 시점이 아니라 2주 차에야 알아챘을 것입니다.

이번 주 바로 해야 할 일

Opus 4.7을 사용한다면 가격 페이지 대신 자체 토큰 수부터 확인해야 합니다. 프로덕션 호출 100건을 샘플링해 Anthropic의 토큰 카운트 엔드포인트에서 4.6과 4.7로 각각 실행하고, 실제 프롬프트에서 발생하는 차이를 측정하십시오. 그런 다음 이번 주 안에 안정적인 프리픽스를 활용하는 프롬프트 캐싱 구조로 바꾸십시오. 다음 스프린트나 다음 기획 주기까지 미룰 일이 아닙니다. 캐시는 프롬프트 길이에 비례해 효과가 커지는 유일한 지렛대이며, 인플레이션이 가장 심한 곳도 바로 긴 프롬프트입니다.

GPT-5.5를 사용한다면 5.4에서 옮기기 전에 전환 사용자 기준으로 비용을 계산해야 합니다. 2배가 된 요율은 10K 토큰 초과 구간에서 출력 길이가 –19~–34% 줄어드는 효과로 일부 상쇄되므로, 실제 비용은 전적으로 출력 대비 입력 비율에 달려 있습니다. 긴 컨텍스트의 리팩터링 워크로드라면 거의 같은 수준에 머물 수 있지만, 채팅형 제품은 그렇지 않습니다.

Copilot을 사용한다면 6월 1일 전에 5월 초 사용량 미리보기를 확인하십시오. 한 번에 프롬프트 하나를 보내는 기본 플랜 사용자는 변화를 체감하지 못할 것입니다.

더 큰 흐름을 보면 AI는 이제 기술 예산에서 변동성이 가장 큰 항목입니다. AWS는 하룻밤 사이 2배가 되지 않습니다. CDN 대역폭은 계량 단위를 몰래 1.4x로 바꾸지 않습니다. Postgres는 토크나이저를 바꾸지 않습니다. 그런데 AI 계층은 이 세 가지를 한 주 만에 모두 해냈습니다. 캐시 구조, 모델 라우터, 길이 규율, 강제 지출 상한으로 이뤄진 하네스는 비용에 민감한 팀에 더 이상 선택 사항이 아닙니다. 프로덕션에서 이런 인프라를 운영하기 위해 치러야 하는 기본 비용입니다.

벤더는 앞으로도 같은 일을 반복할 것입니다. 초크포인트를 구축하지 않으면 앞으로 열두 달 동안 그들이 내리는 모든 결정을 그대로 감당해야 합니다.

마지막 업데이트

2026년 9월 5일

카테고리AI

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

AI의 다른 글

AI 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.