Claude Fable 5.1 분석: Claude API 가격과 달라진 규칙

Claude Fable 5.1의 Claude API 가격과 1M 토큰 컨텍스트, 75% 저렴해진 캐시 읽기, 엄격해진 툴 호출·대화 기록 규칙을 정리했습니다. Opus 5와의 비용 차이부터 장기 AI 에이전트에 맞는 도입 기준, 안전한 마이그레이션 절차까지 한눈에 확인해 보세요.

Wednesday, September 2, 2026Omid Saffari
Claude Fable 5.1 분석: Claude API 가격과 달라진 규칙

Claude Fable 5.1은 장시간 실행되는 에이전트 작업이라면 테스트할 가치가 있지만, 모든 Claude 통합 환경에 그대로 적용할 수 있는 업그레이드는 아닙니다. Anthropic은 2026년 9월 1일 이 모델을 출시했습니다. Claude API 가격에서 캐시 읽기는 1M 토큰당 $0.25로 낮아졌지만, 강제 툴 호출과 수정된 대화 기록 때문에 기존 통합이 깨질 수 있는 API 규칙도 함께 적용됩니다.

Claude API 가격을 보기 전에: Fable 5.1은 어떤 모델인가

Fable 5.1은 오래 이어지는 작업을 겨냥한 Anthropic의 AI 에이전트 모델입니다. 코딩 에이전트가 여러 서비스에 걸친 장애를 추적하거나, 리서치 에이전트가 여러 출처의 근거를 따라가거나, 문서 에이전트가 방대한 파일 묶음을 최종 결과물로 완성하는 경우가 여기에 해당합니다. API 모델 ID는 claude-fable-5-1이며, 모든 Claude API 고객이 이용할 수 있습니다. Amazon Bedrock, Claude Platform on AWS, Google Cloud, Microsoft Foundry에서도 제공됩니다.

여기서 중요한 단어는 모델입니다. 새로운 앱도, Claude 제품 전체를 대체하는 서비스도 아닙니다. Anthropic은 여전히 대부분의 API 개발자에게 Claude Opus 5부터 시작하라고 안내합니다. 까다로운 추론이나 장기 작업이 자체 Opus 평가에서도 통과하지 못할 때 Fable 5.1로 한 단계 올리는 방식입니다. Claude Mythos 5.1은 같은 기반 모델에 다른 안전장치를 적용하지만, 승인된 Project Glasswing 고객만 사용할 수 있습니다. Anthropic의 최신 모델 가이드에는 이 구분이 명확히 나와 있습니다.

기본 컨텍스트 윈도는 1M 토큰이고, 출력은 최대 128k 토큰까지 지원합니다. 컨텍스트 윈도는 현재 요청을 처리하는 모델의 작업 기억입니다. 지시문, 메시지, 파일, 툴, 실행 결과, 사고 과정, 생성 중인 답변이 모두 포함됩니다. 1M 토큰은 방대한 분량을 담을 수 있지만, 모든 토큰이 유용해지는 것은 아닙니다. Anthropic의 컨텍스트 가이드도 컨텍스트 부패를 경고합니다. 관련 없는 내용이 쌓일수록 기억 재현과 정확도가 떨어질 수 있습니다.

적응형 사고는 항상 켜져 있습니다. 모델이 들일 작업량은 low, medium, high, xhigh, max의 5단계로 조절합니다. API 기본값인 high에서 시작하는 편이 좋습니다. 평가 결과가 그대로 유지된다고 확인됐을 때만 낮추십시오. 사고 과정이 화면에 보이지 않더라도 사고 토큰은 출력으로 과금되기 때문입니다.

이 글은 API 개발자를 위한 설명입니다. Claude를 채팅으로만 사용한다면 맡긴 작업의 품질이 좋아질 수는 있어도, 직접 수행할 마이그레이션은 없습니다.

Claude API 가격: 싸진 부분과 그대로인 부분

Fable 5.1의 모든 비용이 내려간 것은 아닙니다. 기본 입력·출력 단가는 Fable 5와 같고, 둘 다 Opus 5의 2배입니다. 크게 달라진 부분은 반복 컨텍스트입니다.

모델입력 1M 토큰당캐시 읽기 1M 토큰당출력 1M 토큰당컨텍스트
Claude Fable 5.1$10$0.25$501M
Claude Fable 5$10$1$501M
Claude Opus 5$5$0.50$251M

프롬프트 캐시는 시스템 지시문, 툴 정의, 저장소 구조도, 문서 묶음처럼 이미 처리한 프리픽스를 저장합니다. 다음 요청이 완전히 같은 프리픽스로 시작하면 Claude는 전체 입력 단가로 다시 처리하지 않고 캐시된 결과를 읽을 수 있습니다.

1M 토큰짜리 프리픽스를 10번 읽는다고 가정해 보겠습니다. Fable 5의 캐시 읽기 비용은 $10이지만, Fable 5.1은 $2.50입니다. 새 입력과 출력을 제외해도 같은 반복 컨텍스트에서 $7.50, 즉 75%가 절감됩니다. Anthropic은 2026년 8월 4주간의 사용량을 바탕으로, 토큰 과금 기반의 일반적인 워크로드에서는 총비용이 약 25%, 에이전트 중심 워크로드에서는 최대 약 45% 줄어든다고 추산합니다. 공급업체가 제시한 추정치이지만, 그 바탕이 되는 단가는 분명합니다. 최신 요금표에서 모든 캐시 작업의 가격을 확인할 수 있습니다.

1M 토큰 캐시 프리픽스를 10번 읽을 때 Fable 5는 $10, Fable 5.1은 $2.50이 드는 점을 점토 운하 수문으로 비교한 그림
Fable 5.1은 반복 프리픽스 비용을 75% 낮추지만, 새 입력이나 출력 가격까지 낮추지는 않습니다.

주의할 점도 있습니다. 5분 캐시 쓰기는 1M 토큰당 $12.50, 1시간 쓰기는 $20입니다. 기본 캐시 수명은 5분입니다. 프리픽스가 최소 512 토큰이어야 하고 완전히 일치해야 하며, 병렬 후속 요청이 캐시를 사용하려면 첫 응답이 먼저 시작돼야 합니다. Anthropic에 따르면 5분 옵션은 한 번 읽으면, 1시간 옵션은 두 번 읽으면 쓰기 비용을 회수합니다. 캐시가 작동했을 것이라고 짐작하지 말고 cache_creation_input_tokens, cache_read_input_tokens, input_tokens를 확인해야 합니다.

짧은 일회성 프롬프트, 계속 바뀌는 프리픽스, 비용 대부분이 출력에서 발생하는 에이전트라면 이번 변화의 효과는 미미합니다. 출력이 1M 토큰당 $50이므로 불필요한 사고와 긴 답변은 여전히 전체 비용을 좌우할 수 있습니다.

출시 벤치마크의 방향은 긍정적이지만, 그것만으로 구매를 결정해서는 안 됩니다. Anthropic 발표에 따르면 Terminal-Bench 4.0에서 Fable 5.1은 55.8%, Fable 5는 42.0%였고, AutomationBench에서는 각각 31.4%와 17.1%였습니다. 해당 테스트에는 Anthropic의 프로덕션 안전장치가 적용됐으며 결과도 공급업체가 발표한 것입니다. 모든 워크로드가 개선된다는 증거가 아니라, 실제 작업 단위 평가를 해볼 근거로 받아들이는 편이 적절합니다. 출시 보고서에는 테스트 조건과 비교 결과가 공개돼 있습니다.

Claude 모델 비교: 누가 Fable 5.1을, 어떻게 써야 하나

까다로운 저장소 작업 하나를 맡은 1인 창업자

모든 코딩 작업을 Fable 5.1로 옮길 필요는 없습니다. 일상적인 수정은 이미 기준을 충족하는 모델에 두고, 여러 서비스에 걸친 마이그레이션이나 근본 원인 조사, 대규모 코드베이스의 의사결정을 연결해야 하는 리뷰처럼 좀처럼 풀리지 않는 작업만 Fable에 보내십시오. 안정적인 저장소 지시문과 툴 정의는 캐시합니다. 작은 작업마다 Fable 단가를 지불하지 않으면서도 고비용 작업의 성공 가능성을 높일 수 있습니다.

툴 루프를 출시하는 에이전트 플랫폼 엔지니어

모델 교체는 절반에 불과합니다. 에이전트 실행기가 특정 툴 사용을 강제하는지, 최상위 시스템 프롬프트를 다시 쓰는지, 툴 배열을 바꾸는지, 예전 메시지를 삭제하는지, 이후 사고 블록을 남겨둔 채 클라이언트 측 요약으로 교체하는지 점검해야 합니다. 이 가운데 어느 패턴이든 정상 세션을 400 오류로 바꿀 수 있습니다. 목표는 보기 좋은 데모가 아니라, 후속 턴에서도 버티는 배포입니다.

대규모 파일 묶음을 다루는 리서치 책임자

1M이라는 숫자가 눈에 띈다는 이유가 아니라, 긴 기록 전체의 연결 관계가 실제로 필요한 작업에 Fable 5.1을 사용하십시오. high effort에서 시작해 이미 알고 있는 결과와 답변을 대조한 다음 medium까지 낮춰 봅니다. Anthropic은 medium이 더 낮은 비용으로 Fable 5와 대체로 비슷한 수준이라고 설명하지만, 그 절충이 유효한지는 자체 검색·인용 검증으로 판단해야 합니다.

기업 보안 또는 데이터 책임자

성능보다 정책부터 확인해야 합니다. Fable 5.1은 30일 데이터 보존이 필요한 Covered Model이며, Anthropic이 명시적으로 허가하지 않는 한 데이터 미보존 조건으로 사용할 수 없습니다. Priority Tier도 지원하지 않습니다. 둘 중 하나라도 양보할 수 없는 조건이라면 평가를 멈추고, 요건을 충족하는 모델을 라우팅 경로에 유지해야 합니다.

Fable 5.1을 안전하게 마이그레이션하는 방법

최소 호출 자체는 간단하지만, 프로덕션 마이그레이션에는 4가지 점검이 필요합니다.

  1. 실제 작업 하나로 기준선 만들기

    현재 모델과 Fable 5.1에서 대표 작업을 똑같이 실행하고 작업 성공 여부, 경과 시간, 입력, 캐시 생성, 캐시 읽기, 출력, 거부 발생 여부를 기록합니다. 단순한 예제 프롬프트가 아니라 Fable의 높은 단가를 감수할 가치가 있는 작업을 사용해야 합니다.

  2. 고정된 모델을 high effort로 호출하기

    API 키를 설정하고 최신 Python SDK를 설치한 다음, 아래 Python 블록을 test_fable.py로 저장합니다.

    Bash
    python3 -m venv .venv
    source .venv/bin/activate
    pip install anthropic
    export ANTHROPIC_API_KEY="your-api-key-here"
    Python
    import anthropic
    
    client = anthropic.Anthropic()
    
    message = client.messages.create(
        model="claude-fable-5-1",
        max_tokens=4096,
        output_config={"effort": "high"},
        messages=[
            {
                "role": "user",
                "content": "Map the risks in moving this service from SQLite to PostgreSQL.",
            }
        ],
    )
    
    for block in message.content:
        if block.type == "text":
            print(block.text)
    
    print(message.usage.model_dump_json())

    python test_fable.py로 실행합니다. Anthropic의 최신 SDK와 effort 문법을 따른 예시입니다. 프로덕션 프롬프트에는 실제 평가 작업을 넣어야 합니다.

  3. 오류를 일으키는 두 패턴 제거하기

    요청에서 tool_choiceany 또는 특정 tool로 설정돼 있는지 찾습니다. 이제 둘 다 HTTP 400을 반환합니다. auto로 두고, 유효한 인수가 필요할 때는 툴 스키마에 strict: true를 설정한 뒤 해당 턴에 필요한 툴을 모델에게 지시합니다.

    그다음 대화 기록을 추가 전용으로 바꿉니다. 사고 블록을 포함한 어시스턴트 턴을 반환받은 그대로 다시 전송하십시오. 새 지시문은 대화 중간의 시스템 메시지로 추가합니다. 앞선 턴을 다시 쓰는 대신 서버 측 압축이나 컨텍스트 편집을 사용합니다.

  4. 트래픽 투입 전에 진단 켜기

    베타 헤더 thinking-binding-controls-2026-08-01prefix_mismatch_behavior: "drop_block"을 적용해 일반적인 멀티턴 세션을 실행하고 input_transformations를 기록합니다. prefix_binding_mismatch가 나오면 통합 환경에서 대화 기록을 바꾼 것입니다. 이전 모델로 라우팅한 뒤 나타나는 model_binding_mismatch는 정상입니다.

    대화 기록이 안정되면, 재사용 가능한 프리픽스가 최소 512 토큰인 요청에 최상위 cache_control: {"type": "ephemeral"}을 추가합니다. 이후 요청의 cache_read_input_tokens가 0보다 큰지 확인합니다.

솔직한 평가: 컨텍스트 비용은 낮아졌지만 상태 규칙은 엄격해졌다

Fable 5.1은 각 사고 블록을 그 앞에 있던 시스템 프롬프트, 툴, 메시지에 묶습니다. 2026년 8월 31일 이후 생성된 계정에서는 해당 프리픽스를 바꾼 뒤 사고 블록을 다시 보내면 The block is bound to a different conversation 오류가 발생합니다. 기존 계정도 지금 같은 검사를 선택할 수 있으며, Anthropic은 향후 모델에서 이를 더 폭넓게 적용할 예정이라고 밝혔습니다.

추가 전용 대화 턴은 정상 출력으로 이어지지만, 앞선 턴을 수정하면 400 오류가 발생하고 베타 drop-block으로 우회되는 과정을 점토 모형으로 표현한 그림
Fable 5.1에서는 에이전트 대화 기록을 추가 전용으로 유지해야 합니다. 과거 기록을 다시 쓰면 이후의 모든 사고 블록이 무효화될 수 있습니다.

오류를 내지 않더라도 모델의 동작은 달라질 수 있습니다. 암묵적인 에이전트 루프에서 Fable 5가 여러 툴 호출을 한꺼번에 처리했다면, Fable 5.1은 한 번에 하나만 호출할 수 있습니다. 진행 상황 업데이트는 줄고, low effort에서는 검색 빈도가 낮아지며, 문장은 더 조밀해질 수 있습니다. 작은 수정에도 파일 전체를 다시 쓸 가능성도 있습니다. 캐시 단가는 내려가도 이런 변화 때문에 턴 수, 지연 시간, 출력량은 늘 수 있습니다. Anthropic은 각 동작에 맞춘 프롬프트 수정법을 공개했습니다. 그래도 중요한 동작을 직접 측정하는 평가는 필요합니다.

128k 출력이라는 설명 뒤에는 또 하나의 상한선이 숨어 있습니다. max_tokens가 21,333을 넘으면 SDK에서 스트리밍을 사용해야 합니다. 사고 과정도 같은 출력 예산을 쓰기 때문에, high-effort 요청은 화면에 보이는 답변이 시작되기 전에 예산의 상당 부분을 소모할 수 있습니다. 정말 어려운 작업에는 넉넉한 한도를 설정하되, 큰 상한선을 목표치로 오해해서는 안 됩니다.

Claude Code 사용자는 통합 작업이 더 적습니다. 버전 2.1.257은 2026년 9월 1일 Fable 5.1을 기본 Fable 모델로 전환했습니다. 그래도 사용량과 diff를 확인하고, 결과가 단가를 정당화하는 작업에만 이 모델을 써야 합니다. Claude Code 변경 로그에서 모델 전환 기록을 확인할 수 있습니다.

지금 해야 할 일

이미 Fable 5 에이전트를 장시간 실행하고, 안정적인 컨텍스트를 반복 전송하며, 데이터 보존 조건을 수용할 수 있다면 이번 주에 바로 실행에 옮기십시오. Fable 5.1을 소규모 트래픽에 먼저 적용하고, 대화 기록 진단을 실행하고, 강제 툴 설정을 없앤 뒤 mediumhigh effort에서 성공한 작업당 비용을 비교합니다.

Opus 5나 현재 모델이 이미 해당 워크로드를 통과하거나, 대부분의 호출이 일회성이거나, 대표 평가 작업이 없다면 기다리는 편이 낫습니다. Fable의 기본 입력·출력 비용은 여전히 Opus 5의 2배입니다. 캐시 항목 하나가 저렴해졌다고 잘못된 라우팅 결정까지 바로잡히지는 않습니다.

Claude 채팅만 사용하고 API 통합을 직접 관리하지 않는다면 영향을 받지 않습니다. 제품이 모델을 선택하도록 두고 결과를 평가하면 됩니다. 일반적인 데이터 미보존이나 Priority Tier가 필요한 기업 역시 Anthropic의 서면 승인이 없다면 요건을 충족하는 라우팅 경로를 유지해야 합니다.

다음 출시 소식도 실제 구축 판단에 바로 활용할 수 있는 형태로 받아보려면 뉴스레터를 구독하세요.

마지막 업데이트

2026년 9월 2일

카테고리Explained

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

Explained의 다른 글

Explained 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.