Precios de la API de Claude Fable 5.1: contexto más barato, reglas más estrictas
Conoce los precios de la API de Claude Fable 5.1, el ahorro real de la caché, sus límites y los cambios clave para migrar agentes sin errores.

Los precios de la API de Claude Fable 5.1 sitúan las lecturas de caché en $0.25 por millón de tokens. El modelo merece una prueba en ejecuciones largas de agentes, pero no es una actualización que pueda incorporarse sin más a cualquier integración de Claude. Anthropic lo lanzó el 1 de septiembre de 2026 con reglas de API capaces de romper las llamadas forzadas a herramientas y los historiales de conversación editados.
Qué es realmente Claude Fable 5.1
Fable 5.1 es el modelo de Anthropic para los trabajos que no se resuelven en un par de pasos: un agente de programación que rastrea una falla entre varios servicios, un agente de investigación que sigue la evidencia a través de distintas fuentes o un agente documental que convierte un gran conjunto de archivos en un entregable terminado. El identificador del modelo en la API es claude-fable-5-1. Está disponible para todos los clientes de la API de Claude, además de Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry.
La palabra clave es modelo. No se trata de una aplicación nueva ni de un sustituto para todo el producto Claude. Anthropic sigue recomendando a la mayoría de quienes desarrollan con la API que comiencen con Claude Opus 5. Fable 5.1 es el siguiente escalón cuando el razonamiento exigente o el trabajo de largo alcance todavía no supera las evaluaciones propias con Opus. Claude Mythos 5.1 comparte el mismo modelo base y aplica salvaguardas diferentes, pero está limitado a clientes aprobados de Project Glasswing. La guía de modelos vigente de Anthropic deja clara esta diferencia.
De forma predeterminada, ofrece una ventana de contexto de 1M tokens y admite hasta 128k tokens de salida. La ventana de contexto es la memoria de trabajo del modelo para la solicitud en curso: incluye instrucciones, mensajes, archivos, herramientas, resultados, razonamiento y la respuesta que está generando. Un millón de tokens da mucho margen, pero no convierte cada token en información útil. La propia guía de contexto de Anthropic advierte sobre el deterioro del contexto: la capacidad de recordar y la precisión pueden caer a medida que se acumula material irrelevante.
El razonamiento adaptativo está siempre activo. Hay cinco niveles de esfuerzo para controlar cuánto trabajo realiza el modelo: low, medium, high, xhigh y max. Conviene empezar con high, el valor predeterminado de la API. Solo debe reducirse cuando las evaluaciones demuestren que la calidad se mantiene, porque los tokens de razonamiento se facturan como salida aunque ese texto permanezca oculto.
Esta guía está dirigida a quienes desarrollan con la API. Si Claude solo se usa mediante el chat, el modelo puede mejorar una tarea concreta, pero no hay ninguna migración que realizar.
Precios de la API de Claude: el cambio es menor y mayor de lo que parece
Fable 5.1 no se abarató en todos los frentes. Sus tarifas base de entrada y salida no cambian respecto a Fable 5, y ambas duplican las de Opus 5. La gran diferencia está en el contexto reutilizado.
La caché de prompts guarda un prefijo ya procesado, como las instrucciones del sistema, las definiciones de herramientas, el mapa del repositorio o un conjunto de documentos. Si la siguiente solicitud comienza con exactamente el mismo prefijo, Claude puede leer ese trabajo desde la caché en lugar de procesarlo otra vez a la tarifa completa de entrada.
Pensemos en un prefijo de 1M tokens que se lee diez veces. Fable 5 cobra $10 por esas lecturas en caché; Fable 5.1 cobra $2.50. Reutilizar el mismo contexto permite ahorrar $7.50, es decir, 75%, antes de sumar la entrada nueva o la salida. Anthropic calcula un ahorro total cercano al 25% en cargas típicas facturadas por tokens y de hasta alrededor del 45% en cargas con un uso intensivo de agentes, según cuatro semanas de uso de agosto de 2026. Son estimaciones del proveedor, pero el precio unitario que las sustenta es inequívoco. La tabla de tarifas vigente detalla cada operación de caché.

Hay una salvedad. Escribir un millón de tokens en una caché de cinco minutos cuesta $12.50, mientras que hacerlo en una de una hora cuesta $20. La caché predeterminada dura cinco minutos. El prefijo debe contener al menos 512 tokens y coincidir exactamente; además, la primera respuesta debe haber comenzado antes de que solicitudes posteriores en paralelo puedan aprovecharlo. Según Anthropic, la opción de cinco minutos se amortiza tras una lectura y la de una hora, tras dos. En vez de dar por hecho que la caché funcionó, hay que comprobar cache_creation_input_tokens, cache_read_input_tokens e input_tokens.
El cambio apenas influye en prompts breves de una sola ejecución, prefijos que cambian constantemente o agentes cuyo costo se concentra en la salida. A $50 por millón de tokens de salida, el razonamiento innecesario y las respuestas largas todavía pueden dominar la factura.
Los benchmarks de lanzamiento son alentadores, pero no bastan para decidir una compra. Anthropic sitúa a Fable 5.1 en 55.8%, frente a 42.0% de Fable 5, en Terminal-Bench 4.0; en AutomationBench, los resultados son 31.4% y 17.1%, respectivamente. Las pruebas usaron las salvaguardas de producción de Anthropic y proceden del propio proveedor. Deben servir como motivo para evaluar tareas reales, no como prueba de que todas las cargas mejorarán. El informe de lanzamiento publica las notas de las pruebas y las comparaciones.
Quién debería usarlo y de qué manera
Un fundador independiente ante una tarea difícil en su repositorio
No conviene trasladar todas las tareas de programación a Fable 5.1. Las ediciones rutinarias pueden quedarse en el modelo que ya cumple el nivel exigido, mientras Fable se reserva para lo que se atasca: una migración entre servicios, una investigación de causa raíz o una revisión que deba conectar decisiones a lo largo de una base de código extensa. Guardar en caché las instrucciones estables del repositorio y las definiciones de herramientas mejora las probabilidades de resolver el trabajo costoso sin pagar las tarifas de Fable en cada tarea pequeña.
Un ingeniero de plataformas de agentes que va a lanzar un bucle de herramientas
Cambiar de modelo solo resuelve la mitad del trabajo. Hay que revisar si el ejecutor del agente fuerza una herramienta, reescribe el prompt de sistema de nivel superior, modifica la lista de herramientas, elimina mensajes antiguos o inserta un resumen generado en el cliente mientras conserva bloques de razonamiento posteriores. Cualquiera de esos patrones puede convertir una sesión normal en un error 400. El beneficio no es una demostración más vistosa, sino un despliegue que siga funcionando en turnos posteriores.
Un responsable de investigación que trabaja con muchos archivos
Fable 5.1 tiene sentido cuando el trabajo necesita de verdad conectar información a lo largo de un historial extenso, no solo porque exista la cifra de 1M. El punto de partida es el esfuerzo high: se compara la respuesta con hallazgos conocidos y después se baja a medium. Anthropic afirma que medium ofrece un resultado aproximadamente equivalente al de Fable 5 por menos dinero, pero las comprobaciones propias de recuperación y citas son las que determinan si esa relación se sostiene.
Un responsable empresarial de seguridad o datos
Primero se revisa la política; después, la capacidad. Fable 5.1 es un Covered Model sujeto a un requisito de retención de datos de 30 días y no está disponible con retención cero, salvo autorización expresa de Anthropic. Tampoco admite Priority Tier. Si alguna de estas condiciones es innegociable, la evaluación termina aquí y la ruta debe conservar un modelo apto.
Cómo migrar con seguridad a la API de Claude Fable 5.1
La llamada mínima es sencilla. Una migración a producción exige cuatro comprobaciones.
Establecer una referencia con un trabajo real
Ejecute la misma tarea representativa con el modelo actual y registre si se completó correctamente, el tiempo transcurrido, la entrada, la creación de caché, las lecturas de caché, la salida y cualquier rechazo. Use el trabajo que justifica la tarifa superior de Fable, no un prompt de juguete.
Llamar al modelo fijado con esfuerzo high
Configure la clave de API, instale la versión actual del SDK de Python y guarde el bloque de Python como
test_fable.py.Bashpython3 -m venv .venv source .venv/bin/activate pip install anthropic export ANTHROPIC_API_KEY="your-api-key-here"Pythonimport anthropic client = anthropic.Anthropic() message = client.messages.create( model="claude-fable-5-1", max_tokens=4096, output_config={"effort": "high"}, messages=[ { "role": "user", "content": "Map the risks in moving this service from SQLite to PostgreSQL.", } ], ) for block in message.content: if block.type == "text": print(block.text) print(message.usage.model_dump_json())Ejecútelo con
python test_fable.py. Esta sintaxis corresponde al SDK y al parámetro de esfuerzo vigentes de Anthropic. En producción, el prompt debe ser la tarea usada en sus evaluaciones.Eliminar los dos patrones que provocan fallas
Busque solicitudes donde
tool_choiceesté configurado comoanyo como una herramienta concreta. Ambas opciones ahora devuelven HTTP 400. Déjelo enauto, añadastrict: trueal esquema de la herramienta cuando necesite argumentos válidos e indique al modelo qué herramienta requiere el turno.Después, trate el historial como un registro al que solo se añaden elementos. Reenvíe los turnos del asistente exactamente como se recibieron, incluidos los bloques de razonamiento. Agregue instrucciones nuevas como mensajes de sistema a mitad de la conversación. Para no reescribir turnos anteriores, use compactación del lado del servidor o edición de contexto.
Activar los diagnósticos antes de enviar tráfico
Ejecute una sesión normal de varios turnos con el encabezado beta
thinking-binding-controls-2026-08-01yprefix_mismatch_behavior: "drop_block". Registreinput_transformations. Unprefix_binding_mismatchindica que la integración modificó el historial. Unmodel_binding_mismatchdespués de redirigir la solicitud a un modelo anterior es esperable.Cuando el historial sea estable, añada
cache_control: {"type": "ephemeral"}en el nivel superior de una solicitud cuyo prefijo reutilizable tenga al menos 512 tokens. Confirme que una solicitud posterior muestre un valor superior a cero encache_read_input_tokens.
La parte incómoda: un contexto más barato exige un estado más estricto
Fable 5.1 vincula cada bloque de razonamiento con el prompt del sistema, las herramientas y los mensajes que lo preceden. En cuentas creadas el 31 de agosto de 2026 o después, modificar ese prefijo y reproducir el bloque provoca el error The block is bound to a different conversation. Las cuentas anteriores ya pueden activar la misma comprobación, y Anthropic afirma que los modelos futuros la aplicarán de forma más amplia.

El modelo también cambia de comportamiento sin generar errores. En bucles de agentes implícitos puede hacer una sola llamada a herramienta donde Fable 5 agrupaba varias. Produce menos actualizaciones de progreso, busca con menor frecuencia en el nivel de esfuerzo low, puede redactar textos más densos y quizá reescriba un archivo completo para introducir un cambio pequeño. Todo ello puede sumar turnos, latencia y tokens de salida incluso cuando baja la tarifa de caché. Anthropic publica ajustes de prompts para cada comportamiento, pero sigue siendo imprescindible una evaluación que mida el comportamiento relevante para cada caso.
La cifra de 128k tokens de salida esconde otro límite. Los SDK exigen streaming cuando max_tokens supera 21,333. El razonamiento comparte ese presupuesto de salida, por lo que una solicitud de esfuerzo alto puede consumir una parte considerable antes de que empiece la respuesta visible. Asigne un límite holgado al trabajo verdaderamente difícil, pero no confunda un techo amplio con un objetivo.
Quienes usan Claude Code tienen menos trabajo de integración. La versión 2.1.257 convirtió Fable 5.1 en el modelo Fable predeterminado el 1 de septiembre de 2026. Aun así, hay que vigilar el uso, revisar el diff y reservar el modelo para trabajos cuyo resultado justifique la tarifa. El registro de cambios de Claude Code documenta el cambio de modelo.
Qué hacer ahora
Conviene actuar esta semana si ya se ejecutan agentes Fable 5 durante periodos largos, se envía repetidamente un contexto estable y las condiciones de retención son aceptables. Coloque Fable 5.1 detrás de una pequeña fracción del tráfico, ejecute el diagnóstico del historial, sustituya las herramientas forzadas y compare el costo por tarea completada con éxito en los niveles de esfuerzo medium y high.
Es mejor esperar si Opus 5 o el modelo actual ya resuelve la carga, la mayoría de las llamadas son de una sola ejecución o no existe una evaluación representativa. La entrada y la salida base de Fable aún cuestan el doble que en Opus 5. Una tarifa de caché menor no corrige una mala decisión de enrutamiento.
Si Claude solo se usa mediante el chat y no se controla la integración con la API, el cambio no exige ninguna acción. Deje que el producto elija el modelo y evalúe el resultado. Los equipos empresariales que necesitan la retención cero habitual o Priority Tier también deben mantenerse en una ruta apta, salvo autorización escrita de Anthropic.
Si quiere convertir el próximo lanzamiento en una decisión práctica de implementación, suscríbase al boletín.
2 sept 2026


