Bloquear bots de IA en Cloudflare sin cerrar el paso a los buscadores

Configura Cloudflare para bloquear bots de IA dedicados al entrenamiento sin cerrar el acceso de los buscadores. Revisa la migración y el robots.txt.

Wednesday, September 16, 2026Omid Saffari
Bloquear bots de IA en Cloudflare sin cerrar el paso a los buscadores

Para bloquear bots de IA dedicados al entrenamiento sin cerrar el paso a los buscadores, configura Search en Allow, Training en Disallow AI Training y comprueba tanto los ajustes migrados como el archivo robots.txt que sirve Cloudflare. Es importante hacerlo ahora: el 15 de septiembre de 2026, Cloudflare cambió lo que significa Block. Desde entonces, esta opción también puede impedir que rastreadores de uso mixto como Googlebot, Applebot y Bingbot accedan a tu sitio para la búsqueda.

La configuración segura para bloquear bots de IA

Para la mayoría de los sitios que dependen de los buscadores, la decisión es sencilla: permitir Search, rechazar Training y decidir por separado qué pueden hacer los agentes.

ObjetivoSearchTrainingAgentResultado
Conservar la búsqueda y rechazar el entrenamiento de modelosAllowDisallow AI TrainingDecidir por separadoLos rastreadores de uso mixto que asumen compromisos verificables pueden seguir indexando para la búsqueda. Los rastreadores dedicados al entrenamiento quedan bloqueados.
Detener por completo los rastreadores de uso mixtoAllow o una opción más estrictaBlockDecidir por separadoQuedan bloqueados los rastreadores de entrenamiento, incluidos Applebot, Bingbot y Googlebot cuando operan con usos mixtos. La búsqueda puede verse afectada.
Restringir rastreadores solo donde hay anunciosAllowBlock on pages with adsBlock on pages with ads, si correspondeLos rastreadores de uso mixto quedan bloqueados en las páginas donde Cloudflare detecta anuncios.

La explicación de Cloudflare del 15 de septiembre no deja lugar a dudas: usa Disallow AI Training si quieres impedir el entrenamiento y mantener la búsqueda. No sigas una guía anterior que recomiende elegir Training: Block. Antes del cambio, el bloqueo no incluía a los rastreadores de uso mixto. Ahora sí.

El control está disponible en todos los planes de Cloudflare, por lo que no hay que pagar una ampliación específica. El costo deja de estar en comprar otro producto de bloqueo y pasa a comprobar que la política declarada coincida con el comportamiento real. Como referencia, una licencia de Screaming Frog SEO Spider cuesta $279 al año en EE. UU., mientras que un producto específico para vigilar robots.txt anuncia un plan de $129 al mes. Cloudflare aporta el control, pero todavía hace falta un ciclo de verificación.

Qué hace realmente Disallow AI Training

Disallow expresa una preferencia con aplicación selectiva; Block equivale a cerrar la puerta.

Imagina un rastreador de uso mixto como una furgoneta que lleva dos órdenes de trabajo. Una dice «indexar esta página para la búsqueda». La otra, «usar esta página para entrenar un modelo». Bloquear la furgoneta detiene ambas tareas. Disallow AI Training permite que un operador sujeto a compromisos mantenga la tarea de búsqueda y rechace la de entrenamiento.

Cloudflare divide el tráfico automatizado en tres comportamientos:

  • Search crea un índice de búsqueda.
  • Training entrena o ajusta un modelo.
  • Agent visita el sitio por encargo de una persona, como un asistente que consulta una página o un agente que utiliza el navegador.

La nueva opción de Training indica a Bot Preference Sync que publique en robots.txt las instrucciones pertinentes para impedir el entrenamiento. Los rastreadores de uso mixto que cumplen los requisitos siguen pudiendo acceder con fines de búsqueda. Los rastreadores dedicados al entrenamiento de Amazon, Anthropic, Meta y OpenAI quedan bloqueados sin arrastrar con ellos a sus rastreadores de búsqueda independientes.

Infografía arquitectónica que compara la proporción de sitios de Cloudflare que bloquean la búsqueda y el entrenamiento
Menos del 1% de los sitios de Cloudflare bloquea Search, mientras que el 17% utiliza algún mecanismo para bloquear Training. Los controles separados reflejan esa diferencia de intención.

Cloudflare informa que menos del 1% de sus sitios bloquea los bots de Search, mientras que el 17% activa algún mecanismo para bloquear Training. Esa distancia explica el diseño del producto. Un único interruptor para bloquear la IA era demasiado tosco para lo que realmente buscan los propietarios de sitios.

Hay una distinción importante: una instrucción de robots.txt no es un campo de fuerza. Por sí sola, no puede identificar quién rastrea, saber con qué propósito lo hace ni detener a quien decide ignorarla. Cloudflare combina la preferencia publicada con la clasificación de red y el bloqueo de los rastreadores que no reúnen las condiciones de la vía responsable.

Accountable no siempre significa disponible hoy

La etiqueta Accountable de Cloudflare debe entenderse como un estado respaldado por una hoja de ruta, no como prueba de que cada control prometido ya existe.

Para obtenerla, un operador debe cumplir —o comprometerse a cumplir— requisitos sobre la exclusión del entrenamiento, la exclusión de resúmenes de IA, la visibilidad por URL y la garantía de que rechazar el entrenamiento no perjudicará la búsqueda tradicional. Ese matiz importa.

  • Google: Google-Extended puede excluirse mediante robots.txt, y Google afirma que esa decisión no afecta el posicionamiento en la búsqueda. También ofrece un control para webmasters sobre la búsqueda generativa y sus informes. La transparencia adicional de Google-Extended por URL todavía se describía como una función prevista para las semanas posteriores al anuncio.
  • Apple: Applebot-Extended admite la exclusión del entrenamiento mediante robots.txt. Apple también admite nosnippet para los resúmenes de IA y el etiquetado de muros de pago. La inspección por URL no estaba disponible el día del anuncio y se presentó como trabajo para el año siguiente.
  • Microsoft: la vía actual de Bing es distinta. Los propietarios de sitios pueden utilizar NOARCHIVE junto con las herramientas Block URLs o Content Removal de Bing. Microsoft prevé que Bingbot respete una preferencia de no entrenamiento a nivel de dominio a comienzos de 2027. Hasta entonces, Disallow AI Training de Cloudflare no envía automáticamente esa preferencia a Bing mediante robots.txt.

Por eso, la promesa honesta es más limitada que «un interruptor controla todos los usos en todas partes». La nueva opción aclara mucho mejor la decisión segura entre búsqueda y entrenamiento, pero hoy Bing todavía exige una comprobación aparte.

Comprueba qué migró Cloudflare

La mayoría de los ajustes se trasladan de forma automática, pero las etiquetas y sus efectos cambiaron lo suficiente como para justificar una auditoría.

Si un dominio nunca utilizó los controles granulares de Search, Training y Agent, Cloudflare transforma el ajuste anterior Block AI Bots de esta manera:

Ajuste anteriorNuevo SearchNuevo TrainingNuevo Agent
DisabledAllowAllowAllow
BlockAllowDisallow AI TrainingBlock on pages with ads
Block on pages with adsAllowDisallow AI TrainingBlock on pages with ads

Si el dominio ya usaba los controles granulares, Search y Agent conservan su estado práctico. Training: Allow sigue como Allow. Tanto Training: Block como Training: Block on pages with ads se convierten en Disallow AI Training.

Realiza esta comprobación de la migración:

  1. Abre el dominio en Cloudflare, ve a Security Settings y después a Configure AI bot policies.
  2. Anota los valores actuales de Search, Training y Agent antes de modificar nada.
  3. Configura Search como Allow si el descubrimiento orgánico es importante.
  4. Configura Training como Disallow AI Training si quieres rechazar el entrenamiento sin retirar de la búsqueda a los rastreadores de uso mixto que cumplen los requisitos.
  5. Elige la política de Agent según sus propios méritos. Cloudflare no ofrece una preferencia Disallow para los agentes porque todavía no existe una directiva establecida en Internet.
  6. Confirma que Bot Preference Sync esté activado si quieres que Cloudflare publique la política por categorías en robots.txt.
  7. Guarda la política y examina después el resultado público; la etiqueta del panel, por sí sola, no demuestra nada.

En los dominios nuevos financiados con anuncios, la configuración recomendada por Cloudflare ya sigue este patrón: Preference Sync activado, Search permitido, Training rechazado y los agentes bloqueados en las páginas con anuncios. Los dominios nuevos que no monetizan con publicidad comienzan con los tres comportamientos permitidos.

Cómo verificar el acceso de los buscadores tras el cambio

Que el interruptor parezca correcto es apenas el primer punto de control. Verifica la política desde fuera hacia dentro.

Flujo arquitectónico de verificación en cuatro etapas, desde los ajustes de Cloudflare hasta los registros de rastreadores
Comprueba los ajustes, el robots.txt que se sirve, el acceso representativo de los buscadores y la actividad resultante de los rastreadores como una sola cadena.

Aplica esta comprobación en cuatro partes:

  1. Ajustes: confirma que Search indique Allow y Training, Disallow AI Training. Revisa Agent por separado.
  2. robots.txt: solicita el archivo /robots.txt publicado en el dominio. Bot Preference Sync antepone sus reglas generadas a un archivo existente, de modo que tus directivas Disallow originales permanecen. Busca conflictos en ambas secciones.
  3. Comportamiento en buscadores: utiliza las herramientas para webmasters y los informes del buscador para revisar URL representativas. No deduzcas el acceso de búsqueda solo por la palabra «Disallow». Se aplica a la identidad o preferencia de entrenamiento, no al propósito de búsqueda tradicional de un rastreador de uso mixto sujeto a compromisos.
  4. Actividad de rastreadores: consulta AI Crawl Control para revisar solicitudes, cumplimiento de robots.txt y bloqueos inesperados. Cloudflare permite aplicar acciones por rastreador y registra la actividad, por lo que es el lugar práctico para detectar una política cuyo comportamiento no coincide con la intención.

Las reglas personalizadas merecen especial atención. Bot Preference Sync refleja una política para toda una categoría, pero no incorpora al archivo generado la lógica de reglas individuales complejas. Si existe una excepción de licencia para un rastreador, lógica específica por ruta o una regla WAF personalizada, compara esas capas manualmente. Cloudflare permite desactivar Sync y mantener el archivo de forma manual cuando una política por categorías resulta demasiado amplia.

Quién obtiene más valor de esta separación

El mayor beneficiario es cualquier negocio que gana dinero cuando una persona llega a la página, pero no quiere que su archivo termine absorbido como datos de entrenamiento.

PuestoQuiénFlujo de trabajo exactoPor qué compensa
1Un medio financiado con publicidadPermitir Search, rechazar Training, bloquear Agents en páginas con anuncios y después vigilar la actividad de los rastreadores.La búsqueda puede seguir enviando visitas mientras el entrenamiento y las visitas desatendidas de agentes se enfrentan a una política más estricta.
2Una empresa de software que crece mediante SEO y publica documentaciónMantener Search abierto para descubrir la documentación, rechazar Training y revisar los documentos importantes en los informes para webmasters.Las respuestas sobre el producto siguen siendo localizables sin tratar todo el corpus de soporte como material de entrenamiento.
3Una agencia que administra muchas zonas de CloudflareExportar los tres valores de cada zona, marcar Training: Block, cambiar las zonas que deban conservar la búsqueda a Disallow y guardar las pruebas.Un ajuste obsoleto puede excluir las páginas de un cliente del rastreo de búsqueda de uso mixto. Una revisión de la cartera convierte ese peligro en un riesgo de configuración detectable.
4Un archivo de investigación o boletín de pagoPublicar la preferencia general contra el entrenamiento, bloquear a los rastreadores de entrenamiento no responsables y gestionar cada socio con licencia como una excepción explícita.La configuración predeterminada protege el material de suscripción sin impedir una vía de acceso negociada.
5Un comercio con dominios separados para la tienda y el contenido editorialPermitir un descubrimiento más amplio en el dominio de la tienda, pero rechazar Training en la zona editorial manteniendo Search permitido.La política por dominio puede reflejar la distinta economía del descubrimiento de productos y del trabajo editorial original.
6Una empresa regulada con una política documentada sobre el uso de IAGuardar los ajustes de la zona, el robots.txt servido y los informes de rastreadores como una cadena de evidencias.El equipo puede demostrar qué preferencia publicó y qué aplicación configuró, en lugar de señalar un interruptor sin documentar.
7Una plataforma para desarrolladores con documentación de referencia públicaMantener Search permitido, decidir si Training favorece el alcance del ecosistema y configurar por separado el acceso de los agentes para herramientas dirigidas por usuarios.El equipo puede tomar tres decisiones de negocio en vez de condensar la búsqueda, el entrenamiento y el acceso de agentes en una sola respuesta.

El ejemplo del comercio también revela una limitación: estos controles operan a nivel de dominio. No constituyen un sistema integrado de consentimiento por artículo. Las zonas separadas pueden aplicar políticas distintas, pero cada zona adopta una sola postura para Search, Training y Agent, salvo que se añadan reglas más específicas.

Qué conviene construir

La oportunidad más sólida es un monitor de regresiones en la política de rastreadores, no otro generador de robots.txt.

1. Monitor de regresiones de políticas de rastreo

Crea para agencias y equipos que gestionan varios sitios un monitor que lea la política de Cloudflare, solicite el robots.txt publicado, compruebe el acceso representativo de los buscadores y envíe una alerta cuando esas capas se desalineen.

La demanda alrededor de esta tarea es visible: robots.txt generator recibe unas 1,000 búsquedas mensuales en EE. UU. y google indexing checker, alrededor de 110. Las herramientas existentes también demuestran que hay presupuesto. Un producto para vigilar robots.txt anuncia $129 al mes en su plan para cinco dominios, mientras que un monitor de cambios SEO de escritorio cuesta $179 en un solo pago.

La versión mínima vendible necesita cuatro elementos: importar zonas de Cloudflare, comparar la política con robots.txt, ejecutar comprobaciones programadas y enviar una alerta por correo electrónico o Slack con el cambio exacto. La actividad de los rastreadores y los datos para webmasters pueden añadirse cuando el detector básico de desajustes ya resulte fiable.

El límite está en la prueba. La configuración y las solicitudes observadas pueden mostrar qué publicó y bloqueó el sitio. No pueden demostrar que un proveedor de modelos haya eliminado datos recopilados con anterioridad. La ventaja competitiva debe ser una evidencia fiable para muchos dominios, no un interruptor más atractivo.

2. Auditor de migración de Cloudflare

Crea una auditoría específica que encuentre zonas con combinaciones todavía arriesgadas tras la migración y genere un informe de corrección para una agencia, un grupo editorial o una red de franquicias.

cloudflare block ai bots recibe unas 50 búsquedas mensuales en EE. UU. con un CPC de $13.19, y google indexing checker suma otras 110 búsquedas mensuales relacionadas con el resultado que se quiere evitar. Es una demanda menor que la del mercado de generadores, pero el precio del clic sugiere que quien busca tiene un problema operativo real.

El MVP puede leer los campos de la API correspondientes a Search, Training, Agent y Bot Preference Sync, solicitar el robots.txt público y clasificar cada zona como segura para la búsqueda, bloqueada a propósito o incoherente. El resultado debe ser un paquete de evidencias listo para el cliente, con el ajuste y el archivo observado uno junto al otro.

El límite es el riesgo de plataforma. Cloudflare podría añadir el mismo informe para carteras, y la necesidad aumenta alrededor de las migraciones. El mejor negocio consiste en usar la auditoría como producto de entrada y vender después una vigilancia continua de regresiones en Cloudflare y otros proveedores de infraestructura perimetral.

Lo que este control no resuelve

Este es un límite de política más claro, no una respuesta completa al uso de contenido por parte de la IA.

  • No borra material ya recopilado. Cloudflare describe preferencias de rastreo y controles de solicitudes, no una eliminación retroactiva.
  • No garantiza que todos los operadores respeten robots.txt. Cloudflare añade aplicación en la red para los rastreadores ajenos a la vía Accountable, pero la vía de uso mixto todavía depende de que el operador respete la preferencia.
  • No excluye el sitio de todos los resúmenes de IA. Los controles de resúmenes son independientes, y Cloudflare presenta un control centralizado más amplio sobre estos resúmenes como trabajo futuro.
  • No ofrece un estado Disallow para los agentes.
  • No traslada reglas personalizadas complejas por rastreador a Bot Preference Sync.
  • Todavía no expresa automáticamente en robots.txt la preferencia de no entrenamiento de Bing. Revisa por separado NOARCHIVE y los controles actuales para webmasters de Bing.
  • No es la indexación de archivos de R2 mediante Cloudflare AI Search. Ese es otro producto y otro flujo de trabajo.

Elige Block cuando de verdad quieras que el rastreador desaparezca. Elige Disallow AI Training cuando el descubrimiento mediante buscadores siga formando parte del modelo de negocio. Esa distinción es el sentido del cambio de septiembre.

Tu próximo paso el lunes

Elige tres dominios representativos la próxima semana: un sitio financiado con publicidad, un sitio impulsado por la búsqueda y un dominio con reglas de rastreo personalizadas. Registra los valores migrados de Search, Training y Agent, cambia solo los sitios cuyo objetivo de negocio esté claro y guarda el robots.txt publicado y el informe de rastreadores junto al ticket del cambio. Si los tres superan la prueba, aplica la misma revisión basada en evidencias a toda la cartera.

¿Cómo impedir el entrenamiento de IA?

En un dominio gestionado por Cloudflare, configura Training como Disallow AI Training si quieres publicar una preferencia contraria al entrenamiento y mantener disponibles para la búsqueda los rastreadores de uso mixto que cumplen los requisitos. Usa Block solo si también aceptas el efecto sobre la búsqueda de esos rastreadores.

¿Se puede bloquear todo el contenido de IA?

Es posible bloquear categorías o rastreadores individuales, pero «todo el contenido de IA» mezcla varias funciones distintas. Cloudflare separa el tráfico de Search, Training y Agent para que puedas decidir qué usos automatizados permites. Bloquear Training no elimina de los productos de búsqueda el material generado por IA ni borra los datos ya recopilados.

¿Cómo desactivo el modo IA en la búsqueda?

El ajuste de rastreadores de Cloudflare no desactiva para los usuarios una experiencia de búsqueda con IA. Controla el acceso a tu dominio. Google y otros operadores ofrecen controles separados para los resúmenes generativos, mientras que la indexación tradicional y las preferencias de entrenamiento siguen siendo decisiones distintas.

Si quieres que construya para tu empresa esta capa de auditoría y vigilancia de políticas de rastreo, consulta sistemas de IA en producción.

Última actualización
16 sept 2026
Categoría
Build

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Artículos relacionados
Voz a texto con Murmure: análisis a fondo

Voz a texto con Murmure: análisis a fondo

Probamos Murmure para convertir voz a texto sin conexión: precisión, diccionario, reglas, requisitos, límites y uso de LLM locales o remotos.14 sept 2026Build
API FFmpeg: cuánto cuesta RenderIO y qué plan conviene

API FFmpeg: cuánto cuesta RenderIO y qué plan conviene

Compara precios, créditos, límites y sobrecostos de RenderIO para saber cuándo convienen Starter, Growth o Business en una API FFmpeg de producción.14 sept 2026Build
Voz a texto con Dictare: precio real y costos ocultos

Voz a texto con Dictare: precio real y costos ocultos

Dictare convierte voz a texto por $0 y sin suscripción. Comparamos sus costos reales, límites y alternativas para saber cuándo conviene usarlo.13 sept 2026Build
Evals de Claude Code: cómo medir el aporte real de un plugin

Evals de Claude Code: cómo medir el aporte real de un plugin

Guía práctica para ejecutar evals de Claude Code, comparar un plugin con una línea base sin plugin y controlar costos antes de llevar la prueba a CI.12 sept 2026Build
IA de voz en Cloudflare: cómo diagnosticar latencia y silencios

IA de voz en Cloudflare: cómo diagnosticar latencia y silencios

Usa turnmetrics de Cloudflare para localizar la latencia, explicar turnos silenciosos y saber qué etapa de tu agente de voz con IA debes corregir.12 sept 2026Build
Cómo poner subtítulos a un video con Rendi

Cómo poner subtítulos a un video con Rendi

Aprende a poner subtítulos a un video con un archivo SRT y la API de Rendi: configura FFmpeg, controla el proceso y revisa el MP4 antes de escalar.11 sept 2026Build
Agentes de IA con OpenAI: cuándo elegir Agents API o Agents SDK

Agentes de IA con OpenAI: cuándo elegir Agents API o Agents SDK

Compara Agents API y Agents SDK de OpenAI: control, estado, costos, recuperación y límites de datos para elegir la arquitectura adecuada para cada equipo.11 sept 2026Build
Precios de Rendi en 2026: cuánto cuesta y qué plan conviene

Precios de Rendi en 2026: cuánto cuesta y qué plan conviene

Comparamos los precios de Rendi, qué incluye cada plan y cómo calcular el coste real por GB, almacenamiento, tiempo de ejecución y vCPU al mes.11 sept 2026Build
Newsletter

Una carta, cada domingo.Sistemas que funcionan, no opiniones calientes.

Semanal. Sin spam. Cancele cuando quiera.