En resumen: El 15 de septiembre de 2026, Cloudflare anunció Disallow AI Training y nuevos defaults recomendados que tratan por separado el tráfico Search, Training y Agent. Esa actualización se suma a Precursor (detección conductual a nivel de sesión, desplegada en julio) y a la pila habitual de Managed Challenges / Turnstile. Si tus scrapes o monitores se atascaron este mes, no te lo estás imaginando.
¿El job termina igual? Esa es la única pregunta que importa para la mayoría de equipos de datos. Piloterr ya ejecuta este tipo de recolección con WebUnlocker y el resto de productos website.
Qué entregó Cloudflare realmente en septiembre
El anuncio con fecha es la actualización del 15 de septiembre de Bot Management / AI Crawl Control, cubierta en el post del blog de Cloudflare y en la nota de prensa.
Lo que publicaron:
- Un nuevo ajuste Disallow AI Training para que un sitio rechace el entrenamiento y siga en la búsqueda (para crawlers que Cloudflare marca como Accountable).
- Un significado más claro de Block y Block on pages with ads: esas acciones ahora también aplican a crawlers de uso mixto como Googlebot, Bingbot y Applebot. Si solo quieres cortar el entrenamiento y mantener la búsqueda, usa Disallow AI Training en lugar de Block.
- Deprecación del interruptor grosero Block AI Bots a favor de controles separados de Search, Training y Agent.
- Bot Preference Sync sustituye a Managed Robots.txt.
- Para dominios nuevos que se onboardean desde esa fecha, presets recomendados en sitios con publicidad: Search permitido, Training en Disallow AI Training, Agents bloqueados en páginas con anuncios. El changelog de julio ya adelantaba esos defaults.
Las zones existentes se migraron según su configuración previa. Bastantes operadores igual movieron opciones a mano tras el ciclo de noticias. En cualquier caso, más dominios clasifican por defecto como no deseados a los fetchers de chat, agentes de navegador y crawlers estilo entrenamiento.
Eso es un cambio de producto oficial. Por separado, lo que muchos collectors ven en el navegador es la pila antigua de challenges volviéndose más estricta en la práctica porque más zones activan funciones.
Por qué jobs que pasaban ahora fallan
El propio changelog de Cloudflare y la doc de Precursor describen un giro que empezó antes en el verano y sigue aterrizando en zones de clientes: detección a lo largo de toda la sesión, no un solo filtro en la puerta.
Precursor inyecta JavaScript en el cliente, recoge señales de comportamiento con el tiempo y actualiza el estado de sesión en la cookie cf_clearance. Cloudflare indica que el clearance puede reducirse o invalidarse a mitad de sesión, y que pueden dispararse challenges adicionales después de que un visitante ya hubiera «pasado» una vez. Un refresh de página no borra esa firma de sesión como hacía un CAPTCHA de un solo tiro.
Así, un monitor que parece humano en el primer fetch HTML puede recibir un challenge en el tercer hop de paginación. Un scraper de precios que supera un interstitial y luego machaca URLs de producto en bucle cerrado empieza a parecer tráfico Agent bajo la nueva taxonomía Search / Training / Agent.
Nada de eso exige ser un crawler de IA con nombre. Los dueños de sitios activan controles Agent y Training porque vieron los defaults de septiembre. Tu job legítimo de enrichment B2B cae en el mismo cubo automatizado salvo que el publisher haya abierto una excepción.
«El HTTP se ve bien» pero no estás en la página real
Aquí es donde los pipelines se callan por el motivo equivocado.
Cloudflare documenta que una Challenge Page interstitial completa pone el header de respuesta cf-mitigated: challenge, sirve content-type: text/html y (en Managed Challenge / Under Attack Mode) devuelve un 403 con HTML de challenge en lugar de tu payload de producto. Ver Detect a Challenge Page response y los tipos de páginas de error.
En el campo, los equipos siguen diciendo «HTTP 200 pero atascado en un challenge». A menudo hablan de un fallo más suave que el interstitial documentado.
Algunos collectors solo miran códigos de estado y tratan cualquier cuerpo HTML como éxito. El HTML de challenge sigue siendo HTML. Si tu check es status < 400, puedes guardar «Checking your browser…» como un precio.
Las JavaScript Detections y Precursor son otra cosa otra vez: Cloudflare las inyecta en respuestas HTML sin pausar al visitante como un interstitial. Obtienes un 200 que parece real mientras el edge sigue puntuando la sesión, y luego dispara un challenge o baja el bot score. Un Turnstile embebido en un formulario que ya devolvió 200 se comporta igual desde el asiento del operador. La página carga. La acción protegida no termina hasta que el widget se valida.
Los Managed Challenges siguen siendo adaptativos. Muchos humanos ven una espera corta no interactiva; el tráfico que parece automatizado recibe una petición de interacción. Ese comportamiento está en la doc de Challenge Pages, no en una nota de versión solo de septiembre. Septiembre empujó más políticas hacia el tráfico Agent y Training. La maquinaria de challenge es lo que esas políticas llaman.
Qué deben esperar los operadores hasta el otoño
No todas las zones cambiaron el mismo día. Aun así, si lanzas collectors contra propiedades Cloudflare, planifica más Managed Challenges interactivos cuando la huella y el comportamiento se desvíen, y un clearance que no dure todo el job cuando Precursor esté en Maximize Security o la sesión derive.
Los fallos suaves siguen siendo frecuentes: respuestas que parecen exitosas hasta que miras cf-mitigated, la longitud del body o si el payload tiene de verdad los campos que extraes. Los sitios con anuncios que tomaron los nuevos presets de onboarding tratarán como no deseado más tráfico de lo que Cloudflare llama Agent. Los stacks caseros que «resolvieron Cloudflare» en 2024 o principios de 2025 suelen necesitar otro ciclo de mantenimiento. El scoring de sesión y los defaults de Agent cambian el modo de fallo más rápido de lo que pueden arreglar solo los tweaks de fingerprint TLS.
Si tú operas los collectors, presupuesta reintentos que sigan devolviendo HTML de challenge, y validación que mire el contenido y no solo el status.
Si el pipeline se atasca en Cloudflare
La mayoría de equipos con los que hablamos quieren los datos fuera, no un segundo proyecto anti-bot a tiempo completo. Piloterr ya ejecuta collectors contra objetivos protegidos por Cloudflare con Website WebUnlocker (dominios en allowlist, modo HTTP) y Website Rendering cuando la propia página necesita un navegador real. Para elegir la herramienta: Crawler vs Rendering vs WebUnlocker.
Los cambios de Cloudflare de septiembre son reales. Absorber este tipo de giro de proveedor es parte de lo que hacemos para que tu roadmap de producto no tenga que hacerlo.
¿Necesitas revisar un dominio tras los defaults de mediados de septiembre? Empieza por Website Rendering cuando haga falta un navegador real, o por la doc de la API WebUnlocker para objetivos HTTP en allowlist. Abre una conversación desde el sitio si quieres que digamos si el target está en scope y qué tasa de éxito esperar.