Cloudflare ya deja frenar el entrenamiento de IA sin sacar a Googlebot de tu web

Si te gusta mi contenido, dile a Google que te lo muestre antes:

Cloudflare publicó el 15 de septiembre de 2026 la opción Disallow AI Training, que dice «no» al entrenamiento de IA sin sacar a Googlebot, Bingbot y Applebot de la búsqueda. Sustituye al plan de julio, que iba a bloquear a esos rastreadores a quien bloqueara el entrenamiento. Ojo, porque las opciones Block siguen ahí y ahora sí te sacan de los buscadores.

El plan de julio: bloquear el entrenamiento también echaba a Googlebot

El 1 de julio de 2026 Jin-Hee Lee y Bryan Becker publicaron en el blog de Cloudflare «Your site, your rules: new AI traffic options for all customers». Ese día aparecieron tres controles separados por tipo de bot (Search, Agent y Training), disponibles en todos los planes, también en el gratuito.

En el mismo post Cloudflare anunció dos cambios con fecha 15 de septiembre. El primero, que en los dominios nuevos el entrenamiento y los agentes quedarían bloqueados por defecto en las páginas con anuncios, con la búsqueda permitida. El segundo, que a los rastreadores de uso mixto se les aplicaría la regla más restrictiva: "multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training". En pocas palabras, quien bloqueara el entrenamiento bloquearía también a Googlebot.

La nota de prensa de ese 1 de julio añadía algo que el post no decía: los clientes gratuitos que ya estaban en Cloudflare y no tocaran nada antes del 15 de septiembre también pasarían a esos valores por defecto. Search Engine Journal lo contó al día siguiente con un titular muy directo: «Cloudflare's AI crawler rules can block Googlebot».

Ventana AI bot controls de Cloudflare de julio de 2026 con los controles Search, Training y Agent y el desplegable de Training abierto con las opciones Block, Block on pages with ads y Allow
Los controles de bots de IA tal como se presentaron en julio: en Training solo había Block, Block on pages with ads y Allow. Fuente: Cloudflare.

El 21 de agosto llegó un paso intermedio, Bot Preference Sync: una función para todos los planes que escribe en el robots.txt lo que configuras en el panel y lo coloca delante de lo que ya tuvieras. Con ella apareció en Training una opción nueva, «Disallow», que dejaba entrar a los rastreadores mixtos para búsqueda.

Qué hace Disallow AI Training y qué opciones quedan en Cloudflare

El 15 de septiembre, el mismo día en que entraba en vigor lo de julio, Bryan Becker publicó «Have it both ways: stay discoverable in search while disallowing AI training». El problema lo resume en una frase: con los rastreadores mixtos, "Refuse one, and you refuse the other". Si rechazas el entrenamiento, rechazas la búsqueda. La solución es Disallow AI Training, que publica el «no» al entrenamiento en el robots.txt a través de Bot Preference Sync y deja que los rastreadores mixtos que Cloudflare etiqueta como «Accountable» sigan rastreando para búsqueda.

Con esa opción, el resto de rastreadores de entrenamiento se bloquea en red, además del aviso en el robots.txt. Cloudflare pone como ejemplo los bots de entrenamiento de Amazon, Anthropic, Meta y OpenAI, y lo mismo vale para cualquier rastreador mixto sin la etiqueta Accountable (no nombra ninguno). Para ser Accountable, el operador tiene que ofrecer un opt-out de entrenamiento por robots.txt, un opt-out de los resúmenes de IA, visibilidad de qué URLs se han usado y la garantía de que salir del entrenamiento no afecta a la búsqueda. Vale con cumplirlos hoy o tener fecha comprometida. Llevan la etiqueta Google, Apple y Microsoft, y también Amazon, Anthropic, Meta y OpenAI, que ya separan búsqueda y entrenamiento en bots distintos. El listado público está en Cloudflare Radar.

Las cuatro opciones del control Training quedan así:

  • Allow: deja pasar a todos los rastreadores, salvo que otra regla o el WAF los bloquee.
  • Disallow AI Training: el «no» al entrenamiento va al robots.txt, los mixtos Accountable siguen entrando para búsqueda y el resto de bots de entrenamiento se bloquea. Solo existe en Training, no en Search ni en Agent.
  • Block on pages with ads: bloquea en las páginas con anuncios a todos, mixtos incluidos, así que afecta a la búsqueda en esas páginas.
  • Block: bloquea a todos, con Googlebot, Bingbot y Applebot dentro.

Becker lo deja claro: "If you want mixed-use crawlers gone entirely, you now have to say so". Y explica por qué no hay un Disallow AI Training solo para páginas con anuncios: el robots.txt no puede expresarlo, porque la lista de páginas con anuncios es demasiado grande y cambia demasiado.

Un detalle para cuando entres al panel: el post y la nota de prensa hablan de «Disallow AI Training», pero en la captura del alta el desplegable pone solo «Disallow», con la etiqueta «Recommended».

Pantalla de alta de dominio en Cloudflare con la casilla I monetize pages that serve ads marcada, Search en Allow, Agent en Block on pages with ads, Training en Disallow y Bot Preference Sync activado
El alta de un dominio con anuncios desde el 15 de septiembre: Training en «Disallow» y Bot Preference Sync activado. Fuente: Cloudflare.

Cómo migra Cloudflare la configuración de bots que ya tenías

Si solo usabas el antiguo «Block AI Bots», la migración depende de cómo lo tenías. Desactivado, todo pasa a Allow. En Block o en Block on pages with ads, Search queda en Allow, Training pasa a Disallow AI Training y Agent pasa a bloquearse en las páginas con anuncios, algo que antes no tenías configurado.

Si ya usabas los controles por tipo de bot, Search y Agent se quedan como estaban, y en Training tanto Block como Block on pages with ads pasan a Disallow AI Training. Además, «Block AI Bots» y «Managed robots.txt» quedan obsoletos, sustituidos por los tres controles y por Bot Preference Sync.

Para los dominios nuevos, Cloudflare propone unos valores en el alta que se pueden cambiar en ese mismo momento: sin anuncios, todo en Allow; con anuncios, Training en Disallow AI Training y Agent en Block on pages with ads. En los dos casos, Search en Allow y Bot Preference Sync activado. La respuesta del propio Cloudflare a qué tienes que hacer tú es "Nothing, in almost every case".

Lo que añade Bot Preference Sync al robots.txt es un bloque que empieza por # BEGIN Cloudflare Bot Preference Sync, con los user-agents de entrenamiento y los tokens -Extended de los mixtos seguidos de Disallow: /. El ejemplo publicado está anonimizado («TrainingBot1», «MixedUseBot-Extended») y Cloudflare no ha publicado la lista completa de user-agents. Tampoco la documentación técnica está al día: a 17 de septiembre, la página «Block AI Bots» de developers.cloudflare.com sigue describiendo el bloqueo de mixtos de julio.

Google-Extended, Applebot-Extended y el hueco de Bing

En Google, el «no» al entrenamiento se traduce en Google-Extended, que según la documentación de Google "does not impact a site's inclusion in Google Search nor is it used as a ranking signal". Pero ojo, Google-Extended no controla AI Overviews ni AI Mode. Para eso está el control de IA generativa de Search Console, al que el propio Cloudflare se refiere como "a toggle inside their webmaster portal". Cloudflare dice también que Google sacará "in the weeks to come" herramientas para ver por URL qué se ha usado.

En Apple el token es Applebot-Extended, y Apple documenta que bloquearlo no afecta al ranking en su buscador. Para los resúmenes generados, Apple remite a nosnippet.

Con Microsoft la cosa cambia. Bing todavía no respeta un «no training» en el robots.txt: según Cloudflare, lo está construyendo con objetivo "early 2027". Hasta entonces, con Disallow AI Training Bingbot sigue entrando sin recibir la preferencia. La vía que ofrece Bing es la etiqueta NOARCHIVE, que según su documentación evita el uso para entrenar pero también que el contenido salga enlazado en las respuestas de Copilot.

La nota de prensa del 15 de septiembre da tres datos de su red: los rastreadores mixtos son el 36,6% del tráfico de rastreadores verificados, menos del 1% de los sitios bloquea la búsqueda y el 17% restringe el entrenamiento. Son cifras de dominios en Cloudflare, no de toda la web.

Mi lectura

Si tenías el bloqueo de entrenamiento activado, la migración deja pasar a Googlebot y no tienes que hacer nada. Pero ojo, porque desde el 15 elegir Block te saca de Google, y hay mucha web con AdSense donde alguien puede marcar «Block on pages with ads» pensando que solo frena a la IA. Si llevas webs detrás de Cloudflare, yo miraría Security Settings (sobre todo Agent, que puede haber cambiado sin tocarlo) y lo que Bot Preference Sync ha puesto arriba del robots.txt. Tienes el resto de bloqueos típicos en Cosas que NO hacer si quieres aparecer en ChatGPT.

Y no mezcles entrenamiento con respuestas: Disallow AI Training no te saca de AI Overviews ni de AI Mode, eso se decide en Search Console. Con Bing, hasta 2027, yo no tocaría nada salvo que el cliente tenga clarísimo que prefiere desaparecer de Copilot antes que alimentar sus modelos.