Cloudflare está delante de uno de cada cinco sitios web (cifra aproximada, según searchVIU). Eso lo vuelve el gatekeeper del crawling: cada regla de WAF, cada challenge y cada política de cache decide qué ven Googlebot, Bingbot y los bots de IA antes de que un byte llegue a tu servidor. Ahí vive lo que searchVIU llama la paradoja GEO: bloquear todos los bots de IA protege tu contenido, pero te borra de las respuestas generativas donde hoy se deciden compras. GEO empieza en tu CDN, no en tu contenido.
Guía para ingenieros: features, campos y bots con nombre exacto y sus trade-offs. ¿Buscás la versión sin jerga? Empezá por la guía de implementación paso a paso.
Solo los registros proxied (nube naranja) pasan por tu zona de Cloudflare: sobre DNS only (nube gris) no corren Workers, WAF, cache ni Crawler Hints. Primer chequeo: apex y www en naranja.
Un caso real que nos costó horas de debugging: tiendas SaaS cuyo apex tenía registros A apuntando directo a las IPs de la plataforma. Con eso, Cloudflare enruta el dominio raíz a la infraestructura de la plataforma y tu zona queda bypasseada — Workers incluidos — aunque el proxy figure activo. El fix: reemplazar esas A por un CNAME @ → {tienda}.{plataforma}.com proxied, igual que www; el diagnóstico completo está en el caso de la clave IndexNow con Workers.
De los modos de cifrado de SSL/TLS, solo uno es defendible: Full (strict), con validación del certificado del origin.
Con el certificado de origin gratuito de Cloudflare, Full (strict) no cuesta nada: acá no hay trade-off real.
La regla corta: estáticos agresivo, HTML solo con invalidación. searchVIU le dedica una sección ("Caching Affects What Crawlers See"): los crawlers pueden recibir contenido desactualizado del edge, así que purgá el cache al publicar cambios.
Para ecommerce es peor: un HTML cacheado con precio o stock viejo es lo que Bing indexa — y lo que ChatGPT y Copilot responden después. La base sigue siendo un sitemap con lastmod honesto: si el cache miente y el sitemap también, el crawler se queda sin señales confiables.
Bot Fight Mode (plan Free) desafía tráfico automatizado sin excepciones posibles: ni Skip rules ni allowlist. Super Bot Fight Mode (Pro en adelante) agrega los toggles Definitely automated / Verified bots y, crucialmente, reglas Skip.
Cloudflare valida verified bots (Googlebot, Bingbot y compañía) por IP y comportamiento, y los expone en cf.client.bot, disponible en todos los planes (cf.bot_management.verified_bot es solo Enterprise). Los docs dicen que los verified bots están exentos de challenges, pero hay falsos positivos reportados en la comunidad: verificá en lugar de confiar.
El síntoma clásico: 403 a Googlebot o Bingbot, descubierto cuando Search Console o Bing Webmaster Tools no pueden leer el sitemap. Diagnóstico en cuatro pasos:
Googlebot, bingbot) y buscá eventos Block o Challenge.cf.client.bot y ponela primera en el orden: un Block anterior gana.En agosto de 2026, Search Engine Journal reportó un caso — un hilo de r/TechSEO, sin confirmación de Cloudflare — de bloqueo de bots de IA que impedía indexar a Googlebot por su clasificación "Search + Training". La dirección del riesgo: las reglas anti-IA pueden pisar el crawling de búsqueda.
"Los bots de IA" no son una sola cosa. Se dividen por propósito:
| Crawler | Propósito | robots.txt |
|---|---|---|
| GPTBot | Entrenamiento (OpenAI) | Lo respeta |
| OAI-SearchBot | Búsqueda de ChatGPT | Lo respeta |
| ChatGPT-User | Acción de usuario en ChatGPT | Según OpenAI, "puede no aplicar" |
| ClaudeBot | Entrenamiento (Anthropic) | Lo respeta |
| Claude-SearchBot | Búsqueda de Claude | Lo respeta |
| Claude-User | Acción de usuario | Anthropic afirma que lo respeta |
| PerplexityBot | Búsqueda de Perplexity (no entrena) | Lo respeta |
| Perplexity-User | Acción de usuario | "Generalmente lo ignora" |
| Google-Extended | Token de control: entrenamiento + grounding de Gemini | Token en robots.txt, sin UA propio |
Dos aclaraciones que casi nadie hace:
Para tiendas: permití los bots de búsqueda — OAI-SearchBot, Claude-SearchBot, PerplexityBot, además de Bingbot y Googlebot — y decidí de forma consciente sobre los de entrenamiento. Los de búsqueda generan las citas (y ventas) en las respuestas.
Aviso clave: desde el 1 de julio de 2025 ("Content Independence Day"), Cloudflare bloquea crawlers de IA por defecto en zonas nuevas (el alcance exacto depende del onboarding). Si tu zona es posterior, revisá AI Crawl Control — todos los planes, acciones Allow, Block y Charge — y permití explícitamente los de búsqueda. Charge sale de pay-per-crawl (HTTP 402), aún en beta privada.
Última pieza: la Content Signals Policy (24-sep-2025) agrega señales al robots.txt gestionado — Content-Signal: search=yes, ai-train=no — ya en más de 3,8 millones de dominios. Pero son señales, no enforcement. El muro es Robotcop (diciembre de 2024): enforcement del robots.txt a nivel de red contra el bot que declara una cosa y hace otra. Señal para el que respeta; muro para el que no.
Cloudflare ya es un emisor de IndexNow. Crawler Hints (Cache → Configuration, gratis en todos los planes) avisa a los buscadores cuando detecta contenido cambiado, usando el protocolo IndexNow. Requiere registros proxied y excluye URLs que respondan 4xx o peor.
El matiz: dispara con cache MISS, una heurística pasiva: Cloudflare infiere el cambio por el estado del cache, sin saber qué cambió ni si importa. Un push por evento es otra cosa: el webhook de "producto actualizado" lleva la URL exacta en el momento exacto, incluidas las bajas, que un MISS nunca representa bien. No compiten: activá Crawler Hints y sumale el push por evento. Para tiendas, eso es IndexNow Connect: escucha los webhooks del catálogo (alta, cambio, baja) y envía cada URL a IndexNow al instante, sin heurísticas y sin tocar el código de la tienda.
Un Worker corre antes que tu origin. Dos usos SEO concretos:
El plan gratuito incluye 100.000 requests diarios: para estos usos, sobra.
Si hacés el SEO pero no administrás el Cloudflare del cliente, no pidas admin: pedí acceso read-only a Security → Events, Security → Bots y AI Crawl Control. Alcanza para auditar sin tocar nada.
www proxied; sin registros A hacia IPs de una plataforma SaaS.cf.client.bot primera en el orden; Security → Events sin bloqueos a Googlebot/Bingbot.No debería: los docs dicen que los verified bots están exentos, pero hay falsos positivos reportados en la comunidad. En el plan Free no existen excepciones ni Skip rules, así que si ves 403 a Googlebot en Security → Events, tus opciones son desactivar Bot Fight Mode o pasar a Pro y usar Super Bot Fight Mode con una regla Skip.
Las dos cosas, y lo decide tu invalidación. Mejora el tiempo de respuesta que ven usuarios y crawlers, pero un HTML viejo servido desde el edge mete precios y stock desactualizados en el índice y en las respuestas de IA. Si no podés purgar al publicar, no cachees HTML.
Es una decisión de negocio sobre entrenamiento, no sobre visibilidad. Bloquear GPTBot no te saca de la búsqueda de ChatGPT — eso lo gobierna OAI-SearchBot, que conviene permitir. El error grave es bloquear a los dos por reflejo.
Porque el 403 no lo emite tu servidor: lo emite Cloudflare antes de que el request llegue al origin. Un curl desde tu red no lo reproduce porque vos no sos Googlebot. Filtrá Security → Events por user-agent, identificá la regla y creá una Skip primera en el orden.
Conectá tu tienda gratis → — Crawler Hints avisa cuando el cache lo intuye; IndexNow Connect avisa cuando tu catálogo cambia de verdad.