CookingMetrics Data-Driven Business
Martín Garay·19 de agosto de 2026·8 min de lecturaCloudflareSEO técnico

Cloudflare para SEO y GEO: guía técnica de configuración

Cloudflare está delante de uno de cada cinco sitios web (cifra aproximada, según searchVIU). Eso lo vuelve el gatekeeper del crawling: cada regla de WAF, cada challenge y cada política de cache decide qué ven Googlebot, Bingbot y los bots de IA antes de que un byte llegue a tu servidor. Ahí vive lo que searchVIU llama la paradoja GEO: bloquear todos los bots de IA protege tu contenido, pero te borra de las respuestas generativas donde hoy se deciden compras. GEO empieza en tu CDN, no en tu contenido.

Guía para ingenieros: features, campos y bots con nombre exacto y sus trade-offs. ¿Buscás la versión sin jerga? Empezá por la guía de implementación paso a paso.

DNS: proxied o nada

Solo los registros proxied (nube naranja) pasan por tu zona de Cloudflare: sobre DNS only (nube gris) no corren Workers, WAF, cache ni Crawler Hints. Primer chequeo: apex y www en naranja.

Un caso real que nos costó horas de debugging: tiendas SaaS cuyo apex tenía registros A apuntando directo a las IPs de la plataforma. Con eso, Cloudflare enruta el dominio raíz a la infraestructura de la plataforma y tu zona queda bypasseada — Workers incluidos — aunque el proxy figure activo. El fix: reemplazar esas A por un CNAME @ → {tienda}.{plataforma}.com proxied, igual que www; el diagnóstico completo está en el caso de la clave IndexNow con Workers.

TLS: Full (strict), siempre

De los modos de cifrado de SSL/TLS, solo uno es defendible: Full (strict), con validación del certificado del origin.

Con el certificado de origin gratuito de Cloudflare, Full (strict) no cuesta nada: acá no hay trade-off real.

Cache: velocidad sí, HTML viejo no

La regla corta: estáticos agresivo, HTML solo con invalidación. searchVIU le dedica una sección ("Caching Affects What Crawlers See"): los crawlers pueden recibir contenido desactualizado del edge, así que purgá el cache al publicar cambios.

Para ecommerce es peor: un HTML cacheado con precio o stock viejo es lo que Bing indexa — y lo que ChatGPT y Copilot responden después. La base sigue siendo un sitemap con lastmod honesto: si el cache miente y el sitemap también, el crawler se queda sin señales confiables.

Bots: donde se rompen las indexaciones

Bot Fight Mode (plan Free) desafía tráfico automatizado sin excepciones posibles: ni Skip rules ni allowlist. Super Bot Fight Mode (Pro en adelante) agrega los toggles Definitely automated / Verified bots y, crucialmente, reglas Skip.

Cloudflare valida verified bots (Googlebot, Bingbot y compañía) por IP y comportamiento, y los expone en cf.client.bot, disponible en todos los planes (cf.bot_management.verified_bot es solo Enterprise). Los docs dicen que los verified bots están exentos de challenges, pero hay falsos positivos reportados en la comunidad: verificá en lugar de confiar.

El síntoma clásico: 403 a Googlebot o Bingbot, descubierto cuando Search Console o Bing Webmaster Tools no pueden leer el sitemap. Diagnóstico en cuatro pasos:

  1. Security → Events: filtrá por user-agent (Googlebot, bingbot) y buscá eventos Block o Challenge.
  2. Identificá el rule ID y el servicio que lo disparó (WAF custom, Super Bot Fight Mode, rate limiting).
  3. Creá una regla Skip con cf.client.bot y ponela primera en el orden: un Block anterior gana.
  4. Re-verificá con URL Inspection (Search Console) y su equivalente en Bing Webmaster Tools.

En agosto de 2026, Search Engine Journal reportó un caso — un hilo de r/TechSEO, sin confirmación de Cloudflare — de bloqueo de bots de IA que impedía indexar a Googlebot por su clasificación "Search + Training". La dirección del riesgo: las reglas anti-IA pueden pisar el crawling de búsqueda.

Crawlers de IA: bloqueá por propósito, no por marca

"Los bots de IA" no son una sola cosa. Se dividen por propósito:

Crawler Propósito robots.txt
GPTBot Entrenamiento (OpenAI) Lo respeta
OAI-SearchBot Búsqueda de ChatGPT Lo respeta
ChatGPT-User Acción de usuario en ChatGPT Según OpenAI, "puede no aplicar"
ClaudeBot Entrenamiento (Anthropic) Lo respeta
Claude-SearchBot Búsqueda de Claude Lo respeta
Claude-User Acción de usuario Anthropic afirma que lo respeta
PerplexityBot Búsqueda de Perplexity (no entrena) Lo respeta
Perplexity-User Acción de usuario "Generalmente lo ignora"
Google-Extended Token de control: entrenamiento + grounding de Gemini Token en robots.txt, sin UA propio

Dos aclaraciones que casi nadie hace:

Para tiendas: permití los bots de búsqueda — OAI-SearchBot, Claude-SearchBot, PerplexityBot, además de Bingbot y Googlebot — y decidí de forma consciente sobre los de entrenamiento. Los de búsqueda generan las citas (y ventas) en las respuestas.

Aviso clave: desde el 1 de julio de 2025 ("Content Independence Day"), Cloudflare bloquea crawlers de IA por defecto en zonas nuevas (el alcance exacto depende del onboarding). Si tu zona es posterior, revisá AI Crawl Control — todos los planes, acciones Allow, Block y Charge — y permití explícitamente los de búsqueda. Charge sale de pay-per-crawl (HTTP 402), aún en beta privada.

Última pieza: la Content Signals Policy (24-sep-2025) agrega señales al robots.txt gestionado — Content-Signal: search=yes, ai-train=no — ya en más de 3,8 millones de dominios. Pero son señales, no enforcement. El muro es Robotcop (diciembre de 2024): enforcement del robots.txt a nivel de red contra el bot que declara una cosa y hace otra. Señal para el que respeta; muro para el que no.

Crawler Hints: Cloudflare ya habla IndexNow

Cloudflare ya es un emisor de IndexNow. Crawler Hints (Cache → Configuration, gratis en todos los planes) avisa a los buscadores cuando detecta contenido cambiado, usando el protocolo IndexNow. Requiere registros proxied y excluye URLs que respondan 4xx o peor.

El matiz: dispara con cache MISS, una heurística pasiva: Cloudflare infiere el cambio por el estado del cache, sin saber qué cambió ni si importa. Un push por evento es otra cosa: el webhook de "producto actualizado" lleva la URL exacta en el momento exacto, incluidas las bajas, que un MISS nunca representa bien. No compiten: activá Crawler Hints y sumale el push por evento. Para tiendas, eso es IndexNow Connect: escucha los webhooks del catálogo (alta, cambio, baja) y envía cada URL a IndexNow al instante, sin heurísticas y sin tocar el código de la tienda.

Workers: SEO en el edge

Un Worker corre antes que tu origin. Dos usos SEO concretos:

El plan gratuito incluye 100.000 requests diarios: para estos usos, sobra.

Observabilidad: mirá lo que Cloudflare decide por vos

Si hacés el SEO pero no administrás el Cloudflare del cliente, no pidas admin: pedí acceso read-only a Security → Events, Security → Bots y AI Crawl Control. Alcanza para auditar sin tocar nada.

Checklist final

  1. Apex y www proxied; sin registros A hacia IPs de una plataforma SaaS.
  2. TLS en Full (strict) con certificado de origin.
  3. Estáticos agresivos; purga de HTML al publicar precios, stock o contenido.
  4. Regla Skip con cf.client.bot primera en el orden; Security → Events sin bloqueos a Googlebot/Bingbot.
  5. AI Crawl Control revisado — obligatorio si la zona nació después del 1-jul-2025 — con los bots de búsqueda en Allow.
  6. robots.txt y Content Signals coherentes con lo que el WAF hace de verdad.
  7. Crawler Hints activado, más push por evento para el catálogo.
  8. Acceso read-only pactado para quien audita.

Preguntas frecuentes

¿Bot Fight Mode bloquea a Googlebot?

No debería: los docs dicen que los verified bots están exentos, pero hay falsos positivos reportados en la comunidad. En el plan Free no existen excepciones ni Skip rules, así que si ves 403 a Googlebot en Security → Events, tus opciones son desactivar Bot Fight Mode o pasar a Pro y usar Super Bot Fight Mode con una regla Skip.

¿Cachear HTML mejora o empeora el SEO?

Las dos cosas, y lo decide tu invalidación. Mejora el tiempo de respuesta que ven usuarios y crawlers, pero un HTML viejo servido desde el edge mete precios y stock desactualizados en el índice y en las respuestas de IA. Si no podés purgar al publicar, no cachees HTML.

¿Bloqueo GPTBot o no?

Es una decisión de negocio sobre entrenamiento, no sobre visibilidad. Bloquear GPTBot no te saca de la búsqueda de ChatGPT — eso lo gobierna OAI-SearchBot, que conviene permitir. El error grave es bloquear a los dos por reflejo.

¿Por qué Search Console reporta 403 si mi servidor responde 200?

Porque el 403 no lo emite tu servidor: lo emite Cloudflare antes de que el request llegue al origin. Un curl desde tu red no lo reproduce porque vos no sos Googlebot. Filtrá Security → Events por user-agent, identificá la regla y creá una Skip primera en el orden.

Conectá tu tienda gratis → — Crawler Hints avisa cuando el cache lo intuye; IndexNow Connect avisa cuando tu catálogo cambia de verdad.