A Cloudflare está na frente de um em cada cinco sites (número aproximado, segundo a searchVIU). Isso a torna o gatekeeper do crawling: cada regra de WAF, cada challenge e cada política de cache decide o que Googlebot, Bingbot e os bots de IA veem antes de um byte chegar ao seu servidor. É aí que mora o que a searchVIU chama de paradoxo GEO: bloquear todos os bots de IA protege seu conteúdo, mas apaga você das respostas generativas onde hoje se decidem as compras. GEO começa no seu CDN, não no seu conteúdo.
Guia para engenheiros: features, campos e bots com nome exato e seus trade-offs. Procurando a versão sem jargão? Comece pelo guia de implementação passo a passo.
Só os registros proxied (nuvem laranja) passam pela sua zona da Cloudflare: sobre DNS only (nuvem cinza) não rodam Workers, WAF, cache nem Crawler Hints. Primeira checagem: apex e www em laranja.
Um caso real que nos custou horas de debugging: lojas SaaS cujo apex tinha registros A apontando direto para os IPs da plataforma. Com isso, a Cloudflare roteia o domínio raiz para a infraestrutura da plataforma e sua zona fica bypassada — Workers incluídos — mesmo com o proxy aparecendo como ativo. O fix: substituir esses A por um CNAME @ → {loja}.{plataforma}.com proxied, igual ao www; o diagnóstico completo está no caso da chave IndexNow com Workers.
Dos modos de criptografia de SSL/TLS, só um é defensável: Full (strict), com validação do certificado do origin.
Com o certificado de origin gratuito da Cloudflare, Full (strict) não custa nada: aqui não há trade-off real.
A regra curta: estáticos agressivo, HTML só com invalidação. A searchVIU dedica uma seção ao tema ("Caching Affects What Crawlers See"): os crawlers podem receber conteúdo desatualizado do edge, então purgue o cache ao publicar mudanças.
Para ecommerce é pior: um HTML cacheado com preço ou estoque velho é o que o Bing indexa — e o que ChatGPT e Copilot respondem depois. A base continua sendo um sitemap com lastmod honesto: se o cache mente e o sitemap também, o crawler fica sem sinais confiáveis.
Bot Fight Mode (plano Free) desafia tráfego automatizado sem exceções possíveis: nem Skip rules nem allowlist. Super Bot Fight Mode (Pro em diante) adiciona os toggles Definitely automated / Verified bots e, crucialmente, regras Skip.
A Cloudflare valida verified bots (Googlebot, Bingbot e companhia) por IP e comportamento, e os expõe em cf.client.bot, disponível em todos os planos (cf.bot_management.verified_bot é só Enterprise). Os docs dizem que os verified bots estão isentos de challenges, mas há falsos positivos reportados na comunidade: verifique em vez de confiar.
O sintoma clássico: 403 para Googlebot ou Bingbot, descoberto quando o Search Console ou o Bing Webmaster Tools não conseguem ler o sitemap. Diagnóstico em quatro passos:
Googlebot, bingbot) e procure eventos Block ou Challenge.cf.client.bot e coloque-a primeira na ordem: um Block anterior ganha.Em agosto de 2026, o Search Engine Journal reportou um caso — uma thread do r/TechSEO, sem confirmação da Cloudflare — de bloqueio de bots de IA que impedia o Googlebot de indexar por sua classificação "Search + Training". A direção do risco: as regras anti-IA podem atropelar o crawling de busca.
"Os bots de IA" não são uma coisa só. Eles se dividem por propósito:
| Crawler | Propósito | robots.txt |
|---|---|---|
| GPTBot | Treinamento (OpenAI) | Respeita |
| OAI-SearchBot | Busca do ChatGPT | Respeita |
| ChatGPT-User | Ação de usuário no ChatGPT | Segundo a OpenAI, "pode não se aplicar" |
| ClaudeBot | Treinamento (Anthropic) | Respeita |
| Claude-SearchBot | Busca do Claude | Respeita |
| Claude-User | Ação de usuário | A Anthropic afirma que respeita |
| PerplexityBot | Busca do Perplexity (não treina) | Respeita |
| Perplexity-User | Ação de usuário | "Geralmente ignora" |
| Google-Extended | Token de controle: treinamento + grounding do Gemini | Token no robots.txt, sem UA próprio |
Dois esclarecimentos que quase ninguém faz:
Para lojas: permita os bots de busca — OAI-SearchBot, Claude-SearchBot, PerplexityBot, além de Bingbot e Googlebot — e decida de forma consciente sobre os de treinamento. Os de busca geram as citações (e vendas) nas respostas.
Aviso-chave: desde 1º de julho de 2025 ("Content Independence Day"), a Cloudflare bloqueia crawlers de IA por padrão em zonas novas (o alcance exato depende do onboarding). Se sua zona é posterior, revise o AI Crawl Control — todos os planos, ações Allow, Block e Charge — e permita explicitamente os de busca. Charge vem do pay-per-crawl (HTTP 402), ainda em beta privado.
Última peça: a Content Signals Policy (24-set-2025) adiciona sinais ao robots.txt gerenciado — Content-Signal: search=yes, ai-train=no — já em mais de 3,8 milhões de domínios. Mas são sinais, não enforcement. O muro é o Robotcop (dezembro de 2024): enforcement do robots.txt em nível de rede contra o bot que declara uma coisa e faz outra. Sinal para quem respeita; muro para quem não.
A Cloudflare já é uma emissora de IndexNow. O Crawler Hints (Cache → Configuration, grátis em todos os planos) avisa os buscadores quando detecta conteúdo alterado, usando o protocolo IndexNow. Exige registros proxied e exclui URLs que respondam 4xx ou pior.
A nuance: dispara com cache MISS, uma heurística passiva: a Cloudflare infere a mudança pelo estado do cache, sem saber o que mudou nem se importa. Um push por evento é outra coisa: o webhook de "produto atualizado" leva a URL exata no momento exato, incluindo as remoções, que um MISS nunca representa bem. Não competem: ative o Crawler Hints e some o push por evento. Para lojas, isso é o IndexNow Connect: escuta os webhooks do catálogo (inclusão, mudança, remoção) e envia cada URL ao IndexNow na hora, sem heurísticas e sem tocar no código da loja.
Um Worker roda antes do seu origin. Dois usos SEO concretos:
O plano gratuito inclui 100.000 requisições diárias: para esses usos, sobra.
Se você faz o SEO mas não administra a Cloudflare do cliente, não peça admin: peça acesso read-only a Security → Events, Security → Bots e AI Crawl Control. Basta para auditar sem tocar em nada.
www proxied; sem registros A para IPs de uma plataforma SaaS.cf.client.bot primeira na ordem; Security → Events sem bloqueios a Googlebot/Bingbot.Não deveria: os docs dizem que os verified bots estão isentos, mas há falsos positivos reportados na comunidade. No plano Free não existem exceções nem Skip rules, então se você vê 403 para o Googlebot em Security → Events, suas opções são desativar o Bot Fight Mode ou passar para o Pro e usar o Super Bot Fight Mode com uma regra Skip.
As duas coisas, e quem decide é a sua invalidação. Melhora o tempo de resposta que usuários e crawlers veem, mas um HTML velho servido do edge coloca preços e estoque desatualizados no índice e nas respostas de IA. Se você não pode purgar ao publicar, não cacheie HTML.
É uma decisão de negócio sobre treinamento, não sobre visibilidade. Bloquear o GPTBot não tira você da busca do ChatGPT — quem governa isso é o OAI-SearchBot, que convém permitir. O erro grave é bloquear os dois por reflexo.
Porque o 403 não é emitido pelo seu servidor: é a Cloudflare que o emite antes de o request chegar ao origin. Um curl da sua rede não reproduz o problema porque você não é o Googlebot. Filtre Security → Events por user-agent, identifique a regra e crie uma Skip primeira na ordem.
Conecte sua loja grátis → — o Crawler Hints avisa quando o cache intui; o IndexNow Connect avisa quando seu catálogo muda de verdade.