O que muda em 15 de setembro de 2026 para quem vive de anúncios
Em 15 de setembro de 2026, daqui a 12 dias, a Cloudflare muda o padrão para domínios novos. Os bots de IA classificados como Training e Agent passam a ser bloqueados nas páginas que exibem anúncios; os bots classificados como Search continuam liberados. A regra está na documentação oficial Block AI bots, com data de atualização de 1º de julho de 2026, e no anúncio do blog da empresa do mesmo dia.
Este checklist é para o publisher, o portal de conteúdo e o dono de site que vive de anúncios. A promessa: ao fechar os 12 itens, você terá uma decisão registrada para cada uma das dez linhas da matriz (nove crawlers e um token de controle), um robots.txt coerente com o painel da Cloudflare e um número próprio de crawl-to-referral para justificar cada linha. O esforço cabe em uma tarde de trabalho se você já tem acesso ao log do servidor, ao GA4 e ao painel da Cloudflare; sem um dos três, conte o tempo de conseguir o acesso antes de começar.
Minha tese, aberta a contestação: o padrão novo pode proteger parte da receita de anúncios de hoje e, em troca, reduz a chance de citação e de clique vindos de assistentes amanhã. Quem herda o padrão sem ler fecha a porta para o bot que traz o clique humano (ChatGPT-User, Claude-User, Perplexity-User) enquanto discute abstratamente o bot que treina modelo. Padrão herdado é decisão de outra pessoa sobre o seu negócio.
O caso condutor é um cenário hipotético composto, e cada número dele é simulação, sem valor de evidência. O Portal Sabor, site de receitas com 900 mil visitas mensais e 70% da receita vinda de anúncios programáticos (números hipotéticos), vai migrar para um domínio novo na Cloudflare em 20 de setembro de 2026 por causa de um rebranding. Ele cai inteiro dentro do padrão novo. Volto a ele no fim, com a matriz preenchida.
Quem é atingido pela mudança e quem só acha que é
A mudança de 15 de setembro atinge os domínios que entram na Cloudflare a partir dessa data; domínios já cadastrados mantêm a configuração que têm, segundo o mesmo documento oficial. Três situações, três consequências:
- Domínio novo, cadastrado a partir de 15 de setembro: herda Training e Agent em Block on pages with ads e Search em Allow. Para ter outra matriz, é preciso entrar no painel e mudar.
- Domínio existente sem a opção legada ligada: nada muda sozinho. As três categorias já estão disponíveis e a configuração atual permanece.
- Domínio existente com a opção legada "Block AI bots" ligada: a opção entra em descontinuação em 15 de setembro. Até lá, o documento diz que todos os clientes podem recusar os padrões novos em Security settings; quem não mexer fica com a migração feita pela Cloudflare.
Três detalhes do anúncio de 1º de julho de 2026 mudam a leitura. Primeiro, as três categorias (Search, Agent, Training) e as três ações por categoria (Block, Block on pages with ads, Allow) valem para todos os planos, inclusive o Free, em Security settings, Configure AI bot policies. Segundo, a detecção de "página com anúncios" é automatizada pela própria Cloudflare, e a documentação não descreve o mecanismo; a única auditoria possível é ler, depois do dia 15, quais URLs aparecem bloqueadas no AI Crawl Control e comparar com o inventário de páginas monetizadas. Terceiro, crawlers de finalidade mista (Googlebot, Applebot e BingBot, nomeados no texto) passam a ser julgados por todos os seus comportamentos, com a regra mais restritiva prevalecendo.
A consequência para o Googlebot está escrita na página Block AI bots, atualizada em 1º de julho de 2026, na seção sobre os padrões de 15 de setembro: "Mixed-purpose crawlers that combine Search and Training will also be blocked by all configurations to block AI training, including the legacy 'Block AI bots' option". Em português: qualquer configuração que bloqueie Training, inclusive a legada, alcança o Googlebot nas páginas em que a regra se aplica. A Cloudflare não publicou exemplo reproduzível do Googlebot bloqueado por essa regra; o item 10 do checklist é a conferência no seu próprio domínio.
Em 21 de agosto de 2026 a Cloudflare anunciou o Bot Preference Sync, com disponibilidade para todos os planos na semana seguinte. O recurso reescreve o robots.txt a partir das políticas do painel, em um bloco delimitado por comentários BEGIN e END. Para quem se declara publisher com receita de anúncios no cadastro, Training já nasce em Disallow. Painel e robots.txt deixam de ser dois lugares e viram um só, o que é bom para a coerência e ruim para quem nunca abriu o painel.
No Brasil, a Flowup Agency relatou em 27 de agosto de 2026 um caso, e é um caso só: site de médico em São Paulo com conteúdo preparado para IA e o ClaudeBot bloqueado por uma regra de ModSecurity herdada da hospedagem, sem resposta HTTP, com visibilidade zero nos assistentes. O padrão herdado age em silêncio, na CDN ou no servidor. A matriz de bots por finalidade que publiquei em junho já separava treino, busca e ação de usuário; a Cloudflare transforma essa separação em botão com valor padrão, e valor padrão tem dono.
Matriz de crawlers por finalidade: nove bots, um token, três trabalhos
Cada provedor de IA opera dois ou três bots com trabalhos distintos: treinar modelo, indexar para busca e citação, ou buscar uma página em nome de um usuário que acabou de perguntar. A documentação oficial de OpenAI, Anthropic, Perplexity e Google, consolidada na referência de bots do AI Crawl Control (atualizada em 23 de abril de 2026), sustenta a tabela abaixo. A coluna final é a minha decisão para um site com anúncios, e cada linha dela pode ser contestada com o seu próprio log.
O recorte: os nove crawlers são os que o Radar AI Insights desagrega na composição do crawl de OpenAI, Anthropic, Perplexity e Google; Google-Extended entra como décima linha por ser o token que mais gera decisão errada, mesmo sem ser crawler. Applebot e BingBot seguem a regra do Googlebot: finalidade mista, nunca bloquear pela categoria Training.
| Bot | Provedor | Finalidade declarada | Categoria na Cloudflare | Respeita robots.txt | Devolve visita humana | Minha decisão para site com anúncios |
|---|---|---|---|---|---|---|
| GPTBot | OpenAI | Treino e melhoria de modelo | Training | Sim (doc OpenAI) | Por desenho, nenhuma | Condicionada: Allow se o conteúdo é commodity e a marca precisa existir no corpus; Block on pages with ads se há conteúdo proprietário ou licenciável |
| OAI-SearchBot | OpenAI | Índice de busca do ChatGPT | Search | Sim (doc OpenAI) | Sim, pela citação | Allow em todas as páginas |
| ChatGPT-User | OpenAI | Busca a página em nome do usuário | Agent | Regras "podem não se aplicar" (doc OpenAI) | Sim, é o próprio clique | Allow, inclusive em páginas com anúncios |
| ClaudeBot | Anthropic | Treino de modelo | Training | Sim; IPs em claude.com/crawling/bots.json | Por desenho, nenhuma | Condicionada, mesma régua do GPTBot: Allow para conteúdo commodity; Block on pages with ads para conteúdo proprietário ou licenciável |
| Claude-SearchBot | Anthropic | Índice de busca do Claude | Search | Sim | Sim, pela citação | Allow em todas as páginas |
| Claude-User | Anthropic | Busca a página em nome do usuário | Agent | Sim (diferencial da Anthropic) | Sim, é o próprio clique | Allow, inclusive em páginas com anúncios |
| PerplexityBot | Perplexity | Índice de busca (doc afirma que não treina) | Search | Sim | Sim, pela citação | Allow em todas as páginas |
| Perplexity-User | Perplexity | Busca a página em nome do usuário | Agent | "Generally ignores robots.txt" (doc Perplexity) | Sim, é o próprio clique | Allow; se um dia bloquear, só o WAF faz valer |
| Google-Extended | Token de controle: treino do Gemini e grounding (uso da página para embasar respostas do Gemini) | Fora das três categorias; diretiva de robots.txt, sem user-agent próprio | Sim (diretiva, sem crawler) | Sem relação com AI Overviews ou AI Mode | Allow, em linha explícita no robots.txt | |
| Googlebot | Busca, AI Overviews e AI Mode | Finalidade mista (Search e Training) | Sim | Sim, 4,7 crawls por visita (Radar, 3 set 2026) | Nunca bloquear; conferir que Training bloqueado não o alcança nas páginas com anúncios |
A régua da coluna final muda com o tipo de site. Marca que quer visibilidade em IA, e-commerce e negócio local: liberar tudo, inclusive treino, porque a presença no corpus de treinamento é um ativo quando a pergunta é "a IA sabe que a minha marca existe"; essa é a posição da Brasil GEO para clientes de visibilidade. Publisher com conteúdo commodity (receitas, listas, notícia de agência): a mesma régua, porque não há licenciamento a proteger. Publisher com conteúdo proprietário ou licenciável: Training em Block on pages with ads, com a exceção por bot decidida junto com quem negocia licenças.
Um detalhe que o padrão esconde: a matriz restritiva que a Cloudflare aplica ao domínio novo bloqueia Training e Agent juntos nas páginas com anúncios. O publisher que quer proteger conteúdo precisa manter Training em Block e, no mesmo painel, forçar Agent para Allow; sem essa intervenção, o clique humano do fetcher de usuário some junto com o bot de treino. O erro está em cair numa das matrizes por herança.
Crawl-to-referral: o número que transforma opinião em decisão
Crawl-to-referral é a razão entre requisições de crawl a páginas HTML e visitas humanas devolvidas com referer da plataforma, medida pela Cloudflare no tráfego da própria rede. No painel Radar AI Insights, em snapshot de 3 de setembro de 2026, a Perplexity estava em 684,2 crawls por visita, a Anthropic em 653,7, a OpenAI em 426, a Microsoft em 37,5 e o Google em 4,7.
| Plataforma | Crawls por visita devolvida (Radar, 3 set 2026) | Variação sobre o período anterior | Composição do crawl |
|---|---|---|---|
| Perplexity | 684,2 : 1 | Queda de 15,1% | PerplexityBot 78,1%; Perplexity-User 21,9% |
| Anthropic | 653,7 : 1 | Queda de 7,3% | ClaudeBot 73,7%; Claude-SearchBot 25,5%; Claude-User 0,8% |
| OpenAI | 426 : 1 | Queda de 13,3% | GPTBot 81,3%; ChatGPT-User 10,6%; OAI-SearchBot 8,1% |
| Microsoft | 37,5 : 1 | Alta de 4,9% | Sem desagregação publicada no snapshot |
| 4,7 : 1 | Queda de 16,7% | Googlebot 88,9%; GoogleOther 9,7%; outros 1,4% |
Legenda: método da Cloudflare, requisições HTML de crawl divididas por referrals HTML com referer da plataforma, no universo de clientes da rede, mundo inteiro. A métrica é viva e o painel muda todo dia: leituras do mesmo 3 de setembro de 2026 oscilaram alguns pontos (OpenAI entre 426 e 431 para 1), então leia a tabela como ordem de grandeza e copie o valor do painel no dia da decisão. Um ano antes, na semana de 19 a 26 de junho de 2025, o blog da Cloudflare media a Anthropic em cerca de 70.900 crawls por visita; a queda para a casa das centenas mostra que a troca ficou menos desigual, e ainda assim fica duas ordens de grandeza acima do Google.
O Google devolve uma visita a cada cinco crawls porque busca clássica, AI Overviews e AI Mode partem do mesmo índice do Googlebot; qualquer regra que o alcance custa tráfego de busca inteiro. Dentro de OpenAI, Anthropic e Perplexity, a fatia que devolve visita está nos bots de Search e de Agent, e a fatia que consome sem devolver está nos bots de Training. A categoria que a Cloudflare bloqueia por padrão nas páginas com anúncios inclui justamente a metade que devolve.
O número do painel é média mundial de outros sites. O que decide a sua matriz é o seu próprio crawl-to-referral: requisições dos user-agents da tabela nos logs do servidor, com IP validado contra as listas oficiais, divididas pelas sessões que o GA4 atribui a chatgpt.com, perplexity.ai e claude.ai. O GA4 é piso, e piso baixo: os aplicativos de ChatGPT, Perplexity e Claude no celular abrem o link em navegador interno e costumam perder o referer, e a sessão cai em Direct. Cruze o log de Agent com picos de tráfego Direct nas mesmas URLs e no mesmo horário antes de concluir que o assistente não devolve nada. Um piso próprio decide melhor que uma média alheia.
A régua que uso para transformar o número em decisão, e que vale para site com anúncios sem licenciamento de conteúdo:
- Search: Allow em qualquer crawl-to-referral. O custo do bloqueio é a citação com link; o ganho é nenhum, porque os três bots de Search declaram que não treinam com o que leem.
- Agent: Allow enquanto o log mostrar requisições de ChatGPT-User, Claude-User ou Perplexity-User em página monetizada; cada requisição é um clique com anúncio na tela. Bloqueio só se o custo de infraestrutura desse volume superar o RPM dessas páginas, o que o item 5 do checklist mede.
- Training: Allow enquanto não houver conteúdo licenciável; Block on pages with ads no dia em que houver contrato de licença, exclusividade editorial ou negociação aberta com uma plataforma. O crawl-to-referral de Training é infinito por desenho; sozinho, não decide nada. Quem decide é a existência de um comprador para o conteúdo.
Para o portal, a citação em resposta de IA é a moeda. O assistente recupera o texto editorial sem considerar a monetização da página: a resposta da IA pesa o conteúdo assinado e ignora o anúncio, e o bot que lê a matéria para citá-la é o de Search.
Checklist de 12 dias: uma decisão registrada por bot
O checklist tem duas metades: seis itens de diagnóstico, que produzem os números, e seis itens de decisão, um por família de bot, que produzem o robots.txt e o painel. A ordem importa porque decisão sem número vira preferência pessoal.
Itens 1 a 6: diagnóstico (dias 1 a 4)
- Confira a data de entrada de cada domínio na Cloudflare. Como: no painel, a data de cadastro de cada zona; domínios previstos para depois de 15 de setembro entram na lista dos que herdam o padrão novo. Por quê: o documento oficial aplica os padrões novos a domínios novos e preserva a configuração dos antigos; a lista diz onde o trabalho é urgente.
- Fotografe o estado atual em Security settings, Configure AI bot policies. Como: registre o valor de Search, Agent e Training e anote se a opção legada "Block AI bots" está ligada. Por quê: a legada entra em descontinuação em 15 de setembro e, enquanto vive, bloqueia crawlers mistos junto com os de treino.
- Puxe 30 dias de log e conte requisições por user-agent da matriz. Como: filtre GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User e Googlebot; valide o IP contra as listas oficiais antes de contar. Por quê: user-agent de IA é falsificado por scanners nos dois sentidos, e o número sem validação infla a conta.
- Calcule o crawl-to-referral próprio por plataforma. Como: divida as requisições HTML validadas do item 3 pelas sessões do GA4 com referer chatgpt.com, perplexity.ai e claude.ai no mesmo período; some as sessões Direct que coincidem, em URL e horário, com o crawl de Agent. Por quê: o Radar dá a média mundial; a régua da seção anterior precisa do número do seu site, mesmo sendo piso.
- Liste as 50 URLs com anúncios que mais recebem crawl de Agent. Como: cruze o log de ChatGPT-User, Claude-User e Perplexity-User com o inventário de páginas monetizadas. Por quê: são exatamente as páginas que somem do clique humano se Agent ficar bloqueado em páginas com anúncios.
- Leia o robots.txt inteiro antes de ligar qualquer sincronização. Como: procure Disallow sob User-agent: * e regras por caminho que conflitem com o que você vai decidir. Por quê: o Bot Preference Sync acrescenta um bloco no topo; uma regra global antiga embaixo pode produzir o efeito oposto ao pretendido.
Itens 7 a 12: decisão e publicação (dias 5 a 12)
- Decida Search: Allow para OAI-SearchBot, Claude-SearchBot e PerplexityBot. Como: no painel, categoria Search em Allow; no robots.txt, sem Disallow para os três. Por quê: é o bot que lê a página para citá-la; bloquear aqui tende a reduzir fortemente a chance de citação com link e protege pouco contra treino, porque os três declaram nos textos oficiais finalidade de busca, sem uso do conteúdo lido para treinar modelo.
- Decida Agent: Allow, inclusive em páginas com anúncios, para ChatGPT-User, Claude-User e Perplexity-User. Como: categoria Agent em Allow e, se houver regra de WAF por user-agent, exceção explícita para os três. Por quê: esse bot é o usuário humano com a pergunta feita e o dedo no link; ChatGPT-User respondeu por 10,6% do crawl da OpenAI no Radar de 3 de setembro de 2026, e cada uma dessas requisições é um clique que o anúncio da página pode monetizar. Como ChatGPT-User e Perplexity-User declaram que podem ignorar o robots.txt, o painel da Cloudflare é o único lugar onde a decisão vale de verdade. Quem quer receber agentes sem virar vetor de ataque encontra o contrapeso em segurança agêntica para sites abertos a agentes.
- Decida Training para GPTBot e ClaudeBot e escreva o motivo. Como: Allow, se a prioridade é a marca existir no corpus dos modelos; Block on pages with ads, se há conteúdo proprietário que você licencia ou pretende licenciar. Por quê: são os únicos bots da matriz que, por desenho, nunca devolvem visita; a decisão é de negócio, e o motivo escrito é o que impede a próxima pessoa de reverter sem saber por quê.
- Decida Google-Extended em linha explícita e mantenha o Googlebot livre. Como: no robots.txt, uma linha User-agent: Google-Extended com Allow ou Disallow declarado e comentário datado; se Training ficou em Block, confira no painel que o Googlebot continua passando nas páginas com anúncios. Por quê: a página AI features and your website, do Google, diz que AI Overviews e AI Mode usam o Googlebot; Google-Extended controla treino do Gemini e grounding, e bloqueá-lo não tira ninguém dos AI Overviews.
- Ligue o Bot Preference Sync e confira o arquivo servido. Como: ative a sincronização, baixe o robots.txt pela internet pública e leia o bloco entre BEGIN e END linha a linha, inclusive a linha Content-Signal. Por quê: o que vale é o arquivo que o crawler recebe, com cache; o Content Signals é preferência declarada, e John Mueller, do Google, respondeu em público por volta de 6 de julho de 2026, em relato do Search Engine Roundtable, que o sinal não tem efeito em nenhum crawler ou modelo da empresa. Depois de 15 de setembro, abra o AI Crawl Control e confira quais URLs estão devolvendo bloqueio a Agent e Training: é a única forma de saber onde a detecção automatizada de anúncios se aplicou.
- Registre decisão e data num bloco de comentário do próprio robots.txt e marque a releitura. Como: comentário com a data, o crawl-to-referral próprio do item 4 e a decisão por bot; agenda em 15 de outubro para reler o Radar e recalcular. Por quê: a matriz é uma fotografia; o Radar caiu entre 7% e 17% por plataforma no último período medido, e a decisão de setembro pode não ser a de dezembro.
Se quiser uma segunda leitura antes de 15 de setembro, mande o robots.txt atual e um print da tela Configure AI bot policies para o WhatsApp +55 62 99814-1505. Devolvo em dois dias úteis a matriz preenchida com a decisão que eu tomaria em cada uma das dez linhas e o motivo. Você implementa sozinho, sem contrato e sem me dar acesso ao painel.
Quatro armadilhas que o painel não mostra
Quatro decisões erradas são frequentes o bastante para ganhar aviso próprio, e nenhuma aparece como erro na tela da Cloudflare. Todas nascem de tratar sinal declarado como bloqueio efetivo, ou o contrário.
A primeira é bloquear Google-Extended "para sair dos AI Overviews". O token controla treino e grounding do Gemini; os AI Overviews e o AI Mode partem do índice do Googlebot. O controle de exposição em AIO passa por nosnippet, data-nosnippet, max-snippet e noindex, cada um com custo direto em busca clássica. Para um portal que vive de tráfego, o padrão é não restringir.
A segunda é bloquear Training pela opção legada sem ler a cláusula dos crawlers mistos, citada acima. O portal que quis proteger conteúdo do GPTBot pode ter cortado o Googlebot das páginas com anúncios, que são as que pagam a conta.
A terceira é confiar no robots.txt para conter fetchers de usuário (o bot que abre a página na hora em que alguém pergunta). ChatGPT-User e Perplexity-User declaram nos textos oficiais que as regras podem não se aplicar a eles; o robots.txt continua sendo o sinal correto a publicar, e o bloqueio efetivo, quando você o quiser, mora no WAF ou no painel de bots. O mesmo raciocínio vale para o llms.txt: é sinal opcional, e mantenho o meu sem tratá-lo como requisito.
A quarta é planejar receita com o pay-per-crawl. O programa, apresentado em 1º de julho de 2025 com resposta HTTP 402 e preço por domínio, continua em beta fechado em 3 de setembro de 2026, com um Monetization Gateway em lista de espera desde 1º de julho de 2026. Vale acompanhar; vale menos ainda bloquear hoje esperando cobrar amanhã. Enquanto isso, o que um agente consegue fazer no seu site depende de sinais que você já controla, e os dez sinais de prontidão para agentes que auditei cabem no mesmo sprint deste checklist.
O Portal Sabor 12 dias depois
O Portal Sabor (cenário hipotético) chegou a 15 de setembro com a matriz preenchida, o robots.txt sincronizado e um número próprio no lugar da média mundial. O que mudou entre o dia 3 e o dia 15 foi a origem das decisões: no dia 3, todas seriam da Cloudflare; no dia 15, todas são do portal.
No diagnóstico (hipotético em cada número): 30 dias de log mostraram 2,1 milhões de requisições validadas de bots de IA, das quais 1,6 milhão de GPTBot e ClaudeBot, e 4.100 sessões atribuídas pelo GA4 a chatgpt.com, perplexity.ai e claude.ai. Crawl-to-referral próprio: 512 para 1, abaixo da média do Radar para a OpenAI e acima da do Google. Das 50 URLs com anúncios mais visitadas por ChatGPT-User, 38 eram receitas de fim de semana, as páginas de maior CPM do portal. Pela régua: Search e Agent em Allow sem discussão; Training em Allow, porque receita de bolo é conteúdo commodity e o portal não tem contrato de licença.
Na decisão: Search em Allow para os três bots de busca; Agent em Allow, inclusive em páginas com anúncios, com exceção explícita no WAF para ChatGPT-User, Claude-User e Perplexity-User; Training em Allow, com o motivo escrito ("marca precisa existir no corpus; nenhum conteúdo licenciado hoje") e revisão marcada para 15 de outubro; Google-Extended em Allow em linha própria; Googlebot conferido nas páginas com anúncios depois da sincronização. O padrão que o domínio novo herdaria em 20 de setembro teria bloqueado Agent nas 38 receitas de maior CPM; a decisão registrada mantém o clique e o anúncio na mesma página.
A situação de 3 de setembro era um prazo de outra empresa. A de 15 de setembro é uma matriz com dez linhas, dez motivos e uma data de releitura, escrita por quem vive da página. É o único resultado que este checklist promete, e cabe em uma tarde para quem já tem log, GA4 e painel na mão.
Referências
- Block AI bots, Cloudflare Docs, atualizado em 1º de julho de 2026
- Your site, your rules: new AI traffic options for all customers, blog da Cloudflare, 1º de julho de 2026
- Bot Preference Sync, blog da Cloudflare, 21 de agosto de 2026
- Radar AI Insights, crawl-to-referral por plataforma, Cloudflare Radar, snapshot de 3 de setembro de 2026
- AI Crawl Control, referência de bots, Cloudflare Docs, atualizado em 23 de abril de 2026
- Content Signals Policy, blog da Cloudflare, 24 de setembro de 2025
- Introducing pay per crawl, blog da Cloudflare, 1º de julho de 2025
- AI features and your website, Google Search Central, consultado em 3 de setembro de 2026
- Overview of OpenAI crawlers, OpenAI Platform, consultado em 3 de setembro de 2026
- Bloqueio de crawlers de IA, Flowup Agency, 27 de agosto de 2026