GEO Universal Framework · Capítulo 6 de 29 · 26 min
Qual robô de IA pode ler o seu site: decida por escrito
Você sai com as três funções dos robôs de IA, a prova de que bloquear o de treino não tira a marca das respostas e a decisão de acesso escrita: quem entra, quem fica fora, o que cada bloqueio produz.
Este capítulo faz parte do curso gratuito GEO Universal Framework. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Bloquear o robô de treino não tira a sua empresa das respostas do ChatGPT nem do Claude; o que apaga a marca é bloquear o robô de busca por engano no firewall. Serve para quem recebeu a ordem de "tirar a empresa da IA" ou a proposta de "abrir o site para a IA" e precisa decidir por escrito. Você ganha a matriz das três funções, os dois controles do Google lado a lado e uma auditoria de 20 minutos no livro de visitas do servidor.
Para quem decide: a decisão é qual função de robô entra no site (treino, busca e citação, ação do usuário), assinada antes de qualquer configuração. Bloquear a busca por engano apaga a marca das respostas em semanas, sem queda no analytics: a OpenAI escreve que site excluído do OAI-SearchBot não aparece nas respostas de busca do ChatGPT. Pergunta para a equipe: qual código de resposta o servidor deu ao OAI-SearchBot nos últimos 30 dias?
Ao final você consegue: (1) classificar qualquer robô de IA nas três funções e dizer o que cada bloqueio produz. (2) Aprovar um robots.txt (o arquivo em que o site diz a cada robô o que pode ler) que separe treino de citação, com o motivo de cada linha. (3) Pedir à equipe o diagnóstico no log de servidor (o livro de visitas do site) que prova se o robô que importa está sendo atendido. (4) Decidir se llms.txt (o arquivo de texto para modelos na raiz do site) entra no projeto, por um motivo que se sustenta em reunião.
Verificação rápida
Pré-teste, antes de ler o módulo. Uma empresa bloqueia GPTBot e ClaudeBot no robots.txt para reduzir a presença da marca em respostas de inteligência artificial. O que essa mudança realmente produz?
Glossário rápido
Crawler
O robô que lê o site, como um leitor que visita cada página. Cada operador de IA mantém mais de um, com funções diferentes, e o nome com que ele se apresenta é o que permite separá-los.
User agent
A string que o robô envia em cada requisição HTTP para se identificar. É a única chave que o seu servidor tem para saber quem está batendo na porta, e por isso toda decisão deste módulo é escrita em cima dela.
robots.txt
Arquivo na raiz do domínio que declara, por user agent, quais caminhos podem ser rastreados. É convenção respeitada por operadores sérios, sem nenhuma força técnica de bloqueio; Perplexity-User e Meta-ExternalFetcher declaram ignorá-lo.
Grounding
A etapa em que o modelo busca documentos na web em tempo real para compor a resposta, em vez de depender apenas do que memorizou durante o treino.
llms.txt
Proposta de arquivo Markdown na raiz do site descrevendo o conteúdo em formato amigável a modelos. O guia oficial do Google diz que a Busca o ignora, e o changelog de 15/06/2026 registra que ele não ajuda nem prejudica.
MCP (Model Context Protocol)
Protocolo pelo qual um agente conecta ferramentas e fontes de contexto. Doado à Linux Foundation em 09/12/2025, dentro da Agentic AI Foundation.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
O que cada bloqueio de robô realmente produz?
| Função | OpenAI | Anthropic | O que o robô faz | Efeito de bloquear |
|---|---|---|---|---|
| Coluna 1: treino | GPTBot | ClaudeBot | Coleta material que pode alimentar versões futuras dos modelos | Nenhum efeito na citação de hoje, com perda de associação de marca no longo prazo |
| Coluna 2: busca e citação | OAI-SearchBot | Claude-SearchBot | Monta o índice consultado no momento em que alguém faz a pergunta | A marca some das respostas em semanas, sem sintoma em nenhum relatório de analytics |
| Coluna 3: ação do usuário | ChatGPT-User | Claude-User | Busca a página porque um humano, naquele instante, pediu | Frustra um usuário que já demonstrou intenção explícita sobre aquela URL |
A confusão do mercado começa em tratar bot de IA como categoria única. A linha em que o robô está determina inteiramente o resultado do bloqueio, e as três linhas produzem consequências que nada têm em comum entre si.
A regra que contraria quase todo post de rede social: bloquear GPTBot ou ClaudeBot não remove o seu site das respostas de busca. Os dois são crawlers (robôs que leem o site, como um leitor que visita cada página) de treino, e a citação de hoje vem de outro robô. A documentação de robôs da OpenAI resolve a dúvida em uma frase: "Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers". Sobre o outro robô, ela diz que "Disallowing GPTBot indicates a site's content should not be used in training".
A Anthropic escreve o equivalente na documentação de 07/04/2026: desativar o Claude-SearchBot pode reduzir a visibilidade do site nos resultados de busca do usuário. A mesma documentação da OpenAI lista um quarto robô, o OAI-AdsBot, que só visita páginas enviadas como anúncio no ChatGPT para validar a página de destino; um firewall que o barra reprova o anúncio.
O cenário caro é o inverso. Uma regra genérica de "proteção contra IA" no firewall devolve erro ao OAI-SearchBot, a marca some das respostas em semanas e nenhum painel de analytics registra a causa. O clique que deixou de existir não aparece em lugar nenhum.
O que cada bloqueio de robô produz de fato
Escolha um robô e leia a consequência no painel de estado. Compare o GPTBot com o OAI-SearchBot: os dois pertencem à OpenAI, e só um deles apaga a marca da resposta de hoje quando bloqueado.
A cor do painel de estado é a consequência, não um enfeite: robô de índice de busca em vermelho apaga a marca da resposta de hoje quando bloqueado; robô de treino e de ação do usuário em verde não muda a resposta de hoje. Tratar bot de IA como categoria única é a origem da confusão mais cara desta camada.
Os demais operadores seguem a mesma divisão, com duas exceções que mudam a ferramenta de bloqueio. O Perplexity-User, que abre a página quando o usuário pede, "generally ignores robots.txt rules" segundo a documentação da Perplexity. Quem quer barrá-lo precisa de regra no servidor ou no WAF, o firewall que fica na frente do site. O Meta-ExternalFetcher faz o mesmo. Já o Meta-WebIndexer é o robô que decide citação no Meta AI, e a Meta escreve que liberá-lo no robots.txt ajuda o Meta AI a citar e linkar o conteúdo.
Os outros operadores, na mesma matriz
| Operador | Treino | Busca e citação | Ação do usuário e observação |
|---|---|---|---|
| Google-Extended (treino e grounding em Gemini Apps e Vertex AI) | Googlebot, que também alimenta AI Overviews e AI Mode | Sem robô separado; sair das superfícies de IA é pelo Search Console, global desde 31/08/2026 | |
| Perplexity | Nenhum: a documentação diz que os dois robôs não coletam para treino de modelos | PerplexityBot, respeita o robots.txt | Perplexity-User ignora o robots.txt; só regra no servidor ou no WAF o barra |
| Meta | Meta-ExternalAgent | Meta-WebIndexer, decide citação no Meta AI (Instagram, WhatsApp, Facebook) | Meta-ExternalFetcher, pode ignorar o robots.txt |
| Apple | Applebot-Extended (recusa de treino) | Applebot: Spotlight, Siri e Safari | Sem robô separado; a meta tag nosnippet impede uso da página como contexto em resposta gerada |
| OpenAI, quarta função | GPTBot | OAI-SearchBot | ChatGPT-User; e o OAI-AdsBot, que valida páginas de destino de anúncios e reprova o anúncio quando é barrado |
Datas das documentações abertas em 07/09/2026: OpenAI (developers.openai.com/api/docs/bots), Anthropic (07/04/2026), Perplexity, Meta e Apple (republicada em 04/09/2026; conteúdo de 08/06/2026).
O Google tem dois controles com nomes parecidos e efeitos diferentes, e a confusão entre eles está por trás de boa parte das ordens mal executadas. O Google-Extended, na documentação de 14/07/2026, controla se o conteúdo alimenta o treinamento e o grounding (a consulta ao vivo que o modelo faz para compor a resposta) dos aplicativos Gemini e do Vertex AI. O Google escreve que ele não afeta a inclusão do site na Busca nem é sinal de ranqueamento; AI Overviews e AI Mode, servidos pelo índice do Googlebot, continuam mostrando o site.
O controle que tira o site de AI Overviews, AI Mode e do Discover generativo é outro: "Search generative AI", dentro do Search Console, o painel gratuito do Google para donos de site. Anunciado em 03/06/2026, ficou disponível para todos os sites do mundo em 31/08/2026. Tem três opções: incluir, que é o padrão, excluir e herdar da propriedade acima. Age em nível de site, faz efeito em um ou dois dias e não é sinal de ranqueamento no restante da Busca. Ele não afeta treinamento; para isso, o próprio Google remete ao Google-Extended.
As diretivas nosnippet, data-nosnippet e max-snippet continuam existindo para granularidade por página, com o efeito colateral de encolher o trecho orgânico também. Para a maioria das empresas, a combinação defensável é Google-Extended para recusar treino, e nada mais. O controle do Search Console entra só quando a decisão de sair das respostas geradas do Google tiver sido assinada com o custo em cliques ao lado.
Google-Extended ou Search generative AI: qual você precisa?
| Controle | O que controla | O que não faz | Onde e desde quando |
|---|---|---|---|
| Google-Extended (robots.txt) | Uso do conteúdo em treinamento e grounding dos aplicativos Gemini e do Vertex AI | Não tira o site da Busca, de AI Overviews nem de AI Mode; não é sinal de ranqueamento | Linha no robots.txt; documentação de 14/07/2026 |
| Search generative AI (Search Console) | Presença em AI Overviews, AI Mode e Discover generativo: incluir, excluir ou herdar | Não afeta treinamento (para isso, Google-Extended); não é sinal de ranqueamento no restante da Busca; sem granularidade por página | Painel do Search Console; anunciado em 03/06/2026, global em 31/08/2026; efeito em 1 a 2 dias |
| nosnippet, data-nosnippet, max-snippet | Quanto da página pode aparecer em trecho, inclusive nos recursos de IA | Não exclui o site; encolhe também o trecho orgânico | Meta tag ou HTML da página; documentação de recursos de IA do Google |
Pare aqui e escreva, sem voltar à figura: um e-commerce bloqueou GPTBot e Google-Extended no robots.txt há seis meses. Hoje ele aparece citado em respostas do ChatGPT com busca ativada e dentro de AI Overviews. (a) Isso é contradição ou comportamento esperado? (b) Qual robô você procuraria no log para explicar a citação do ChatGPT? (c) Qual mudança de robots.txt faria a citação desaparecer? Anote as três respostas antes de seguir.
Agora o exemplo trabalhado. O cenário: um site de conteúdo B2B que quer preservar visibilidade nas respostas de IA e, ao mesmo tempo, reduzir a coleta para treino, sem sacrificar a área logada. Cada bloco do arquivo abaixo carrega o motivo da decisão, porque robots.txt copiado de template é a origem mais comum de perda silenciosa de citação.
# robots.txt
# Decisão declarada: liberar TUDO que serve busca e citação,
# restringir apenas coleta para treino. Cada bloco justificado.
# --- Colunas 2 e 3 da matriz: busca e ação do usuário. LIBERAR. ---
# É DESTES robôs que depende aparecer na resposta. Bloquear aqui
# é o erro caro e silencioso: some da resposta e nenhum relatório
# de analytics mostra a causa.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Meta-WebIndexer
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
# Perplexity-User e Meta-ExternalFetcher ignoram este arquivo:
# se a decisão for barrá-los, a regra vai no servidor ou no WAF.
# --- Coluna 1 da matriz: treino. RESTRINGIR SÓ O QUE FAZ SENTIDO. ---
# Restringe a área de pesquisa proprietária (/labs/) e libera o blog:
# o blog é o material que quero associado à marca na memória
# paramétrica dos modelos. Bloqueio total de treino não traz ganho
# de curto prazo e joga fora esse efeito de longo prazo.
User-agent: GPTBot
Disallow: /labs/
Allow: /
User-agent: ClaudeBot
Disallow: /labs/
Allow: /
User-agent: Meta-ExternalAgent
Disallow: /labs/
Allow: /
User-agent: Applebot-Extended
Disallow: /labs/
# Google-Extended trata de treino e grounding em Gemini e Vertex AI.
# Não remove o site de AI Overviews nem de AI Mode: essas superfícies
# são servidas pelo índice do Googlebot, que segue liberado abaixo.
# Sair delas é decisão tomada no Search Console.
User-agent: Google-Extended
Disallow: /labs/
# --- Busca tradicional. Nunca mexer sem motivo explícito. ---
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Sitemap: https://exemplo.com.br/sitemap.xmlO contra-exemplo que mais aparece em auditoria: o time recebe a ordem de "tirar a empresa da IA", bloqueia GPTBot e ClaudeBot, e declara a tarefa concluída. Seis meses depois a marca continua nas respostas, porque nada foi feito na coluna 2, e o blog deixou de circular para treino, o único efeito real do bloqueio. O contrário é pior: alguém adiciona Disallow: / para OAI-SearchBot num template genérico de "proteção contra IA" e o site some das respostas em semanas, sem queda proporcional no GA4, sem alerta, sem sintoma. A fronteira da regra: robots.txt trata de propósito de coleta, e propósito de coleta não é presença na resposta.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
O que muda na conta com os marcos da Cloudflare?
- 01/07/2026Concluído
Classificação de bots em três categorias
A Cloudflare passou a classificar robôs em Search, Agent e Training. Até aqui, política defensável e alinhada com a matriz de funções que você acabou de estudar.
- 21/08/2026Concluído
Bot Preference Sync em todos os planos
O painel da Cloudflare passa a escrever no robots.txt as políticas de Search, Agent e Training, do plano gratuito ao Enterprise. O arquivo deixa de ser editado à mão e passa a refletir o que alguém clicou.
- 15/09/2026Previsto
Bloqueio padrão de Agent e Training em domínios novos
Em domínios novos, Training e Agent ficam bloqueados por padrão em páginas com anúncios, e Search segue permitido. Qualquer cliente pode recusar os novos padrões antes da data.
- A partir de 15/09/2026Previsto
Efeito de segunda ordem nos crawlers multipropósito
Crawlers multipropósito, e Googlebot é o exemplo que dói, passam a ser bloqueados de acordo com todos os seus comportamentos em sites que bloqueiam Training. Como o mesmo robô serve indexação de busca e alimentação de treino, restringir treino pode derrubar a indexação orgânica junto.
O texto da Cloudflare é preciso e vale ler como está. A partir de 15/09/2026 a empresa aplica novos padrões a domínios novos: "bots classified as Training or as Agent will be blocked on pages that display ads, and Search will remain allowed". A frase seguinte da documentação fecha o efeito colateral: "Mixed-purpose crawlers that combine Search and Training will also be blocked by all configurations".
O gatilho é domínio novo com página que exibe anúncio, e não o plano contratado; nenhum texto da Cloudflare fala em plano gratuito ou em "todos os robôs de IA". O changelog de 01/07/2026 acrescenta que "All customers can opt out of the new defaults at any time before September 15".
Três peças cercam essa data. O pay-per-crawl, em que o site cobra por acesso do robô, está em beta fechado, com preço mínimo de US$ 0,001 por acesso e a Cloudflare como Merchant of Record (a vendedora oficial na fatura). Não existe lista pública de robôs pagantes. O Bot Preference Sync, de 21/08/2026, disponível do plano gratuito ao Enterprise, escreve no robots.txt o que o painel decidir para Search, Agent e Training.
A terceira peça é a linha de Content Signals, em que o robots.txt declara o uso permitido do conteúdo. Ela ganhou a extensão content-use em teste (use=immediate, use=reference, use=full), e o robots.txt gerido pela Cloudflare passa a emitir "search=yes, ai-train=no, use=reference". A Search Engine Roundtable registra que o Google declarou que os Content Signals não têm efeito na Busca: é declaração de intenção, lida por quem quiser lê-la.
Quem administra site sob Cloudflare trata essa configuração como mudança de SEO técnico, com janela de observação em log e no Search Console, e nunca como um botão de política de conteúdo. O teste barato é aplicar em um subdomínio, com log aberto, por sete dias, antes de tocar no domínio principal.
O jurídico determinou que a empresa deve sair das inteligências artificiais. A ordem chegou por escrito, sem detalhe técnico, e o prazo é de uma semana. O site roda sob Cloudflare, tem blog ativo com boa presença em busca orgânica e recebe cerca de um terço dos agendamentos por descoberta no Google. Você precisa escrever a diretiva que será aplicada e defender a escolha na reunião seguinte.
Qual conjunto de diretivas você escreve, e o que cada um de fato produz?
Com o mecanismo no lugar, o llms.txt fica fácil de julgar. O guia oficial do Google para busca com IA, publicado em 15/05/2026 e atualizado em 10/07/2026, afirma: "You don't need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search". Sobre esses arquivos, o mesmo guia diz que "Google Search ignores them". A entrada do changelog de 15/06/2026 reforça que eles não ajudam nem prejudicam a visibilidade e o ranqueamento.
John Mueller comparou o arquivo à meta tag keywords: sinal declarado pelo próprio site, sem custo de falsificação e, portanto, sem valor de ranqueamento.
Do lado de quem lê, o resultado é o mesmo. O Common Crawl analisou 584.107 arquivos llms.txt do rastreio de julho de 2026, em publicação de 31/08/2026. Do total, 68,27% foram gerados por plugin, 49,90% seguem a especificação completa, 22,56% não têm nenhum link e 6,59% carregam política de acesso que a especificação não prevê. Mueller acrescentou, em 31/08/2026, que nos sites de teste dele os únicos robôs que declaram aceitar Markdown são ferramentas de SEO. Um arquivo gerado por plugin sem revisão pode publicar uma política de robô que o robots.txt não aplica; onde ele existir, confira o conteúdo.
O que muda quando o Google ignora um arquivo que outro motor lê?
Muda o destinatário, e com ele muda quem cobra o resultado. Um arquivo que a Busca do Google ignora não é entregável de SEO e não entra em KPI de posição. O mesmo arquivo, quando outro motor o lê, vira uma instrução de para onde olhar, e passa a ter efeito real sobre qual URL sua aparece citada.
A medição própria deste projeto mostra as duas metades ao mesmo tempo. A atribuição por URL do monitor de citação registrou o Perplexity citando uma rota alias do site seis vezes por corrida, e o motivo estava escrito no próprio llms.txt, que apontava para ela em vez de apontar para a rota publicada. Nenhum ganho de posição no Google veio junto, e nem podia vir. O arquivo dirigiu o motor que o lê, e o dirigiu para o lugar errado.
A outra metade é o custo de manutenção, e ele também foi medido. Na varredura de 09/09/2026 do próprio site, das 481 URLs listadas no arquivo, 84 respondiam com redirecionamento, 77 delas para a mesma página de destino. Dezessete por cento dos links apontavam para endereço que mudou de lugar. Arquivo assim não é neutro: ele gasta o orçamento de leitura de quem o consome e entrega a URL errada para citar.
Um arquivo, três destinatários: quem lê o quê?
| Destinatário | O que faz com o arquivo | Como se sabe disso | Consequência prática |
|---|---|---|---|
| Busca do Google | Ignora | Guia de otimização para busca com IA, publicado em 15/05/2026 e atualizado em 10/07/2026, mais o changelog de 15/06/2026 | Fora de proposta de SEO, fora de KPI e fora de qualquer promessa de posição |
| Motor que consome o arquivo | Segue os endereços que o arquivo indica | Atribuição por URL do monitor de citação deste projeto: seis citações da rota alias por corrida no Perplexity, registradas em 10/09/2026 | O arquivo dirige o motor para onde você apontar, inclusive para a URL errada |
| Agente de programação e servidor MCP | Lê como índice de documentação técnica | Uso corrente em editores com agente; John Mueller registrou em 31/08/2026 que nos sites de teste dele só ferramentas de SEO declaram aceitar Markdown | Caso de uso legítimo, sem relação com busca e sem efeito em ranqueamento |
A regra de leitura é uma só: antes de perguntar se o arquivo funciona, pergunte para quem. A resposta muda a pessoa que vai cobrar o resultado, e muda a métrica que prova que ele aconteceu.
Fonte: Documentação do Google Search Central, declaração de John Mueller e medição própria do monitor de citação e da varredura de 09/09/2026
O caso de uso que sobra é estreito e tem leitor conhecido: documentação técnica de produto consumida por agentes de programação, como Cursor, Claude Code, Copilot e Windsurf. Entram aí também os servidores MCP (o protocolo pelo qual um agente conecta ferramentas e fontes de contexto), e nos dois casos o próprio time é quem lê o arquivo.
Se o seu produto tem API ou biblioteca que desenvolvedores usam dentro de um editor com agente, o arquivo custa quase nada e pode ficar. Se o objetivo declarado é aparecer no Google ou em qualquer motor de resposta, o guia oficial já respondeu, e o arquivo não entra em proposta, em KPI nem em fator.
Qual alavanca desta camada muda a citação de hoje?
| Alavanca | O que ela realmente controla | Efeito na citação de hoje | Custo de manutenção |
|---|---|---|---|
| Liberar OAI-SearchBot, Claude-SearchBot, PerplexityBot e Meta-WebIndexer | Presença no índice de busca dos assistentes | Alto e direto | Baixo, uma linha por robô |
| Bloquear GPTBot e ClaudeBot | Coleta para treino futuro | Nenhum | Baixo, com perda de longo prazo |
| Google-Extended | Treino e grounding em Gemini Apps e Vertex AI | Nenhum sobre AI Overviews e AI Mode | Baixo |
| Search generative AI (Search Console, global desde 31/08/2026) | Exclusão de AI Overviews, AI Mode e Discover generativo | Remove a presença, sem granularidade por página | Baixo, decisão de site inteiro |
| Regra no servidor ou no WAF | Robôs que ignoram o robots.txt (Perplexity-User, Meta-ExternalFetcher) | Nenhum sobre a citação; frustra o usuário que pediu a página | Médio, exige teste por robô |
| Categoria Training da Cloudflare | Coleta para treino, com efeito colateral em crawler multipropósito | Nenhum direto, com risco de dano à indexação | Alto, exige monitoramento |
| llms.txt | Nada em busca; índice legível para agentes de programação e MCP | Nenhum | Médio, o arquivo apodrece rápido |
Repare que a alavanca de maior efeito é também a mais barata, e ela consiste em não bloquear. A de custo mais alto de manutenção é a da Cloudflare, justamente porque o efeito colateral dela recai sobre a busca tradicional.
Heurística de praticante: antes de discutir qualquer arquivo novo na raiz do site, rode uma varredura de códigos de resposta por robô nos últimos 30 dias de log. Um 403, 429 ou 5XX servido a OAI-SearchBot é citação perdida de forma silenciosa, e nenhum outro canal revela isso. Na prática, CDN, WAF e regra de rate limit explicam mais casos de invisibilidade em IA do que qualquer decisão de conteúdo. Comece pela causa barata.
Uma correção de rota importante para quem estudou material de 2024 e 2025: circulou muito a afirmação de que crawlers de IA não executam JavaScript, com exceção do Gemini. Essa generalização não tem verificação pública sólida e mudou de figura conforme os operadores evoluíram.
O argumento defensável para servir HTML no servidor continua existindo. Ele se apoia em velocidade de entrega e em não depender do comportamento de renderização (a montagem da página pelo navegador, quando o conteúdo depende de JavaScript) de cada operador, que ninguém publica em detalhe. Sustente a decisão de SSR por esse motivo, verificável, e não por uma regra categórica sobre robôs alheios.
Sem consultar o texto: descreva o robots.txt que você entregaria para um SaaS jurídico que quer máxima citação em assistentes e mínima exposição de treino. Liste as duas verificações de log que você faria na semana seguinte para provar que a entrega funcionou. Se você não consegue nomear o robô que prova o sucesso, volte à matriz.
Nas próximas 48 horas, peça à equipe os últimos 30 dias do log do servidor filtrados por oito robôs: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot e Meta-WebIndexer. A tabela tem contagem de acessos e de códigos de resposta por robô, com a autenticidade conferida pela faixa de IP que cada operador publica. Critério de sucesso: você diz, com o log na mão, quantas respostas diferentes de 200 foram servidas aos robôs da coluna de busca e em quais URLs. Se for mais que zero, você encontrou um problema que nenhuma ferramenta paga de GEO mostraria, e a correção é de configuração, não de conteúdo.
Faça agora (20 min)
Reserve 20 minutos com quem administra o site; o resultado é a decisão de acesso escrita e o primeiro dado do log.
Passo 1: Escreva a decisão em três linhas: treino, busca e citação, ação do usuário
Para cada função, "permitir" ou "restringir" e o motivo em uma frase; leve para quem tem autoridade assinar.
Erro comum: Escrever "sair da IA" sem dizer qual das três funções. A ordem vaga vira bloqueio de treino que não muda nada, ou bloqueio de busca que apaga a marca.
Passo 2: Abra o robots.txt servido em produção e confira as linhas dos robôs de busca
Digite seudominio.com.br/robots.txt no navegador e procure OAI-SearchBot, Claude-SearchBot, PerplexityBot e Meta-WebIndexer. Se algum deles tem Disallow: /, a marca está saindo das respostas.
Deu certo quando: Os quatro robôs de busca aparecem liberados, ou nem aparecem (o que também libera).
Passo 3: Peça ao time o código de resposta dado ao OAI-SearchBot nos últimos 30 dias
Uma linha por robô, com o total de acessos e quantos receberam 403, 429 ou 5XX; o dado vem do log do servidor ou do painel do CDN.
Erro comum: Aceitar "está tudo liberado no robots.txt" como resposta: o bloqueio que apaga a marca costuma estar no firewall, e o arquivo continua limpo.
Passo 4: Confira os dois controles do Google no Search Console
Abra a propriedade do site e veja o estado do controle "Search generative AI" (incluir é o padrão); confira se Google-Extended está no robots.txt e por quê.
Deu certo quando: Você sabe dizer, para cada um dos dois, o estado atual e quem decidiu.
Passo 5: Se o site está sob Cloudflare, agende a revisão de 15/09/2026 como mudança de SEO técnico
Peça a configuração das categorias Search, Agent e Training e um teste em subdomínio com log aberto por sete dias antes de tocar no domínio principal.
Erro comum: Tratar a categoria Training como botão de política de conteúdo: crawlers mistos podem ser bloqueados em todos os comportamentos.
No fim você tem: a decisão de acesso escrita em três linhas com dono, o robots.txt de produção conferido, o código de resposta servido ao OAI-SearchBot nos últimos 30 dias e o estado dos dois controles do Google, o que basta para responder ao jurídico ou ao fornecedor sem adivinhar.
Resumo em três linhas: Os robôs de IA têm três funções, e só o bloqueio do robô de busca, como o OAI-SearchBot, tira a marca das respostas; bloquear o de treino não muda a citação de hoje. No Google, Google-Extended trata de treino e grounding; quem tira o site de AI Overviews e AI Mode é o controle do Search Console, global desde 31/08/2026; llms.txt segue opcional e sem consumidor. Na segunda-feira, escreva a decisão em três linhas, peça o código de resposta dado ao OAI-SearchBot nos últimos 30 dias e agende a revisão da Cloudflare de 15/09 como mudança de SEO técnico.
Os robôs que importam estão sendo atendidos?
Log de servidor, últimos 30 dias
0/5robots.txt e diretivas
0/5Camada de CDN e WAF
0/4Perguntas frequentes deste capítulo
Bloquear GPTBot tira minha empresa do ChatGPT?
Preciso do Google-Extended ou do controle do Search Console?
Vale a pena publicar llms.txt?
O que muda para mim em 15/09/2026 se meu site já existe e está sob Cloudflare?
Meu site é SSR ou pode ser client-side? Os crawlers de IA executam JavaScript?
Todos os capítulos de GEO Universal Framework
- 01GEO em quinze minutos: o que mudou e o que você decide
- 02Sete princípios com fonte: como este curso trata o problema
- 03O que é SEO e por que a base decide o resto
- 04Busca sem clique: o que os números de 2026 dizem de verdade
- 05O que é GEO e como ler os números do mercado
- 06Qual robô de IA pode ler o seu site: decida por escrito
- 07Sua empresa como entidade: o que o Google documenta, o que inventaram
- 08Dados estruturados depois da poda: o que ainda rende resultado
- 09O motor escolhe onde buscar antes de responder: entre na lista
- 10Busca local: endereço, perfil e o que a IA consegue ver
- 11Mais de um idioma: o que muda para ser citado lá fora
- 12Site grande: quando as suas próprias páginas competem entre si
- 13Conteúdo feito com IA: o que o Google proíbe e o que já é detectável
- 14Riscos que a diretoria assina: injeção de prompt, LGPD e log
- 15Permitir, cobrar ou bloquear os robôs de IA: a decisão por escrito
- 16ChatGPT Ads no Brasil: separar pago de orgânico antes de comprar
- 17Medir sem se enganar: três camadas e o relatório oficial do Google
- 18Ciclo mensal: quatro fases, portão de saída e relatório em cinco linhas
- 19Operar com agentes: qual modelo para qual tarefa, e quando não orquestrar
- 20Ler um case sem cair no conto: a rubrica dos cinco portões
- 21De onde veio esse número: quatro passos antes de repetir
- 22A proposta de GEO chegou: dez perguntas antes de assinar
- 23Etapa 1: o diagnóstico em 16 pilares e o portão de entrada
- 24Etapa 2: robô certo entra, página existe sem JavaScript, markup ainda serve
- 25Etapa 3: escrever o trecho citável e provar que a IA citou
- 26Etapa 4: concentrar presença fora do site, e o custo de pulverizar
- 27Etapa 5: o site que o agente consegue ler, comparar e comprar
- 28Etapa 6: medir sem se enganar, e decidir manter ou reverter
- 29Etapa 7: 90 dias, três dependências e o critério de parada