GEO Universal Framework · Capítulo 28 de 29 · 30 min
Etapa 6: medir sem se enganar, e decidir manter ou reverter
Você sai decidindo manter ou reverter cada mudança com um critério escrito antes da coleta, lendo três camadas de evidência sem somá-las e recusando qualquer número sem faixa, execuções, instrumento e modelo.
Este capítulo faz parte do curso gratuito GEO Universal Framework. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
A decisão desta etapa é manter ou reverter cada mudança feita no site, e ela só é defensável quando o número que a sustenta vem com faixa de incerteza, execuções, instrumento e modelo declarados. Serve a quem aprova relatório de agência ou de ferramenta e precisa dizer sim ou não a um slide. Você sai lendo três camadas de evidência sem somá-las, exigindo intervalo de confiança em vez de número solto e aplicando o Twin Branch (o teste com e sem, com critério escrito antes da coleta) para decidir.
Para quem decide: a decisão é aceitar um resultado de GEO como real ou registrá-lo como inconclusivo, e o critério é escrito antes da coleta: diferença mínima na taxa de menção e faixas de incerteza que não se cruzem. Errar custa o trimestre seguinte: uma medição única mostra só 62% a 77% das marcas que cinco rodadas revelam. Pergunta para a equipe: quantas execuções, qual instrumento, qual modelo e qual faixa estão por trás deste número?
Ao final você consegue: (1) Separar as três camadas de evidência (acessibilidade, visibilidade, consequência) e recusar o painel que as soma num índice único. (2) Exigir conjunto de prompts congelado, execuções até a convergência e intervalo de confiança antes de aceitar uma taxa de menção. (3) Decidir manter, reverter ou registrar inconclusivo com um gate numérico definido por escrito antes da coleta. (4) Diagnosticar, num relatório de terceiro ou num case de fornecedor, se o número tem controle, denominador e data ou só aparência.
Verificação rápida
Pré-teste, antes de ler o módulo. Uma coleta mostra a marca subindo da sexta para a quarta posição entre os domínios citados por um assistente. Você pode reportar essa subida como resultado do trabalho do trimestre?
Glossário rápido
Execução
Uma chamada, um prompt, um retorno. A unidade de coleta.
Taxa de menção
Proporção de execuções em que a marca aparece, dentro de um conjunto de prompts fixo, numa plataforma específica.
Piso de ruído
A variação que a medição produz sozinha, sem nenhuma mudança no mundo. Diferenças menores que ele são indistinguíveis de acaso.
Intervalo de confiança
A faixa dentro da qual o valor real provavelmente está. Um IC de 95% de 11% a 26% diz que a taxa verdadeira quase certamente fica nessa faixa, e que 18% é só o centro dela.
Bootstrap
Reamostrar com reposição as execuções que você já tem, muitas vezes, para estimar a incerteza da métrica sem supor distribuição. É como reembaralhar o próprio baralho para ver quanto o resultado varia.
Controle e placebo
Controle é a marca ou a página que não recebeu a mudança, comparada com a que recebeu. Placebo é aplicar o mesmo método a uma data em que nada mudou, para ver se ele encontra efeito onde não há.
Regra de parada
Critério que diz quando a coleta pode parar: o ranking estabilizou e a diferença entre domínios ficou maior que a incerteza. Substitui o número fixo de execuções.
Twin Branch
O teste com e sem: a versão nova e a antiga medidas na mesma janela, com o critério de aprovação escrito antes da coleta e três saídas possíveis (manter, reverter, inconclusivo).
Denominador
O conjunto de prompts, a plataforma e o número de execuções sobre os quais a métrica foi calculada. Métrica sem denominador publicado não é comparável nem consigo mesma.
Os trabalhos que sustentam o método, e o que cada um obriga a mudar na sua planilha
| Trabalho | Desenho | Achado que importa | O que muda na prática |
|---|---|---|---|
| arXiv 2604.07585, "Don't Measure Once", Schulte, Bleeker e Kaufmann, 08/04/2026 | Argumento metodológico sobre variação entre execuções, entre prompts e ao longo do tempo | A observação pontual não é confiável; visibilidade é distribuição com dispersão declarada | A célula do relatório deixa de aceitar número solto e passa a exigir taxa, intervalo e n |
| arXiv 2603.08924, Sielinski, 09/03/2026, versão 3 de 26/08/2026 | Amostragem diária por nove dias e a cada dez minutos em Perplexity Search, SearchGPT e Gemini; intervalos por bootstrap | Rankings de citação instáveis; muitas diferenças aparentes dentro do piso de ruído; distribuição de citações em lei de potência | Movimento de posição deixa de ser reportado sozinho; o intervalo de confiança vem do bootstrap deste trabalho |
| arXiv 2607.10341, Sielinski, 11/07/2026, versão 2 de 26/08/2026 | Critério sequencial de convergência em 30 combinações plataforma-tópico (Gemini, SearchGPT, Perplexity) | Nenhum orçamento fixo de execuções se justifica em todos os contextos; a coleta para no platô de estabilidade | O N fixo vira piso de segurança; o relatório informa quantas execuções a regra de parada exigiu |
| arXiv 2609.05059, Żatuchin, 04/09/2026 | 300 células pergunta-motor: 50 perguntas, seis motores, 15 rodadas, 1.470 organizações | Uma rodada mostra 62% a 77% das marcas de cinco rodadas; motor com busca web satura perto da décima; lista fixa de marcas fabrica platôs | Extração aberta de marcas em vez de lista fechada de concorrentes |
| arXiv 2408.04667, "Non-Determinism of 'Deterministic' LLM Settings", Atil e colegas, 06/08/2024, revisão até 02/04/2025 | Cinco modelos, oito tarefas, dez execuções, sob configurações que se espera serem determinísticas | Variação de acurácia de até 15% e diferenças de desempenho de até 70% entre execuções | Baixar a temperatura para zero deixa de ser tratado como solução do problema de medição |
A base desta etapa é acadêmica porque quase todo estudo público de GEO em 2026 é produzido por quem vende a ferramenta de medição.
Uma ressalva de proveniência sobre a causa do não determinismo. Amostragem estocástica, ordem de execução em sistemas paralelos e aritmética de ponto flutuante são o entendimento corrente de engenharia, e não a conclusão do arXiv 2408.04667. O que os autores levantam no resumo é a hipótese de que a variação venha do uso eficiente de recursos de computação, com dados de requisições distintas misturados nos buffers de entrada. O efeito prático para o seu trabalho é o mesmo; a atribuição correta continua importando.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
As oito regras da camada de visibilidade são o coração deste módulo, e cada uma responde a um dos achados acima. A tabela traz o que fazer e o motivo; os parágrafos seguintes explicam as duas que mudaram em agosto de 2026. A oitava entrou em 10/09/2026, depois de um alarme falso do próprio painel deste projeto.
As oito regras operacionais da camada de visibilidade
| Regra | O que fazer | Por quê |
|---|---|---|
| 1. Congele e versione o conjunto de prompts | De 100 a 200 prompts num arquivo com data, com paráfrases por intenção. Se o conjunto mudar, a série quebra, e o relatório diz isso | Prompt escolhido depois de ver o resultado é viés de seleção, o erro mais comum em times que reportam para dentro |
| 2. Repita até a convergência | Piso de segurança de 10 execuções por prompt por plataforma, 30 para intervalo de 95%. Pare quando o ranking estabilizar e a diferença entre domínios superar a incerteza; reporte quantas execuções isso exigiu. Não feche a lista de concorrentes | arXiv 2607.10341: nenhum orçamento fixo se justifica; arXiv 2609.05059: uma rodada mostra 62% a 77% das marcas, e lista fixa fabrica platôs |
| 3. Reporte distribuição, nunca ponto | Taxa de menção de 18%, IC 95% de 11% a 26%, n igual a 30, ChatGPT com busca, modelo declarado, pt-BR, Brasil, 12 a 18 de julho. Nunca "estamos em 18%" | arXiv 2604.07585: a observação pontual não é confiável |
| 4. Não reporte movimento dentro do ruído | Intervalos sobrepostos significam sem mudança detectável, e essa é a frase que vai para o slide | arXiv 2603.08924: muitas diferenças aparentes caem no piso de ruído |
| 5. Documente o instrumento, com modelo | API ou interface, modelo e versão, busca web ligada ou desligada, localidade e idioma, sessão limpa ou com histórico, data e hora | O AI Mode trocou de modelo três vezes em seis semanas; o 3.8 Flash respondeu sem links em 03/09 e o Google corrigiu em 04/09 |
| 6. Publique o denominador | Conjunto de prompts, plataforma e número de execuções em toda participação de voz | O denominador muda a cada conjunto e move o resultado sem que nada tenha acontecido no mundo |
| 7. Meça um controle | Dois ou três concorrentes, uma marca irrelevante para o tema e, quando o teste é de conteúdo, páginas do próprio domínio que não receberam a mudança | Marca irrelevante com taxa parecida com a sua denuncia conjunto de prompts que induz a resposta; arXiv 2606.04362: 5,7 vezes bruto virou 1,82 vez com controle |
| 8. Não leia razão calculada sobre poucos eventos | Piso de 30 impressões por lado antes de comparar posição média entre janelas, e a mesma disciplina para qualquer taxa. Abaixo do piso, o relatório informa a contagem e omite a comparação | Apuração própria de 10/09/2026: quatro URLs com uma a três impressões por dia produziram queda aparente de 1,5 para 46,5 de posição média, sobre duas impressões de cada lado |
As regras 2 e 7 mudaram em 2026: a regra de parada substituiu o número fixo, e o controle ganhou a versão mais barata, que é a própria propriedade.
A regra 2 trocou o alvo. Até julho de 2026 este curso pedia dez execuções para leitura direcional e 30 para intervalo de 95%, como heurística coerente com os papers. Desde a versão 2 do arXiv 2607.10341 (26/08/2026), a coleta para por convergência: o ranking de domínios estabiliza e a dispersão entre os domínios estabelecidos supera a incerteza. Em 30 combinações de plataforma e tópico (Gemini, SearchGPT, Perplexity), nenhum orçamento fixo se justificou em todos os contextos. Os mínimos antigos viram piso de segurança, e o relatório informa quantas execuções a regra exigiu, por plataforma.
O arXiv 2609.05059 (04/09/2026) mostra o custo de parar cedo. Em 300 células de pergunta e motor, uma rodada única revelou só 62% a 77% das marcas que cinco rodadas revelam. Os motores sem busca web ainda acrescentavam marcas novas na rodada 15, e o único com busca web saturou perto da décima. Rastreadores que só procuram uma lista fixa de concorrentes produzem curvas planas sobre as mesmas respostas: a estabilidade que mostram é fabricada pela lista.
Ser citado e ser usado também são medidas diferentes. Um framework de dois estágios (arXiv 2604.25707, 28/04/2026, 602 prompts e 21.143 citações) separa a seleção da citação da absorção do conteúdo na resposta. Perplexity e Google citam mais fontes; o ChatGPT cita menos e aproveita mais cada página. A taxa de citação diz que a página entrou, e não diz quanto dela virou resposta.
Quanto a sua amostra realmente sabe: largura do intervalo por número de execuções
Mova os dois controles para montar o total de execuções por prompt, somando a primeira rodada e a rodada de repetição. A margem indicada abaixo usa a aproximação normal de 95% com taxa observada de 50%, que é o pior caso, ou seja, o ponto em que o intervalo fica mais largo. Taxas próximas de zero ou de cem estreitam o intervalo: com 30 execuções, a margem é de 10,7 pontos para uma taxa de 10% e de 17,9 pontos para 50%. Quadruplicar o n corta a margem pela metade, porque o ganho vai com a raiz. Cálculo próprio deste curso pela fórmula padrão de intervalo para proporção; use o bootstrap do exemplo em Python quando as execuções vierem de prompts repetidos.
Quantas vezes você roda cada prompt na coleta de baseline, na mesma plataforma e com o mesmo instrumento.
Repetição é o que aumenta o n sem mexer no conjunto de prompts. Trocar prompts para ganhar volume quebra a série temporal.
Com dez execuções, uma taxa observada de 50% vem acompanhada de margem de cerca de 31 pontos, ou seja, o intervalo cobre de 19% a 81%. Esta faixa serve para leitura direcional interna e não sustenta comparação entre dois períodos nem entrada em relatório de resultado. Se o total ficar aqui, a frase correta no slide é que a coleta ainda não distingue movimento de ruído.
Quanto a sua amostra realmente sabe
Mexa no número de execuções e na taxa observada. Comece com n igual a 10 e repare na largura do intervalo antes de tirar qualquer conclusão. Depois suba para 30 e para 60 e observe onde o ganho de precisão começa a desacelerar.
Mês 1: taxa de 18% com intervalo de 95% de 0,0% a 41,8%, margem de 23,8 pontos, n igual a 10 execuções. Mês 2: taxa de 24% com intervalo de 0,0% a 50,5%, margem de 26,5 pontos, n igual a 10 execuções. Os dois intervalos se sobrepõem, então a leitura honesta é sem mudança detectável.
Atenção: com n em torno de 10 o intervalo cobre quase todo o eixo, e essa leitura não sustenta comparação entre dois períodos nem entrada em relatório de resultado.
Aproximação de Wald para proporção, adequada para planejamento. A margem cai com a raiz de n, então quadruplicar as execuções corta a margem pela metade e não a um quarto. Ancorado em arXiv 2604.07585 e arXiv 2603.08924, que o curso já cita: quando os intervalos se sobrepõem, movimento de posição não deve ser reportado como resultado.
O controle mais barato é a própria propriedade. Um estudo de logs (arXiv 2606.04362, 03/06/2026) mediu o referral do ChatGPT para páginas otimizadas e para páginas do mesmo domínio que não receberam nada. O total cresceu 5,7 vezes e as páginas não tratadas, 3,5 vezes, porque o ChatGPT inteiro cresceu no período. Descontado isso, o modelo estimou o salto em 1,82 vez, e o placebo deu p igual a 0,16: efeito sugestivo, não conclusivo. É a distância entre o case de fornecedor e o número defensável.
O mesmo case, do número bruto ao número defensável
5,7x
crescimento bruto do referral do ChatGPT
O número que vai para o slide de fornecedor
3,5x
crescimento das páginas não tratadas do mesmo domínio
O controle na própria propriedade
1,82x
salto atribuível à intervenção no modelo
IC de 95% de 1,31 a 2,54
p = 0,16
teste placebo no tempo
Efeito sugestivo, não conclusivo
Fonte: Keisuke Watanabe e Kazuki Nakayashiki, "Disentangling Answer Engine Optimization from Platform Growth", arXiv:2606.04362, 03/06/2026. Achados do resumo do artigo.
Fronteira metodológica que quase nenhum fornecedor destaca: coleta por API não reproduz o que o usuário vê. O produto de consumo aplica localização, memória, personalização, busca web e formatação de citação que a API não aplica. Uma chamada de API sem busca devolve apenas a memória do modelo, e pode retornar zero citações num prompt em que o usuário real vê cinco. A coleta por interface captura mais da realidade, é frágil e pode violar termos de serviço. Antes de assinar qualquer ferramenta, exija por escrito: coleta por API ou por interface, modelo exato, busca web ligada ou não, localidade, execuções por prompt por período e como a regra de parada é aplicada. Fornecedor que não responde está vendendo um número que você não consegue defender, e o preço não é o problema desse produto. A segunda fronteira é do lado do resultado. O GA4 mede cliques resultantes de IA e os subestima por magnitude desconhecida, porque sessões sem cabeçalho de referrer (a etiqueta que diz de onde a visita veio) caem em Direto. Aplicativos nativos de assistente frequentemente não enviam essa etiqueta. Escrever desconhecido é mais honesto e mais defensável do que qualquer faixa sem método. Visibilidade em IA o GA4 simplesmente não mede, e confundir cliques vindos de IA com visibilidade em IA é o erro de medição mais comum do mercado.
Sem voltar ao texto, escreva a frase que você colocaria no relatório para descrever este resultado. A taxa de menção do mês passado foi 14% com IC 95% de 8% a 21%; a deste mês foi 19% com IC 95% de 12% a 27%; ambas com n igual a 30. A frase precisa dizer o que aconteceu e o que não pode ser afirmado. Depois preveja: se você tivesse rodado 100 execuções em vez de 30 e as taxas continuassem 14% e 19%, o que mudaria na sua frase?
As três camadas de evidência organizam o resto, e nunca viram um único índice de GEO. Somar destrói a informação que torna cada uma útil: a confiabilidade de cada camada é diferente por natureza, e a média de um dado censitário com um dado ruidoso não herda a confiabilidade de nenhum dos dois.
Por que as três camadas nunca viram um índice único?
| Camada | Pergunta que responde | Fonte | Confiabilidade | Sob seu controle |
|---|---|---|---|---|
| Acessibilidade | O robô consegue pegar a página? | Log de servidor; impressões em IA do Search Console | Alta, é censitário | Sim |
| Visibilidade | A IA menciona a marca, cita uma URL dela ou a recomenda? | Amostragem de prompts, com modelo declarado | Média, estatístico e ruidoso | Não |
| Consequência | Gerou visita, lead, receita? | GA4, CRM e pergunta autodeclarada | Baixa a média, sabidamente subestimado | Parcialmente |
A coluna de confiabilidade é o motivo de as três nunca serem somadas. Cada linha responde a uma pergunta diferente, com um instrumento diferente, e a única leitura válida é lado a lado. No relatório para a diretoria, a camada de consequência se abre em duas, visita e resultado, porque o viés de cada uma é diferente, e a posição orgânica entra como camada própria: o módulo de monitoramento traz as quatro lado a lado.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Comece pela camada de acessibilidade, porque ela é a mais barata, a mais confiável e a única em que se encontra bug de verdade. Guarde logs brutos (o livro de visitas do site, que registra cada robô que entrou) por no mínimo 90 dias. Segmente os robôs de treino, como GPTBot, ClaudeBot, CCBot e meta-externalagent, dos robôs de busca e citação, como OAI-SearchBot, Claude-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User e Claude-User. Só a segunda categoria tem efeito de curto prazo sobre aparecer nas respostas, e um relatório que soma tudo numa linha chamada bots de IA perde a informação acionável.
Verifique autenticidade por faixa de IP publicada pelos operadores e reporte apenas os acessos verificados, porque falsificar agente de usuário é trivial. O relatório semanal mínimo, em ordem de utilidade: códigos de resposta por robô, URLs mais rastreadas pelos robôs de citação, páginas prioritárias nunca tocadas, latência e peso da resposta, série por provedor. Um 403, 429 ou 5XX servido ao robô de busca de um assistente é citação perdida em silêncio, e bloqueio inadvertido é a causa raiz mais comum e a mais barata de resolver.
Desde 31/08/2026 esta camada tem uma série oficial. O relatório de IA generativa do Search Console mostra impressões em AI Overviews e AI Mode por página, país, dispositivo e data, para todos os sites. Ele não mostra cliques nem consultas, e as perguntas feitas dentro do AI Mode entram no relatório principal como consultas novas. A série tem um buraco documentado de 13 a 17/08/2026, restaurado em 21/08, anotado em qualquer comparação que cruze essas datas.
Há um motivo estatístico para começar por aqui, e ele vem da lei de potência do arXiv 2603.08924. Poucos domínios concentram a maior parte das citações, e o primeiro progresso de uma marca nova acontece dentro da cauda, onde a instabilidade é maior. Sair de zero citações para citação ocasional é resultado real que aparece como ruído em quase qualquer instrumento. Nessa fase, eleja uma métrica de acessibilidade como indicador principal e trate a visibilidade como acompanhamento trimestral.
Na camada de consequência, o grupo de canais AI Assistant do GA4 classifica sessões desde 13/05/2026, quando o medium é ai-assistant e o referrer casa com uma lista de assistentes que o Google não publica inteira. ChatGPT, Gemini, DeepSeek, Copilot e Grok são os exemplos oficiais; a inclusão da Perplexity por padrão não está confirmada. O canal exclui AI Overviews e AI Mode, e esse tráfego segue contado como busca orgânica. Mantenha também um grupo customizado, por expressão regular sobre session_source, cobrindo chatgpt, openai, perplexity, claude, anthropic, gemini, copilot, bing com chat, grok e deepseek, testado na sua própria propriedade.
Acrescente uma pergunta de atribuição autodeclarada no formulário, com opções explícitas de ChatGPT, Gemini, Perplexity e Claude. É a única forma de capturar o percurso em que a pessoa lê no chat, depois busca a marca pelo nome e converte, percurso que o GA4 credita a Orgânico ou Direto. A Visibility Labs, ao medir conversão de tráfego do ChatGPT em 94 lojas em 2025, avisa que o GA4 subconta a influência do assistente quando o usuário volta ao Google para comprar. O ramo autodeclarado existe por isso, e o viés próprio da autodeclaração vai escrito no relatório.
Não use benchmark externo de conversão de tráfego de IA como constante. Os números públicos vêm de verticais, países e períodos diferentes, e qualquer "IA converte N vezes" no relatório precisa de vertical, período, país e denominador ao lado. Compare o tráfego de IA do próprio site com os outros canais do próprio site.
O instrumento de consequência é recente, e a data limita o que ele responde
- 13/05/2026Concluído
Início da classificação no GA4
O grupo de canais AI Assistant classifica sessões apenas a partir desta data. Nada antes dela foi reprocessado, e AI Overviews e AI Mode ficam fora.
- 31/08/2026Concluído
Relatório de IA do Search Console para todos os sites
Impressões em AI Overviews e AI Mode por página, país, dispositivo e data. Sem cliques. Buraco de 13 a 17/08 restaurado em 21/08.
- 01/09/2026Concluído
Quebra de série no GA4
Dia sem dados no GA4, somado às URLs goto do Google desde 26/08 e à troca de modelo do AI Mode em 02/09. Toda comparação que cruza essas datas leva nota.
- 07/09/2026Agora
Onde você está agora
Cerca de quatro meses de série do GA4 e uma semana da série oficial do Search Console. Comparação ano contra ano segue inviável.
- 13/05/2027Previsto
Primeira comparação anual possível no GA4
Antes desta data, qualquer variação anual apresentada como resultado de trabalho compara com um período em que o instrumento não media.
Cliques quando a IA responde têm, desde 2026, evidência experimental, e ela calibra a expectativa da camada 3 antes de qualquer promessa comercial. Dois experimentos de campo, de equipes diferentes, convergem: quando o resumo de IA aparece, cliques orgânicos para sites caem, e a maior parte das visitas com AI Overview termina sem clique em fonte. A tabela reúne o que entra no relatório, com o desenho de cada estudo ao lado do número.
Cliques quando a IA responde: os experimentos e as medições que entram no relatório
| Estudo | Desenho | Achado | O que muda no relatório |
|---|---|---|---|
| RCT ISB-CMU, Agarwal e Sen (registro AEARCTR-0017393; SSRN 6513059, revisto 17/06/2026) | 1.065 usuários de Chrome desktop, três braços, 07/01 a 10/02/2026 | AI Overview reduz cliques orgânicos externos em 39,8% e eleva buscas sem clique em 34,5%; anúncios e frequência de busca sem mudança; cerca de 8% dos cliques vêm de citações do resumo | A expectativa de clique quando a IA responde tem número causal, e ele não é de vendor |
| RCT Wang, Gleason, Bart, Wilson e Metaxa (arXiv 2608.18352, 18/08/2026) | Experimento pré-registrado com 1.100 participantes no Google | Remover AI Overviews e AI Mode aumenta a taxa de clique para publishers; experiência só com AI Mode reduz cliques e corrói confiança | Segundo experimento independente na mesma direção: o relatório diz "dois RCTs convergem" |
| Painel Chapekis, Lieb, Shah e Smith (arXiv 2608.04831, 05/08/2026) | 900 adultos dos Estados Unidos, um mês de navegação, regressão mista | Clique em fonte citada ocorre em cerca de 1% das visitas com AI Overview | Ser citado não é ser clicado; a citação vale na camada 2, e não na 3 |
| Ahrefs, Ryan Law, 04/02/2026 | 300 mil palavras-chave, Search Console de dezembro de 2023 contra dezembro de 2025 | A taxa de clique da posição 1 cai 58% quando há AI Overview; posição 2 perde 50,8%, posição 10 perde 19,4% | A posição clássica vale menos quando o resumo aparece |
| Ahrefs, Louise Linehan, 02/03/2026 | 863 mil páginas de resultado, 4 milhões de URLs | 38% das URLs citadas no AI Overview estão no top-10 orgânico, contra cerca de 76% em julho de 2025 | Ranking clássico explica cada vez menos quem é citado |
| Seer Interactive, abril de 2026 | 53 marcas, 5,47 milhões de consultas, 2,43 bilhões de impressões, janeiro de 2025 a fevereiro de 2026 | Taxa de clique orgânica de 3,3% sem AI Overview, 2,1% quando citada e 0,9% quando não citada: ser citada rende 120% mais cliques por impressão | A régua para a promessa comercial de "ser citado", ainda 38% abaixo da consulta sem resumo |
Cite a Ahrefs direto, com as datas, e não a matéria patrocinada de terceiros que a resume. Nenhum desses números vale para o Brasil sem medição própria; o que viaja é o desenho e a direção.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
O Twin Branch é o procedimento que fecha o ciclo, e a razão de ele existir é o Princípio 7 do curso: alguns enriquecimentos degradam o desempenho em vez de melhorá-lo. Adicionar marcação, perguntas, perfis e links tem custo de manutenção certo e benefício incerto, e a única forma de separar os dois é medir com e sem.
A paternidade do método precisa ser dita. O Twin Branch Evaluation Protocol foi introduzido por Beining Wu e colegas em "From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning", submetido em 21/04/2026 e aceito no ACL 2026 Findings (arXiv 2604.19516). O paper o propõe como mecanismo de atribuição causal de edições de conteúdo no framework multiagente MAGEO, ao lado da métrica DSV-CF e do benchmark MSME-GEO-Bench.
Os autores validaram o protocolo em três motores generativos, num desenho controlado com edições geradas e avaliadas pelo próprio sistema, e não num site de produção com tráfego real. O que este curso faz é transportar a lógica para a rotina editorial, como adaptação de praticante.
O que separa o Twin Branch de um teste antes e depois qualquer é a etapa 1: o gate é definido antes da coleta, por escrito. Gate escolhido depois de ver o resultado é a falha de seleção da regra 1 com outro nome. O valor de referência deste curso é delta maior ou igual a 0,05 na métrica escolhida, com a condição adicional de os intervalos de confiança não se sobreporem. O 0,05 é convenção operacional deste framework, e não constante de literatura. Se o seu volume permitir n maior, aperte o gate; se for pequeno, aumente a janela em vez de afrouxar o gate.
A condição de sobreposição de intervalos é o que impede o teste de aprovar sorte. Um delta de 0,06 com intervalos que se cobrem quase inteiramente descreve duas amostras da mesma distribuição. Nesse caso a decisão correta é a terceira saída do fluxo (inconclusivo), e a tentação a resistir é tratar inconclusivo como aprovado porque já houve trabalho investido.
Aprovar, reverter ou inconclusivo
Suba o delta observado até um valor grande e depois aumente a largura dos intervalos. Procure a faixa em que o delta é alto e o veredito ainda é inconclusivo. É esse ponto que separa medição honesta de teatro de medição.
Os intervalos das duas medições se sobrepõem, então a diferença é compatível com duas amostras da mesma distribuição. Delta acima do gate com intervalos sobrepostos ainda é inconclusivo: a saída honesta é estender a janela e aumentar o n, sem afrouxar o gate.
Delta observado de 6,0 pontos, sobre baseline de 15%. Medição A: 7,0% a 23,0%. Medição B: 13,0% a 29,0%. Intervalos sobrepostos. Gate de delta cumprido. Veredito: Inconclusivo.
O valor de 0,05 é convenção operacional deste framework, calibrada para barrar ruído, e não constante derivada de literatura. O baseline de 15% é âncora fixa do simulador, escolhida para caber no eixo. A terceira saída, inconclusivo, é o que impede o teste de aprovar sorte quando o delta parece grande mas os intervalos ainda se cobrem.
A equipe implementou marcação estruturada nova em doze páginas de uma seção, com gate definido por escrito antes da coleta: delta maior ou igual a 0,05 na taxa de menção, com a condição adicional de os intervalos de confiança não se sobreporem. A janela de duas semanas fechou. O baseline deu taxa de menção de 0,14, com IC 95% de 0,08 a 0,21, n igual a 30 execuções por prompt. A releitura deu 0,20, com IC 95% de 0,13 a 0,28, mesmo n, mesmo instrumento, mesmo modelo, mesma localidade. O delta é de 0,06, acima do gate. Os intervalos se cobrem de 0,13 a 0,21, ou seja, na maior parte da extensão de ambos. A apresentação de fechamento é depois de amanhã.
Qual saída do Twin Branch você registra na ata?
Janela mínima de medição por tipo de enriquecimento, e a métrica do gate
| Enriquecimento testado | Janela mínima | Métrica do gate | Armadilha específica |
|---|---|---|---|
| Marcação estruturada nova numa página | 2 semanas | Taxa de menção da página no conjunto de prompts | Confundir aparecer no validador com aparecer na resposta |
| Reescrita de página com resposta direta no topo | 3 semanas | Taxa de menção mais posição da citação | Reescrever cinco páginas na mesma janela e não saber qual funcionou |
| Expansão de perfis sameAs consistentes | 4 semanas | Taxa de menção da entidade em prompts de identidade | Efeito lento demais para janela de 4 semanas em marcas pequenas |
| Nova frente de presença externa | 8 semanas | Taxa de menção mais acessos verificados nos logs | A frente leva mais tempo para ser indexada do que para publicar |
| Correção de bloqueio a robô de citação | 2 semanas | Acessos verificados com status 200 nos logs | Esta é a única em que a camada de acessibilidade já responde sozinha |
| Servidor MCP de leitura | Indefinida | Nenhuma métrica de visibilidade responde a isso | Não teste com Twin Branch, porque não há mecanismo esperado |
As janelas são heurísticas de praticante, calibradas por tempo típico de recrawl e de atualização de índice, e não por estudo publicado. O valor de 0,05 usado como gate de delta é convenção operacional deste framework, e não constante derivada de literatura.
# Exemplo trabalhado: intervalo de confiança por bootstrap sobre execuções.
# Método de Sielinski, arXiv 2603.08924 (versão 3, 26/08/2026), adaptado.
# Decisão 1: uso bootstrap e não fórmula analítica porque a métrica é uma
# proporção com n pequeno (30) e as execuções não são independentes de forma
# limpa (mesmo prompt repetido), o que quebra as suposições da aproximação normal.
# Decisão 2: reamostro por PROMPT e não por execução solta, porque a unidade que
# se repete no desenho é o prompt. Reamostrar execução solta subestima a
# incerteza e produz intervalo estreito demais, o que é pior do que não ter intervalo.
# Decisão 3: 1000 reamostragens. Acima disso o ganho de estabilidade é marginal
# para reportar percentis 2,5 e 97,5.
import random
# execuções[prompt] = lista de 0/1, uma entrada por execução daquele prompt.
# 1 = a marca foi mencionada na resposta; 0 = não foi.
execuções = {
"p01": [1, 0, 0, 1, 0],
"p02": [0, 0, 0, 0, 0],
"p03": [1, 1, 1, 0, 1],
"p04": [0, 1, 0, 0, 0],
"p05": [0, 0, 1, 0, 0],
"p06": [1, 0, 0, 0, 0],
}
def taxa(amostra_prompts):
"""Taxa de menção agregada sobre a lista de prompts recebida."""
plano = [r for p in amostra_prompts for r in execuções[p]]
return sum(plano) / len(plano)
def ic95_bootstrap(n_reamostragens=1000, semente=42):
rng = random.Random(semente) # semente fixa: o relatório precisa ser reproduzível
prompts = list(execuções.keys())
k = len(prompts)
distribuição = []
for _ in range(n_reamostragens):
amostra = [rng.choice(prompts) for _ in range(k)] # com reposição
distribuição.append(taxa(amostra))
distribuição.sort()
baixo = distribuição[int(0.025 * n_reamostragens)]
alto = distribuição[int(0.975 * n_reamostragens)]
return taxa(prompts), baixo, alto
ponto, baixo, alto = ic95_bootstrap()
n_exec = sum(len(v) for v in execuções.values())
print(
f"taxa de menção {ponto:.1%} "
f"(IC 95%: {baixo:.1%} a {alto:.1%}; "
f"n={n_exec} execuções em {len(execuções)} prompts)"
)
# Leitura do resultado: com 6 prompts o intervalo sai largo, e isso é a resposta
# correta, não um defeito do código. Intervalo largo com n pequeno é o instrumento
# dizendo que você ainda não sabe. A saída é coletar mais, nunca estreitar o
# intervalo escolhendo um método mais generoso.Heurística de praticante para começar: rode quatro semanas em planilha manual antes de escrever qualquer automação. Você aprende a reconhecer a cara do ruído, que é a competência que nenhum script entrega. Depois automatize, e mantenha para sempre uma coleta manual mensal de dez prompts como controle da automação, porque coletor automático quebra em silêncio quando a interface muda e continua devolvendo número com aparência normal. Um coletor quebrado que devolve zero citações se parece muito com uma queda de desempenho.
O report mensal que sai desta etapa tem três níveis, na ordem que a diretoria lê. Nível 1, negócio: conversões orgânicas, de referral de IA, autodeclaradas e pago em IA. Nível 2, visibilidade: citação e menção por motor com modelo e execuções até a convergência, impressões em IA do Search Console, fatia de página própria e cobertura de feed. Nível 3, apoio, trimestral: sentimento, substituição, backlinks e prontidão para agentes.
As cinco linhas nunca se misturam: orgânico clássico; citação orgânica em IA, com modelo; referral de IA, sempre como piso; pago em IA, com fatia de respostas com anúncio, taxa de clique e custo por clique; conversão assistida e autodeclarada. Quem vende produto acrescenta cobertura de feed e presença no Shopping. A incerteza fica no bastidor: faixa e amostra, modelo e data, observado separado de inferido, controle declarado e execuções até a convergência aparecem no rodapé de cada número, nunca como aviso solto no corpo.
Relatório de medição honesta, em uma linha reportável
Preencha os campos e o parágrafo abaixo se monta sozinho. Ele foi desenhado para que seja impossível entregar um número sem instrumento, sem modelo, sem localidade, sem n e sem intervalo. Se algum campo ficar vazio, o marcador aparece no documento montado, e é essa lacuna que você leva para a reunião em vez de um número que não se sustenta.
Documento montado
RELATÓRIO DE MEDIÇÃO DE VISIBILIDADE
Métrica: {{metrica_nome}}
Resultado: [TAXA OBSERVADA], com intervalo de confiança de 95% de [INTERVALO DE CONFIANÇA DE 95%], sobre [NÚMERO DE EXECUÇÕES (N) ATÉ A CONVERGÊNCIA, E NÚMERO DE PROMPTS].
Instrumento e modelo declarados: [INSTRUMENTO E MODELO]. Localidade e idioma: [LOCALIDADE E IDIOMA]. Período: {{periodo_medido}}.
Calibração do instrumento: a marca-controle irrelevante registrou [TAXA DA MARCA-CONTROLE IRRELEVANTE]. Se essa taxa estiver próxima da taxa medida, o conjunto de prompts está induzindo a resposta e a rodada deve ser descartada antes de qualquer leitura.
Comparação com o período anterior: [COMPARAÇÃO COM O PERÍODO ANTERIOR, EM UMA DAS TRÊS FORMAS].
Limites desta medição: [O QUE ESTE NÚMERO NÃO PERMITE AFIRMAR].
Frase reportável, para o slide:
"{{metrica_nome}} de [TAXA OBSERVADA] (IC 95%: [INTERVALO DE CONFIANÇA DE 95%]; [NÚMERO DE EXECUÇÕES (N) ATÉ A CONVERGÊNCIA, E NÚMERO DE PROMPTS]; [INSTRUMENTO E MODELO]; [LOCALIDADE E IDIOMA]; {{periodo_medido}}). Contra o período anterior: [COMPARAÇÃO COM O PERÍODO ANTERIOR, EM UMA DAS TRÊS FORMAS]."
O que você digitar fica salvo neste navegador. Nada é enviado para servidor algum.
Pegue um enriquecimento que a sua equipe já fez nos últimos seis meses e que foi considerado um sucesso. Reconstrua, por escrito e sem consultar este texto, as sete etapas do Twin Branch como elas teriam sido aplicadas: métrica, gate definido antes, baseline, janela e saída do losango. Depois responda a pergunta que interessa: com a informação que existe hoje, esse enriquecimento teria passado, sido revertido ou ficado inconclusivo? Se a resposta for "não dá para saber", você acabou de encontrar o custo real de não ter medido baseline.
Tarefa executável no seu ambiente real, em 48 horas. Crie um arquivo prompts-v1-AAAA-MM-DD.txt no repositório da equipe com 20 prompts do seu nicho, escritos do ponto de vista de quem ainda não conhece a sua marca, sem citar o nome dela. Inclua duas marcas concorrentes e uma marca irrelevante para o tema, como controle. Rode cada prompt dez vezes em uma plataforma, com localidade, idioma e sessão limpa fixos, e registre por execução: prompt, data e hora, plataforma, modelo, busca ativada ou não, marca mencionada, domínios citados. Critério de sucesso: você entrega uma linha no formato padrão do relatório, taxa de menção com intervalo de confiança, n, instrumento e modelo declarados, mais a taxa da marca-controle. Se a marca irrelevante aparecer com taxa próxima da sua, o entregável correto é a conclusão de que o conjunto está mal calibrado, e a próxima tarefa é reescrever os prompts. Esse resultado negativo vale um trimestre inteiro, porque impede decisões tomadas sobre um instrumento quebrado.
Faça agora (20 min)
Cinco movimentos que a pessoa que decide executa sobre o último relatório recebido, sem abrir planilha nenhuma.
Passo 1: Procure a faixa ao lado de cada taxa
Toda taxa de menção, de citação por URL ou de recomendação precisa de intervalo, número de execuções, instrumento e modelo na mesma linha. Marque as que vieram soltas.
Deu certo quando: Cada número do relatório tem faixa e n, ou está marcado para devolução.
Erro comum: Aceitar "subimos de 14% para 19%" sem as faixas.
Passo 2: Pergunte se os intervalos se cruzam
Se as faixas do mês passado e deste mês se sobrepõem, a frase correta é sem mudança detectável, e é ela que vai para o slide.
Deu certo quando: Nenhum movimento dentro do ruído apresentado como resultado.
Passo 3: Exija o gate escrito antes da coleta
Para cada mudança que o relatório credita, peça a data do documento em que o critério de aprovação foi definido. Sem data anterior à coleta, o resultado é inconclusivo por definição.
Deu certo quando: Um gate datado por mudança creditada.
Erro comum: Gate ajustado depois de ver o número.
Passo 4: Peça o controle
Marca irrelevante no conjunto de prompts e, em teste de conteúdo, páginas do próprio domínio que não receberam a mudança. Sem controle, o crescimento pode ser da plataforma.
Deu certo quando: O relatório mostra o bruto e o descontado, como 5,7x e 1,82x.
Passo 5: Confira as quebras de série e o modelo
13 a 17/08 (Search Console), 26/08 (goto), 01/09 (GA4) e a troca de modelo do AI Mode em 02/09. Toda comparação que cruza essas datas leva nota, e toda leitura de AI Mode declara o modelo.
Deu certo quando: As quebras estão anotadas no calendário do relatório.
Erro comum: Comparar agosto com setembro sem a nota.
No fim você tem: a lista de números devolvidos por falta de faixa, os gates datados por mudança, o controle exigido por escrito e as quebras de série anotadas para o próximo relatório.
Resumo em três linhas: Medição de GEO tem três camadas com confiabilidades diferentes, e o número só entra no relatório com faixa, execuções até a convergência, instrumento e modelo. Manter ou reverter é decidido por um gate escrito antes da coleta, com controle na própria propriedade, e inconclusivo é uma saída legítima que não se confunde com aprovado. Na segunda-feira, devolva cada taxa sem faixa, peça o gate datado de cada mudança creditada e anote as quebras de série de agosto e setembro no calendário do relatório.
Report mensal em dez blocos, na ordem que a diretoria lê
Negócio primeiro
0/2Visibilidade e técnica
0/5Fechamento
0/3Perguntas frequentes deste capítulo
Meu diretor não aceita relatório com intervalo de confiança. Ele quer um número. O que eu faço?
Trinta execuções por prompt em cem prompts é inviável para a minha equipe. O que corto primeiro?
Posso usar uma ferramenta de mercado em vez de montar a coleta manual?
Se o intervalo quase sempre dá inconclusivo, qual o sentido de medir?
Todos os capítulos de GEO Universal Framework
- 01GEO em quinze minutos: o que mudou e o que você decide
- 02Sete princípios com fonte: como este curso trata o problema
- 03O que é SEO e por que a base decide o resto
- 04Busca sem clique: o que os números de 2026 dizem de verdade
- 05O que é GEO e como ler os números do mercado
- 06Qual robô de IA pode ler o seu site: decida por escrito
- 07Sua empresa como entidade: o que o Google documenta, o que inventaram
- 08Dados estruturados depois da poda: o que ainda rende resultado
- 09O motor escolhe onde buscar antes de responder: entre na lista
- 10Busca local: endereço, perfil e o que a IA consegue ver
- 11Mais de um idioma: o que muda para ser citado lá fora
- 12Site grande: quando as suas próprias páginas competem entre si
- 13Conteúdo feito com IA: o que o Google proíbe e o que já é detectável
- 14Riscos que a diretoria assina: injeção de prompt, LGPD e log
- 15Permitir, cobrar ou bloquear os robôs de IA: a decisão por escrito
- 16ChatGPT Ads no Brasil: separar pago de orgânico antes de comprar
- 17Medir sem se enganar: três camadas e o relatório oficial do Google
- 18Ciclo mensal: quatro fases, portão de saída e relatório em cinco linhas
- 19Operar com agentes: qual modelo para qual tarefa, e quando não orquestrar
- 20Ler um case sem cair no conto: a rubrica dos cinco portões
- 21De onde veio esse número: quatro passos antes de repetir
- 22A proposta de GEO chegou: dez perguntas antes de assinar
- 23Etapa 1: o diagnóstico em 16 pilares e o portão de entrada
- 24Etapa 2: robô certo entra, página existe sem JavaScript, markup ainda serve
- 25Etapa 3: escrever o trecho citável e provar que a IA citou
- 26Etapa 4: concentrar presença fora do site, e o custo de pulverizar
- 27Etapa 5: o site que o agente consegue ler, comparar e comprar
- 28Etapa 6: medir sem se enganar, e decidir manter ou reverter
- 29Etapa 7: 90 dias, três dependências e o critério de parada