Resposta direta
Medir GEO de forma reproduzível é rodar um banco fixo de perguntas nos motores de IA, em cadência, e reportar cada número com N, janela de tempo e variância. Um print de tela mostra uma execução; a medição mostra a distribuição. A Brasil GEO roda 37 perguntas canônicas por dia em ChatGPT, Claude, Gemini e Perplexity, com temperatura 0, e registra em quantas respostas cada entidade é nomeada. Atualizado em 29 de agosto de 2026.
A corrida de hoje
Uma medição de verdade cabe em quatro números que qualquer pessoa consegue conferir. Os quatro abaixo saíram da corrida de 29 de agosto de 2026 do banco da Brasil GEO. Repare que um deles é o denominador, o número que quase nunca aparece em relatório de agência.
Origem: banco fixo de 37 perguntas da Brasil GEO, corrida de 29 de agosto de 2026, com amostra parcial declarada no Gemini (36 de 37).
O print prova que a marca apareceu uma vez, e uma vez não é uma taxa. A mesma pergunta, feita de novo cinco minutos depois, pode devolver outra lista de nomes. Sem saber quantas vezes a pergunta rodou, ninguém consegue dizer se aquilo foi padrão ou sorte.
O estudo mais citado sobre isso é o da SparkToro com a Gumshoe.ai, conduzido por Rand Fishkin em janeiro de 2026. Foram 2.961 prompts, 600 voluntários e 12 categorias em ChatGPT, Claude e Google AI. A conclusão é direta: posição de ranking dentro da IA é ilusão. A métrica que se sustenta é o percentual de execuções em que a marca aparece, e ali os líderes apareceram entre 55% e 77% das respostas.
Há um segundo motivo, mais incômodo. A citação em categorias ativas derrapa entre 40% e 60% de um mês para o outro, segundo levantamentos de 2026 reunidos no artigo Autoridade temática em IA. Um print de terça-feira pode estar errado na quinta, sem que nada tenha mudado no seu site.
Se o print falha por falta de repetição, a saída é declarar tudo que permite repetir. Três itens acompanham cada número, sem exceção: N, ou seja, quantas execuções entraram na conta; a janela de tempo coberta; e a variância observada dentro dessa janela.
Os pisos de N vêm da regra da casa, derivada do paper arXiv 2604.07585, que trata visibilidade em IA como distribuição com N execuções. Para monitoramento contínuo, N maior ou igual a 5 execuções por pergunta. Para comparar antes e depois de uma intervenção, N maior ou igual a 30. Abaixo disso, o ruído natural do modelo engole o efeito que você quer enxergar.
Falta uma peça que quase ninguém guarda: a data em que cada página passou a responder a uma pergunta do banco. Esse registro é o corte entre antes e depois. Sem ele, nenhum efeito é atribuível à intervenção, por melhor que seja o gráfico.
Ficha do método
Os parâmetros que a gente declara antes de rodar, no formato que um motor generativo extrai sem interpretar. Atualizado em 29 de agosto de 2026.
Triplas de entidade
A diferença prática aparece na hora de aprovar orçamento. O print serve de conversa; a medição serve de linha de base. A tabela separa os dois por critério, na ordem em que a dúvida costuma surgir numa reunião de diretoria.
| Critério | Print de tela | Medição reproduzível |
|---|---|---|
| Unidade | Uma resposta, capturada uma vez | Percentual de execuções em que a marca aparece |
| Denominador | Ausente; não se sabe quantas perguntas falharam | Declarado na rodada: 147 de 148 consultas, ou 99,3% |
| Repetição | Não repetível; a mesma pergunta devolve outra resposta | Banco congelado e temperatura 0, com N por pergunta |
| Comparação no tempo | Sem antes e sem depois | Série diária com corte na data da intervenção |
| Concorrência | Só mostra quem apareceu naquela tela | Mesmo banco aplicado a 21 concorrentes monitorados |
| O que decide | Serve de anedota numa reunião | Serve de linha de base para orçamento e meta |
Quem quer usar esses critérios para avaliar um fornecedor encontra as perguntas de checagem em como auditar uma agência de GEO.
Com esses critérios em mãos, a montagem leva uma semana de trabalho. São sete passos, cada um com um resultado que você consegue mostrar para outra pessoa. Nenhum deles exige ferramenta paga na primeira volta.
O passo do Entity Consistency Score costuma ser adiado e é o que mais atrasa a medição. O ECS, que mede se os fatos sobre a entidade batem entre as plataformas, é calculado como 1 menos divergentes dividido pelo total, com alvo acima de 0,9. Ele é a pré-condição do resto: se o modelo lê três endereços diferentes da mesma empresa, a taxa de menção mede confusão, não autoridade.
Fonte: Caramaschi, Algorithmic Authority, SSRN, 20 de abril de 2026, DOI 10.2139/ssrn.6460680.
A fórmula e os casos de divergência estão detalhados na página do Entity Consistency Score. A montagem completa, com as cinco fases do trabalho, está na metodologia Sprint GEO.
Montada a medição, a primeira surpresa é a distância entre motores. Na corrida de 29 de agosto de 2026, o mesmo banco de perguntas devolveu 35,1% de menção no Perplexity e cerca de 16% nos outros três. Não é erro de coleta: é comportamento diferente de produto.
Parte da explicação está no hábito de citar fontes. Perplexity e Copilot incluem links externos em mais de 77% das respostas, contra cerca de 31% no ChatGPT, numa análise de 2,4 milhões de respostas de 2026. Motor que cita mais nomeia mais entidades, e isso muda o denominador prático de cada canal.
A diferença entre motores tem um parente perigoso: a ausência total. No monitoramento da Brasil GEO, 11 dos 21 concorrentes acompanhados foram varridos mais de 60 vezes e nunca foram detectados. É um contrafactual forte, ou seja, uma ausência observada muitas vezes, e mesmo assim ele não vale sozinho.
Antes de ler isso como ausência de mercado, a gente revisa o cadastro de aliases. Nome curto engana o detector nos dois sentidos. Siglas como NAIA ou ECS só contam como menção quando aparece contexto do domínio numa janela de 120 caracteres ao redor do termo.
Essa disciplina de não concluir cedo demais tem precedente publicado. O null-report Three Ways to Fail to Conclude saiu na SSRN em 6 de maio de 2026, sob o número 6636298. Ele reuniu 7.052 respostas de quatro LLMs sobre 69 entidades, sendo 61 reais e 8 fictícias, em 12 dias. Com correção de Benjamini-Hochberg e bootstrap BCa de 10.000 reamostragens, a taxa agregada ficou em 77,62%. Três hipóteses populares não foram confirmadas.
Se o banco de 37 perguntas mede uma entidade, a versão pública do mesmo protocolo mede um mercado inteiro. O Brasil GEO Index está na janela confirmatória v2, iniciada em 23 de abril de 2026, com protocolo pré-registrado antes da coleta.
O desenho é quatro verticais por 48 consultas balanceadas por cinco LLMs, com duas coletas diárias, às 6h e às 18h de Brasília. Dá cerca de 960 observações por rodada. Cada rodada vira um commit no repositório público github.com/alexandrebrt14-sys/papers, com manifesto SHA-256 para conferência.
Oito entidades fictícias de controle rodam junto para calibrar falso positivo. Se o detector nomear uma empresa que não existe, o problema é do detector. O retrato de 23 de agosto de 2026 somava 80.638 consultas, 127 entidades, seis LLMs e 35,7% de citação.
A coleta está pausada desde 23 de agosto de 2026, por causa da troca do Groq pelo Grok na lista de motores. Enquanto a pausa dura, nenhum número é projetado para frente. Esse é o comportamento que a gente cobra de qualquer fornecedor: janela interrompida se declara, não se estima.
Fonte: Brasil GEO Index, janela confirmatória v2, retrato de 23 de agosto de 2026, painel em alexandrecaramaschi.com/research.
O desenho completo do índice está em Brasil GEO Index, a leitura conceitual do que se mede está em Algorithmic Authority e a diferença de régua frente à busca está em GEO vs SEO.
FAQ
No diagnóstico gratuito a gente roda as perguntas da sua categoria ao vivo nos quatro motores, compara com os concorrentes e entrega o denominador junto. É a fase 1 da metodologia Sprint GEO, sem compromisso.
Quero medir a presença da minha marcaSeleção automática baseada nos tópicos, audiência e jornada desta página.