Quanto do número pertence ao instrumento de medição?
Nas mesmas 7.436 respostas históricas do Perplexity, a taxa de detecção de entidades foi de 51,95% nos primeiros 200 caracteres Unicode e de 75,73% no texto retido disponível. A diferença de 23,78 pontos percentuais não exigiu uma nova pergunta, uma nova resposta ou uma mudança no modelo. Bastou mudar quanto do registro o extrator pôde ler.
Esse é o contraste pareado central do preprint empírico corrigido BRGEO-1, datado de 11 de setembro de 2026. A investigação audita 91.392 respostas persistidas em 56 datas, entre 23 de abril e 11 de setembro. É uma auditoria de medição em APIs de modelos de linguagem. O resultado não demonstra que uma intervenção de GEO aumentou a presença de uma marca.
Atualizei este artigo em 18 de setembro de 2026 para refletir essa versão corrigida. Ela substitui aqui os números e as interpretações da versão editorial anterior, inclusive as comparações entre provedores apresentadas como se fossem diretamente equivalentes. O manuscrito tem 41 páginas e ainda não passou por revisão por pares.
Para quem contrata um painel de visibilidade, a consequência é concreta: antes de comparar percentuais, peça a definição do evento contado e a evidência que sobreviveu à coleta. Menção, citação de fonte, URL própria e recomendação descrevem eventos diferentes. A pesquisa detecta nomes elegíveis de uma lista; não autoriza converter cada detecção em recomendação comercial.
O que a comparação dos mesmos registros mostrou?
A comparação relê as mesmas respostas com a mesma regra de correspondência. No prefixo de 200 caracteres, 3.863 respostas tinham ao menos uma entidade elegível. No texto retido, eram 5.631. As 1.768 ocorrências adicionais estavam fora do prefixo. Outras 1.805 respostas não apresentavam entidade em nenhuma das duas janelas.
| Leitura | Respostas positivas | Taxa de detecção |
|---|---|---|
| Primeiros 200 caracteres Unicode | 3.863 | 51,95% |
| Todo o texto retido disponível | 5.631 | 75,73% |
Fonte: Tabela 2 do preprint corrigido. A diferença é de 23,78 pontos percentuais, não de 23,78% de crescimento relativo. Nenhuma resposta positiva no prefixo se tornou negativa ao ampliar a leitura, como se espera quando a mesma correspondência lexical é aplicada a um texto que contém aquele prefixo.
A palavra “retido” é essencial. Nesse acervo histórico, os registros do Perplexity chegavam a 2.502 caracteres. Ler todo o registro disponível não prova que o provedor não tenha produzido texto além dele. Para os registros em que só os primeiros 200 caracteres sobreviveram, não existe como reconstruir a resposta original a partir do rótulo ou de um excerto.
O achado sustenta a necessidade de declarar a janela. Ele não permite atribuir toda diferença entre modelos ao truncamento. Também não transforma a leitura curta em medida de atenção do usuário: o estudo não observou o que as pessoas leram na tela.
Por que os percentuais dos provedores não viram um ranking?
O acervo histórico reúne 83.486 respostas em 50 datas de coleta. A bateria principal tem 192 perguntas, quatro setores, seis categorias e dois idiomas. Perguntas de sondagem e controles cumprem outros papéis. Somar todos os registros no denominador sem distinguir essas famílias modifica a pergunta estatística que o painel responde.
A versão corrigida também examina um recorte recente com 5.746 respostas da bateria principal e texto completo disponível. Há 272 combinações de pergunta e data compartilhadas pelos cinco provedores, mas elas cobrem apenas três datas. Nesse conjunto, ampliar a janela aumenta a detecção nos cinco serviços. A magnitude varia entre eles, o que não permite atribuir toda diferença entre provedores à janela ou produzir um ranking de qualidade.
Um ranking exigiria condições comparáveis de consulta, calendário, modelo, configuração, busca e retenção. Mesmo assim, o resultado valeria para a bateria observada. Os prompts do estudo não são uma amostra representativa das perguntas reais dos consumidores, e uma resposta da API não é automaticamente a resposta que alguém encontraria na interface pública do assistente.
Essa distinção muda a operação. Se um provedor falha na coleta, sua ausência não equivale a uma resposta sem menção. A taxa deve usar respostas válidas elegíveis e informar quais motores ficaram de fora. Ao comparar duas corridas, é preciso declarar se a composição mudou; caso contrário, uma variação do painel pode ser apenas uma troca do conjunto medido.
Quais interpretações a auditoria precisou retirar?
Um campo histórico chamado absorption_status copiava o indicador de menção em 33.052 linhas. O nome sugeria absorção semântica, mas a implementação não fornecia uma medida independente disso. A correção necessária é no significado atribuído ao campo: não há evidência para promover uma duplicação de rótulo a um novo fenômeno.
Os controles com entidades fictícias mostram outro limite. Houve 16.579 detecções lexicais de nomes de controle, e 11.195 dessas respostas também continham marcadores de recusa. Um modelo pode repetir o nome para explicar que não reconhece a entidade. Contar toda ocorrência como alucinação confundiria o objeto investigado com o método usado para encontrá-lo.
A auditoria identificou ainda 14.208 registros do Groq excluídos de um denominador composto, embora suas ocorrências entrassem no numerador, afetando 13 entradas. Indicadores com essa composição precisam ser recalculados antes de receber interpretação de negócio.
O denominador e a regra de ausência também alteram medidas de concordância. No estudo, tratar dois conjuntos vazios como concordância perfeita elevava o Jaccard agregado de 0,7423 para 0,9460; 79,05% dos pares eram vazios dos dois lados. Isso não representa, por si, concordância sobre quais empresas recomendar. Representa em grande parte concordância na ausência de detecção.
O que pedir antes de usar uma taxa de GEO para decidir?
Minha decisão prática é exigir um registro que permita voltar do percentual à resposta observada. Esse registro deve preservar o texto recebido, a pergunta, a data, o modelo solicitado e o modelo informado pelo provedor, além da versão do extrator. Quando um metadado não estiver disponível, a ausência deve ser explícita.
Peça também o número de tentativas, respostas válidas, erros e exclusões; a lista de perguntas; a condição de busca; a regra de correspondência; e a janela efetivamente retida. Um excerto serve para inspeção rápida, mas não substitui a evidência usada na classificação. Trocar a regra de leitura requer separar a nova série da antiga ou reprocessar os mesmos textos, quando eles existirem.
O conjunto completo de dados por resposta desta versão não está publicamente disponível. O manuscrito descreve procedimentos e código de análise, mas isso não significa que uma reprodução independente já tenha sido feita. O registro SSRN 7446519 pertence a uma versão anterior da mesma pesquisa; não deve ser contado como confirmação independente.
Declaro também meu vínculo com a Brasil GEO, que atua comercialmente no campo estudado. A licença CC BY 4.0 do manuscrito não implica licença irrestrita sobre todas as respostas dos provedores. Para conferir os resultados e os limites antes de aplicar a proposta, leia o PDF corrigido e consulte a referência bibliográfica desta versão.
Fontes
- CARAMASCHI, Alexandre. BRGEO-1: A longitudinal audit of entity-mention measurement in generative engines. Preprint empírico corrigido, 11 de setembro de 2026. Tabelas 1 a 4 e seções sobre validade da medição, disponibilidade de dados e limitações. Brasil GEO. Sem revisão por pares.