Conclusões corrigidas do BRGEO-1
O projeto Papers concluiu a coleta. Os agendamentos foram desligados e novas coletas estão bloqueadas. O acervo, o código e as análises existentes permanecem disponíveis para consulta; as propostas de pesquisa abaixo dependem de um novo estudo.
O BRGEO-1 mostra que presença de um nome no texto depende da janela textual, do denominador e do tipo de pergunta. A taxa de menção, isoladamente, não demonstra recomendação, endosso ou citação de uma fonte verificável.
| Recorte | Respostas persistidas | Composição e período |
|---|---|---|
| Histórico | 83.486 | 66.399 da bateria principal + 17.087 sondas; 50 datas UTC, até 31/08/2026. |
| Atualização do artigo | 91.392 | 72.145 da bateria principal + 19.247 sondas; 56 datas UTC, de 23/04 a 11/09/2026. |
Respostas persistidas são registros salvos, com repetições e dependência entre observações. As 56 datas não representam uma série diária contínua, e esses números não são denominadores de eventos independentes.
Cortar o texto muda o resultado
Nas mesmas 7.436 respostas históricas do Perplexity, o mesmo extrator congelado detectou menção em 75,73% dos textos retidos e em 51,95% dos prefixos de 200 pontos de código.
A redução foi de 23,78 pontos percentuais: 1.768 positivos deixaram de ser detectados. O teste compara duas janelas do mesmo texto; não compara um detector antigo com um novo.
Uma recusa pode conter o nome
Em 11.195 de 16.579 respostas elegíveis das sondas fictícias, houve simultaneamente marcador lexical do nome e correspondência à regra lexical de recusa ou indisponibilidade: 67,53%.
Esse cruzamento não é uma taxa validada de recusa ou de alucinação. Um modelo pode repetir o nome inventado enquanto informa que não conhece a entidade.
| Escolha auditada | Resultado observado | Consequência |
|---|---|---|
| Contar dois conjuntos vazios como estabilidade perfeita | 31.372 de 39.686 pares de datas tinham ambos os conjuntos vazios. O índice Jaccard foi de 0,7423 nos pares informativos a 0,9460 incluindo vazios como similaridade um. | A aparente estabilidade depende da convenção de ausência, não apenas de persistência de menções. |
| Tratar aliases como entidades independentes | Amazon e Amazon Brasil apareceram como dois rótulos do mesmo trecho em 316 respostas. Ao unificá-los, a diversidade efetiva no varejo passou de 5,203 a 4,589, com 3.838 respostas positivas preservadas. | A resolução de identidade muda diversidade sem mudar quantas respostas têm menção. |
| Usar populações diferentes no numerador e no denominador | O painel ativo excluía 14.208 respostas Groq da elegibilidade, enquanto o numerador original ainda contava esse braço. | O denominador precisa seguir a mesma regra de elegibilidade do numerador. |
| Interpretar um campo como medida independente | Nas 33.052 linhas preenchidas, absorption_status repetia cited por atribuição direta no código. | O nome de uma coluna não valida o fenômeno que ela pretende medir. |
Na extensão recente dos contrastes entre janelas de texto, a auditoria restringiu a análise a 272 células comuns de pergunta e data, entre 08 e 10/09, com 2.096 respostas. Cada célula recebeu peso igual após promediar repetições. Essa análise reduz a desigualdade de cobertura do recorte, mas não transforma o estudo observacional em ranking universal de provedores.
Fonte: BRGEO-1, revisão empírica corrigida de 11/09/2026, disponível no Zenodo. Os indicadores do painel legado usam outro recorte e não substituem esses resultados.
Os filtros e gráficos preservam o agregado legado de 92.064 consultas. O artigo descreve 91.392 respostas persistidas em outro recorte; a diferença de 672 não recebe causa presumida. Taxas, rankings, sentimento e intervalos do painel são saídas históricas do instrumento, sem validação como endosso, recomendação ou citação factual.
O recorte atualiza consultas, citações, comparação de modelos e entidades. Os demais indicadores estão identificados como base completa.
Base completa · 92.064 consultas. Ranking ordenado por mais citações.
Visão geral
Comparações temporais do acervo
As datas e os volumes da série histórica continuam disponíveis em Qualidade e custos. Testes semanais automáticos deixaram de ser apresentados como prova de ganho ou perda: faltantes, dependência entre respostas e mudanças de instrumento exigem inferência específica por recorte.
Leituras descritivas do detector legado
Base completa · todos os verticais
Maior taxa de citação entre os 6 LLMs (6575 citadas em 8893 queries). Este é o ranking do detector legado no acervo congelado; não equivale a citação verificada.
23084 queries no vertical, 10060 com citação. Leitura descritiva do detector legado, sujeita às correções do BRGEO-1.
Maior contagem de nomes detectados no agregado operacional legado. 1,7× mais citações que o segundo colocado (Mercado Livre).
O detector classificava nomes e links; essa classificação não verifica existência, endosso ou validade da fonte.
Posição registrada no primeiro terço do texto analisado pelo detector legado, sem inferência de impacto ou recomendação.
Variação de contagens não demonstra efeito de uma intervenção
Os rankings preservam o último agregado do detector. Atribuir mudanças a conteúdo, marca ou ação de marketing exige um novo desenho com controles; o acervo observacional não estabelece essa causalidade.
Comparação entre modelos de IA
Base completa · taxa do detector legado · 6 modelos
Perplexity
Perplexity AI
Grok
xAI
Claude
Anthropic
ChatGPT
OpenAI
Groq
Groq
Gemini
Comparação entre verticais
Base completa · todos os verticais
Fintech
Varejo
Tecnologia
Saúde
Matriz cruzada — LLM × Vertical
Base completa · todos os verticais
Identifica gaps de cobertura
| Vertical / LLM | Perplexity | Claude | ChatGPT | Gemini | Groq |
|---|---|---|---|---|---|
| Fintech | 84,0% n=2249 | 62,0% n=5123 | 36,3% n=5088 | 23,8% n=5280 | 29,7% n=4576 |
| Saúde | 67,7% n=2208 | 31,2% n=5098 | 27,2% n=5088 | 18,7% n=5280 | 27,0% n=4576 |
| Tecnologia | 55,3% n=2208 | 30,5% n=5022 | 37,9% n=5088 | 18,4% n=5258 | 26,9% n=4576 |
| Varejo | 88,5% n=2228 | 46,1% n=5152 | 39,4% n=5088 | 21,2% n=5280 | 32,3% n=4576 |
Células com borda tracejada têm amostra abaixo de 30 (n<30) — leitura descritiva com base pequena; o corte não substitui análise de precisão. Ver avisos abaixo.
Ranking de entidades citadas
Base completa · 30 entidades com citação detectada
30 de 30 entidades · citações detectadas
Observação: as entidades nesta listagem vêm da tabela citation_context, com extração granular já consolidada nos quatro verticais (Fintech, Saúde, Tecnologia e Varejo). O ranking é absoluto por número de citações detectadas; veja o catálogo completo abaixo para a cobertura por roster de cada vertical.
Catálogo de empresas monitoradas
Base completa · empresas do cadastro de monitoramento
O projeto monitora 111 empresas reais e 16 entidades fictícias para detectar falsos positivos. O catálogo abaixo segue o recorte selecionado. O símbolo de confirmação e a contagem identificam empresas com citações detectadas. A cobertura considera apenas as empresas do cadastro de cada vertical; âncoras internacionais e entidades de controle ficam fora desse cálculo.
61 empresas exibidas em 4 verticais. A busca não altera os denominadores da cobertura.
Fintech & Bancos Digitais
16 empresas12 de 16 empresas do roster com citação (75% de cobertura)
- Nubank5379
- PagBank449
- Cielo5
- Stone279
- Banco Inter848
- Mercado Pago622
- Itaú331
- Bradesco543
- C6 Bank952
- PicPay1164
- Ame Digital
- Neon467
- Original
- BS2
- Safra3
- Banco Carrefour
Varejo & E-commerce
15 empresas8 de 15 empresas do roster com citação (53,3% de cobertura)
- Magazine Luiza2770
- Casas Bahia545
- Ponto Frio
- Americanas1110
- Amazon Brasil672
- Mercado Livre3146
- Shopee Brasil
- AliExpress Brasil
- Leroy Merlin
- Tok&Stok
- Renner117
- Riachuelo2
- C&A Brasil
- Centauro
- Netshoes40
Saúde & Farmacêuticas
15 empresas14 de 15 empresas do roster com citação (93,3% de cobertura)
- Dasa132
- Hapvida163
- Unimed35
- Eli Lilly Brasil
- Raia Drogasil190
- Fleury165
- Rede D'Or8
- Einstein208
- Sírio-Libanês249
- Eurofarma759
- Aché435
- EMS1253
- Hypera Pharma846
- NotreDame Intermédica29
- SulAmérica Saúde20
Tecnologia & TI
15 empresas9 de 15 empresas do roster com citação (60% de cobertura)
- Tivit78
- Accenture Brasil5
- Stefanini266
- Totvs1411
- Linx16
- Locaweb109
- Positivo Tecnologia
- Movile255
- CI&T301
- Vivo Empresas
- Embraer
- WEG
- Natura &Co
- iFood310
- 99
Qualidade dos dados
Base completa · todos os verticais
Sentimento das menções
- Neutro28976 (78.4%)
- Positivo7893 (21.3%)
- Negativo107 (0.3%)
Tipo de atribuição
- Nomeada (named)36964 (100.0%)
- Apenas linkada12 (0.0%)
Posição na resposta
- Início (1º tercil)15814 (42.8%)
- Meio (2º tercil)11803 (31.9%)
- Fim (3º tercil)9359 (25.3%)
Custos: o agregado não contém um total reconciliado
A cópia final preserva consultas e detecções, mas não inclui o custo completo do projeto. Ausência de valor não significa gasto zero. Os checkpoints financeiros permanecem no repositório; os agendamentos de novas coletas estão desligados.
Consultar critérios de orçamento, precisão e redução de tokens para um próximo estudo.
Série temporal de coleta
Base completa · todos os verticais
Taxa de citação por categoria de query
Base completa · todos os verticais
Qual tipo de pergunta dispara mais citações espontâneas? Ordenado pela taxa.
Português × Inglês — LLMs citam mais em qual idioma?
Base completa · todos os verticais
Distribuição de sentimento por LLM
Base completa · todos os verticais
Latência de resposta por LLM
Base completa · todos os verticais
Gap de cobertura — marcas do roster ainda não citadas
Base completa · todos os verticais
Oportunidade de GEO: marcas monitoradas que ainda não receberam menção espontânea dos LLMs em queries-alvo.
Avisos e metodologia
Base completa · todos os verticais
Limites estatísticos identificados
- Top entidades concentradas em Fintech: a concentração em marcas-âncora deve ser examinada antes de interpretar a média setorial. O projeto está encerrado.
Como os dados foram coletados
- Fonte: papers.db (92064 queries dataset)
- Pipeline: 7 módulos Python rodando contra APIs oficiais (Perplexity AI, xAI, Anthropic, OpenAI, Groq, Google)
- Validação: 16 entidades fictícias inseridas para detectar falsos positivos
- Atribuição named (100%): menção pelo nome próprio, não apenas link
- Análise de sentimento: classificador automático (3 classes)
- Ver Papers Roadmap completo →
Qual período estes dados representam?
Janela nominal, respostas persistidas e encerramento
O planejamento v2 definiu uma janela nominal de 23/04 a 21/07/2026. A série incluiu observações posteriores; a revisão corrigida separa o histórico até 31/08 da atualização até 11/09. A coleta terminou definitivamente em 11/09/2026.
O campo de data projetada no JSON legado, 15/10/2026, permanece preservado no arquivo de origem para rastreabilidade. Não é um prazo vigente e não ativa coleta. As 56 datas UTC observadas no artigo incluem lacunas; dias ausentes não foram preenchidos.
O painel conserva o agregado operacional de 92.064 consultas. O snapshot do artigo contém 91.392 respostas persistidas, sendo 72.145 da bateria principal e 19.247 sondas. Esses totais não representam registros únicos nem observações independentes.
Como a procedência da cópia final pode ser conferida?
O site usa uma cópia versionada do JSON gerado em 11 de setembro de 2026 às 19:57 (BRT). Ambas as páginas leem o mesmo arquivo local, sem buscar uma versão mais recente ou cair em uma cópia antiga.
SHA-256: ea9f7926c873b82192849734b3c84c7be2117b6d44dc2c67eb8677890eff3bb4.
O que a medição não consegue demonstrar?
A conclusão do estudo é sobre a validade da medição. O desenho não permite atribuir variação de menções a uma ação de marketing, comparar fornecedores como se fossem condições idênticas ou inferir conhecimento a partir de uma correspondência de nome.
- Texto retido não é necessariamente resposta integral. Limites de armazenamento e truncamento precisam acompanhar cada resultado; o trecho salvo pode omitir menções posteriores.
- Consulta da bateria principal e sonda fictícia têm funções distintas. Misturá-las muda a pergunta estatística e contamina o denominador.
- Versão de modelo e data são parte do instrumento. Groq e Grok são braços históricos distintos. A série registra mudanças de cobertura, execução e provedor.
- Zero precisa de procedência. Uma ausência pode resultar de nenhuma correspondência, resposta vazia, falha técnica ou falta de observação. Esses estados exigem rótulos diferentes.
- Repetição não produz independência. Reanálises precisam considerar dependência temporal, repetição de prompts e concentração de entidades.
- Controle lexical não valida significado. Aliases, eco do prompt, negação e recusa exigem inspeção contextual e validação humana antes de uma interpretação semântica.
O código está disponível. O preprint não disponibiliza publicamente o conjunto completo por resposta; o pacote de auditoria permanece sob custódia do autor. Disponibilidade do código e disponibilidade dos dados são compromissos diferentes.
Aprendizados e melhorias de método
As falhas documentadas mudam o critério de qualidade para pesquisas futuras: cada número deve poder ser refeito a partir de uma resposta identificada e de uma regra versionada. A execução sem erro é apenas uma etapa dessa prova.
| Falha ou limite | Aprendizado | Critério para o próximo estudo |
|---|---|---|
| Execuções verdes sem dado novo | O sucesso do workflow não prova persistência. | Conferir aumento de registros elegíveis, último instante gravado e integridade antes de declarar uma rodada concluída. |
| Recuperação de base antiga e sincronização silenciosa | Uma restauração pode parecer válida enquanto regride o acervo. | Usar manifesto, hash, contagem mínima e teste de restauração; falhar de modo explícito se a cópia exigida estiver ausente. |
| Prefixo textual tratado como texto completo | O corte afeta a sensibilidade da detecção. | Registrar tamanho retido, tamanho recebido quando disponível, motivo do corte e análise pareada de sensibilidade. |
| Nome fictício contado sem contexto | Menção pode coexistir com negação e recusa. | Separar reconhecimento lexical, posição do modelo, recomendação e referência verificável, com amostra anotada por humanos. |
| Troca de modelo e lacunas | Uma série longa pode reunir instrumentos diferentes. | Versionar cada observação, publicar um registro de ausências e exigir janelas comparáveis para análise temporal. |
| Crédito esgotado confundido com chave inválida | Causas distintas pedem respostas distintas. | Distinguir orçamento, autenticação, indisponibilidade e timeout em logs estruturados; não repetir chamadas pagas sem limite. |
Essas medidas são sugestões para um protocolo posterior. O encerramento atual preserva as evidências e bloqueia novas coletas; não cria uma rotina adicional de pesquisa.
Sugestões para pesquisas posteriores
Planejamento preliminar de 11/09/2026 · histórico
Esta proposta preliminar preserva as sugestões feitas no encerramento do BRGEO-1, em 11/09/2026. A especificação vigente da PesquisaGeo2027 foi definida em 12/09/2026: Anthropic, Google, xAI e OpenAI, com 90 datas qualificadas em até 180 dias e teto de US$20 por data no conjunto. Os estudos permanecem separados.
A proposta abaixo usava três meses de calendário. A regra vigente exige 90 datas distintas qualificadas, não necessariamente consecutivas, entre 01/10/2026 e 29/03/2027, com horário nominal de 05h de São Paulo. O piloto permanece separado; faltantes não viram zeros, e atingir 90 datas não demonstra, por si só, precisão suficiente.
Três frentes que aproveitam o aprendizado do projeto
Preparação com o acervo
Reanalisar antes de gastar
Reprocessar textos preservados, comparar janelas, resolver aliases e testar a influência de entidades dominantes. Extrações determinísticas podem rodar localmente; seus resultados precisam apontar para o texto e a regra que os produziram.
A entrega é uma base para calibrar o novo desenho. Reusar uma resposta antiga não cria outra observação longitudinal.
Novo painel longitudinal
Comparar condições identificáveis
Manter perguntas sentinelas e uma rotação planejada, com os serviços elegíveis nas mesmas células de pergunta e data. Separar idioma, superfície, busca e época de modelo; registrar o que não for observável.
A série diária das sentinelas e os agregados da bateria rotativa têm coberturas diferentes. Os pesos não podem dar vantagem a uma pergunta apenas porque ela foi repetida mais vezes.
Experimento editorial, se houver viabilidade
Testar páginas ou temas com tratamento estável
Sortear grupos de páginas ou tópicos entre intervenção e controle, preservar o HTML servido e registrar versão, hash, período de referência e mudanças paralelas. O teste A/B de visitantes mede outra exposição: cookies não demonstram qual variante um motor observou.
Servir a mesma versão experimental para pessoas e robôs, sem diferenciação oculta por agente. Considerar atrasos de indexação e contaminação por links ou templates compartilhados. Sem grupos suficientes e exposição avaliável, manter o estudo descritivo; um antes/depois isolado não prova efeito causal.
O que o repositório permite aproveitar e o que precisa ser construído
Inventário documental do site no commit 653e6438. A inspeção do código não comprova migração aplicada, agendamento ativo ou implantação dessas adaptações. O estudo futuro precisa de dados e contabilidade separados do produto comercial e do Papers encerrado.
| Capacidade | Base observada | Requisito para outro estudo |
|---|---|---|
| Monitor de citações | Quatro adaptadores, banco de perguntas, rotação e controle de concorrência aparecem no código. | Criar tarefas duráveis e gravação incremental. O limite atual de tempo não é limite financeiro; congelar perguntas separadamente do conteúdo editorial que elas também alimentam. |
| Fila do GEO Checker | Há aquisição atômica de trabalho e recuperação de tarefas interrompidas. | Unir reserva de orçamento e admissão na mesma transação. A consulta financeira separada e as exceções de quota comercial não servem como teto rígido de pesquisa. |
| Respostas e fontes | O monitor salva excertos; sondas guardam texto bruto ou URLs, com riqueza diferente entre rotas. | Preservar um objeto completo por tentativa e arquivar fontes selecionadas com acesso permitido. URL presente não comprova suporte à afirmação. |
| Custos e cache | Existem estimativas por tokens e cache de produto por domínio, versão e capacidade. | Conciliar todas as tentativas: custo zero em uma falha não prova gratuidade. Identificar contexto e protocolo; cache de produto não gera réplica científica. |
| Triagem de concorrentes | A varredura estática e o planejador da etapa aprofundada estão presentes. | O plano não demonstra execução paga. Manter a coorte principal; selecionar apenas alvos já citados favoreceria os mais visíveis. |
| Classificação e testes | Há regras locais, validadores, testes de execução e utilitários estatísticos. | Validar contra humanos independentes e simular dependência temporal. Teste de software e concordância entre motores não validam o desfecho científico. |
O protocolo baseado no site registra caminhos, evidências do código e a separação entre capacidade existente, adaptação necessária e proposta ainda não executada.
Como o estudo passa da proposta à publicação
As responsabilidades abaixo organizam o trabalho futuro. Cada passagem exige um artefato verificável e pode reprovar o plano; nenhuma fase está agendada.
Preparar sem novas consultas
Responsabilidade: Ciência, engenharia e curadoria.
Entrega: Pergunta primária, rubrica, matriz de capacidades, tarefas simuladas e teste de restauração.
Critério de avanço: Avançar quando o arquivo e a contabilidade puderem ser refeitos. Falha de integridade ou duplicação impede o piloto.
Validar no piloto
Responsabilidade: Ciência e FinOps.
Entrega: Referência humana reservada, distribuição de custos, falhas e simulação de precisão por contraste.
Critério de avanço: Aprovar apenas um desenho que caiba no orçamento e atenda aos critérios definidos antes. Se nenhum passar, reformular o escopo.
Congelar o protocolo
Responsabilidade: Responsável científico e revisão técnica.
Entrega: Datas, perguntas, superfícies, versões, parâmetros, pesos, limites e regras de pausa versionados.
Critério de avanço: Liberar outro estudo somente com plano revisado e recursos previstos. Sem configuração ou custo verificável, não iniciar.
Observar por três meses completos
Responsabilidade: Operação e curadoria.
Entrega: Tarefas, tentativas, respostas, ausências, versões e gastos ligados às mesmas células de pergunta e data.
Critério de avanço: Pausar diante de falha de qualidade, mudança de instrumento ou limite de orçamento. Uma execução verde não substitui dados íntegros.
Encerrar e analisar
Responsabilidade: Ciência e revisão independente.
Entrega: Acervo final, reconciliação de custos, cobertura, estimativas e análises de sensibilidade previstas.
Critério de avanço: Após o período mínimo, avaliar os critérios de precisão. Resultado inconclusivo é possível; extensão exige decisão e orçamento próprios.
Publicar um pacote reproduzível
Responsabilidade: Responsável científico e curadoria.
Entrega: Manuscrito, código, manifesto, dados com acesso permitido e instruções de reprodução.
Critério de avanço: Outra pessoa deve conseguir refazer as tabelas permitidas. Não anunciar dados abertos antes de disponibilizar o pacote correspondente.
Como validar rótulos, juízes e incerteza sem multiplicar chamadas
| Decisão proposta | Como verificar | Evidência e limite |
|---|---|---|
| Preservar o julgamento humano | Rubricas distintas para menção, recusa, recomendação, citação e suporte factual; dois avaliadores, rótulos individuais, adjudicação e conjunto reservado. | Elangovan et al., ICLR 2025: publicação de conferência. Correlação agregada pode ocultar desacordo; a rubrica local ainda precisa ser validada. |
| Calibrar o juiz e seu erro | Comparar a estimativa humana com a assistida, incluindo incerteza da calibração, classes raras e auditoria aleatória de respostas em que os juízes concordam. | Chen et al., 2026 e Mukherjee et al., v2 de 2026: preprints consultados. Independência e consenso não podem ser presumidos neste painel. |
| Separar deriva do serviço e do avaliador | Sentinelas recebem respostas novas; um arquivo fixo permite verificar mudanças do juiz. Reavaliar o arquivo não conta como coleta fresca. | Wiese, PLOS One 2026: artigo de periódico. Motiva ancoragem humana longitudinal; suas dez semanas não satisfazem o prazo deste plano. |
| Economizar primeiro na anotação do arquivo | Comparar seleção ativa com seleção probabilística em corpus congelado, registrando probabilidades e pesos. Só adotar ganho que sobreviva à avaliação reservada. | Wu, Nair e Candès, v3 de 2026: preprint. Seu alvo de população finita não valida automaticamente adaptação da coleta ao longo do tempo. |
Na comparação direta entre humano e juiz, usar uma referência humana independente de quem está sendo avaliado. Anotar apenas casos difíceis ajuda a desenvolver a rubrica, mas não estima sozinho o erro de toda a população. A auditoria de desempenho precisa de seleção probabilística independente ou pesos conhecidos, com incerteza por classe e estrato. Um segundo juiz só entra se demonstrar ganho que justifique custo e latência no mesmo conjunto humano reservado.
As simulações devem considerar dependência por pergunta e data, autocorrelação, mudança de versão, faltantes e erro de anotação. Não aplicar uma fórmula para observações independentes como solução pronta. Réplicas são dimensionadas pelo alvo científico; reduzir temperatura ou o limite de saída para aparentar estabilidade muda a condição de medição.
Separar superfície, citação, fonte e efeito editorial
API e interface pública são instrumentos distintos. A bateria principal deve identificar endpoint, modelo solicitado e retornado quando exposto, idioma, horário, estado de sessão, localização e modo de busca. Uma subamostra previamente selecionada pode estudar a interface pública se o acesso e os termos permitirem; seu resultado não é somado à API como réplica equivalente.
Disponibilidade, recuperação, citação e suporte são etapas diferentes. Uma URL citada não demonstra que a fonte sustenta a afirmação. Quando a recuperação interna não é exposta, o estado é desconhecido. Registrar URL original e final, acesso, instante e captura permitida dos documentos auditados; a página vista semanas depois pode ter mudado.
Search Arena, ICLR 2026, motiva separar preferência humana de factualidade. SourceBench, 2026, é um preprint útil para distinguir qualidade da página e suporte à afirmação; não fornece um avaliador automaticamente validado para PT-BR.
No experimento editorial, pré-especificar efeito por alocação, agrupamento por página ou tema, múltiplos testes e controles negativos. Não selecionar a análise principal apenas entre páginas citadas após a intervenção. O novo protocolo precisa controlar mudanças de templates, links e conteúdo que possam alcançar também o grupo de controle.
Orçamento de execução: limites rígidos ainda precisam de implementação e prova
Contar chamadas pelas células de pergunta × serviço × data × repetições é o início. O orçamento completo inclui validação humana, juízes, buscas, ferramentas, cache, armazenamento e tentativas adicionais. Conferir produto, endpoint, unidades e vigência da tarifa; não transportar um desconto entre provedores ou modelos.
Custo conciliado + reservas em aberto + custo máximo da nova tarefa + compromissos de armazenamento devem caber no teto aplicável. A reserva precisa ser atômica e persistente: dois trabalhadores não podem gastar o mesmo saldo. Essa é uma exigência para o novo coletor, não uma garantia já implementada no projeto.
- Reservar antes de enviar. Conferir limites por tarefa, período e estudo. Manter provisionadas chamadas em andamento e conciliar o uso efetivo depois. Se não há limite verificável de uma ferramenta faturável, a configuração não atende ao requisito de teto rígido.
- Falha não significa custo zero. Timeout pode deixar resultado incerto; raciocínio pode consumir tokens sem texto visível. Uma repetição paga exige nova reserva e continua ligada à tarefa original. Não liberar saldo apenas porque o cliente deixou de esperar.
- Lotes precisam caber na pergunta temporal. Processamento assíncrono pode atravessar a janela de comparação. Guardar horários efetivos, IDs e resultados parciais; reservar o lote inteiro. Cancelamento não é necessariamente imediato, e desconto não é universal.
- Cache tem mínimo e validade. Medir o ganho com o prefixo e a cadência reais. Não aumentar o prompt com texto sem função científica para atingir um limiar, nem tratar resposta local reutilizada como observação nova.
- Preservar o objeto recebido. Guardar texto, referências, uso e razões de término; derivar recortes depois. Resultados temporários do fornecedor precisam ser recolhidos e conferidos antes de expirar, com manifesto e restauração testada.
Versões e capacidades também são parte do custo: aliases podem mudar, parâmetros podem não ser suportados e cotas podem ser compartilhadas pelo projeto. A pausa deve mostrar sua causa. Trocar silenciosamente de modelo, reduzir saídas ou deslocar consultas para outro dia não é uma forma válida de manter o plano completo.
Documentação oficial consultada em 11/09/2026: OpenAI, lotes e respostas incompletas; Claude, cache; Gemini, preços e cotas; Perplexity, unidades de cobrança; xAI, ferramentas, armazenamento e lotes. Revalidar as condições antes do piloto e do estudo principal.
Cenários ilustrativos de chamadas: coberturas diferentes, sem precisão garantida
Este exemplo contábil mantém 92 dias que cubram três meses completos, cinco serviços, uma resposta-base por célula, 10% de réplicas novas e reserva de até 5% para tentativas adicionais. Não há datas marcadas nem tamanho amostral aprovado. Os gastos do piloto e da validação exigem planejamento próprio.
| Plano hipotético | Chamadas-base | Com réplicas | Máximo com reserva |
|---|---|---|---|
| 12 prompts por dia | 5.520 | 6.072 | 6.376 |
| 24 prompts por dia | 11.040 | 12.144 | 12.752 |
| 24 sentinelas + 42 prompts rotativos por dia | 30.360 | 33.396 | 35.066 |
Doze prompts continuam sendo apenas doze grupos de perguntas, mesmo repetidos por três meses. A rotação não estima a série diária de cada prompt com a cobertura de uma bateria completa. Escolher o menor plano que passe na simulação de precisão e cobertura; se nenhum couber, restringir a pergunta antes de iniciar.
Tokens não equivalem a chamadas. Medir entrada e saída, raciocínio e ferramentas conforme a cobrança do modelo, sem contar uma parcela duas vezes. Médias do piloto ajudam a prever gasto; o limite admissível de cada tarefa deve sustentar a reserva antes do envio.
As decisões acima são propostas de aplicação, não resultados novos. Elas complementam os estudos de repetição de Schulte et al. (2026) e estabilidade de Sielinski (2026), ambos preprints. A rotação simples não é automaticamente um desenho formal de blocos incompletos balanceados.
Ler o protocolo futuro baseado no site, com matriz do código, critérios e referências. O documento distingue capacidades existentes, adaptações propostas e validações ainda necessárias. Nenhum piloto ou novo agendamento foi iniciado.
PesquisaGeo2027: planejamento do novo estudo. Consulte a regra vigente de 90 datas em até 180 dias, os quatro provedores e o ensaio isolado.
Publicação corrigida e versão anterior
A revisão empírica corrigida de BRGEO-1: A longitudinal audit of entity-mention measurement in generative engines é a referência para as conclusões do projeto. Publicada no Zenodo em 11/09/2026, ela examina como o próprio instrumento de medição altera a contagem de menções a entidades.
Versão de referência
Zenodo: revisão corrigida
O documento de 41 páginas reúne a auditoria de medição. DOI 10.5281/zenodo.22711743. A publicação em repositório permite acesso ao preprint, sem comprovar revisão por pares.
Ler a revisão empírica no ZenodoHistórico de versões
SSRN: versão anterior
O registro SSRN contém uma versão anterior, de 183 páginas, da mesma pesquisa. Não constitui réplica independente nem incorpora automaticamente as correções do Zenodo.
Consultar a versão anterior no SSRNDúvidas sobre os dados e o encerramento
O projeto fará novas coletas?
Não. O projeto de coleta foi encerrado em 11 de setembro de 2026. Os agendamentos foram desligados e o código bloqueia novas coletas. Uma pesquisa futura precisa de protocolo e autorização próprios.
Por que o painel tem 92.064 consultas e o artigo 91.392 respostas?
O painel preserva o agregado operacional final, enquanto a revisão corrigida usa o snapshot empírico descrito no artigo. São recortes não equivalentes. A diferença de 672 registros não recebe uma causa presumida sem reconciliação por resposta.
A taxa de menção mede recomendação ou alucinação?
Não por si só. O nome pode aparecer em uma recusa, em uma negação ou como eco da pergunta. O BRGEO-1 distingue correspondência lexical de interpretação semântica; uma taxa de recusa ou alucinação exige validação específica.
Qual versão devo citar?
Para as conclusões corrigidas, cite o BRGEO-1 publicado no Zenodo, DOI 10.5281/zenodo.22711743. A versão SSRN de 183 páginas é anterior e pertence à mesma pesquisa; não é uma réplica nem prova de revisão por pares.
Os dados completos por resposta estão públicos?
O código está disponível no GitHub. O preprint não publica o conjunto completo por resposta; o pacote de auditoria permanece sob custódia do autor. Os agregados públicos permitem consultar resultados dentro dos limites descritos.
Fontes para conferir o resultado
Leia o preprint corrigido no Zenodo para as conclusões e a versão anterior no SSRN para rastrear a evolução do manuscrito. O repositório Papers preserva código e documentação; o agregado final no Git é a fonte das tabelas exploráveis.
O depósito do manuscrito não inclui publicamente o conjunto completo por resposta. O pacote de auditoria permanece sob custódia do autor. Propostas de novos estudos não reativam este ciclo.