Janela confirmatória v2 concluída: 90 de 90 dias
Iniciada em 2026-04-23 e encerrada em 2026-07-21, conforme o cronograma pré-registrado. A janela fechou com 63.684 observações, congeladas para a análise confirmatória e distribuídas conforme o desenho fatorial pré-registrado (4 verticais × 48 queries balanceadas × 5 LLMs × 2 coletas diárias). A taxonomia, os prompts e os parâmetros de temperatura permaneceram imutáveis do dia 1 ao dia 90. A coleta longitudinal foi retomada em 22/07/2026 e segue 2 vezes ao dia, agora fora da janela.
Como o dataset cresce
Duas coletas automatizadas rodam por dia, às 06:00 e 18:00 BRT, via GitHub Actions. Cada execução percorre 4 verticais × 48 queries × 5 LLMs, gerando aproximadamente 960 observações por rodada (cerca de 1.900 por dia somando as duas coletas). Ao final de cada run, o pipeline faz commit direto no repositório papers, com manifest SHA-256 para garantir reprodutibilidade bit-a-bit. O dataset é público desde o primeiro registro — sem embargo, sem versão privada, sem curadoria posterior.
- Dia 3 (25/04/2026): potência estatística de H1 (vantagem RAG) — ✓ atingido
- Dia 38 (30/05/2026): potência estatística de H2 (probe fictícia) — ✓ atingido
- Dia 90 (21/07/2026): fechamento da janela e congelamento do dataset — ✓ atingido
- 22/07/2026: retomada da coleta longitudinal pós-janela (864 queries no dia) · ✓ atingido
- Outubro/2026: submissão do Paper 5 à Elsevier (Information Sciences) · previsto
Paper 4 — Null-Triad: submetido SSRN + publicado Zenodo · DOI 10.5281/zenodo.19712217
Paper 5: em preparação, alvo Elsevier, infraestrutura v2 operacional · ver /publicacoes →
Reimplementação algorítmica completa
O Paper 4 (Null-Triad) expôs três modos de falha no pipeline anterior: H1 com underpower estatístico, H2 com design-null (probe fictício desligado) e H3 com instrumentação assimétrica. O v2.0.0-reboot endereça os três simultaneamente com dez pilares metodológicos pré-registrados.
- NER v2 (entity extraction)Normalização Unicode NFC+NFKD, regex com word-boundary rigoroso, aliases canônicos e stop-contexts. Redução de 45% em falsos positivos sobre dataset histórico.
- Cluster-robust inference (CR1)Sandwich estimator com cross-group covariance para diff-of-proportions sobre clusters temporais (dias).
- Null simulation empíricaDistribuição Monte Carlo de Jaccard sob H0 de uniformidade, substituindo threshold arbitrário por P5 empírico.
- Power analysis pré-registradaRule-of-Three inverse (probe fictício), Cohen's h para diff-proportions, design-effect adjustment por correlação intra-cluster.
- GLMM hierárquicoBinomialBayesMixedGLM com random intercepts aninhados (query, day, entity) para partição correta de variância.
- Cohort científica v279 entidades BR reais (4 verticais) + 32 âncoras internacionais de calibração + 16 decoys fictícios para FPR via alucinação — 127 entidades monitoradas no total.
- Query battery balanceada192 queries com balanceamento 50/50 idioma (PT/EN) e tipo (directive/exploratory), cobertura 4 verticais × 6 categorias × 2 temporal.
- Hypothesis engine (BH-FDR)Benjamini-Hochberg automático + decision rule pré-registrada (reject iff BH-adjusted p<0,05 AND 95% CI exclui null).
- Reprodutibilidade bit-para-bitDocker image pinada + PYTHONHASHSEED fixo + SHA-256 manifest de outputs via scripts/reproduce.sh contra git tag.
- Test coverage 217/217Suíte automatizada de 217 testes: seis módulos analíticos do v2 (NER, CR1, null-sim, power, GLMM, hypothesis-engine) mais hot-path E2E, migrations e sync Supabase.
Visão geral
Verificação de variação semanal
Taxa estávelCompara a taxa de citação por query (não a contagem absoluta) entre as duas janelas mais recentes de 7 dias com coleta cada (não 7 dias corridos — veja a lacuna abaixo), separando o que é variação de volume de coleta do que é variação de propensão dos LLMs a citar, com teste de significância. Minimiza suposição: só dispara alarme quando a taxa cai de fato.
Decomposição shift-share: quanto é efeito de quantas queries foram coletadas, quanto é efeito da taxa por query.
Insights principais
Maior taxa de citação entre os 5 LLMs (4372 citadas em 5760 queries). Perplexity AI é o motor que mais cita marcas brasileiras hoje.
15968 queries no vertical, 6719 com citação. Vertical com cobertura empírica robusta.
Marca mais citada por LLMs em todo o dataset. 1.7× mais citações que o segundo colocado (Mercado Livre).
Atribuições nomeadas (vs apenas linkadas) indicam alta precisão das citações — LLMs mencionam empresas pelo nome próprio.
Posição privilegiada (primeiro tercil) na resposta gerada pelo LLM. Marcas citadas no início têm maior peso de leitura.
Movimentação semanal · todos os verticais
2026-08-01 a 2026-08-07 vs. 2026-07-25 a 2026-07-31
Comparativo das citações detectadas nos últimos 7 dias contra os 7 dias anteriores, agregando as 4 verticais. Mostra de relance quem ganhou visibilidade nos LLMs, quem está perdendo terreno e quem entrou no radar nesta semana. 0 subindo · 0 caindo · 20 novos — leitura distorcida pela retomada de coleta, veja o aviso abaixo.
Estes movimentos são em contagem absoluta de citações e, portanto, sensíveis ao volume de queries coletado na janela. Para saber se houve queda real de taxa (e não apenas menos queries), veja a Verificação de variação semanal acima.
Maiores altas
Maior ganho de citações vs. a semana anterior
Maiores quedas
Maior perda de visibilidade vs. a semana anterior
Novos no radar
Citadas na retomada da coleta — a semana anterior não teve rodadas (lacuna), então tudo conta como novo
- 1NubankFintechnovo+59
- 2Mercado LivreVarejonovo+35
- 3Magazine LuizaVarejonovo+32
- 4TotvsTecnologianovo+20
- 5EMSSaúdenovo+13
- 6FinPay SolutionsFintechnovo+12
- Travar a persistência da citação: rodar os 25 prompts canônicos toda semana, mirar drift <20% em 30 dias.
- Reforçar o Information Gain da página citada (dado proprietário, framework próprio) — é o que sustenta o lift.
- Garantir Schema-content parity e
dateModifiedreal; redating vazio derruba o frescor.
- Checar Entity Boundary Drift (cos θ < 0,80 derruba o sinal): auditar Wikidata + 5 plataformas externas.
- Buscar consenso multi-fonte (Wikipedia + Reddit + G2 + papers): 2,8× mais chance de citação cruzada.
- Conferir parsing por crawler de IA: SSR + schema rendem 94% vs 23% de leitura; conteúdo só em JS some.
Variações computadas por compute_weekly_deltas.py sobre o histórico granular por entidade. Selecione um vertical específico acima para ver as hipóteses GEO de cada movimento (por que subiu, por que caiu). Recomendações pelo cânone GEO 2026.
Como interpretar os movimentos — e o que fazer com eles
Os números acima medem visibilidade citacional. Esta seção traduz o que move essa visibilidade segundo o cânone GEO de 2026 — as métricas certas, as alavancas de redação com lift medido, o que mudou após o Google I/O e os sinais observáveis que decidem se um LLM cita uma marca.
Posição da fonte na resposta + tokens atribuídos + frequência de citação. É o que esta página mede de forma longitudinal.
Qualidade da citação + cobertura dos keypoints + coerência. Otimizar GEO sem degradar GEU — senão os engines penalizam.
O método empírico (medir lift por engine comparando pares vencedor/perdedor, sem GPU) rende +50 a +82% de GEO Score e cresce +46,4% com reescrita multi-turno (AgenticGEO). AutoGEO · ICLR 2026 (CMU)
Performance por LLM
Ordenado pela taxa de citação · 5 modelos
Perplexity
Perplexity AI
Claude
Anthropic
ChatGPT
OpenAI
Groq
Groq
Gemini
Performance por Vertical
Fintech
Varejo
Tecnologia
Saúde
Matriz cruzada — LLM × Vertical
Identifica gaps de cobertura
| Vertical / LLM | Perplexity | Claude | ChatGPT | Gemini | Groq |
|---|---|---|---|---|---|
| Fintech | 86.5% n=1440 | 61.6% n=3680 | 35.4% n=3680 | 24.4% n=3488 | 28.6% n=3680 |
| Saúde | 69.8% n=1440 | 30.0% n=3626 | 26.6% n=3680 | 17.9% n=3488 | 26.5% n=3680 |
| Tecnologia | 54.4% n=1440 | 30.1% n=3568 | 37.1% n=3680 | 17.7% n=3466 | 26.4% n=3680 |
| Varejo | 93.0% n=1440 | 45.7% n=3680 | 38.6% n=3680 | 19.4% n=3488 | 31.2% n=3680 |
Células com borda tracejada têm amostra abaixo de 30 (n<30) — resultado estatisticamente não-confiável. Ver avisos abaixo.
Top entidades citadas
Ranking absoluto · 30 entidades com pelo menos 1 citação detectada · 8 são decoys de controle
Sobre as entidades marcadas como “fictícia · controle”: elas não são empresas reais — são os decoys do protocolo anti-alucinação, alvo deliberado de queries de sondagem. As contagens aqui refletem o nome ecoado nas respostas a essas sondagens do grupo de controle, e não conhecimento espontâneo dos LLMs; por isso não contradizem a especificidade de 100% medida na calibração (menções espontâneas a marcas inexistentes fora das sondagens).
Observação: as entidades nesta listagem vêm da tabela citation_context, com extração granular já consolidada nos quatro verticais (Fintech, Saúde, Tecnologia e Varejo). O ranking é absoluto por número de citações detectadas; veja o catálogo completo abaixo para a cobertura por roster de cada vertical.
Catálogo completo · 111 empresas monitoradas
Roster canônico do projeto Papers · 4 verticais
As 111 empresas reais abaixo são monitoradas em todas as queries de cada vertical, com 16 entidades fictícias adicionais para detectar falsos positivos. Empresas com badge verde têm pelo menos 1 citação detectada na tabela citation_context. A cobertura de cada vertical conta apenas empresas do próprio roster — menções a âncoras internacionais, decoys e marcas fora do roster ficam de fora do cálculo, então o valor nunca excede 100%.
Fintech & Bancos Digitais
16 empresas12 de 16 empresas do roster com citação (75% de cobertura)
- Nubank3604
- PagBank170
- Cielo5
- Stone168
- Banco Inter572
- Mercado Pago309
- Itaú291
- Bradesco443
- C6 Bank628
- PicPay781
- Ame Digital
- Neon315
- Original
- BS2
- Safra3
- Banco Carrefour
Varejo & E-commerce
15 empresas8 de 15 empresas do roster com citação (53,3% de cobertura)
- Magazine Luiza1906
- Casas Bahia383
- Ponto Frio
- Americanas791
- Amazon Brasil580
- Mercado Livre2084
- Shopee Brasil
- AliExpress Brasil
- Leroy Merlin
- Tok&Stok
- Renner57
- Riachuelo1
- C&A Brasil
- Centauro
- Netshoes33
Saúde & Farmacêuticas
15 empresas14 de 15 empresas do roster com citação (93,3% de cobertura)
- Dasa93
- Hapvida46
- Unimed11
- Eli Lilly Brasil
- Raia Drogasil121
- Fleury95
- Rede D'Or3
- Einstein127
- Sírio-Libanês162
- Eurofarma584
- Aché326
- EMS855
- Hypera Pharma703
- NotreDame Intermédica5
- SulAmérica Saúde7
Tecnologia & TI
15 empresas9 de 15 empresas do roster com citação (60% de cobertura)
- Tivit59
- Accenture Brasil5
- Stefanini195
- Totvs956
- Linx16
- Locaweb69
- Positivo Tecnologia
- Movile182
- CI&T230
- Vivo Empresas
- Embraer
- WEG
- Natura &Co
- iFood220
- 99
Qualidade dos dados
Sentimento das menções
- Neutro19525 (77.8%)
- Positivo5525 (22.0%)
- Negativo58 (0.2%)
Tipo de atribuição
- Nomeada (named)25096 (100.0%)
- Apenas linkada12 (0.0%)
Posição na resposta
- Início (1º tercil)11073 (44.1%)
- Meio (2º tercil)8142 (32.4%)
- Fim (3º tercil)5893 (23.5%)
FinOps — Custo da pesquisa
| Plataforma | Modelo | Gasto | Limite |
|---|---|---|---|
| ChatGPT | gpt-4o-mini | US$ 0,05 | US$ 30,00 |
| Claude | claude-haiku-4-5 | US$ 0,32 | US$ 40,00 |
| Gemini | gemini-2.5-pro | — | US$ 90,00 |
| Perplexity | sonar | US$ 0,02 | US$ 30,00 |
| Groq | llama-3.3-70b-versatile | US$ 0,00 (free tier) | US$ 10,00 |
Custos por modelo medidos no checkpoint FinOps do repositório papers (mesma fonte do total mensal). Valores abaixo de US$ 0,01 são exibidos com 4 casas decimais; o Groq roda em free tier, com custo real de US$ 0,00.
Série temporal de coleta
Taxa de citação por categoria de query
Qual tipo de pergunta dispara mais citações espontâneas? Ordenado pela taxa.
Português × Inglês — LLMs citam mais em qual idioma?
Distribuição de sentimento por LLM
Latência de resposta por LLM
Gap de cobertura — marcas do roster ainda não citadas
Oportunidade de GEO: marcas monitoradas que ainda não receberam menção espontânea dos LLMs em queries-alvo.
Avisos e metodologia
Limites estatísticos identificados
- Top entidades concentradas em Fintech: reflete onde a metodologia foi calibrada inicialmente. Expansão para outros verticais em andamento.
Como os dados foram coletados
- Fonte: papers.db (63684 queries dataset)
- Pipeline: 7 módulos Python rodando contra APIs oficiais (Perplexity AI, Anthropic, OpenAI, Groq, Google)
- Validação: 16 entidades fictícias inseridas para detectar falsos positivos
- Atribuição named (100%): menção pelo nome próprio, não apenas link
- Análise de sentimento: classificador automático (3 classes)
- Ver Papers Roadmap completo →
Perguntas frequentes
Sobre a metodologia e os dados desta pesquisa.
Como os dados desta pesquisa são coletados?
papers.db, que identifica menções a cada uma das 127 entidades monitoradas e registra se houve citação ou não. A coleta roda duas vezes ao dia, às 06:00 e 18:00 BRT, e os dados são publicados nesta página via ISR a cada 24 horas. A janela confirmatória v2 encerrou em 21/07/2026 com o dataset congelado para análise; a coleta longitudinal continua no mesmo protocolo, agora fora da janela.O que significa a taxa de citação de 35,3%?
Por que a Fintech aparece como o vertical mais citado?
Por que alguns LLMs citam mais do que outros?
Os modelos usados na coleta mudam ao longo do tempo?
model_version), permitindo segmentar a análise por versão e tratar a não-estacionariedade dos LLMs de forma estatisticamente correta. Em 17 de junho de 2026, a coleta do Gemini passou do modelo 2.5 Pro para o 2.5 Flash, com o raciocínio interno (“thinking”) desligado — uma otimização de custo (FinOps) que reduz a despesa por observação sem afetar a detecção de citação. A mudança é forward-only: dados anteriores permanecem intactos e identificados pela versão de modelo correspondente, preservando a integridade da série longitudinal.