Antes de explorar a linha do tempo, entenda o vocabulário e as convenções visuais usadas nesta página.
Cada entrega carrega um dos três rótulos abaixo. As cores são consistentes em toda a página.
Cada ponto do GEO Score é ancorável a um paper acadêmico (Cohen/Fleiss kappa, BSTS, bootstrap BCa) ou a um arquivo TypeScript real no repositório. Nenhuma dimensão é arbitrária.
Das seis fases principais, cinco já estão ativas em produção e processando domínios reais. A sexta — Causal Impact (BSTS) — aguarda acúmulo de ao menos três snapshots do mesmo domínio para ativar a análise de séries temporais.
Verde indica entrega concluída; âmbar sinaliza aviso ou meta pendente; azul identifica o acento primário da interface. Barras e marcadores de linha do tempo seguem esta paleta de forma consistente.
Cada KPI é rastreável: 8 dimensões em score-calculator.ts, modelos LLM em llm-probes.ts, 10 heurísticas seed em preference-engine.ts, cliente Stone documentado em geo-stone/audits/www-stone-com-br/.
Enquanto o motor do checker ficou estável (zero commits em score-calculator, llm-probes e preference-engine na janela), o ecossistema ao redor dele avançou em volume. Números apurados por git log --no-merges sobre origin/master de cada clone. Nada estimado.
* inclui commits de coleta automática diária (cron); declarado, não descontado. Os 27 repos restantes somam os demais commits da janela.
No checker em si, a janela rendeu três entregas: FinOps de jobs auditável (jobs-finops.ts, 03-jul), refresh visual de /ferramentas/geo-score (14-jul) e a credencial CSO Nuvini propagada na entity (20-jul).
Um resumo operacional semana a semana — selecione o mês para navegar entre os destaques.
Auditoria NAIA (25-mai) diagnosticou 64 páginas de stone.com.br: 32 com zero JSON-LD, 32 só com FAQPage, 0 declaram Organization/WebSite na home. Baseline ~45/100 · 25 pts atrás do Mercado Pago. Monitoramento seguiu automático: 4 capturas quinzenais de conteudo.stone.com.br versionadas (15-mai, 01-jun, 15-jun, 01-jul) e rascunhos semanais automáticos W20-W27 no repo. A matéria-prima de ≥3 snapshots para o Causal Impact já existe; falta consolidá-la no formato do checker. Delta causal ainda não calculado: os fixes de Schema seguem pendentes do lado Stone.
Score Geo 7,9/10. Severidade low. Cobertura BR 3/4 · US 3/4 · EU 3/4. Validação de filter bubble regional via pairwise agreement entre Brasil, Estados Unidos e Europa.
Auditoria NAIA de 25 de maio de 2026, ainda o baseline vigente em 22 de julho. O monitoramento seguiu automático (4 capturas quinzenais versionadas de 15-mai a 01-jul e rascunhos semanais W20-W27), mas o delta causal pós-rebrand ainda não foi calculado: depende da aplicação dos fixes de Schema.org do lado Stone e da consolidação das capturas no formato do checker.
Referência do setor
Segunda posição
Baseline atual — cliente piloto
Gap em relação ao líder
Baseline: ~45/100. Meta imediata: alcançar 60 pontos com correções de Schema.org e exposição.
Próximos passos técnicos
A literatura 2025-2026 sobre GEO derrubou três premissas que moldavam praticamente toda ferramenta de SEO do mercado.
O GEO Score Checker v2.0 foi desenhado a partir dessas três leis. Cada ponto do score é rastreável a um paper ou métrica validada publicamente.
O GEO Score não é um número único: cada estágio do motor generativo recebe uma dimensão própria, medida de forma independente. Abaixo você vê como os três estágios se encadeiam e como uma análise percorre todo o fluxo assíncrono até chegar ao score final.
Atenção: otimizar a geração pode degradar o retrieval. Por isso o GEO Score é medido estágio a estágio — não como número único.
O site é alcançável e legível por crawlers de IA (GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot)?
Sinais estruturais (JSON-LD válido, Schema.org, hierarquia de headings, canonical+OG) colocam o site no top-K das fontes?
A IA cita o site em respostas sintetizadas, com fidelidade ao que ele declara?
Sequência de avaliação: Retrieval (15 pts) → Reranking (15 pts) → Generation (35 pts). Passe o cursor ou use Tab para ver o detalhe de cada estágio.
A análise é assíncrona: o frontend faz polling a cada 2,5 s enquanto o worker processa em fases — estática, compreensão por LLMs e validação de entidade — antes de entregar o score final.
Sequência completa: Usuário → POST /api/geo-check → validação SSRF → fila Supabase → Vercel Cron → claim atômico → fase estática (30%) → 4 LLMs em paralelo (60%) → Wikidata + Google KG (90%) → score-calculator (100%) → polling do frontend a cada 2,5 s.
Cada dimensão captura um aspecto diferente da presença de um site nos motores de IA generativa. Os pesos refletem a força causal medida nos estudos mais recentes — e somam exatamente 100 pontos, sem tectos artificiais.
Requer >=3 snapshots do mesmo domínio (BSTS). É a 6ª e última fase pendente.
Pesos exatos extraídos de score-calculator.ts: a soma dá 100 em pontos inteiros, sem caps artificiais. Passe o mouse (ou o foco) em um segmento para destacar a dimensão correspondente na lista.
Os crawlers de IA chegam e leem o site: robots.txt, bots de IA, sitemap, llms.txt, HTML com SSR
O conteúdo sobrevive ao reranker: JSON-LD válido, entidade canônica, hierarquia H1/H2, canonical + OG
Taxa de reconhecimento e citação pelos engines reais, com confiança média e menção do domínio
Quando citado, os engines falam a verdade sobre a marca: acurácia factual, sem alucinações
Divergência entre engines (invertida: consenso alto pontua mais), medida com Fleiss kappa
Filter bubble regional: 4 provedores × 3 geos (BR · US · EU), cobertura e consistência narrativa
Baseline técnico: HTTPS, TTFB, title, meta description e o sinal de frescor detalhado abaixo
Autoridade de entidade: match Wikidata, Google Knowledge Graph e validação de sameAs
O checker lê o lastmod do sitemap (ou o header Last-Modified) e credita pontos pela idade da atualização mais recente. A literatura que embasa o critério reporta lift de aproximadamente 3,2x na taxa de citação para conteúdo recém-atualizado. É a parte do score que decai sozinha se o site parar de publicar.
Pontos por idade do último lastmod. Sem sinal detectável, o item fica em 0,5.
As 8 dimensões do GEO Score são ancoradas em literatura acadêmica 2025-2026; clique em uma dimensão para revelar a lógica.
A wave de pesquisa de julho versionou um corpus de 32 papers arXiv de 2026 sobre GEO, cada um verificado por existência e abstract via API do arXiv (os PDFs completos ainda não foram lidos; os números abaixo vêm dos abstracts, e o próprio corpus manda ler antes de citar em paper). Os nove mais relevantes para o score, e com o que cada um dialoga no checker:
Além da literatura, o projeto mede citação cross-LLM com dado próprio: a primeira janela de 90 dias fechou em 21-jul. As 16 entidades-controle fictícias (marcas que não existem) registraram zero menções, ou seja, especificidade de 100% e taxa de falso positivo 0,0 no protocolo. A calibração dos pesos das 8 dimensões contra esse ground truth ainda não rodou sobre dados reais; o AUROC 0,81 citado na metodologia vem de simulação e não é resultado real.
Cada número do GEO Score tem uma fórmula por trás. Arraste os controles abaixo para ver como cada decisão de design — tamanho do título, velocidade do servidor, número de réplicas — se transforma em pontuação.
Em vez de "aprovado/reprovado", dá crédito parcial e contínuo: títulos entre 30-65 caracteres recebem pontuação máxima; fora disso a curva cai suavemente.
Rastreadores de IA abandonam requisições lentas. A curva premia TTFB abaixo de 500 ms e penaliza acima de 1.500 ms, chegando a zero em 3 s.
O Bias-Corrected and Accelerated bootstrap (Efron, 1987) fornece um IC mais honesto que reportar um número cravado. Surge quando o motor executa 5 ou mais réplicas estocásticas e compensa assimetrias na distribuição amostral.
Ilustração: score pontual 74 com banda de confiança de 95% entre 69 e 78 (width = 9 pontos). Quanto maior o número de réplicas, mais estreita tende a ser a banda.
Quando múltiplos motores de IA avaliam o mesmo critério, o acordo bruto superestima a concordância real. O Fleiss kappa desconta o que seria esperado por acaso.
3 de 4 motores concordam em 'sim'. O acordo bruto parece alto (0,83), mas o Fleiss kappa desconta a concordância que ocorreria por acaso.
Todas as 7 fórmulas do score em cartões colapsados — expanda apenas o que precisar.
O GEO Score Checker consulta simultaneamente quatro grandes modelos de linguagem para obter a narrativa que cada engine constrói sobre um domínio. A divergência entre essas visões é tão informativa quanto a resposta individual — e toda a operação é blindada por sete camadas de controle de custo.
As quatro chamadas saem ao mesmo tempo. A resposta de cada engine chega em janelas de latência distintas, refletindo diferenças de infraestrutura e modelo — não de informação.
Cada par de respostas é comparado por similaridade de Dice sobre bigramas de caracteres. O grafo abaixo mostra todos os pares; a espessura e a cor da aresta indicam o grau de concordância.
diceSimilarity(a, b) = 2 · |bigrams(a) ∩ bigrams(b)| / (|a| − 1 + |b| − 1)Engines convergem — a narrativa da marca está sólida e consistente no ecossistema de IAs. Menor risco de resposta conflitante para o usuário final.
Engines divergem — há ambiguidade informacional explorável. O GEO Score penaliza e indica quais engines precisam de atenção editorial prioritária.
A versão 2.2 do Score anexará Fleiss kappa para penalizar acordância por acaso entre os engines — refinando a medida de consenso real.
Cada job percorre sete camadas de controle antes de qualquer chamada paga chegar aos provedores. O funil abaixo mostra a sequência e o custo real por análise comparado ao teto diário.
Atualizado em 23 de julho de 2026. Preço por 1 milhão de tokens. Gemini foi atualizado de 2.5-flash para 2.5-pro em 18-abr-2026 para elevar a qualidade do structured output. Cada probe espelha custo+tokens em finops_calls (Supabase) para FinOps unificado.
Cada componente do checker organizado por responsabilidade — o fluxo assíncrono end-to-end está animado na seção acima.
Todas as 16 entradas acima são rastreáveis ao código em produção. A suíte do repositório soma hoje 136 arquivos de teste (os badges "360" e "380" dos highlights de junho eram os totais da época). Inferência estatística via inference.ts (Cohen kappa, Fleiss kappa, bootstrap BCa). SSRF e gate de triagem entregues na Leva 1 da robustez — suite 360/360 casos.
Cada fase ampliou a capacidade de mensuração. A ordem reflete a evolução técnica — de análise estática booleana até inferência causal com séries temporais.
Análise estática síncrona, 6 dimensões booleanas.
Pesos contínuos, crédito parcial, 8 dimensões stage-aware.
Pergunta real aos 4 LLMs; mede exposição, fidelidade e bubble.
Cross-check de entidade em Wikidata + Google Knowledge Graph.
12 chamadas (4 LLMs × 3 geos: BR, US, EU); robustez regional.
Heurísticas extraídas do histórico via cron diário.
Cohen/Fleiss kappa, bootstrap BCa, bridge com o projeto Papers.
Requer >= 3 snapshots do mesmo domínio. Última fase pendente.
Abra apenas as fases que lhe interessam — cada cabeçalho mostra o progresso sem exigir leitura de todas as tarefas.
Dados extraídos do código-fonte em 21 de junho de 2026 e reauditados em 22 de julho de 2026: o motor de score não recebeu commits na janela, então cada status permanece válido. Cada tarefa "planejada" tem rastreabilidade a um workstream ativo no plano de robustez ou à Fase 5.5 de inferência estatística.
Cada regra vive em geo_preferences_learned com source='seed', baseada em literatura, e é cruzada com os engines que participaram da análise antes de entrar nas recomendações. Ordenadas por lift médio estimado em pontos de score. O cron diário das 4h promove novas regras a learned apenas com amostra suficiente.
Confiança e lift vêm da literatura (não de amostra própria): todos os seeds nasceram com sample_size=0 e só o batch noturno, com 30 dias ou mais de dados reais, promove variações a source='learned'.
Transparência total sobre onde acaba a automação e começa a decisão humana.
Medir compreensão por IA é difícil porque LLMs são não-determinísticos; veja as garantias que elevam a régua do GEO Score Checker.
Todos os 4 provedores são chamados com temperature zerada. Em ~95% dos casos a mesma query retorna JSON idêntico entre runs. Os 5% restantes variam em ~1-2 palavras, que o pairwise agreement + Fleiss kappa absorvem.
OpenAI json_schema strict, Google responseSchema, Anthropic prompt explícito. Zero parsing de texto livre — ou o LLM retorna o schema, ou falha visivelmente.
Faithful Credit compara name vs <title> e proposition vs meta description. Alucinações capturadas quando divergem do que o próprio site afirma.
4 engines independentes reduzem vieses específicos. Pairwise agreement elimina rajadas de um único modelo.
O prompt força o LLM a admitir desconhecimento em vez de chutar. Exemplos positivos e negativos no próprio prompt.
Cada LLM devolve hallucinationFlags[] listando afirmações incertas. Contadas e penalizadas na dimensão Faithful Credit.
cost_usd individual em evaluations[]; soma em geo_analysis_jobs.cost_usd. trackProbeCall espelha em finops_calls (cross-projeto).
Corrige pairwise agreement bruto pelo esperado por chance. Cada campo livre vira shingle canônico → rótulo nominal → kappa Landis-Koch.
Bias-Corrected and Accelerated (Efron 1987). Score = 74 [69, 78] em vez de cravado, quando há ≥5 réplicas.
score_calibration_inputs + scripts/calibrate_score.py. Logit com 5-fold CV AUROC ~0,81 em simulação N=200. Pesos calibrados quando dataset real maturar.
AUTOMATIZÁVEL: rodar mesmo domínio 10× e calcular variância dos scores por dimensão. Meta: std < 1 pt total.
SEMI-MANUAL: 20 marcas famosas + 20 desconhecidas, comparar contra anotação humana de 'reconhecimento factual'. Meta: accuracy > 85%.
AUTOMATIZÁVEL: gravar model + version em cada probe. Alerta quando provider muda internamente (custo/tokens médios saltam). Invalida comparação histórica.
Implementado em 06-abr (commit 4f24fc2). Cada job armazena rawText de cada probe; UI expõe via /api/geo-check/[id]?evidence=1.
Cada análise atravessa uma escada de bloqueios independentes: se uma camada falhar, a próxima ainda contém o gasto.
Gemini 2.5-pro: US$ 1,25 / 5,00 por 1M tokens (entrada/saída) — reconciliado em 21-jun-2026 (commit eb440b6). Os tetos US$ 0,04 e US$ 0,13 já absorvem esse preço real.
5 das 6 fases em produção e as três primeiras levas de robustez entregues. Oito passos destravam Causal Impact, concluem o endurecimento e elevam o piloto Stone.