Antes de explorar a linha do tempo, entenda o vocabulário e as convenções visuais usadas nesta página.
Cada entrega carrega um dos três rótulos abaixo. As cores são consistentes em toda a página.
Cada ponto do GEO Score é ancorável a um paper acadêmico (Cohen/Fleiss kappa, BSTS, bootstrap BCa) ou a um arquivo TypeScript real no repositório. Nenhuma dimensão é arbitrária.
Das seis fases principais, cinco já estão ativas em produção e processando domínios reais. A sexta — Causal Impact (BSTS) — aguarda acúmulo de ao menos três snapshots do mesmo domínio para ativar a análise de séries temporais.
Verde indica entrega concluída; âmbar sinaliza aviso ou meta pendente; azul identifica o acento primário da interface. Barras e marcadores de linha do tempo seguem esta paleta de forma consistente.
Cada KPI é rastreável: 8 dimensões em score-calculator.ts, modelos LLM em llm-probes.ts, 10 heurísticas seed em preference-engine.ts, cliente Stone documentado em geo-stone/audits/www-stone-com-br/.
Um resumo operacional semana a semana — selecione o mês para navegar entre os destaques.
Auditoria NAIA (25-mai) cobriu 64 URLs de stone.com.br: 32 com zero JSON-LD, 32 só com FAQPage, 0 declaram Organization/WebSite na home. Baseline ~45/100 · 25 pts atrás do Mercado Pago. Snapshots D-Day e D+17 capturados; delta causal ainda não calculado (depende dos fixes de Schema serem aplicados).
Score Geo 7,9/10. Severidade low. Cobertura BR 3/4 · US 3/4 · EU 3/4. Validação de filter bubble regional via pairwise agreement entre Brasil, Estados Unidos e Europa.
Auditoria NAIA de 25 de maio de 2026. O delta causal pós-rebrand ainda não foi calculado — depende da aplicação dos fixes de Schema.org e do acúmulo de ao menos três snapshots para ativar a fase Causal Impact.
Referência do setor
Segunda posição
Baseline atual — cliente piloto
Gap em relação ao líder
Baseline: ~45/100. Meta imediata: alcançar 60 pontos com correções de Schema.org e exposição.
Próximos passos técnicos
A literatura 2025-2026 sobre GEO derrubou três premissas que moldavam praticamente toda ferramenta de SEO do mercado.
O GEO Score Checker v2.0 foi desenhado a partir dessas três leis. Cada ponto do score é rastreável a um paper ou métrica validada publicamente.
O GEO Score não é um número único: cada estágio do motor generativo recebe uma dimensão própria, medida de forma independente. Abaixo você vê como os três estágios se encadeiam e como uma análise percorre todo o fluxo assíncrono até chegar ao score final.
Atenção: otimizar a geração pode degradar o retrieval. Por isso o GEO Score é medido estágio a estágio — não como número único.
O site é alcançável e legível por crawlers de IA (GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot)?
Sinais estruturais (JSON-LD válido, Schema.org, hierarquia de headings, canonical+OG) colocam o site no top-K das fontes?
A IA cita o site em respostas sintetizadas, com fidelidade ao que ele declara?
Sequência de avaliação: Retrieval (15 pts) → Reranking (15 pts) → Generation (35 pts). Passe o cursor ou use Tab para ver o detalhe de cada estágio.
A análise é assíncrona: o frontend faz polling a cada 2,5 s enquanto o worker processa em fases — estática, compreensão por LLMs e validação de entidade — antes de entregar o score final.
Sequência completa: Usuário → POST /api/geo-check → validação SSRF → fila Supabase → Vercel Cron → claim atômico → fase estática (30%) → 4 LLMs em paralelo (60%) → Wikidata + Google KG (90%) → score-calculator (100%) → polling do frontend a cada 2,5 s.
Cada dimensão captura um aspecto diferente da presença de um site nos motores de IA generativa. Os pesos refletem a força causal medida nos estudos mais recentes — e somam exatamente 100 pontos, sem tectos artificiais.
Requer >=3 snapshots do mesmo domínio (BSTS). É a 6ª e última fase pendente.
As 8 dimensões do GEO Score são ancoradas em literatura acadêmica 2025-2026; clique em uma dimensão para revelar a lógica.
Cada número do GEO Score tem uma fórmula por trás. Arraste os controles abaixo para ver como cada decisão de design — tamanho do título, velocidade do servidor, número de réplicas — se transforma em pontuação.
Em vez de "aprovado/reprovado", dá crédito parcial e contínuo: títulos entre 30-65 caracteres recebem pontuação máxima; fora disso a curva cai suavemente.
Rastreadores de IA abandonam requisições lentas. A curva premia TTFB abaixo de 500 ms e penaliza acima de 1.500 ms, chegando a zero em 3 s.
O Bias-Corrected and Accelerated bootstrap (Efron, 1987) fornece um IC mais honesto que reportar um número cravado. Surge quando o motor executa 5 ou mais réplicas estocásticas e compensa assimetrias na distribuição amostral.
Ilustração: score pontual 74 com banda de confiança de 95% entre 69 e 78 (width = 9 pontos). Quanto maior o número de réplicas, mais estreita tende a ser a banda.
Quando múltiplos motores de IA avaliam o mesmo critério, o acordo bruto superestima a concordância real. O Fleiss kappa desconta o que seria esperado por acaso.
3 de 4 motores concordam em 'sim'. O acordo bruto parece alto (0,83), mas o Fleiss kappa desconta a concordância que ocorreria por acaso.
Todas as 7 fórmulas do score em cartões colapsados — expanda apenas o que precisar.
O GEO Score Checker consulta simultaneamente quatro grandes modelos de linguagem para obter a narrativa que cada engine constrói sobre um domínio. A divergência entre essas visões é tão informativa quanto a resposta individual — e toda a operação é blindada por sete camadas de controle de custo.
As quatro chamadas saem ao mesmo tempo. A resposta de cada engine chega em janelas de latência distintas, refletindo diferenças de infraestrutura e modelo — não de informação.
Cada par de respostas é comparado por similaridade de Dice sobre bigramas de caracteres. O grafo abaixo mostra todos os pares; a espessura e a cor da aresta indicam o grau de concordância.
diceSimilarity(a, b) = 2 · |bigrams(a) ∩ bigrams(b)| / (|a| − 1 + |b| − 1)Engines convergem — a narrativa da marca está sólida e consistente no ecossistema de IAs. Menor risco de resposta conflitante para o usuário final.
Engines divergem — há ambiguidade informacional explorável. O GEO Score penaliza e indica quais engines precisam de atenção editorial prioritária.
A versão 2.2 do Score anexará Fleiss kappa para penalizar acordância por acaso entre os engines — refinando a medida de consenso real.
Cada job percorre sete camadas de controle antes de qualquer chamada paga chegar aos provedores. O funil abaixo mostra a sequência e o custo real por análise comparado ao teto diário.
Atualizado em 21 de junho de 2026. Preço por 1 milhão de tokens. Gemini foi atualizado de 2.5-flash para 2.5-pro em 18-abr-2026 para elevar a qualidade do structured output. Cada probe espelha custo+tokens em finops_calls (Supabase) para FinOps unificado.
Cada componente do checker organizado por responsabilidade — o fluxo assíncrono end-to-end está animado na seção acima.
Todas as 15 entradas acima são rastreáveis ao código em produção. Inferência estatística via inference.ts (Cohen kappa, Fleiss kappa, bootstrap BCa). SSRF e gate de triagem entregues na Leva 1 da robustez — suite 360/360 casos.
Cada fase ampliou a capacidade de mensuração. A ordem reflete a evolução técnica — de análise estática booleana até inferência causal com séries temporais.
Análise estática síncrona, 6 dimensões booleanas.
Pesos contínuos, crédito parcial, 8 dimensões stage-aware.
Pergunta real aos 4 LLMs; mede exposição, fidelidade e bubble.
Cross-check de entidade em Wikidata + Google Knowledge Graph.
12 chamadas (4 LLMs × 3 geos: BR, US, EU); robustez regional.
Heurísticas extraídas do histórico via cron diário.
Cohen/Fleiss kappa, bootstrap BCa, bridge com o projeto Papers.
Requer >= 3 snapshots do mesmo domínio. Última fase pendente.
Abra apenas as fases que lhe interessam — cada cabeçalho mostra o progresso sem exigir leitura de todas as tarefas.
Dados extraídos do código-fonte em 21 de junho de 2026. Cada tarefa "planejada" tem rastreabilidade a um workstream ativo no plano de robustez ou à Fase 5.5 de inferência estatística.
Transparência total sobre onde acaba a automação e começa a decisão humana.
Medir compreensão por IA é difícil porque LLMs são não-determinísticos; veja as garantias que elevam a régua do GEO Score Checker.
Todos os 4 provedores são chamados com temperature zerada. Em ~95% dos casos a mesma query retorna JSON idêntico entre runs. Os 5% restantes variam em ~1-2 palavras, que o pairwise agreement + Fleiss kappa absorvem.
OpenAI json_schema strict, Google responseSchema, Anthropic prompt explícito. Zero parsing de texto livre — ou o LLM retorna o schema, ou falha visivelmente.
Faithful Credit compara name vs <title> e proposition vs meta description. Alucinações capturadas quando divergem do que o próprio site afirma.
4 engines independentes reduzem vieses específicos. Pairwise agreement elimina rajadas de um único modelo.
O prompt força o LLM a admitir desconhecimento em vez de chutar. Exemplos positivos e negativos no próprio prompt.
Cada LLM devolve hallucinationFlags[] listando afirmações incertas. Contadas e penalizadas na dimensão Faithful Credit.
cost_usd individual em evaluations[]; soma em geo_analysis_jobs.cost_usd. trackProbeCall espelha em finops_calls (cross-projeto).
Corrige pairwise agreement bruto pelo esperado por chance. Cada campo livre vira shingle canônico → rótulo nominal → kappa Landis-Koch.
Bias-Corrected and Accelerated (Efron 1987). Score = 74 [69, 78] em vez de cravado, quando há ≥5 réplicas.
score_calibration_inputs + scripts/calibrate_score.py. Logit com 5-fold CV AUROC ~0,81 em simulação N=200. Pesos calibrados quando dataset real maturar.
AUTOMATIZÁVEL: rodar mesmo domínio 10× e calcular variância dos scores por dimensão. Meta: std < 1 pt total.
SEMI-MANUAL: 20 marcas famosas + 20 desconhecidas, comparar contra anotação humana de 'reconhecimento factual'. Meta: accuracy > 85%.
AUTOMATIZÁVEL: gravar model + version em cada probe. Alerta quando provider muda internamente (custo/tokens médios saltam). Invalida comparação histórica.
Implementado em 06-abr (commit 4f24fc2). Cada job armazena rawText de cada probe; UI expõe via /api/geo-check/[id]?evidence=1.
Cada análise atravessa uma escada de bloqueios independentes: se uma camada falhar, a próxima ainda contém o gasto.
Gemini 2.5-pro: US$ 1,25 / 5,00 por 1M tokens (entrada/saída) — reconciliado em 21-jun-2026 (commit eb440b6). Os tetos US$ 0,04 e US$ 0,13 já absorvem esse preço real.
5 das 6 fases em produção e as três primeiras levas de robustez entregues. Oito passos destravam Causal Impact, concluem o endurecimento e elevam o piloto Stone.