O que a evidência de 2026 diz sobre schema e citação em IA
Em maio de 2026 a Ahrefs publicou um teste com grupo de controle sobre schema e citação em IA, e o resultado contrariou o que boa parte do mercado vendia: as 1.885 páginas que adicionaram JSON-LD entre agosto de 2025 e março de 2026, comparadas a 4.000 páginas de controle em desenho de diferenças em diferenças, tiveram menos 4,6% de citações em AI Overviews, mais 2,4% em AI Mode e mais 2,2% no ChatGPT, variações que o próprio estudo descreve como indistinguíveis de zero (Ahrefs, "We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved", 11 de maio de 2026). O Google chega ao mesmo ponto por outro caminho no guia oficial de otimização para recursos de IA generativa, atualizado em 10 de julho de 2026: dados estruturados não são exigidos para a busca generativa e não existe schema especial para IA (Google Search Central, "Google's Guide to Optimizing for Generative AI Features on Google Search").
Isso muda o que este artigo promete. Schema.org é higiene semântica e desambiguação de entidade: diz ao motor, sem margem para interpretação, quem é a organização, quem assina o texto, qual serviço está sendo descrito e a quais perfis externos essas peças se ligam. Uma marca com marcação coerente não ganha citação por isso. Uma marca com marcação contraditória, ou com um nome que o modelo confunde com o de outra empresa, dá ao motor um motivo a menos para confiar no que lê, e é esse o problema que o trabalho abaixo resolve. Ele entra como um dos itens do guia como aparecer no ChatGPT, ao lado de conteúdo que responde à pergunta e de presença em fontes que os motores recuperam; nenhum dos três decide sozinho.
Quais tipos de Schema fazem o trabalho de desambiguação
A ordem abaixo é regra de casa da Brasil GEO, baseada em onde a ambiguidade costuma aparecer nos diagnósticos que fazemos; nenhum motor publica peso para esses tipos. Ela serve para decidir por onde começar quando o orçamento de implementação é curto.
- Organization e Person: fixam nome, descrição, fundador, cargo e os perfis externos (sameAs) da entidade. É a camada que resolve o caso mais frequente dos diagnósticos, a empresa que o modelo lê como duas.
- Article: liga cada texto a um autor identificado, a uma data de publicação e a uma data de atualização real. Sem isso o motor infere autoria e frescor a partir do HTML, com mais erro.
- Service e Offer: descrevem o que a marca vende, para quem e por quanto. Só valem se repetirem o que a página mostra; preço no schema e preço diferente no texto é a contradição que a marcação deveria eliminar.
- FAQPage: continua útil como espelho de perguntas reais respondidas na página. O Google encerrou o rich result de FAQ em 7 de maio de 2026, então a marcação não rende mais destaque visual na busca, e não há multiplicador de citação a esperar dela.
- BreadcrumbList e WebSite: descrevem hierarquia e raiz do site. Ajudam rastreio e navegação; não entram na decisão de citar.
- SpeakableSpecification: opcional. Indica trechos adequados à leitura por voz. Não há evidência pública de que motores generativos de texto o usem para escolher fontes; implemente se houver produto de voz, e só depois dos itens acima.
Áudio e vídeo gerados por IA entram no circuito de descoberta por outro caminho, o da transcrição indexável, tema que trato no blog da Brasil GEO em O papel da IA generativa de áudio e vídeo no ecossistema GEO.
Erros que desfazem o ganho de clareza
Boa parte dos sites que implementa Schema.org comete erros que anulam a clareza que a marcação deveria trazer. Os quatro mais frequentes nos diagnósticos:
- Inconsistência de entidade: o nome da empresa aparece de formas diferentes no schema, no site e em fontes externas. O motor precisa decidir se são a mesma entidade, e pode decidir errado.
- Schema incompleto: só o tipo Organization, sem sameAs, sem founder, sem description. É preencher um formulário só com o nome.
- sameAs sem conferência: links para perfis que não existem, para itens de Wikidata excluídos ou para páginas de terceiros com dados divergentes. Identificador externo só entra depois de aberto e conferido; um sameAs quebrado é contradição publicada.
- Schema que diz o que a página não mostra: avaliação, preço, evento ou FAQ presentes no JSON-LD e ausentes do HTML visível. Isso contraria a diretriz de dados estruturados do Google e é o erro mais fácil de cometer quando o JSON-LD sai de um template e o texto muda por outro caminho.
Implementação prática: passo a passo
A implementação em quatro camadas produz um grafo em que cada nó aponta para o outro por @id. O objetivo é que um extrator leia qualquer página isolada e ainda saiba quem publicou, quem escreveu e a que organização o texto pertence.
- Camada 1, identidade: Person e Organization com nome, descrição, fundador, cargo e sameAs apontando só para perfis abertos e conferidos.
- Camada 2, oferta: Service e Offer para cada serviço, com preço, disponibilidade e público idênticos ao que a página exibe.
- Camada 3, conteúdo: Article por publicação, com datePublished, dateModified real e author referenciando o Person da camada 1 por @id; FAQPage só onde a página tem FAQ visível.
- Camada 4, conexão: BreadcrumbList e WebSite como raiz; ItemList apenas para listas que existem na página.
O arquivo llms.txt é opcional nesse desenho: o guia do Google citado acima diz que a busca do Google, inclusive nos recursos de IA, não usa arquivos de texto para IA nem marcação especial. Quem quiser mantê-lo para um consumidor identificado encontra o contexto em llms.txt é o novo robots.txt para IA, e o passo a passo dos dois artefatos, com exemplos de código validados, está no guia prático de Schema, JSON-LD e llms.txt.
Trate a implementação com o rigor de código de produção. Dado estruturado errado ou abandonado vira insumo de resposta incorreta sobre a marca, e a conta chega; argumento o ponto em OpenAI no banco dos réus revela o risco que seu código ignora, no blog da Brasil GEO.
Como medir o que schema pode mudar
Como o efeito esperado é redução de ambiguidade, a medida de acompanhamento é a descrição que os modelos devolvem quando perguntados quem é a marca: nome, categoria, cargo do fundador e serviços corretos, em amostra fixa de prompts, na mesma superfície e no mesmo modelo, antes e depois da implementação. Citação se mede em outra série, com o método descrito em share of voice em IA, e nada neste artigo autoriza esperar que ela suba por causa da marcação. Se as duas séries mudarem juntas, o desenho da Ahrefs mostra por que isso ainda não prova causa.