FAQ: Schema.org e dados estruturados para IA generativa
Dados estruturados são marcações semânticas, na prática blocos JSON-LD, que descrevem sua marca em um formato que máquinas interpretam sem ambiguidade. Depois da desativação do FAQ rich result em 7 de maio de 2026, os tipos que ainda pagam o esforço em GEO são Organization e Person com sameAs, Article com data, Product com offers e BreadcrumbList, sempre em JSON-LD, o formato que o Google recomenda. Este FAQ responde as 11 dúvidas técnicas que eu mais repito nos projetos.
Eu gosto de dizer que Schema.org é o “RG digital” da sua marca. Sem ele, você é uma entidade anônima na internet — a IA até pode encontrar seu site, mas não consegue entender com precisão o que você faz, quem você atende e por que deveria citar você em vez do concorrente.
Este FAQ reúne as dúvidas técnicas mais comuns sobre dados estruturados no contexto de GEO. Não é um tutorial básico de Schema — é um guia prático para quem quer usar metadados semânticos como arma competitiva em visibilidade algorítmica.
Quais tipos de Schema.org realmente importam para GEO em 2026?
A lista de tipos que pagam o esforço encolheu, e encolheu por evidência. Cinco continuam valendo: Organization e Person com sameAs, que consolidam a entidade e alimentam o Knowledge Graph; Article com author, datePublished e dateModified, que carrega o sinal de frescor; Product e Offer com price, priceCurrency e availability, que ainda geram resultado enriquecido e desambiguam busca comercial; BreadcrumbList, que declara hierarquia; e LocalBusiness com NAP completo para quem tem operação local. O FAQPage saiu dessa lista como alavanca em 7 de maio de 2026, quando o Google desativou o rich result correspondente (Google Search Central, 7 mai 2026). O vocabulário segue válido e o JSON-LD pode continuar na página, mas ele deixou de gerar display e passou a valer como higiene editorial. Priorize pela função de cada tipo, não pela quantidade de tipos implementados.
Como implementar Schema.org no meu site sem criar retrabalho?
Implemente em JSON-LD, dentro de uma tag script, gerado pelo mesmo código que renderiza a página. A ordem que evita retrabalho começa por listar as entidades reais do site, que são a organização, as pessoas, os produtos e os artigos, atribuir um @id estável a cada uma e depois fazer as demais páginas referenciarem a entidade por esse @id, em vez de recopiar o objeto inteiro. Recopiar é o defeito mais comum que encontro em auditoria, e o estrago demora a aparecer: duas cópias divergem com o tempo e o extrator passa a enxergar duas pessoas homônimas, ou duas empresas, no lugar de uma. Em Next.js isso significa um módulo de schemas importado pelas rotas, nunca JSON colado à mão em cada arquivo de página.
JSON-LD ou microdata: qual formato usar?
JSON-LD, por razão operacional antes de doutrinária. O Google recomenda JSON-LD na própria documentação de dados estruturados, e o formato vive em um bloco separado do HTML, o que permite gerá-lo no servidor a partir da mesma fonte de dados que preenche a página. Microdata exige atributos espalhados pelo HTML, então qualquer refatoração de layout pode quebrar a marcação sem que ninguém perceba, porque a página continua renderizando igual. Vale a ressalva contra o exagero: microdata e RDFa seguem sendo vocabulários válidos e o Google continua lendo os dois, então a recomendação de JSON-LD é de manutenibilidade, não de compatibilidade. Se você já tem microdata estável, migrar não é urgente; se vai escrever agora, escreva em JSON-LD.
Como testar se meus dados estruturados estão corretos?
Três verificações, e cada uma responde a uma pergunta diferente. O Schema Markup Validator, em validator.schema.org, checa sintaxe e conformidade com o vocabulário, sem opinar sobre o Google. O Rich Results Test, em search.google.com/test/rich-results, responde apenas se o Google reconhece um tipo elegível a resultado enriquecido, recorte que está ficando mais estreito: o FAQPage saiu dos relatórios e da ferramenta a partir da desativação de 7 de maio de 2026 (Google Search Central, 7 mai 2026). Passar nas duas ferramentas não significa que a marcação esteja correta em substância, e daí a terceira verificação, manual, que quase ninguém faz: leia o JSON gerado e confirme, campo a campo, que cada valor aparece no texto visível da página. Marcação que descreve o que não está na tela contraria as diretrizes de dados estruturados do Google e é descartada inteira, não corrigida em parte.
O que é llms.txt e eu preciso de um?
O llms.txt é uma proposta pública de Jeremy Howard, da Answer.AI, publicada em setembro de 2024 em llmstxt.org: um arquivo de texto na raiz do domínio que descreve em linguagem direta quem é a empresa, o que ela faz, quem atende e quais problemas resolve. O que a maioria dos materiais de GEO omite é que nenhum dos grandes fornecedores documenta, na referência pública dos próprios crawlers, que lê esse arquivo, e John Mueller, Search Advocate do Google, afirmou publicamente em 2025 não conhecer sistema de IA que o utilize. A recomendação honesta segue em duas partes: publique, porque o custo é de uma hora e o arquivo dá à equipe um lugar de referência onde a versão oficial dos fatos fica escrita; e não desloque para ele o orçamento de Organization em JSON-LD nem o de consistência entre fontes externas, que são as camadas com efeito comprovado hoje.
Como configurar o robots.txt para crawlers de IA?
O robots.txt decide quem entra, e é nele que termina a maioria dos diagnósticos de invisibilidade em IA. Os agentes documentados pelos próprios fornecedores são GPTBot, OAI-SearchBot e ChatGPT-User na OpenAI; ClaudeBot, Claude-SearchBot e Claude-User na Anthropic; PerplexityBot e Perplexity-User na Perplexity; e Googlebot mais Google-Extended no Google. Dois papéis distintos costumam ser confundidos na mesma linha de bloqueio: GPTBot e ClaudeBot servem à coleta para treinamento, enquanto OAI-SearchBot e Claude-SearchBot servem à busca dentro do produto, então bloquear o primeiro par sem entender o segundo tira a marca da resposta ao vivo sem que ninguém tenha decidido isso. O Google-Extended também é mal lido com frequência: a documentação do Google define esse controle para uso em Gemini e Vertex AI, e a presença nas AI Overviews segue o Googlebot comum e as diretivas de snippet. Libere o que deve ser lido e restrinja por caminho, não por agente, o que não deve ser público.
Dados estruturados garantem que a IA vai citar minha marca?
Não garantem, e existe medição pública indicando que o efeito isolado é pequeno. A Ahrefs acompanhou 1.885 páginas que adicionaram JSON-LD entre agosto de 2025 e março de 2026, contra quase 4.000 páginas de controle pareadas, e não encontrou ganho de citação atribuível ao schema em AI Overviews, AI Mode ou ChatGPT (Ahrefs, We Tracked 1,885 Pages Adding Schema, mai 2026). A leitura cuidadosa desse resultado depende do recorte: a amostra mediu páginas que já estavam sendo citadas, ou seja, mede seleção dentro do conjunto de fontes, não entrada nele. A conclusão que sustento em consultoria é que schema é pré-requisito de legibilidade e de identidade, enquanto a alavanca de citação está no conteúdo, onde o experimento de Princeton mediu que citar fontes, incluir estatísticas e trazer citação de especialista eleva a visibilidade da fonte em até 40% em motores generativos (Aggarwal et al., GEO: Generative Engine Optimization, KDD 2024, arXiv:2311.09735). Quem espera que a marcação faça o trabalho do texto vai medir zero.
Preciso de dados estruturados em todas as páginas?
Não em todas, e o excesso cobra manutenção. O piso é Organization na home, Product ou Service nas páginas de oferta, Person na página sobre, Article nos textos com autor e data, e BreadcrumbList onde existir hierarquia de navegação, porque trilha visível sem marcação equivalente deixa o extrator sem saber onde aquela página vive dentro do site. Para decidir caso a caso, o critério é um só: a página contém informação que você quer ver citada de forma exata? Se sim, estruture. Se a marcação só repete o que a página já diz de maneira óbvia, ela vira mais um arquivo para manter em sincronia com o texto, e marcação dessincronizada é pior do que marcação ausente, porque contraria diretriz e derruba o bloco inteiro.
Qual a diferença entre Schema.org para SEO e Schema.org para GEO?
O vocabulário é o mesmo; muda o que se preenche e por quê. Em SEO, a marcação existe para disparar um display, sejam estrelas de avaliação, faixa de preço ou trilha de navegação, e o critério de sucesso é a elegibilidade ao resultado enriquecido. Em GEO, ela existe para que o motor identifique a entidade sem ambiguidade e ligue afirmações a ela, então as propriedades que carregam peso são outras: sameAs apontando para perfis externos verificáveis, knowsAbout delimitando a área de competência, areaServed, foundingDate e identifier. A prova prática dessa diferença está em quais tipos sobreviveram a 2026: o FAQPage perdeu o display em 7 de maio e continuou útil como sinal semântico, enquanto Organization com sameAs nunca gerou display nenhum e sempre foi o bloco mais importante para desambiguar a marca.
Como lidar com dados estruturados em sites multi-idioma?
Cada versão de idioma precisa do próprio bloco, escrito no idioma daquela página, com inLanguage no valor correto: pt-BR para a versão brasileira, não o pt genérico, porque o subtipo regional é o que separa conteúdo brasileiro de português europeu na hora da recuperação. As versões se conectam por hreflang no HTML ou no cabeçalho HTTP, que é o mecanismo documentado pelo Google para páginas alternativas de idioma; sameAs não faz esse trabalho, já que ele declara identidade da entidade em fontes externas e não tradução da mesma página. O erro mais caro nesse cenário é traduzir o texto visível e esquecer o JSON-LD, deixando a página em espanhol com description em português. A marcação passa a divergir do que o usuário lê, que é exatamente o que as diretrizes do Google proíbem.
FAQPage ainda vale a pena depois da desativação de maio de 2026?
Vale como higiene, não como alavanca, e essa distinção decide orçamento. O Google desativou o FAQ rich result em 7 de maio de 2026, e com ele foi embora a razão pela qual muita empresa mantinha FAQs infladas, que era ocupar altura visual na página de resultados (Google Search Central, 7 mai 2026). O vocabulário FAQPage continua válido em schema.org, o JSON-LD segue sendo lido por Bing e por crawlers de LLM, e a Microsoft documenta em sua orientação pública para webmasters que seções de perguntas e respostas bem estruturadas ajudam sistemas de IA a referenciar conteúdo com mais precisão. Daí três recomendações que não se contradizem: mantenha a marcação onde ela já existe, porque o custo de manutenção é próximo de zero e o benefício fora do Google é positivo; não inicie projeto novo de FAQ schema esperando ganho de clique no Google; e corte as perguntas que foram escritas para o schema em vez de para o leitor, porque essas viraram ruído sem contrapartida.
Checklist rápido de dados estruturados para GEO
- Organization com nome, URL, logo, sameAs e areaServed
- Product ou Service com descrição detalhada e offers
- FAQPage apenas onde as perguntas são reais: o rich result saiu em 7 mai 2026 e o schema virou higiene, não alavanca
- Person para o founder/CEO com knowsAbout e sameAs
- Article em todos os posts do blog com author e datePublished
- BreadcrumbList em todas as páginas
- Arquivo llms.txt na raiz do domínio
- robots.txt permitindo GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot e Google-Extended
Seus dados estruturados estão prontos para IA?
Faço uma auditoria técnica completa do seu Schema.org, llms.txt e robots.txt. Em 30 minutos, você sabe exatamente o que está faltando para IAs citarem sua marca.
Quero minha auditoria técnica gratuita