Quais pesquisas e aprimoramentos valem um novo protocolo?
Planejamento preliminar de 11/09/2026 · histórico
Esta proposta preliminar preserva as sugestões feitas no encerramento do BRGEO-1, em 11/09/2026. A especificação vigente da PesquisaGeo2027 foi definida em 12/09/2026: Anthropic, Google, xAI e OpenAI, com 90 datas qualificadas em até 180 dias e teto de US$20 por data no conjunto. Os estudos permanecem separados.
Regra temporal preliminar, substituída pela especificação de 12/09/2026A proposta abaixo usava três meses de calendário. A regra vigente exige 90 datas distintas qualificadas, não necessariamente consecutivas, entre 01/10/2026 e 29/03/2027, com horário nominal de 05h de São Paulo. O piloto permanece separado; faltantes não viram zeros, e atingir 90 datas não demonstra, por si só, precisão suficiente.
Três frentes que aproveitam o aprendizado do projeto
Preparação com o acervo
Reanalisar antes de gastar
Reprocessar textos preservados, comparar janelas, resolver aliases e testar a influência de entidades dominantes. Extrações determinísticas podem rodar localmente; seus resultados precisam apontar para o texto e a regra que os produziram.
A entrega é uma base para calibrar o novo desenho. Reusar uma resposta antiga não cria outra observação longitudinal.
Novo painel longitudinal
Comparar condições identificáveis
Manter perguntas sentinelas e uma rotação planejada, com os serviços elegíveis nas mesmas células de pergunta e data. Separar idioma, superfície, busca e época de modelo; registrar o que não for observável.
A série diária das sentinelas e os agregados da bateria rotativa têm coberturas diferentes. Os pesos não podem dar vantagem a uma pergunta apenas porque ela foi repetida mais vezes.
Experimento editorial, se houver viabilidade
Testar páginas ou temas com tratamento estável
Sortear grupos de páginas ou tópicos entre intervenção e controle, preservar o HTML servido e registrar versão, hash, período de referência e mudanças paralelas. O teste A/B de visitantes mede outra exposição: cookies não demonstram qual variante um motor observou.
Servir a mesma versão experimental para pessoas e robôs, sem diferenciação oculta por agente. Considerar atrasos de indexação e contaminação por links ou templates compartilhados. Sem grupos suficientes e exposição avaliável, manter o estudo descritivo; um antes/depois isolado não prova efeito causal.
O que o repositório permite aproveitar e o que precisa ser construído
Inventário documental do site no commit 653e6438. A inspeção do código não comprova migração aplicada, agendamento ativo ou implantação dessas adaptações. O estudo futuro precisa de dados e contabilidade separados do produto comercial e do Papers encerrado.
Base existente e adaptação necessária| Capacidade | Base observada | Requisito para outro estudo |
|---|
| Monitor de citações | Quatro adaptadores, banco de perguntas, rotação e controle de concorrência aparecem no código. | Criar tarefas duráveis e gravação incremental. O limite atual de tempo não é limite financeiro; congelar perguntas separadamente do conteúdo editorial que elas também alimentam. |
|---|
| Fila do GEO Checker | Há aquisição atômica de trabalho e recuperação de tarefas interrompidas. | Unir reserva de orçamento e admissão na mesma transação. A consulta financeira separada e as exceções de quota comercial não servem como teto rígido de pesquisa. |
|---|
| Respostas e fontes | O monitor salva excertos; sondas guardam texto bruto ou URLs, com riqueza diferente entre rotas. | Preservar um objeto completo por tentativa e arquivar fontes selecionadas com acesso permitido. URL presente não comprova suporte à afirmação. |
|---|
| Custos e cache | Existem estimativas por tokens e cache de produto por domínio, versão e capacidade. | Conciliar todas as tentativas: custo zero em uma falha não prova gratuidade. Identificar contexto e protocolo; cache de produto não gera réplica científica. |
|---|
| Triagem de concorrentes | A varredura estática e o planejador da etapa aprofundada estão presentes. | O plano não demonstra execução paga. Manter a coorte principal; selecionar apenas alvos já citados favoreceria os mais visíveis. |
|---|
| Classificação e testes | Há regras locais, validadores, testes de execução e utilitários estatísticos. | Validar contra humanos independentes e simular dependência temporal. Teste de software e concordância entre motores não validam o desfecho científico. |
|---|
O protocolo baseado no site registra caminhos, evidências do código e a separação entre capacidade existente, adaptação necessária e proposta ainda não executada.
Como o estudo passa da proposta à publicação
As responsabilidades abaixo organizam o trabalho futuro. Cada passagem exige um artefato verificável e pode reprovar o plano; nenhuma fase está agendada.
Preparar sem novas consultas
Responsabilidade: Ciência, engenharia e curadoria.
Entrega: Pergunta primária, rubrica, matriz de capacidades, tarefas simuladas e teste de restauração.
Critério de avanço: Avançar quando o arquivo e a contabilidade puderem ser refeitos. Falha de integridade ou duplicação impede o piloto.
Validar no piloto
Responsabilidade: Ciência e FinOps.
Entrega: Referência humana reservada, distribuição de custos, falhas e simulação de precisão por contraste.
Critério de avanço: Aprovar apenas um desenho que caiba no orçamento e atenda aos critérios definidos antes. Se nenhum passar, reformular o escopo.
Congelar o protocolo
Responsabilidade: Responsável científico e revisão técnica.
Entrega: Datas, perguntas, superfícies, versões, parâmetros, pesos, limites e regras de pausa versionados.
Critério de avanço: Liberar outro estudo somente com plano revisado e recursos previstos. Sem configuração ou custo verificável, não iniciar.
Observar por três meses completos
Responsabilidade: Operação e curadoria.
Entrega: Tarefas, tentativas, respostas, ausências, versões e gastos ligados às mesmas células de pergunta e data.
Critério de avanço: Pausar diante de falha de qualidade, mudança de instrumento ou limite de orçamento. Uma execução verde não substitui dados íntegros.
Encerrar e analisar
Responsabilidade: Ciência e revisão independente.
Entrega: Acervo final, reconciliação de custos, cobertura, estimativas e análises de sensibilidade previstas.
Critério de avanço: Após o período mínimo, avaliar os critérios de precisão. Resultado inconclusivo é possível; extensão exige decisão e orçamento próprios.
Publicar um pacote reproduzível
Responsabilidade: Responsável científico e curadoria.
Entrega: Manuscrito, código, manifesto, dados com acesso permitido e instruções de reprodução.
Critério de avanço: Outra pessoa deve conseguir refazer as tabelas permitidas. Não anunciar dados abertos antes de disponibilizar o pacote correspondente.
Como validar rótulos, juízes e incerteza sem multiplicar chamadas
Quatro decisões motivadas pela pesquisa recente| Decisão proposta | Como verificar | Evidência e limite |
|---|
| Preservar o julgamento humano | Rubricas distintas para menção, recusa, recomendação, citação e suporte factual; dois avaliadores, rótulos individuais, adjudicação e conjunto reservado. | Elangovan et al., ICLR 2025: publicação de conferência. Correlação agregada pode ocultar desacordo; a rubrica local ainda precisa ser validada. |
|---|
| Calibrar o juiz e seu erro | Comparar a estimativa humana com a assistida, incluindo incerteza da calibração, classes raras e auditoria aleatória de respostas em que os juízes concordam. | Chen et al., 2026 e Mukherjee et al., v2 de 2026: preprints consultados. Independência e consenso não podem ser presumidos neste painel. |
|---|
| Separar deriva do serviço e do avaliador | Sentinelas recebem respostas novas; um arquivo fixo permite verificar mudanças do juiz. Reavaliar o arquivo não conta como coleta fresca. | Wiese, PLOS One 2026: artigo de periódico. Motiva ancoragem humana longitudinal; suas dez semanas não satisfazem o prazo deste plano. |
|---|
| Economizar primeiro na anotação do arquivo | Comparar seleção ativa com seleção probabilística em corpus congelado, registrando probabilidades e pesos. Só adotar ganho que sobreviva à avaliação reservada. | Wu, Nair e Candès, v3 de 2026: preprint. Seu alvo de população finita não valida automaticamente adaptação da coleta ao longo do tempo. |
|---|
Na comparação direta entre humano e juiz, usar uma referência humana independente de quem está sendo avaliado. Anotar apenas casos difíceis ajuda a desenvolver a rubrica, mas não estima sozinho o erro de toda a população. A auditoria de desempenho precisa de seleção probabilística independente ou pesos conhecidos, com incerteza por classe e estrato. Um segundo juiz só entra se demonstrar ganho que justifique custo e latência no mesmo conjunto humano reservado.
As simulações devem considerar dependência por pergunta e data, autocorrelação, mudança de versão, faltantes e erro de anotação. Não aplicar uma fórmula para observações independentes como solução pronta. Réplicas são dimensionadas pelo alvo científico; reduzir temperatura ou o limite de saída para aparentar estabilidade muda a condição de medição.
Separar superfície, citação, fonte e efeito editorial
API e interface pública são instrumentos distintos. A bateria principal deve identificar endpoint, modelo solicitado e retornado quando exposto, idioma, horário, estado de sessão, localização e modo de busca. Uma subamostra previamente selecionada pode estudar a interface pública se o acesso e os termos permitirem; seu resultado não é somado à API como réplica equivalente.
Disponibilidade, recuperação, citação e suporte são etapas diferentes. Uma URL citada não demonstra que a fonte sustenta a afirmação. Quando a recuperação interna não é exposta, o estado é desconhecido. Registrar URL original e final, acesso, instante e captura permitida dos documentos auditados; a página vista semanas depois pode ter mudado.
Search Arena, ICLR 2026, motiva separar preferência humana de factualidade. SourceBench, 2026, é um preprint útil para distinguir qualidade da página e suporte à afirmação; não fornece um avaliador automaticamente validado para PT-BR.
No experimento editorial, pré-especificar efeito por alocação, agrupamento por página ou tema, múltiplos testes e controles negativos. Não selecionar a análise principal apenas entre páginas citadas após a intervenção. O novo protocolo precisa controlar mudanças de templates, links e conteúdo que possam alcançar também o grupo de controle.
Orçamento de execução: limites rígidos ainda precisam de implementação e prova
Contar chamadas pelas células de pergunta × serviço × data × repetições é o início. O orçamento completo inclui validação humana, juízes, buscas, ferramentas, cache, armazenamento e tentativas adicionais. Conferir produto, endpoint, unidades e vigência da tarifa; não transportar um desconto entre provedores ou modelos.
Regra proposta de admissãoCusto conciliado + reservas em aberto + custo máximo da nova tarefa + compromissos de armazenamento devem caber no teto aplicável. A reserva precisa ser atômica e persistente: dois trabalhadores não podem gastar o mesmo saldo. Essa é uma exigência para o novo coletor, não uma garantia já implementada no projeto.
- Reservar antes de enviar. Conferir limites por tarefa, período e estudo. Manter provisionadas chamadas em andamento e conciliar o uso efetivo depois. Se não há limite verificável de uma ferramenta faturável, a configuração não atende ao requisito de teto rígido.
- Falha não significa custo zero. Timeout pode deixar resultado incerto; raciocínio pode consumir tokens sem texto visível. Uma repetição paga exige nova reserva e continua ligada à tarefa original. Não liberar saldo apenas porque o cliente deixou de esperar.
- Lotes precisam caber na pergunta temporal. Processamento assíncrono pode atravessar a janela de comparação. Guardar horários efetivos, IDs e resultados parciais; reservar o lote inteiro. Cancelamento não é necessariamente imediato, e desconto não é universal.
- Cache tem mínimo e validade. Medir o ganho com o prefixo e a cadência reais. Não aumentar o prompt com texto sem função científica para atingir um limiar, nem tratar resposta local reutilizada como observação nova.
- Preservar o objeto recebido. Guardar texto, referências, uso e razões de término; derivar recortes depois. Resultados temporários do fornecedor precisam ser recolhidos e conferidos antes de expirar, com manifesto e restauração testada.
Versões e capacidades também são parte do custo: aliases podem mudar, parâmetros podem não ser suportados e cotas podem ser compartilhadas pelo projeto. A pausa deve mostrar sua causa. Trocar silenciosamente de modelo, reduzir saídas ou deslocar consultas para outro dia não é uma forma válida de manter o plano completo.
Documentação oficial consultada em 11/09/2026: OpenAI, lotes e respostas incompletas; Claude, cache; Gemini, preços e cotas; Perplexity, unidades de cobrança; xAI, ferramentas, armazenamento e lotes. Revalidar as condições antes do piloto e do estudo principal.
Cenários ilustrativos de chamadas: coberturas diferentes, sem precisão garantida
Este exemplo contábil mantém 92 dias que cubram três meses completos, cinco serviços, uma resposta-base por célula, 10% de réplicas novas e reserva de até 5% para tentativas adicionais. Não há datas marcadas nem tamanho amostral aprovado. Os gastos do piloto e da validação exigem planejamento próprio.
Hipóteses de escopo; não equivalentes em precisão ou cobertura| Plano hipotético | Chamadas-base | Com réplicas | Máximo com reserva |
|---|
| 12 prompts por dia | 5.520 | 6.072 | 6.376 |
|---|
| 24 prompts por dia | 11.040 | 12.144 | 12.752 |
|---|
| 24 sentinelas + 42 prompts rotativos por dia | 30.360 | 33.396 | 35.066 |
|---|
Doze prompts continuam sendo apenas doze grupos de perguntas, mesmo repetidos por três meses. A rotação não estima a série diária de cada prompt com a cobertura de uma bateria completa. Escolher o menor plano que passe na simulação de precisão e cobertura; se nenhum couber, restringir a pergunta antes de iniciar.
Tokens não equivalem a chamadas. Medir entrada e saída, raciocínio e ferramentas conforme a cobrança do modelo, sem contar uma parcela duas vezes. Médias do piloto ajudam a prever gasto; o limite admissível de cada tarefa deve sustentar a reserva antes do envio.
As decisões acima são propostas de aplicação, não resultados novos. Elas complementam os estudos de repetição de Schulte et al. (2026) e estabilidade de Sielinski (2026), ambos preprints. A rotação simples não é automaticamente um desenho formal de blocos incompletos balanceados.
Ler o protocolo futuro baseado no site, com matriz do código, critérios e referências. O documento distingue capacidades existentes, adaptações propostas e validações ainda necessárias. Nenhum piloto ou novo agendamento foi iniciado.
PesquisaGeo2027: planejamento do novo estudo. Consulte a regra vigente de 90 datas em até 180 dias, os quatro provedores e o ensaio isolado.