Segundo cérebro com IA · Capítulo 14 de 16 · 12 min
Ler um placar de memória sem ser enganado
Leia o teste antes do número e veja se o placar vale para a pousada.
Este capítulo faz parte do curso gratuito Segundo cérebro com IA. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Leia o placar de um fornecedor de memória com quatro perguntas (quem mediu, em qual prova, contra quem e em que conversa) e decida a troca por uma prova sua, lida com margem de erro. Sem essas respostas, o placar descreve a conversa do fornecedor, e a decisão de contratar fica apoiada na propaganda.
Antes de começar, tenha o número que o fornecedor mostrou, a tabela do artigo de onde ele saiu e 20 perguntas reais do seu balcão com a resposta certa. Pular as perguntas custa caro depois da assinatura: em 2025, o mesmo sistema de memória, o Zep, apareceu com quatro placares diferentes na mesma prova, todos publicados por empresas que vendem memória.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Os quatro placares saíram no LoCoMo, um benchmark (prova padronizada, com perguntas de resposta conhecida, que dá nota ao agente, como exame de direção). Em abril de 2025, a Mem0 publicou um artigo em que o Zep, concorrente, marcava 65,99. A Zep respondeu que o sistema tinha sido configurado errado e anunciou 84, depois corrigido para 75,14 por erro de conta; o diretor de tecnologia da Mem0 refez a conta e chegou a 58,44.
Por que o mesmo sistema de memória tem quatro placares?
O mesmo sistema tem quatro placares porque cada empresa montou a prova do concorrente com a configuração que ela mesma escolheu. Quem vende conhece a própria configuração, e a do concorrente fica nas mãos de quem quer vencer; uma conta errada muda o resultado em vários pontos. E cada prova imita um tipo de conversa: a de conversas curtas favorece quem põe tudo na mesa do modelo, e a de fatos que mudam de data favorece quem guarda datas.
As três provas públicas de memória e o que cada uma mede
| Prova | O que mede | Tamanho |
|---|---|---|
| LongMemEval | Cinco habilidades, como perceber que um fato mudou e dizer “não sei” | 500 perguntas escritas à mão |
| LoCoMo | Memória de conversas muito longas | Cerca de 600 turnos, em até 32 sessões |
| MemBench | Memória de fatos e memória de reflexão | Cenários em que o agente conversa ou só observa |
Das três, o LongMemEval é a mais parecida com um negócio de clientes que voltam, porque pergunta por fatos que mudaram entre conversas. Nenhuma das três mede se o agente usa a memória sem ser perguntado: num estudo da Universidade de Kyoto aceito no EMNLP 2026, com 40 usuários por quatro meses, o sistema que acertava 78,8% quando perguntado usou só 7,9% desses fatos quando o assunto voltou sem pergunta.
Que quatro perguntas fazer ao número do fornecedor
Pergunte quem mediu, em qual prova, contra quem e em que tipo de conversa. No exemplo do curso, um fornecedor abre a apresentação com “+18,5% de acerto”, número que a Zep publicou no LongMemEval. Quem mediu foi a própria Zep; a prova foi a versão curta, com conversas de cerca de 115 mil tokens; o adversário foi a conversa inteira na frente do modelo, com um modelo só, o gpt-4o.
A quarta pergunta muda a leitura. Na tabela da própria Zep, os 18,5% são ganho relativo sobre uma subida de 60,2% para 71,2% de acerto, ou seja, 11 pontos percentuais. Pense na ocupação subindo de 50% para 60%: são 10 pontos percentuais a mais e, em relação ao começo, 20% a mais. Os dois números contam o mesmo ganho, e o maior costuma ir para o anúncio.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Na mesma tabela, a Zep mostra onde a ferramenta ganha e onde perde, e esse detalhe raramente chega ao slide de vendas.
O resultado do Zep no LongMemEval por inteiro, pela conta da própria Zep
+11,0 pontos
de 60,2% para 71,2% de acerto
com o gpt-4o, contra a conversa inteira no modelo
2,58 s
tempo de resposta, contra 28,9 s com a conversa inteira
mesma medição da Zep
80,4%
acerto sobre o que o assistente disse, contra 94,6% com a conversa inteira
com o gpt-4o; onde a ferramenta perde
56,7%
acerto em preferências do usuário, contra 20,0% com a conversa inteira
com o gpt-4o; onde a ferramenta mais ganha
O painel mostra por que um número sozinho engana: a mesma ferramenta ganha muito num tipo de pergunta e perde em outro. O placar também envelhece. Em 2026, criadores de outros sistemas publicaram placares próprios acima de 90% no mesmo LongMemEval, com modelos mais novos, e um número medido com o gpt-4o não disputa com um medido com modelo de outra geração. O tamanho do acervo também pesa: acrescentar conversas sem relação com a pergunta derruba a confiabilidade de sistemas que iam bem.
Leve as quatro perguntas a qualquer número que um vendedor mostrar. Quem conhece o próprio teste responde em poucos minutos, com a tabela do artigo aberta; quem desconversa já deu a resposta. O curso “GEO e Knowledge Graph” ensina como pegar número inventado no relatório do fornecedor.
O que perguntar a um número de fornecedor antes de aceitar
| O que você vê | O que perguntar | O que fazer |
|---|---|---|
| Só a porcentagem de ganho | De quanto para quanto, em pontos | Peça os dois números da comparação |
| O nome de uma prova | O que ela mede e o tamanho da conversa | Compare com as conversas do seu balcão |
| Um adversário vencido | Quem configurou o adversário | Peça o resultado com o adversário configurado pelo dono dele |
| Um modelo de IA só | Qual modelo e quantas rodadas | Peça o resultado com o modelo que você usa |
| Só o acerto | Quanto texto e quanto custo por resposta | Peça custo e tempo ao lado do acerto |
| Nenhum teste seu | Como a ferramenta erra nas suas perguntas | Rode a sua prova |
Só a última linha dá um número que vale para o seu negócio, porque mede a conversa do seu cliente. As mesmas perguntas, feitas a quem vende agentes de código, estão no curso “Reinforcement Learning para Vibecoding: do prompt ao loop verificável”, em sete perguntas ao fornecedor antes de assinar, com duas que valem aqui: quanto custa cada resposta certa e qual é o teto de gasto.
Como montar a prova da pousada e ler a margem de erro
Monte a prova com 20 perguntas reais, itens de resposta sim ou não e três rodadas por pergunta, e leia o resultado como faixa, e não como número exato. Com 20 perguntas, a sorte do dia mexe muito no resultado, como uma semana cheia que não prova que a temporada mudou. A faixa mostra onde o acerto de verdade provavelmente está; se as faixas de duas opções se sobrepõem, a diferença entre elas pode ser sorte.
Três trabalhos sustentam o método. Pesquisadores de Bristol e Oxford mostraram na ICML 2025 que, com poucas dezenas de perguntas, a margem de erro do jeito usual sai estreita demais, e recomendam a conta de Wilson. Em 2026, a Maritaca AI e o Jusbrasil, que desenvolvem e usam os modelos avaliados, mostraram em conversas reais em português que itens de sim ou não fazem juízes diferentes concordarem. E a prova τ-bench, de 2024, criou a regra de contar acerto só quando a tarefa passa em todas as rodadas.
A prova da pousada com margem de erro
Passo 1: Junte 20 perguntas reais e guarde-as com quem atende o balcão
Do WhatsApp, do telefone e das correções do balcão, com recados que não perguntam, como “chego no horário de sempre”.
Erro comum: O erro mais comum é mandar as perguntas ao fornecedor antes da prova. Ele afina a ferramenta para elas; mande só uma amostra e guarde o resto.
Passo 2: Escreva para cada pergunta de dois a quatro itens de resposta sim ou não
Por exemplo: citou a diária de R$ 480? Ofereceu o quarto 3?
Deu certo quando: Duas pessoas que corrigem a mesma resposta chegam à mesma contagem.
Passo 3: Confira o estado final quando a pergunta gera uma ação
A reserva ficou com o preço certo na planilha, e não só na frase da resposta.
Passo 4: Rode cada pergunta três vezes em cada opção
Mesmas perguntas, mesma ordem.
Deu certo quando: Você tem, por opção, quantas das 20 passaram nas três rodadas.
Erro comum: Contar a melhor das três. Agente acerta às vezes; conta como acerto só o que passou nas três.
Passo 5: Leia cada resultado como faixa, na tabela abaixo
Deu certo quando: Você vê se as faixas das opções se sobrepõem.
Passo 6: Compare pergunta a pergunta
Conte em quantas só a opção nova acertou e em quantas só a atual acertou.
Deu certo quando: Deu certo quando a decisão sai dessa contagem e das faixas, e não do número maior.
No fim você tem: Uma tabela com os acertos em três rodadas, a faixa de cada opção e a contagem pergunta a pergunta, repetida todo mês e a cada versão nova da ferramenta ou do modelo.
O curso “Prompt Engineering para Executivos” leva a mesma ideia a 20 a 50 tarefas, no capítulo que monta a primeira suíte de avaliação. O passo 5 usa a tabela abaixo, calculada pela conta de Wilson.
A faixa de acerto de uma prova pequena
| Acertos na prova | Faixa provável do acerto | O que a faixa diz |
|---|---|---|
| 20 de 20 | De 84% a 100% | Nem a nota máxima garante acerto sempre |
| 17 de 20 | De 64% a 95% | Cobre quase toda a faixa de 14 |
| 14 de 20 | De 48% a 86% | Cobre quase toda a faixa de 17 |
| 43 de 50 | De 74% a 93% | Mais perguntas estreitam a faixa |
Conta de Wilson com 95% de confiança, a recomendada para provas com poucas dezenas de perguntas.
Na tabela, 17 contra 14 parece vitória clara, mas as faixas quase se cobrem, e com 20 perguntas a diferença ainda pode ser sorte. Se as faixas se sobrepõem e as perguntas em que só a nova acertou não passam claramente das em que só a atual acertou, é empate: não troque e fique com a mais barata. Se precisa decidir entre opções próximas, aumente a prova para 50 perguntas antes de trocar. Se a faixa da nova fica inteira acima da faixa da atual, troque.
Está pronto quando você tem, para cada opção, os acertos nas três rodadas, a faixa e a contagem pergunta a pergunta, e a decisão de trocar ou ficar saiu dessa tabela. Quando a prova precisar rodar sozinha a cada mudança, o curso “RAG em produção” mostra o conjunto de perguntas com resposta conhecida e como medir cada etapa. O próximo passo é achar quem monte o agente com você: abra “Onde buscar ajuda no Brasil para montar o seu agente” e leve as 20 perguntas.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Gestão de Projetos GEOMedir a presença da marca com o mesmo teste todo mêsExaminar conexões de Medir a presença da marca com o mesmo teste todo mês
- Frontends com VibecodingComparar modelos e interpretar benchmarksExaminar conexões de Comparar modelos e interpretar benchmarks
- Prompt Engineering para ExecutivosAvaliar a IA com uma planilha de 20 a 50 tarefasExaminar conexões de Avaliar a IA com uma planilha de 20 a 50 tarefas
- GEO e Knowledge GraphMedir sem se enganar: três fontes oficiais e a pergunta do denominadorExaminar conexões de Medir sem se enganar: três fontes oficiais e a pergunta do denominador
Voltar ao capítulo anterior: Qual ferramenta de memória serve para o agente da pousada