Agentes de código para executivos · Capítulo 7 de 24 · 23 min
Exigir prova executada no lugar de nota dada
Pergunte quem julgou o resultado e com o quê: a resposta separa opinião de fato em quinze segundos.
Este capítulo faz parte do curso gratuito Agentes de código para executivos. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
O gráfico aparece sempre no terceiro slide. Duas barras, a da direita mais alta, e um rodapé com a palavra melhoria. Ninguém na sala pergunta quem mediu, com o quê, em que máquina, nem contra qual teste. A assinatura sai em duas semanas, e o primeiro trimestre de operação não reproduz a barra da direita. O dinheiro já saiu. O que faltou ali cabia em quinze segundos de pergunta e não exigia auditoria técnica nenhuma.
Você decide aqui o que perguntar quando um fornecedor mostrar um gráfico de melhoria: quem julgou aquele resultado, com o quê, e o que você faz se a resposta for evasiva. Por que isso toca receita e risco: o número que abre a proposta é o mesmo número que fecha o contrato e o mesmo que vai ao conselho no trimestre seguinte. Se ele veio de julgamento, ele muda de valor conforme quem julga, e ninguém consegue reconstruir a conta depois. A decisão que cabe a você: qual evidência a sua empresa passa a aceitar como prova de que um agente melhorou. O que dá para delegar: rodar a medição e montar o dossiê. O que não dá: dizer o que conta como prova suficiente antes de o dinheiro sair.
Glossário rápido
RL, aprendizado por reforço
Treinar por consequência em vez de treinar por instrução: em vez de dizer como fazer, você define o que vale prêmio no resultado. Termo já trabalhado na parte anterior, retomado aqui em uma linha porque tudo nesta parte trata de quem mede esse resultado.
Juiz por nota
Quem atribui uma pontuação ao trabalho entregue com base em julgamento, seja uma pessoa ou outro modelo treinado para imitar uma pessoa.
Juiz por execução
O que roda o trabalho entregue e registra se funcionou, sem atribuir julgamento nenhum.
A prova com a questão que ninguém viu antes
Todo mundo conhece o candidato que estuda pelas provas dos anos anteriores. Ele decora o padrão, reconhece o enunciado no dia e vai bem. A banca que quer saber quem de fato aprendeu troca as questões e observa o que acontece com as notas. A queda que aparece nesse dia diz menos sobre a turma e mais sobre o que a nota anterior estava medindo, que era a prova, e não o aluno.
Onde a analogia para de valer: o candidato humano que decora a prova antiga ao menos aprendeu algo transferível no caminho. O agente pode aprender a assinatura do teste sem aprender nada do problema, e a queda só aparece quando o teste muda.
As duas famílias de juiz
Juiz por nota atribui uma pontuação ao trabalho entregue com base em julgamento. Pode ser uma pessoa lendo o resultado, pode ser outro modelo treinado para imitar o que uma pessoa diria. Nos dois casos, o que sai é uma opinião em formato de número.
Juiz por execução roda o trabalho entregue e registra se funcionou. Não atribui julgamento nenhum. O que sai é um fato com data, que outra pessoa consegue repetir na máquina dela e conferir sozinha.
A frase que resolve isso em quinze segundos de reunião cabe em uma linha. Score que não pode ser reconstruído a partir de evidência é opinião com aparência de número.
As duas famílias de juiz, e o que cada uma consegue sustentar
Juiz por nota: alguém, ou outro modelo, atribui pontuação
O que você recusa como prova
- A pontuação existe e ninguém consegue refazer a conta a partir de evidência
- Dois avaliadores diante do mesmo material chegam a números diferentes
- O número sobe quando quem avalia trabalha para quem entrega
- Cobre gosto, estilo e intenção, que é justamente a parte impossível de executar
- Repetir a medição daqui a três meses exige o mesmo avaliador, com o mesmo humor
Juiz por execução: o trabalho roda e o resultado fica registrado
O que você aceita como prova
- Passou ou não passou, com registro que outra pessoa abre sozinha
- Repetir a medição no seu ambiente devolve o mesmo resultado
- Funciona sem a opinião de ninguém, inclusive sem a sua
- Cobre exatamente o que foi escrito, então o que ficou de fora precisa estar declarado
- Serve de anexo contratual, porque tem data, ambiente e resultado observado
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Quatro números que explicam por que medir agente ficou difícil em 2026
63%
das resoluções bem-sucedidas do melhor agente auditado foram respostas que já existiam em algum lugar, encontradas em vez de derivadas
Cursor, 25/06/2026, auditoria de 731 execuções
73,0%
é o que o mesmo agente marca quando o ambiente é isolado, contra 87,1% com histórico e rede à disposição
Cursor, 25/06/2026, SWE-bench Pro
59,4%
dos 138 problemas auditados do teste público mais citado do setor têm defeito material de desenho
OpenAI, 23/02/2026, revisão por seis engenheiros por caso
0
testes públicos de código reportados no lançamento do modelo topo de linha da Anthropic, cinco meses depois da denúncia de contaminação
Anthropic, 24/07/2026, anúncio do Claude Opus 5
Dois fornecedores podem estar rodando exatamente o mesmo modelo por baixo e chegar a números diferentes, sem que nenhum dos dois esteja mentindo. O que muda entre eles é o sistema que executa o modelo: quanto contexto ele carrega, quantas tentativas ele faz, quais ferramentas pode chamar e o que consegue consultar durante a execução. Comparar dois números medidos em arranjos diferentes compara os arranjos. Quando você pedir comparação, exija o arranjo fixado por escrito antes da medição, e exija que os dois fornecedores rodem no mesmo.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Dois meses depois, o quadro mudou de novo, e a mudança reforça a pergunta desta aula. Em 22 de setembro de 2026 a Anthropic lançou o Claude Opus 5.5 publicando 66,4% no Terminal-Bench 4.0, teste em que o agente resolve tarefas reais no terminal, a tela de comandos do computador. O placar público do mesmo teste, atualizado em 25 de setembro, lista esse número como execução complementar, sem comparação controlada.
Na tabela ranqueada desse placar, o GPT-6 Astra da OpenAI aparece com 58,2% e o Claude Fable 5.1 com 57,9%. O mesmo teste produz líderes diferentes conforme quem roda e com qual arranjo. Nenhum dos números é falso: eles respondem a perguntas diferentes, e só a ficha do arranjo diz qual.
Um teste, dois placares: Terminal-Bench 4.0 em setembro de 2026
| Modelo | Número | Quem mediu | Como ler |
|---|---|---|---|
| Claude Opus 5.5 | 66,4% | Anthropic, lançamento de 22/09/2026 | Execução do próprio fabricante, fora do ranking público |
| GPT-6 Astra | 58,2% | Placar público agregado, 25/09/2026 | Primeiro lugar entre as execuções ranqueadas |
| Claude Fable 5.1 | 57,9% | Placar público agregado, 25/09/2026 | Empate técnico com o primeiro colocado |
| Grok 4.7 | 37,6% | Placar público agregado, 25/09/2026 | Sexto lugar; o fabricante divulgou 38,0% |
Compare só dentro da mesma coluna de medição. Misturar a linha do fabricante com as do placar público compara arranjos em vez de modelos.
Fonte: Anthropic (22/09/2026) e CodingFleet, placar do Terminal-Bench 4.0 (25/09/2026)
Verificação rápida
Um fornecedor apresenta um salto de 22 pontos no acerto do agente dele. Você pede a procedência e recebe esta resposta: a medição foi feita pelo time do fornecedor, no ambiente do fornecedor, contra o conjunto de testes público que acompanha a ferramenta. Qual é a leitura correta desse número?
As duas perguntas que abrem qualquer reunião de resultado
Preencha com o número que chegou à sua mesa esta semana e envie antes da próxima reunião. O objetivo é obter as duas respostas por escrito, com anexo, e não convencer ninguém de nada.
Documento montado
PEDIDO DE PROCEDÊNCIA DE RESULTADO Fornecedor ............ [FORNECEDOR E PRODUTO] Número apresentado .... [O NÚMERO APRESENTADO, COM A PALAVRA USADA NO SLIDE] Apresentado em ........ [DATA E CONTEXTO DA APRESENTAÇÃO] Antes de este número entrar em qualquer decisão de contrato, preciso de duas respostas por escrito, com o artefato anexado. 1. QUEM JULGOU ESTE RESULTADO, E COM O QUE? Se foi uma pessoa ou outro modelo atribuindo pontuação, quero o critério escrito e a amostra avaliada. Se foi execução, quero o registro de execução, com data e ambiente. 2. QUEM RODOU A MEDIÇÃO, EM QUE AMBIENTE E CONTRA QUAL TESTE? Quero saber se o ambiente tinha acesso a internet e a histórico do projeto, e se o conjunto de tarefas já era conhecido pela ferramenta antes da medição. CONDIÇÃO DE ACEITE Sem as duas respostas com anexo em cinco dias úteis, o número entra na pauta com a etiqueta de estimativa do fornecedor e perde o status de resultado medido. A comparação com qualquer concorrente fica suspensa até que os dois tenham rodado no mesmo arranjo.
O que você digitar fica salvo neste navegador. Nada é enviado para servidor algum.
Três perguntas para testar a decisão antes da próxima reunião: (1) O gráfico do fornecedor sobe e a única fonte da medição é o próprio fornecedor. Qual é a sua primeira pergunta, e o que você faz se a resposta demorar mais de cinco dias úteis? (2) Seu time propõe comparar duas ferramentas usando o número que cada fabricante publica no próprio site. Você aprova, aprova com condição ou recusa, e qual é a condição? (3) Um número de melhoria chega sem dizer quem julgou o resultado. Em que ponto da sua agenda de decisão ele ainda pode entrar, e a partir de que ponto ele fica de fora?
Guia prático: teste A/B de prompts com métrica, antes de gastar verba. A prova executada desta aula vale também para o pedido que gera anúncio, e-mail ou página. Dois prompts disputam os mesmos briefs, com o mesmo modelo e a mesma temperatura, e só o prompt muda. A documentação da Anthropic resume o ciclo numa figura: casos de teste primeiro, prompt depois, rodadas de correção e uma prova final com casos guardados.

Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Teste A/B de dois prompts de anúncio, do brief ao veredito
Seis passos com uma ferramenta de código aberto, o Promptfoo, que a própria OpenAI indicou como destino de quem usava o Evals.
Passo 1: Monte um arquivo briefs.csv com 40 a 60 linhas
Colunas produto, público e oferta. Inclua casos difíceis: oferta sem desconto, produto de nome longo, público regulado.
Deu certo quando: Arquivo aberto sem erro numa planilha e revisado por quem conhece a conta.
Erro comum: Testar só com os três produtos mais vendidos.
Passo 2: Escreva os dois prompts em arquivos separados e mude uma coisa só
O prompt A pede benefício; o B pede prova social. Se mudar tom e tamanho ao mesmo tempo, o resultado não diz qual mudança pesou.
Deu certo quando: Diferença entre os arquivos cabe em uma ou duas frases.
Erro comum: Comparar o prompt novo com o antigo escrito às pressas.
Passo 3: Declare as métricas no arquivo de configuração
Uma regra em JavaScript para o limite de caracteres e uma rubrica llm-rubric com nota mínima de 0,7, com o modelo juiz fixado em temperatura zero.
Deu certo quando: O comando de validação do Promptfoo aprova o arquivo sem aviso.
Erro comum: Juiz igual ao modelo gerador, que tende a gostar do próprio texto.
Passo 4: Rode cada prompt duas vezes antes de comparar
A diferença entre duas rodadas do mesmo prompt mostra o ruído da medição.
Deu certo quando: Você sabe quantos pontos de taxa de aprovação a medição oscila sozinha.
Erro comum: Declarar vencedor por uma diferença menor que o próprio ruído.
Passo 5: Compare taxa de aprovação, nota média e custo por resposta
A tela de resultado põe as saídas lado a lado, com passou ou falhou por caso e o custo total de cada prompt.
Deu certo quando: Planilha com as três colunas por prompt e os casos em que os dois discordam.
Erro comum: Olhar só a nota média e ignorar o caso que reprovou nos dois.
Passo 6: Leve o vencedor ao experimento real com metade do tráfego
O teste fora do ar escolhe o candidato; o experimento na plataforma de anúncios decide pela taxa de cliques e pela conversão.
Deu certo quando: Experimento ativo com data de leitura marcada e métrica de decisão escrita antes de começar.
Erro comum: Encerrar o experimento no terceiro dia porque um lado saiu na frente.
No fim você tem: Um prompt escolhido por números medidos nos seus briefs, com o ruído conhecido e o veredito final dado pelo tráfego real.
# promptfooconfig.yaml - teste A/B de dois prompts de anúncio
description: "Títulos de pesquisa, prompt A (benefício) contra prompt B (prova social)"
prompts:
- id: file://prompts/a_beneficio.txt
label: A
- id: file://prompts/b_prova_social.txt
label: B
providers:
- id: anthropic:messages:MODELO_GERADOR # o mesmo modelo para A e B
config:
temperature: 0.7
defaultTest:
options:
provider:
id: openai:MODELO_JUIZ # juiz diferente do gerador
config:
temperature: 0
assert:
- type: javascript
value: "output.split('\n')[0].length <= 30"
metric: formato
- type: llm-rubric
value: "Título claro sobre a oferta do brief, com benefício concreto e chamada para ação. Repetir palavra-chave não conta."
threshold: 0.7
metric: persuasao
tests: file://briefs.csv
# Rodar: npx promptfoo@latest eval -c promptfooconfig.yaml --no-cache
# Ver: npx promptfoo@latest viewPegue o último gráfico de melhoria que um fornecedor lhe mostrou e escreva ao lado quem mediu, com qual arranjo e em qual data. Qualquer campo em branco vira pergunta por escrito ao fornecedor. Sem resposta em cinco dias úteis, o número sai da apresentação ao comitê.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Prompt Engineering para ExecutivosAvaliar a IA com uma planilha de 20 a 50 tarefasExaminar conexões de Avaliar a IA com uma planilha de 20 a 50 tarefas
- Do Agile ao Agentic Operating ModelNinguém consegue provar que a entrega do agente funcionouExaminar conexões de Ninguém consegue provar que a entrega do agente funcionou
- Frontends com VibecodingSupervisionar o modelo que opera o computadorExaminar conexões de Supervisionar o modelo que opera o computador
- Bastidores: Como Este Portal Foi ConstruídoBanca de modelos: pesquisa e redação com fonteExaminar conexões de Banca de modelos: pesquisa e redação com fonte
Voltar ao capítulo anterior: Separar treino por consequência de instrução bem escrita
Capítulos vizinhos em Agentes de código para executivos
- 05Medir o reflexo do agente antes de pagar para mudá-lo
- 06Separar treino por consequência de instrução bem escrita
- 07Exigir prova executada no lugar de nota dada
- 08Vetar proposta que não nomeia o verificador
- 09Transformar promessa de melhoria em cláusula de contrato