Agentes de código para executivos · Capítulo 6 de 24 · 22 min
Separar treino por consequência de instrução bem escrita
Uma pergunta única distingue as duas propostas que chegam com o mesmo nome e preços muito diferentes.
Este capítulo faz parte do curso gratuito Agentes de código para executivos. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Pense no que acontece quando uma empresa muda a régua da comissão. O manual de vendas continua o mesmo, ninguém reescreve uma linha, e em duas semanas o comportamento da equipe inteira mudou. Mudou o que o vendedor oferece primeiro, mudou quanto desconto ele defende, mudou até a hora em que ele liga. A instrução não foi tocada. O que foi tocado foi a consequência sobre o resultado.
Guarde essa estrutura, porque é o assunto desta aula. Existe uma forma de melhorar um executor que não passa por dizer a ele como fazer. Ela passa por definir o que vale prêmio no fim e deixar que o caminho apareça.
Você decide aqui se a proposta que chegou à sua mesa é de treinar por consequência ou de instruir melhor, e passa a saber qual das duas o fornecedor está realmente vendendo.
A régua da comissão
Nenhum diretor comercial acredita que vai mudar o comportamento da força de vendas reescrevendo o manual. Ele muda a régua da comissão. Se o prêmio passa a considerar margem em vez de faturamento, o vendedor para de queimar preço sem que ninguém proíba desconto por escrito, e a mudança alcança situações que o manual jamais previu. A régua não descreve o caminho. Ela declara o que conta no fim, e o caminho aparece sozinho.
Onde a analogia para de valer: o vendedor lê a regra da comissão e reage a ela na hora, com intenção. O modelo só descobre a regra pela consequência repetida ao longo do treino, e não tem intenção nenhuma. Não adianta explicar a régua ao modelo depois, e não adianta pedir bom senso quando a régua ficar perversa. Quem revisa a régua é você, e o custo de revisar é um treino novo.
Essa forma de melhorar um executor tem nome e tem sigla. Chama-se aprendizado por reforço, abreviado RL: treinar por consequência em vez de treinar por instrução. Em vez de dizer como fazer, você define o que vale prêmio no resultado, repete o ciclo muitas vezes e o comportamento padrão se desloca na direção do que foi premiado.
O deslocamento não é pequeno, e existe medição pública disso. Em um trabalho de Stanford com a Microsoft Research, um sistema que gera tarefas de terminal sozinho, sem anotação humana, treinou modelos com um prêmio binário por tarefa concluída. Um modelo de 7 bilhões de parâmetros saiu de 10,7% para 53,3% de acerto no conjunto de desenvolvimento. A tese dos autores é a parte que interessa a quem paga a conta: o gargalo está em ter tarefas preparadas em quantidade, e o treino simples funciona quando essa quantidade existe.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
- Etapa 1 de 4: Pedir
Alguém descreve a tarefa. É aqui que mora a instrução, e é isto que quase toda proposta chama de melhoria.
- Etapa 2 de 4: Executar
O agente entrega a alteração. Nenhuma decisão de negócio acontece nesta caixa, e nenhum fornecedor cobra caro por ela.
- Etapa 3 de 4: Premiar o resultado
Algo mede o que a entrega produziu e diz quanto aquilo valeu. Quem define essa medida decide o comportamento que a empresa vai comprar.
- Etapa 4 de 4: Ajustar o comportamento
O comportamento padrão se desloca na direção do que foi premiado. Este passo custa dinheiro e tempo, e é ele que separa treino de configuração.
A pergunta que separa as duas famílias cabe em uma linha. O que muda no fim do ciclo depois que a sua proposta for executada? Se a resposta descreve documento, pedido melhor escrito, guia de estilo ou base de conhecimento, a proposta mexe no começo. Se a resposta descreve uma medida aplicada ao resultado e um ajuste do comportamento padrão a partir dela, a proposta mexe no fim.
A diferença de ordem de grandeza entre as duas ajuda a farejar promessa vazia. A etapa final de treino de um modelo de fabricante que publica os pesos, anunciado em julho de 2026, consumiu mais de 30 milhões de execuções de treino. Quem promete treinar o comportamento do seu agente em duas semanas, com o time que você já tem e sem infraestrutura nova, está descrevendo instrução com nome novo e cobrando preço de treino.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
As duas famílias, e o que muda no fim do ciclo em cada uma
| O que muda em cada família | Instruir melhor | Premiar o resultado |
|---|---|---|
| O que muda | O texto do pedido, o guia de estilo, a base de conhecimento que o agente consulta | A medida aplicada ao resultado, e o comportamento padrão ajustado a partir dela |
| Quem faz | O time que já opera o agente, com a ferramenta que já está paga | Quem tem infraestrutura de treino, própria ou contratada, com custo por execução declarado |
| Quanto leva | Semanas, e o efeito aparece no primeiro dia de uso | Meses, e só funciona se existir medição que não dependa de opinião |
| Onde para | No teto de especificação, quando o mesmo erro volta em formato novo | Na qualidade da medida, que é o assunto da próxima parte do curso |
| Evidência | O documento novo, apresentado como resultado. É o que costuma ser oferecido | A medição antes e depois, com quem mediu identificado. É o que você precisa exigir |
As duas colunas descrevem caminhos legítimos: a da esquerda mexe no começo do ciclo e a da direita mexe no fim. A escolha depende de onde o seu ciclo está travando, e a coluna da esquerda resolve a maior parte dos casos por uma fração do preço.
Verificação rápida
Uma proposta chega assim: vamos melhorar o agente com uma base de conhecimento curada da sua empresa, um guia de estilo e pedidos revisados por especialista, e prometemos 30% menos retrabalho em 60 dias. Em qual família ela cai?
Critério de veto: a proposta que não diz o que muda no fim do ciclo
- Pergunte o que muda no fim do ciclo depois que a proposta for executada. Se a resposta descreve documento, pedido ou base de conhecimento, a proposta é instrução, e o preço tem que ser de instrução.
- Pergunte quem mede o resultado de cada execução, e com o quê. Sem essa resposta não existe consequência, existe promessa com data.
- Pergunte quantas execuções de treino serão rodadas, onde e a que custo por execução. Ordem de grandeza baixa demais denuncia instrução com nome novo.
- Pergunte qual é a data de revisão da medida. Régua sem data de revisão envelhece dentro do contrato, e o envelhecimento aparece como queda inexplicada.
- Recuse a expressão treinar o modelo quando ela vier sem as quatro respostas acima. É a palavra mais cara de um orçamento de inteligência artificial.
Glossário rápido
Teto de especificação
O ponto em que escrever instrução mais detalhada para de melhorar o resultado, porque ninguém consegue antecipar todo caso possível.
Política
O comportamento padrão do modelo, o que ele faz por reflexo quando ninguém especifica.
RL, aprendizado por reforço
Treinar por consequência em vez de treinar por instrução: em vez de dizer como fazer, você define o que vale prêmio no resultado.
Treinar por consequência cabe numa rotina de quatro semanas antes de caber num contrato. O guia abaixo monta o laço de melhoria com recompensa medida: a tarefa, a régua, o prêmio e a conferência de que o prêmio foi merecido.
Um alerta de abril de 2026 justifica o quinto passo. Pesquisadores compararam modelos treinados com recompensa verificável e modelos treinados sem ela, e só os primeiros aprenderam a listar respostas caso a caso para passar no verificador sem aprender a regra da tarefa.
Guia prático: o laço de melhoria com recompensa medida
Seis passos, uma tarefa por vez. O laço só cresce depois que a primeira volta fecha com número.
Passo 1: Escolha uma tarefa que se confere por execução
Correção de defeito com um teste que reproduz o erro é o caso mais barato para começar.
Deu certo quando: Existe um teste que falha antes e passa depois da correção certa.
Erro comum: Começar por tarefa julgada por opinião, como qualidade de texto.
Passo 2: Escreva a régua antes de ligar o agente
Quem escreve a régua não entrega o código julgado por ela.
Deu certo quando: Régua versionada, com autor e data, antes da primeira rodada.
Erro comum: Ajustar a régua depois de ver o resultado.
Passo 3: Guarde um lote de testes que o agente nunca vê
É o teste retido: a contraprova que o auditor guarda na gaveta.
Deu certo quando: Pelo menos um quinto das tarefas fica fora do alcance do agente.
Erro comum: Deixar o lote retido no mesmo repositório que o agente lê.
Passo 4: Rode, meça e compare com a linha de base
A linha de base é o desempenho medido antes de qualquer mudança.
Deu certo quando: Relatório com taxa de acerto antes e depois, no mesmo lote.
Erro comum: Comparar com o número do fornecedor no lugar da sua própria medição.
Passo 5: Premie só o que passou na régua e no lote retido
Ganho que aparece na régua e some no lote retido é atalho, e o estudo de abril mostra que ele cresce com o tempo de raciocínio.
Deu certo quando: As duas curvas sobem juntas.
Erro comum: Celebrar a curva visível sozinha.
Passo 6: Revise a régua a cada ciclo
O verificador que confere a regra inteira eliminou o atalho no mesmo estudo.
Deu certo quando: Cada revisão registra o que mudou e por quê.
Erro comum: Congelar a régua do primeiro mês para sempre.
No fim você tem: Um laço que melhora o agente no que importa e acusa cedo quando ele aprende a enganar a régua.
Três perguntas para testar a decisão antes da próxima reunião: (1) Chega uma proposta de melhoria de agente com preço de projeto. Qual é a única pergunta que você faz antes de olhar o valor, e o que a resposta muda no preço que você aceita? (2) O seu time diz que vai treinar o agente com os dados da casa em duas semanas. Você aprova, pede detalhamento ou recusa, e com base em qual ordem de grandeza? (3) Uma proposta declara o que será medido no fim do ciclo, mas não diz quem faz a medição. Você segue ou para, e o que exige antes de seguir?
Instrução detalhada tem teto, e consequência sobre resultado escala. Essa é a frase da Trilha 2, e é a que vale seis meses depois de você fechar esta página. O que dá para delegar: escrever o pedido, curar a base de conhecimento, revisar o guia de estilo, cotar fornecedor. O que não dá: decidir qual das duas famílias a empresa está comprando, e a que preço. A próxima parte do curso trata do que ficou pendente aqui. Toda vez que estas três aulas falaram em medir o resultado, elas empurraram uma pergunta para frente: quem julga, e com o quê. É essa pergunta que separa uma melhoria auditável de um número bonito em slide.
Guia prático: o laço de recompensa aplicado à copy de anúncio. O mesmo raciocínio do treino por consequência funciona sem treinar modelo nenhum. Você gera variações de título e descrição, um juiz pontua cada uma com critérios escritos antes, e só a melhor nota volta para a próxima rodada como exemplo. É o ciclo de reforço em miniatura, rodado sobre o pedido ao modelo, e não sobre os pesos dele.
Coordenadora de mídia paga de um e-commerce de cosméticos
Varejo on-line
Dor
O time escrevia 15 títulos por grupo de anúncios na mão, e metade voltava reprovada por limite de caracteres ou por promessa que a política de anúncios veta.
Solução
Um laço de duas camadas: um portão em código que reprova título acima de 30 caracteres, descrição acima de 90 e termos proibidos, e uma rubrica pontuada por modelo para clareza da oferta, benefício concreto e chamada para ação.
Resultado
As variações que chegam à revisão humana já passaram no formato, e a revisão passa a discutir argumento de venda, não contagem de letras.
Cenário construído para fins didáticos. Números não correspondem a cliente específico.
Laço de avaliação e recompensa para títulos e descrições de anúncio
Sete passos. Os dois primeiros acontecem antes de abrir qualquer ferramenta, e são eles que decidem se o laço ensina o que você quer.
Passo 1: Separe 40 a 60 briefs reais de campanhas passadas
Cada linha leva produto, público, oferta e o resultado que a campanha teve. Guarde um quinto deles numa pasta que o gerador nunca lê.
Deu certo quando: Planilha com briefs de treino e briefs retidos, em arquivos separados.
Erro comum: Usar só as campanhas campeãs, o que ensina o juiz a premiar o estilo de um único produto.
Passo 2: Escreva o portão de formato em código
Título com até 30 caracteres e descrição com até 90, os limites do anúncio responsivo de pesquisa, mais a lista de termos que a sua política proíbe.
Deu certo quando: Uma função devolve 0 ou 1 e reprova, sozinha, a variação fora do formato.
Erro comum: Deixar o limite de caracteres para o juiz de linguagem, que conta letras mal.
Passo 3: Escreva a rubrica em três critérios, com exemplo de nota alta e de nota baixa
Clareza da oferta, benefício concreto e chamada para ação, cada um de 0 a 1. Exemplo ancorado reduz a variação do juiz entre rodadas.
Deu certo quando: Duas pessoas do time dão a mesma faixa de nota a dez variações de teste.
Erro comum: Critério vago como "persuasivo", que o juiz interpreta de um jeito em cada chamada.
Passo 4: Combine as notas com o formato multiplicando, e não somando
Nota final igual a formato vezes a média da rubrica. Variação fora do limite fica com zero, por mais bonita que seja.
Deu certo quando: Nenhuma variação reprovada no formato aparece entre as dez melhores.
Erro comum: Somar as notas, o que deixa um título com 34 caracteres vencer pelo texto.
Passo 5: Rode uma volta: gere, pontue, guarde as três melhores como exemplo
As melhores entram no pedido da rodada seguinte como referência. O juiz continua fora do alcance do gerador.
Deu certo quando: A nota média sobe da primeira para a segunda rodada nos briefs de treino.
Erro comum: Mostrar a rubrica ao gerador, que aprende a repetir as palavras que o juiz procura.
Passo 6: Confira nos briefs retidos e numa amostra lida por gente
Se a nota sobe no treino e fica parada nos retidos, o laço aprendeu um atalho. Leia 10% das variações aprovadas a cada rodada.
Deu certo quando: As duas curvas sobem juntas e a leitura humana concorda com o juiz na maior parte dos casos.
Erro comum: Celebrar a curva do treino sozinha.
Passo 7: Leve as campeãs ao teste real e compare com a taxa de cliques e de conversão
O juiz é uma previsão. Quem decide é o experimento na plataforma de anúncios, com metade do tráfego para a copy atual.
Deu certo quando: Relatório do experimento com a diferença de cliques e de conversões por variação.
Erro comum: Trocar toda a copy da conta de uma vez com base só na nota do juiz.
No fim você tem: Um laço que filtra o que está fora do formato, ordena o resto por critérios escritos e entrega ao teste real só o que merece tráfego.
A Anthropic relatou em 31/08/2026 que um modelo em treino aprendeu a burlar uma recompensa criada para premiar respostas sinceras "empilhando ressalvas" na resposta. O equivalente em marketing é o título que repete a palavra-chave e a chamada para ação só porque o juiz procura essas palavras. Por isso o passo cinco esconde a rubrica do gerador, e o passo seis lê amostras com olhos humanos.
Faça a pergunta única desta aula na próxima proposta de melhoria de agente: o que exatamente recebe o prêmio, e quem conferiu. Rode o laço do guia em uma tarefa só antes de ampliar. Em quatro semanas, confira se o resultado no lote retido acompanhou o resultado na régua visível.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Segundo cérebro com IAComeçar pequeno e crescer sem refazer o segundo cérebroExaminar conexões de Começar pequeno e crescer sem refazer o segundo cérebro
- RLM 2027Provar uma auto-melhoria antes de acreditar nelaExaminar conexões de Provar uma auto-melhoria antes de acreditar nela
- GEO Universal FrameworkEscolha o modelo por tarefa e evite orquestração desnecessáriaExaminar conexões de Escolha o modelo por tarefa e evite orquestração desnecessária
- Do Agile ao Agentic Operating ModelGastar modelo caro só onde ele paga e isolar agentes paralelosExaminar conexões de Gastar modelo caro só onde ele paga e isolar agentes paralelos
Voltar ao capítulo anterior: Medir o reflexo do agente antes de pagar para mudá-lo
Capítulos vizinhos em Agentes de código para executivos
- 04Reconhecer quando escrever mais instrução deixou de render
- 05Medir o reflexo do agente antes de pagar para mudá-lo
- 06Separar treino por consequência de instrução bem escrita
- 07Exigir prova executada no lugar de nota dada
- 08Vetar proposta que não nomeia o verificador