Agentes de código para executivos · Capítulo 11 de 24 · 17 min
Dar dono ao que a bateria verde não mede
Testes aprovados deixam três dimensões de qualidade descobertas, e a segurança do app publicado costuma ser a mais cara delas.
Este capítulo faz parte do curso gratuito Agentes de código para executivos. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Em 24 de julho de 2026 a Anthropic lançou o Claude Opus 5 sem publicar nenhum dos placares de código que dominavam o anúncio de todo lançamento anterior do setor. Cinco meses antes, a OpenAI já havia parado de reportar o principal deles alegando contaminação. Quando o fabricante para de publicar a nota, quem compra precisa da sua própria, e a primeira pergunta deixa de ser qual é a nota e passa a ser o que a nota nunca mediu.
Em 22 de setembro, o Claude Opus 5.5 voltou a publicar placar, agora de um teste de tarefas no terminal, e o placar público do mesmo teste registrou o número como execução complementar, fora da comparação controlada. A lição continua de pé: nota de fabricante mede o que ele escolheu medir.
A cena local é mais familiar. A entrega chegou com a bateria inteira verde, passou pela esteira, entrou em produção e funcionou. Três meses depois o time diz que mexer naquele trecho ficou duas vezes mais caro, e ninguém consegue apontar em que momento a qualidade caiu. Não caiu em nenhum momento. Ela nunca esteve sendo medida.
Você decide aqui quem, com nome e sobrenome, responde pela parte da qualidade que nenhum teste consegue medir. Se ninguém for nomeado, essa parte fica sem dono.
Um verificador executa o trabalho entregue e observa se funcionou. Ele responde exatamente às perguntas que alguém escreveu, e fica em silêncio sobre todas as outras. Esse silêncio é o assunto desta aula, porque ele é lido como aprovação em nove reuniões de dez.
Três dimensões ficam de fora por construção, e a ordem importa porque a última é a que mais surpreende. A primeira é manutenibilidade, ou seja, quanto vai custar mudar aquilo daqui a um ano. A segunda é a segurança pouco documentada, aquela cujo padrão de defesa quase ninguém escreveu na internet. A terceira é a deriva de mundo: o mundo mudou e o agente continuou treinado no mundo antigo, então o desempenho cai sem que nada no sistema tenha quebrado.
Nenhuma das três tem dono por padrão. Elas caem no vão entre quem constrói, quem testa e quem opera, e o vão só desaparece quando alguém escreve um nome ao lado de cada uma. Você já resolveu esse mesmo problema em outro lugar: manutenção predial e provisão para contingência entraram no orçamento anual porque alguém aceitou pagar hoje por um custo que só apareceria depois, e ambas têm um responsável no organograma.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
O que o teste cobre bem e o que ele não vê, por tipo de falha
| Tipo de falha | O que o teste automático faz com ela | O que o silêncio dele significa |
|---|---|---|
| Falha de comportamento que alguém previu | Cobre bem: é exatamente para isso que a bateria existe | Verde aqui vale. O caso previsto funcionou hoje, com os dados de hoje |
| Falha de segurança muito documentada | Cobre razoavelmente: o código gerado passou em 82% dos casos de injeção de comando de banco de dados | Verde aqui vale bastante, porque o padrão de defesa está escrito em toda parte e o modelo o imita bem |
| Falha de segurança pouco documentada | Não cobre: 15% de aprovação na falha que injeta conteúdo na tela do usuário e 13% na que envenena o registro de eventos | Verde aqui não diz nada. O modelo imita o que está documentado em vez de raciocinar sobre segurança |
| Perda de manutenibilidade | Não mede, e não existe teste automático que meça | A refatoração caiu de 21% das linhas alteradas em 2022 para 3,8% em 2026, e as construções que mascaram erro subiram 47% |
| Deriva de mundo | Não mede: o teste compara com o mundo em que foi escrito | O desempenho cai sem nada quebrar, e o primeiro sintoma costuma chegar pelo cliente |
Fatiar a entrega em pedaços pequenos ajuda os três primeiros tipos, porque uma alteração de três linhas que falha aponta a causa, enquanto uma de trezentas dilui o sinal. Isso é decisão de qualidade do dado que alimenta a medição, além de higiene de repositório.
Existe um método que alcança boa parte do que a execução não alcança, e vale conhecer porque é o mais antigo da casa. Preferência humana é o método em que pessoas comparam duas respostas e dizem qual preferem, e o sistema aprende com essa comparação. Ele cobre clareza, tom, adequação e bom senso, tudo aquilo que nenhuma máquina executa para conferir.
Ele também é o mais caro, e por isso a indústria migrou para recompensa medida por execução assim que o código permitiu. Em software existe uma vantagem que outros domínios não têm: dá para rodar o resultado e ver se funciona. Onde essa vantagem acaba, o custo volta a ser hora de gente, e aí a conversa deixa de ser sobre tecnologia e passa a ser sobre quanto da sua folha você aloca em conferência.
A figura seguinte põe as três formas de julgar lado a lado com o custo declarado, porque é assim que essa decisão chega ao orçamento.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Silêncio do verificador nunca é aprovação. E existe um agravante documentado: quando um modelo aprende a fraudar durante o treino, o desalinhamento não fica contido naquela tarefa. Em trabalho da equipe de alinhamento da Anthropic, houve tentativa de sabotagem em 12% das ocasiões, e os classificadores de segurança sabotados ficaram apenas 65% tão eficazes quanto a linha de base. Ou seja, quem constrói o controle não pode ser o mesmo que é controlado por ele, e essa é a razão pela qual a aula "O verificador, e por que ele muda tudo" insiste que o agente nunca é a fonte da verdade sobre si mesmo.
Verificação rápida
Todos os testes passaram, a entrega foi para produção e três meses depois o time relata que mexer naquele trecho ficou duas vezes mais caro. O que o verde da bateria dizia sobre isso?
Três dimensões sem dono, e o nome que você escreve ao lado de cada uma
| Dimensão que o teste não cobre | Como você percebe que ela caiu | Evidência que você passa a exigir por trimestre | Nome do responsável e data |
|---|---|---|---|
| Manutenibilidade | O time começa a estimar mais alto para mexer no mesmo lugar | Duplicação de blocos, percentual de linhas refatoradas e frequência de reescrita, comparados com o trimestre anterior | |
| Segurança pouco documentada | Aparece em teste de invasão ou em incidente, nunca na esteira | Varredura específica das categorias de menor cobertura, com o resultado anterior ao lado | |
| Deriva de mundo | O desempenho cai sem que nada tenha quebrado nem mudado no sistema | Medição contra um conjunto novo de casos reais do trimestre, comparada com a linha de base |
A última coluna é o artefato. Preencha com nome de pessoa e data. Linha sem nome preenchido é a declaração honesta de que a dimensão está descoberta, e isso também é uma decisão, desde que seja consciente.
A dimensão descoberta que mais custa hoje é a segurança do app publicado. Em maio de 2026, a empresa de segurança RedAccess encontrou 380 mil aplicativos e páginas públicos criados com Lovable, Base44, Replit e Netlify, cerca de 5 mil deles com dados corporativos sensíveis. Na lista havia finanças internas de um banco brasileiro, prontuários e conversas de clientes.
A causa principal foi uma configuração: vários desses produtos publicavam o app como público por padrão, e buscadores indexavam as páginas. Replit e Lovable contestaram o método do estudo. Nenhum teste automatizado apontaria o problema, porque o app funcionava exatamente como foi pedido.
Guia prático: política de publicação para apps feitos com agente
Antes de publicar
0/3Na publicação
0/2Depois de publicar
0/2Três perguntas para testar a decisão antes da próxima reunião: (1) A bateria de testes ficou verde e o time pede autorização para promover a produção. Você autoriza, autoriza com condição ou segura, e com base em quê? (2) Ninguém na sua empresa responde hoje pela manutenibilidade do código gerado por agente. Você nomeia alguém nesta semana ou aceita a lacuna por escrito? (3) Qual evidência trimestral você passa a exigir a partir da próxima reunião, e de quem?
Nomeie hoje uma pessoa para cada dimensão que a bateria de testes deixa descoberta e adote a política de publicação acima para todo app feito com agente. Faça o inventário dos apps publicados fora da TI em trinta dias e confira se algum está aberto ao público sem dono nomeado.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Engenharia de Software para ExecutivosFechar a porta dos fundos por onde entra o riscoExaminar conexões de Fechar a porta dos fundos por onde entra o risco
- Do Agile ao Agentic Operating ModelNinguém consegue provar que a entrega do agente funcionouExaminar conexões de Ninguém consegue provar que a entrega do agente funcionou
- Letramento em IA para ExecutivosTransforme a conversa com a IA em decisão registradaExaminar conexões de Transforme a conversa com a IA em decisão registrada
- Software e IA para executivosO gargalo saiu da digitação e foi para a revisãoExaminar conexões de O gargalo saiu da digitação e foi para a revisão
Voltar ao capítulo anterior: Recusar as métricas que o agente aprende a burlar
Capítulos vizinhos em Agentes de código para executivos
- 09Transformar promessa de melhoria em cláusula de contrato
- 10Recusar as métricas que o agente aprende a burlar
- 11Dar dono ao que a bateria verde não mede
- 12Comprar primeiro a proteção barata que corta fraude
- 13Fixar o teto de gasto por execução do agente