Agentes de código para executivos · Capítulo 14 de 24 · 18 min
Decidir entre comprar, alugar ambiente ou treinar
Treinar só compensa quando três condições aparecem juntas, e uma matriz mostra em que quadrante cai a sua tarefa.
Este capítulo faz parte do curso gratuito Agentes de código para executivos. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Chegou por e-mail uma proposta de treinar um modelo próprio. Ela vem com desenho de arquitetura, cronograma de seis meses e um número de retorno na última página. Faltam três informações, e nenhuma delas é técnica: quantas vezes por mês a empresa executa aquela tarefa, quem escreve o verificador que vai julgar o resultado e o que acontece com o projeto se o fornecedor do ambiente desaparecer no meio do caminho.
O contexto de mercado convida ao erro. O gasto mundial com plataformas e modelos de inteligência artificial deve somar 64 bilhões de dólares em 2026, uma alta de 63,4% sobre 2025. Dentro desse total, o segmento que cresce mais rápido é o de modelos especializados de domínio, com 210%. Quando o segmento que mais cresce é o do modelo feito sob medida, toda proposta de treinar em casa chega com o vento a favor, e a diligência tende a afrouxar exatamente onde deveria apertar.
Você decide aqui se o caso da sua empresa é comprar pronto, alugar ambiente de treino de terceiro ou treinar em casa. E decide qual das três você não vai fazer, e por quê.
O programa de trainee com corte por etapa
Um programa de trainee recebe centenas de candidatos, corta a maioria em cada etapa e mantém poucos no fim. O desenho funciona porque o critério de corte é escrito antes, e porque cada etapa custa pouco perto do custo de contratar errado. O laço de treino de um agente faz o mesmo movimento em escala industrial: gera muitas tentativas, descarta quase todas e mantém as que passam no verificador.
Onde a analogia para de valer: o trainee reprovado continua existindo, e a decisão de cortá-lo tem custo reputacional e humano que obriga quem decide a pensar duas vezes. O candidato descartado pelo sistema desaparece sem custo nenhum, o que torna o descarte barato demais e desloca todo o risco para a qualidade do critério de corte. Quando o descarte é grátis, um critério ruim não dói até chegar a produção.
O item que a proposta chama de projeto tem um nome mais preciso e uma implicação de compra. Ambiente de treino é a tarefa preparada que o agente resolve repetidas vezes para aprender, com o verificador embutido nela. Não é o modelo, não é a infraestrutura e não é o time: é a tarefa com a régua acoplada, empacotada para rodar milhares de vezes.
Essa distinção importa porque ambiente de treino virou item de catálogo em 2026, e não era em 2025. Um único fornecedor colocou mais de 365 mil tarefas de treino de agente atrás de uma interface única, das quais cerca de 198 mil de engenharia de software em mais de vinte linguagens. Alugar deixou de ser hipótese e passou a ser a coluna do meio de uma decisão de três colunas.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Onde a sua tarefa cai, e o que isso autoriza
Eixo horizontal: Volume da tarefa, medido em execuções por mês no último trimestreEixo vertical: Existe um verificador confiável que executa e observa o resultado
Volume alto, verificador ainda inexistente
- Treinar aqui é o gasto mais caro do catálogo, porque o laço vai otimizar contra uma régua que ninguém escreveu
- A compra certa deste trimestre é o verificador. O treino entra no trimestre seguinte, se ainda fizer sentido
- Exemplo: triagem de chamados cuja qualidade só é julgada por leitura humana amostral
Volume baixo, verificador ainda inexistente
- Comprar pronto e parar por aí, porque nem o treino nem o verificador se pagam neste volume
- O esforço interno vai inteiro para a régua de aceite da entrega, que é barata e serve para qualquer fornecedor
- Exemplo: geração de relatórios internos que rodam algumas dezenas de vezes por mês
Volume baixo, verificador confiável de pé
- Comprar pronto e usar o verificador que você já tem como régua de aceite, cobrada em contrato
- O verificador existente já entrega a maior parte do benefício sem nenhum ciclo de treino
- Reavaliar quando o volume dobrar, com a decisão marcada em calendário e com dono
Volume alto, verificador confiável de pé
- É o único quadrante em que alugar ambiente de treino ou treinar em casa se justifica economicamente
- Comece alugando: o catálogo de tarefas prontas encurta meses de trabalho e o compromisso é reversível
- Treinar em casa só depois que o ciclo alugado tiver provado o ganho contra a linha de base
A matriz só funciona se alguém classificar a tarefa antes de a proposta chegar à mesa. Vale aqui a lógica da triagem do pronto-socorro: a enfermeira da entrada, barata e rápida, classifica a gravidade antes de acionar o especialista caro, e ninguém chama o cirurgião para um curativo. No fluxo de compra, a triagem custa minutos e consiste em duas perguntas com resposta numérica, o volume medido e a existência do verificador.
O padrão de compra da empresa brasileira já reflete essa economia, e vale conhecê-lo antes de propor o caminho mais ambicioso. Entre as empresas brasileiras que adotaram inteligência artificial, 80% adquiriram software ou sistemas prontos e 60% contrataram desenvolvedores externos, enquanto o desenvolvimento interno entre grandes empresas subiu de 24% para 37%. A leitura executiva é direta: comprar pronto é o comportamento dominante e defensável, e treinar em casa é a exceção que precisa justificar as três condições.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
As três condições que precisam estar presentes ao mesmo tempo
| A condição | Como você confere numa reunião de uma hora | O que acontece se ela faltar |
|---|---|---|
| A tarefa se repete em volume | Peça o número de execuções por mês do último trimestre, medido no sistema, sem estimativa | O ciclo de treino nunca se paga, e o piloto vira uma demonstração cara que ninguém consegue encerrar |
| Existe um verificador que executa e observa | Peça para rodar o verificador na sua frente, sobre uma entrega que já foi reprovada | O laço otimiza contra opinião, e o número melhora sem que nada tenha melhorado de verdade |
| A empresa aguenta o ciclo até o fim | Peça o teto de gasto do período e o nome de quem tem autoridade para declarar a parada | O piloto termina por cansaço, sem decisão registrada e sem nenhum aprendizado que sobreviva à troca de time |
As três valem juntas, e a ordem entre elas não importa. Faltando qualquer uma, o laço vira teatro caro, e o caminho honesto do trimestre é comprar pronto e gastar o esforço interno na régua de aceite.
Duas armadilhas de preço, e nenhuma delas aparece em comparativo de tabela. A primeira é o calendário. Em julho de 2026, a tabela oficial anunciava que o Claude Sonnet 5 passaria a custar 50% mais em 1º de setembro. Em setembro, o fabricante cancelou a alta e manteve o preço menor como padrão. Tabela muda nos dois sentidos, e um piloto orçado em julho precisava de duas colunas de preço. A segunda é invisível na tabela: os modelos mais novos de uma mesma família usam um tokenizador, o contador que parte o texto em pedaços cobráveis, que produz cerca de 30% mais tokens para o mesmo texto. Por isso preço por token igual não significa custo igual. A defesa contra as duas é a conta desta parte: comparar por tarefa concluída e reconsultar a tabela oficial na véspera de assinar.
Verificação rápida
Um fornecedor propõe treinar um agente sob medida para a triagem de chamados de suporte da sua empresa. A tarefa roda 40 mil vezes por mês, número medido no sistema. Perguntado sobre quem julga se a triagem ficou certa, ele responde que um modelo avaliador atribui nota de 0 a 10, e que a nota média subiu de 6,2 para 8,4 nos testes internos dele. O que a régua das três condições autoriza?
O veto de uma linha, e as quatro linhas que o sustentam
- Proposta sem o número medido de execuções por mês do último trimestre volta ao remetente antes de qualquer discussão de mérito.
- Quem julga o resultado tem nome no documento, e o verificador roda na sua frente antes da assinatura, sobre uma entrega reprovada.
- O teto de gasto do período e o nome de quem declara a parada estão na primeira página, nunca no anexo.
- Todo preço citado traz a data da tabela oficial de onde foi lido, e a tabela é reconsultada na véspera de assinar.
- Faltando qualquer uma das três condições, a decisão do trimestre é comprar pronto e gastar o esforço interno na régua de aceite.
Três perguntas para testar a decisão antes da próxima reunião: (1) Chega uma proposta de treinar modelo próprio e o volume da tarefa não está medido. O que você devolve, e em quanto tempo você espera o número de volta? (2) A sua empresa tem verificador confiável em uma superfície de trabalho e nenhum nas outras cinco. Qual dos três caminhos você aprova para cada grupo, e qual você recusa de propósito? (3) O preço do modelo que sustenta o seu piloto sobe 50% daqui a cinco semanas. Você renegocia, antecipa o piloto ou troca de modelo, e quem tem autoridade para decidir isso na sua empresa?
O caminho de alugar treino por reforço na OpenAI encolheu em 2026, e isso muda a matriz acima para quem pensava em ajuste fino por reforço (RFT). Desde 02/07/2026, só cria job de fine-tuning a organização que rodou inferência num modelo ajustado nos últimos 60 dias. Em 06/01/2027, nem os clientes ativos poderão criar jobs novos. O guia de RFT lista o o4-mini como modelo disponível, e os modelos já ajustados seguem respondendo até a aposentadoria do modelo base.
Calendário da plataforma de ajuste fino e avaliação da OpenAI
| Data | O que muda | Efeito na decisão |
|---|---|---|
| 07/05/2026 | Organizações que nunca rodaram fine-tuning deixam de criar jobs | Quem não começou não começa mais por esse caminho |
| 03/06/2026 | Anúncio de desligamento do Evals, do Agent Builder e dos prompts reutilizáveis | Avaliações e juízes precisam de casa nova |
| 02/07/2026 | Só cria job quem usou um modelo ajustado nos últimos 60 dias | Cliente parado perde o acesso sem aviso individual |
| 31/10/2026 | Avaliações existentes no Evals ficam só para leitura | Exportar dados e juízes antes desta data |
| 30/11/2026 | Painel e API do Evals saem do ar | Migração para o Promptfoo, indicada pela própria OpenAI |
| 06/01/2027 | Clientes ativos deixam de criar jobs de fine-tuning | RFT na OpenAI vira legado; inferência dos modelos ajustados continua |
Fonte: OpenAI, página de descontinuações da API, consultada em 01/10/2026
Antes de aprovar uma proposta de RFT em outubro de 2026
Passo 1: Peça ao fornecedor a plataforma exata em que o treino vai rodar
Se a resposta for a API de fine-tuning da OpenAI, confira na página de descontinuações se a sua organização ainda cria jobs.
Deu certo quando: Nome da plataforma, modelo base e data limite escritos na proposta.
Erro comum: Aprovar cronograma que termina depois de 06/01/2027 na OpenAI.
Passo 2: Separe o que sobrevive à troca de plataforma
Conjunto de dados, juiz e conjunto retido são seus e mudam de casa; o modelo ajustado não muda.
Deu certo quando: Dados e juízes guardados num repositório da empresa, fora da conta do fornecedor.
Erro comum: Deixar o juiz configurado só dentro do painel do Evals.
Passo 3: Compare com o laço sem treino
O laço de recompensa sobre o pedido ao modelo, descrito em "Separar treino por consequência de instrução bem escrita", entrega parte do ganho sem job de treino.
Deu certo quando: Linha de base medida com o laço sem treino antes de pagar o treino.
Erro comum: Comparar o modelo treinado com o pedido mal escrito de antes.
No fim você tem: Uma proposta que diz onde o treino roda, até quando a plataforma aceita o job e o que a empresa leva se ela fechar.
Posicione a sua tarefa principal na matriz desta aula e escreva qual das três condições para treinar está ausente. Sem as três presentes, aprove comprar ou alugar e arquive o pedido de treino. Reconsulte a tabela oficial de preços na véspera de assinar e anexe a data à proposta.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Do Agile ao Agentic Operating ModelTrocar a contagem de esforço por um painel que o conselho entendeExaminar conexões de Trocar a contagem de esforço por um painel que o conselho entende
- Letramento em IA para ExecutivosCalcule quanto a IA custa por entrega aprovadaExaminar conexões de Calcule quanto a IA custa por entrega aprovada
- Vendas Consultivas de Serviços de GEO e IAEscolher as contas que merecem dez meses do seu timeExaminar conexões de Escolher as contas que merecem dez meses do seu time
- Segundo cérebro com IAOnde buscar ajuda no Brasil para montar o seu agenteExaminar conexões de Onde buscar ajuda no Brasil para montar o seu agente
Voltar ao capítulo anterior: Fixar o teto de gasto por execução do agente
Capítulos vizinhos em Agentes de código para executivos
- 12Comprar primeiro a proteção barata que corta fraude
- 13Fixar o teto de gasto por execução do agente
- 14Decidir entre comprar, alugar ambiente ou treinar
- 15Aprovar o piloto só com quatro linhas escritas
- 16Escolher entre Claude Code e Codex pelo tipo de trabalho