Agentes de código para executivos · Capítulo 17 de 24 · 16 min
Decidir onde o Grok Build entra ao lado do Claude
O Grok custa menos por token e perde nos testes de terminal, por isso a conta certa se faz por tarefa concluída.
Este capítulo faz parte do curso gratuito Agentes de código para executivos. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
O Grok 4.7, lançado pela xAI em 21 de setembro de 2026, custa 2 dólares por milhão de tokens de entrada e 6 de saída. O Claude Opus 5.5 custa 4 e 20. Numa planilha de compras, a diferença parece encerrar a discussão, e é exatamente aí que o orçamento de agente costuma errar.
No placar público do Terminal-Bench 4.0, rodar a bateria inteira com o Grok 4.7 consumiu 5,5 bilhões de tokens e custou 3,7 mil dólares, para 37,6% de tarefas resolvidas. O Claude Fable 5.1, com preço por token de cinco a oito vezes maior, consumiu 2,7 bilhões, custou 6,2 mil e resolveu 57,9%. Por ponto de acerto, a distância entre os dois quase desaparece.
Você decide aqui se o Grok entra no portfólio de assistentes da empresa e para qual trabalho. Por que isso toca dinheiro e risco: o preço por token convida a trocar tudo, e um dos editores de código com IA mais usados agora pertence ao grupo que fabrica o Grok. O que dá para delegar: medir o custo por tarefa no seu código. O que não dá: decidir quanto a empresa aceita depender de um único grupo.
Glossário rápido
Grok Build
Assistente de programação de terminal da xAI, lançado em maio de 2026 e vendido nas assinaturas SuperGrok e X Premium Plus.
Subagente
Agente auxiliar que o principal dispara em paralelo, como o mestre de obras que divide a reforma entre equipes.
Custo por ponto de acerto
Quanto custou cada ponto percentual de tarefas resolvidas: o preço do resultado, em vez do preço do insumo.
MCP
Padrão aberto que liga o agente a ferramentas externas, como uma tomada que aceita qualquer aparelho.
A xAI entrou no mercado de assistentes de programação em maio de 2026 com o Grok Build, um agente de terminal com modo de plano: você aprova o que ele vai fazer antes da execução. Ele lê os arquivos de instrução, os plugins e os servidores de ferramenta que o time já usa, e roda subagentes em paralelo, cada um numa cópia separada do repositório.
O Grok 4.7 chegou em setembro com uma rodada de treino por reforço mais longa, segundo a xAI, com peso em tarefas que levam horas para terminar. A janela de contexto é de 500 mil tokens, metade do milhão oferecido pelo Claude e pela OpenAI. Em repositório grande, a diferença pesa na hora de carregar o projeto inteiro de uma vez.
Claude e Grok lado a lado, conferido em 26/09/2026
| Item | Claude | Grok (xAI) |
|---|---|---|
| Modelo de trabalho pesado | Opus 5.5: US$ 4 / 20 por milhão de tokens | Grok 4.7: US$ 2 / 6 (a partir de 200 mil tokens: 4 / 12) |
| Modelo de volume ou de código | Sonnet 5: US$ 2 / 10 | grok-build-0.1: US$ 1 / 2, janela de 256 mil tokens |
| Janela de contexto | 1 milhão de tokens | 500 mil tokens no Grok 4.7 |
| Assistente de terminal | Claude Code, em todos os planos pagos | Grok Build, nas assinaturas SuperGrok e X Premium Plus |
| Ferramentas externas por MCP | Conector na própria API, em fase beta | Só servidores remotos; na interface compatível com a OpenAI, a trava de aprovação humana precisa morar no seu sistema |
Fonte: Documentação oficial da xAI e página de preços da Anthropic, consultadas em 26/09/2026
Nos números do próprio lançamento, a xAI comparou o Grok 4.7 ao Claude Fable 5.1 e publicou o resultado mesmo quando perdia. No teste de terminal, 38,0% contra 57,9%. Na correção de defeitos do DeepSWE, 71,0% contra 72,7%, praticamente empate. Num teste de agente jurídico da Harvey, o Grok venceu com 19,6% contra 6,7%.
A leitura executiva é direta. O Grok perde onde o agente trabalha sozinho por muito tempo no terminal e empata na correção pontual. Esse mapa diz onde vale testar primeiro, e o teste no seu código decide.
Grok 4.7 contra Claude Fable 5.1, com quem mediu
38,0% x 57,9%
Terminal-Bench 4.0, tarefas longas no terminal
xAI, 21/09/2026: vantagem do Claude
71,0% x 72,7%
DeepSWE, correção de defeitos em repositório
xAI, 21/09/2026: empate técnico
19,6% x 6,7%
Agente jurídico da Harvey
xAI, 21/09/2026: vantagem do Grok
US$ 3,7 mil x 6,2 mil
custo de rodar o Terminal-Bench inteiro
Placar público, 25/09/2026
Fonte: Tabela de lançamento da xAI, via MarkTechPost (21/09/2026), e placar público do CodingFleet (25/09/2026)
A segunda metade da decisão fica fora do placar. Em junho de 2026 a SpaceX anunciou a compra da Anysphere, dona do editor Cursor, por 60 bilhões de dólares em ações. A transação foi concluída em 14 de agosto, e o Cursor passou a operar dentro da SpaceXAI, o grupo que fabrica o Grok. O Grok 4.7 está disponível no Cursor em todos os planos.
Para quem usa o Cursor com modelos Claude, nada muda no contrato de hoje. Muda a pergunta de governança: o editor do time pertence a um fabricante de modelo concorrente. Peça por escrito a política de roteamento de modelos, a regra que decide qual modelo atende cada pedido, e o compromisso de manter essa escolha com o cliente.
Concentração num grupo só contra portfólio com saída
Editor, modelo e assinatura no mesmo grupo
O que evitar
- Preço baixo hoje e poder de negociação baixo na renovação
- Roteamento de modelo decidido pelo dono do editor
- Troca de fornecedor exige migrar ferramenta e hábito ao mesmo tempo
Editor, modelo e régua separados
O que fazer
- Instruções do agente em arquivo que o time controla e leva para qualquer ferramenta
- Régua e lote retido da empresa, rodados em qualquer modelo
- Cláusula de escolha de modelo pelo cliente no contrato do editor
Sócio de tecnologia de uma empresa de cobrança com 12 desenvolvedores
Serviços financeiros
Dor
O financeiro pediu para trocar todo o assistente de código pelo modelo mais barato por token.
Solução
Teste de duas semanas em trinta tarefas reais, separadas entre correção pontual e migração, com o mesmo teto por execução.
Resultado
O modelo barato empatou nas correções e perdeu nas migrações, onde gastou o dobro de tokens e pediu revisão extra. A empresa dividiu o trabalho por tipo de tarefa e a conta mensal caiu 18%.
Cenário construído para fins didáticos. Números não correspondem a cliente específico.
Quando usar qual: Claude ou Grok
Cinco regras para decidir com o seu código e sem fidelidade a marca.
Passo 1: Teste o Grok primeiro em correção pontual e em alto volume
É onde o placar do próprio fabricante mostra empate e o preço por token pesa a favor.
Deu certo quando: Custo por tarefa concluída menor, com a mesma aprovação no lote retido.
Erro comum: Comparar só o preço por token e ignorar o consumo, que no placar público foi duas vezes maior.
Passo 2: Mantenha o Claude nas tarefas longas e autônomas
Migração e investigação em vários arquivos, onde a diferença no teste de terminal passa de vinte pontos.
Deu certo quando: Menos devolução na revisão das entregas longas.
Erro comum: Mandar a migração crítica para o modelo mais barato por economia de planilha.
Passo 3: Ponha a aprovação humana no seu código antes de ligar ferramentas externas ao Grok
Na interface compatível com a OpenAI, a API da xAI não aceita a trava de aprovação.
Deu certo quando: Nenhuma ação externa sem aceite registrado.
Erro comum: Supor que a trava vem de fábrica.
Passo 4: Peça ao Cursor a política de roteamento por escrito
O editor agora pertence ao grupo que fabrica o Grok.
Deu certo quando: Documento assinado com a regra de escolha do modelo.
Erro comum: Aceitar a garantia verbal do representante.
Passo 5: Refaça a comparação a cada lançamento
Grok 4.7 e Claude Opus 5.5 saíram com um dia de diferença em setembro.
Deu certo quando: Medição com no máximo 30 dias antes de cada decisão.
Erro comum: Decidir pelo placar do mês anterior.
No fim você tem: Um portfólio em que cada modelo faz o trabalho em que custa menos por tarefa concluída, com saída garantida em contrato.
Rode o Grok e o Claude no mesmo lote de trinta tarefas, separando correção pontual de tarefa longa, e calcule o custo por tarefa concluída em cada grupo. Peça ao fornecedor do editor a política de roteamento por escrito. Decida em quinze dias com os dois documentos na mesa.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- Claude Code CLI: Programação com IAPesar preço, tempo real e maturidade antes de contratar o GrokExaminar conexões de Pesar preço, tempo real e maturidade antes de contratar o Grok
- Prompt Engineering para ExecutivosDecidir onde o Grok cabe ao lado do ClaudeExaminar conexões de Decidir onde o Grok cabe ao lado do Claude
- MCP para quem decideComparar Claude e Grok antes de liberar conectoresExaminar conexões de Comparar Claude e Grok antes de liberar conectores
- Software e IA para executivosPesar Claude contra Grok depois da compra da CursorExaminar conexões de Pesar Claude contra Grok depois da compra da Cursor
Voltar ao capítulo anterior: Escolher entre Claude Code e Codex pelo tipo de trabalho
Capítulos vizinhos em Agentes de código para executivos
- 15Aprovar o piloto só com quatro linhas escritas
- 16Escolher entre Claude Code e Codex pelo tipo de trabalho
- 17Decidir onde o Grok Build entra ao lado do Claude
- 18Comparar Claude e Gemini depois da troca pelo Antigravity
- 19Separar quem escreve o verificador de quem escreve o código