RLM 2027 · Capítulo 8 de 24 · 15 min
Situar agentes, híbridos e RLM numa matriz de decisão
Cinco problemas de um acervo ambiental, cada um no quadrante certo, com a técnica indicada e o teste que confirmaria a escolha.
Este capítulo faz parte do curso gratuito RLM 2027. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Contexto longo, RAG e compactação já têm lugar marcado no mapa da Veredas. Faltam duas famílias que, à primeira vista, parecem o próprio RLM: os agentes de código com subagentes, como o Claude Code e o Codex, e os modelos treinados para decompor um problema em chamadas recursivas.
Confundir essas famílias leva a compras erradas. Um gestor que vê “subagentes” na página de um produto pode supor que ganhou um RLM e descobrir que o agente puxa o acervo inteiro para dentro da própria conversa. Outro pode descartar o RLM porque “o agente já faz isso”, sem ter medido nada.
Ao terminar, você distingue as três famílias pelo lugar onde o material fica e por quem decide a divisão, conhece a evidência teórica mais forte a favor da recursão. E monta a matriz de decisão que a Veredas usou para cinco problemas do acervo.
Por que a recursão tem vantagem na teoria e o agente tem vantagem na prática
Chenxiao Yang, Nathan Srebro e Zhiyuan Li, do Toyota Technological Institute at Chicago, publicaram em março de 2026 o artigo Recursive Models for Long-Horizon Reasoning, aceito no ICML 2026. Eles provam que todo problema computável admite uma decomposição recursiva em que cada subproblema exige um contexto ativo exponencialmente menor. Contexto ativo é o texto que o modelo precisa ter à vista num dado passo, como a página aberta sobre a mesa.
Pela prova, essa decomposição supera estritamente qualquer gestão de contexto confinada a uma única sequência, e o resumo é o exemplo citado. É o suporte teórico mais forte para a intuição de que recursão vence compactação. Os experimentos apontam no mesmo sentido, com modelos pequenos treinados para a estrutura recursiva.
O artigo vai além do resumo. Os autores mostram que modelos recursivos alcançam o que chamam de “optimal power” numa classe ampla de sistemas agênticos: nenhum outro arranjo da mesma classe resolve mais problemas com o mesmo contexto ativo. É uma afirmação provada sobre o que a arquitetura permite. O que um modelo comercial entrega hoje é outra medição.
Modelos recursivos treinados contra alternativas, nos testes do TTIC
| Teste | Modelo recursivo | Alternativas |
|---|---|---|
| SAT difícil, fora do treino | 64% (Qwen2.5-3B ajustado) | Qwen3-235B 51,4%; GPT-4o 48,8%; LLaMA3.3-70B 52,9% (só prompt) |
| SAT fácil e médio | 98% e 95% | treino feito só nesses níveis |
| Go 4x4, traços do tamanho do treino | 91,8% | CoT 73,4%; PENCIL 71,0% |
| Go 4x4, traços mais longos que o treino | 38,5% | CoT 1,0%; PENCIL 5,6% |
No Go, Transformer de 3,18 milhões de parâmetros treinado do zero; acurácia de traço. No SAT, os modelos só com prompt ficam perto do acaso no nível difícil.
Fonte: Yang, Srebro e Li, Recursive Models for Long-Horizon Reasoning, v1 (março de 2026) e v2 (julho de 2026)
Leia a tabela com a condição à vista. É recursão treinada em traços, com modelos pequenos e problemas formais, e não o RLM com REPL de Zhang, Kraska e Khattab. O resultado mostra o teto da ideia. Não garante que um produto chamado recursivo alcance esse teto no acervo de uma consultoria.
Um detalhe do Go interessa a quem administra acervo que cresce. Nos traços mais longos que os do treino, o modelo recursivo manteve 38,5% de acerto, e as cadeias de raciocínio caíram para perto de zero. Generalizar para um tamanho que não se viu no treino é o que um acervo de 14 anos pede todo ano, quando chegam processos novos maiores que os antigos.
Do lado prático estão os agentes. A Anthropic publicou em 2 de junho de 2026 o texto sobre os dynamic workflows do Claude Code, lançados na semana anterior. Um arquivo JavaScript cria e coordena subagentes, escolhe modelo e worktree para cada um e retoma após interrupção. Os padrões incluem fan out and synthesize, adversarial verification e tournament. A documentação da Anthropic não usa o termo Recursive Language Model.
Nos concorrentes, o quadro é parecido. No Codex, da OpenAI, os subagentes só disparam por pedido explícito e aceitam agentes personalizados em TOML, segundo o relato de Simon Willison de março de 2026, fonte secundária. A LangChain lançou os recursive workflows no Deep Agents v0.6, em maio de 2026, e admitiu em julho que o que entrega está mais perto de agentes recursivos do que do RLM do artigo.
O meio-termo técnico aparece nessas mesmas ferramentas. O Deep Agents oferece middlewares com interpretador de código em QuickJS e subagentes criados durante a execução. O guia da Daytona descreve RLMs com profundidade ilimitada, um sandbox por agente e saída em forma de git patch. O vocabulário ainda não assentou, e a mesma palavra cobre desenhos bem diferentes.
Os agentes têm vantagens que o RLM do artigo não oferece. Retomam depois de interrupção, trabalham com ferramentas externas, isolam cada subagente numa cópia do repositório e guardam estado entre sessões. Para trabalho que dura dias e mexe em sistemas, esse pacote pesa mais que a leitura de um acervo inteiro numa execução. Por isso a matriz trata as famílias como peças que se combinam.
A diferença que decide está no lugar onde o material fica. No RLM, o prompt é uma variável fora da janela, e o código chama subchamadas em laço sobre pedaços dessa variável. No uso típico de um agente, o subagente é uma ação escrita na conversa, que o artigo chama de falha nº 3, e os arquivos lidos entram no histórico. Quando o agente recebe o contexto num arquivo e o lê por comandos, a distância diminui.
Onde fica o material e quem decide a divisão
Agente com subagentes, uso típico
Agente
- Arquivos lidos entram no histórico da conversa
- Subagente disparado como ação verbalizada, um de cada vez
- Divisão decidida pelo orquestrador ou pelo roteiro humano
- Bom para trabalho longo com ferramentas e estado
RLM
RLM
- Prompt guardado como variável no REPL, fora da janela
- Subchamadas chamadas por código, dentro de laços
- Divisão decidida pelo modelo raiz depois de explorar
- Resposta montada numa variável, maior que a janela
A Tabela 1 do artigo do RLM mede essa distância. Com o contexto descarregado num arquivo, o OpenCode com GPT-5 marca 94,0 no BrowseComp+, acima do RLM, mas cai para 4,8 no OOLONG-Pairs; o custo dele não foi medido. O Claude Code com Opus 4.1 e contexto em arquivo marca 84,0 no BrowseComp+ e 6,5 no OOLONG-Pairs. O agente acha a agulha; o RLM cruza os pares.
Agentes de código com contexto em arquivo contra o RLM
| Método | CodeQA | BrowseComp+ (1K docs) | OOLONG | OOLONG-Pairs |
|---|---|---|---|---|
| OpenCode + contexto em arquivo (GPT-5) | 64,0 | 94,0 | 52,0 | 4,8 |
| Claude Code + contexto em arquivo (Opus 4.1) | 62,0 | 84,0 | 48,0 | 6,5 |
| RLM, profundidade 1 (GPT-5) | 62,0 | 91,3 | 56,0 | 58,0 |
| RLM, profundidade 3 (GPT-5) | 58,0 | 92,0 | 58,0 | 76,0 |
Acurácia em %, exceto OOLONG-Pairs (F1). Claude Code na versão 2.0.0. Custo do OpenCode não medido pelos autores.
Fonte: Zhang, Kraska e Khattab, Recursive Language Models, v3 (maio de 2026), Tabela 1
Há ainda uma voz contrária que vale ouvir. O SRLM, da Apple, de março de 2026, busca programas guiado por sinais de incerteza, sem recursão explícita, e relata ganho de até 22% sobre o RLM com o mesmo orçamento de tempo. Os autores escrevem que a recursão em si não é o principal motor do desempenho e que, dentro da janela nativa, o RLM com recursão muitas vezes piora em relação ao modelo base.
Híbridos de agente e REPL já aparecem em resultados públicos, com o custo ao lado. A Symbolica relatou em fevereiro de 2026, na avaliação pública do ARC-AGI-2, um agente em REPL inspirado no RLM: com Opus 4.6, 85,28% a US$ 6,94 por problema, contra 79,03% a US$ 3,81 sem o agente. Seis pontos a mais custaram quase o dobro. Se o ponto a mais vale o dólar a mais, só o problema do cliente responde.
A Prime Intellect propôs em janeiro de 2026 uma regra de desenho que a Veredas adotou: ferramentas extras, como busca na web, ficam só com as subchamadas, para não inchar o contexto do modelo raiz. O raiz coordena, e quem usa ferramenta é a folha. No híbrido da Veredas, a busca vetorial roda antes da execução e entrega ao raiz só o recorte; se uma subchamada precisar consultar a tabela de condicionantes, a consulta fica com ela.
Somados, os resultados pedem uma escolha por tipo de pergunta. Armadilha comum: comprar pelo nome. Recursivo, agente e subagente são rótulos de produto; a decisão sai de três perguntas sobre o problema. O material relevante cabe na janela efetiva? A resposta depende de poucas partes ou de todas? A prova de cada item precisa sobreviver até o parecer final?
Como a Veredas montou a matriz para cinco problemas
Helena e Caio escolheram cinco problemas que o escritório enfrenta todo mês e os puseram numa matriz de dois eixos. No horizontal, a densidade da resposta: quantas partes do material ela exige, de um trecho a todos. No vertical, o tamanho do material relevante frente à janela efetiva, de cabe com folga a excede muitas vezes. A rastreabilidade entrou como condição para qualquer quadrante.
Matriz de decisão da Veredas: tamanho do material e densidade da resposta
Eixo horizontal: Densidade da resposta (poucas partes → todas as partes)Eixo vertical: Material relevante frente à janela efetiva (cabe → excede)
Excede e pede poucas partes: RAG
- Localizar o parecer que aprovou a licença de operação da PCH
Excede e pede todas as partes: RLM ou híbrido
- Contar condicionantes hídricas vencidas nos 38 empreendimentos
- Achar laudos que contradizem relatórios de monitoramento na barragem
Cabe e pede poucas partes: chamada direta
- Tirar uma data ou um valor de um único laudo
Cabe e pede todas as partes: contexto longo, com teste contra o RLM
- Resumir o histórico do loteamento de 180 mil tokens para a reunião com o cliente
O primeiro problema, localizar o parecer que aprovou a licença de operação da PCH, fica no RAG: o material é enorme, a resposta mora num trecho, e o assistente já acertava 36 de 40 perguntas desse tipo. O segundo, contar condicionantes hídricas vencidas por empreendimento, é o caso típico do RLM com divisão por condicionante, e o teste que confirma são as 50 perguntas de agregação.
Cruzar laudos de laboratório com relatórios de monitoramento da barragem, o terceiro problema, pede pares. Como a pergunta cita um empreendimento, a busca escolhe primeiro o processo e o RLM lê só esse material: é o desenho híbrido. O quarto, resumir o histórico de um loteamento de 180 mil tokens para uma reunião, cabe numa chamada: no Sonnet 5, 180 mil tokens a US$ 2 por milhão custam US$ 0,36.
O quadrante de baixo à direita é o que mais engana. O material cabe e a resposta pede todas as partes, e o reflexo é chamar o RLM. Pesa aqui o resultado da Apple: dentro da janela nativa, o RLM com recursão muitas vezes piora em relação ao modelo base. Para esse quadrante, a Veredas decidiu testar contexto longo e RLM lado a lado antes de escolher.
Acompanhar os laudos novos que chegam toda semana e avisar quando algum contradiz uma condicionante, o quinto problema, é trabalho prolongado com estado. Ele pede um agente com subagentes e memória entre execuções, e cada laudo novo dispara uma leitura recursiva pequena, restrita às condicionantes que o laudo cita. Aqui as famílias se combinam em vez de competir.
A vigilância semanal é barata se o escopo de cada leitura for pequeno. Com cerca de 40 laudos novos por semana e leituras de 30 mil tokens no GPT-5-mini, a US$ 0,25 por milhão, as subchamadas custam perto de US$ 0,30 por semana, fora o modelo raiz. O custo que importa ali é o do alarme falso, que ocupa horas de Helena, e é ele que o teste de um mês precisa medir.
Também dá para ler na matriz o que faria um problema mudar de quadrante. Se a janela efetiva dos modelos crescer e o Context Rot ceder, parte do quadrante de cima desce para o contexto longo. Se o tokenizador novo inflar a contagem em 30%, recortes que hoje cabem sobem. Helena pediu que a matriz fosse revista a cada troca de modelo, com as mesmas 120 perguntas como régua.
Cinco problemas da Veredas, a técnica indicada e o teste que confirma
| Problema | Material relevante | Densidade | Técnica indicada | Teste que confirma |
|---|---|---|---|---|
| Localizar o parecer da licença de operação da PCH | acervo inteiro | um trecho | RAG | manter 36 de 40 em localização |
| Contar condicionantes hídricas vencidas por empreendimento | acervo inteiro | todas as condicionantes | RLM, divisão por condicionante | 50 perguntas de agregação |
| Cruzar laudos e relatórios da barragem | um processo, centenas de milhares de tokens | pares de documentos | híbrido: busca escolhe, RLM lê | 30 perguntas de cruzamento |
| Resumir o histórico do loteamento | 180 mil tokens | narrativa inteira | contexto longo numa chamada | revisão de Helena, US$ 0,36 |
| Vigiar laudos novos toda semana | um laudo e suas condicionantes | pares, em fluxo contínuo | agente com subagentes e RLM por evento | alertas conferidos por um mês |
Cenário ilustrativo. Custo do resumo a US$ 2 por milhão de tokens de entrada no Sonnet 5.
- Etapa 1 de 5: Classificar a pergunta
localização, agregação ou cruzamento
- Etapa 2 de 5: Buscar o recorte
a busca vetorial escolhe empreendimentos e processos citados
- Etapa 3 de 5: Ler com o RLM
o recorte vira variável; divisão por condicionante
- Etapa 4 de 5: Validar a prova
código descarta item sem id de documento e trecho literal
- Etapa 5 de 5: Responder
tabela com evidência, devolvida como variável
# Roteamento que a Veredas desenhou a partir da matriz (esboço).
def rotear(pergunta, tipo, empreendimentos_citados):
if tipo == "localizacao":
return rag(pergunta, k=8) # barato e já acerta 36 de 40
recorte = buscar_processos(empreendimentos_citados) if empreendimentos_citados \
else acervo_inteiro()
if tokens(recorte) < 700_000 and tipo == "resumo":
return chamada_direta(pergunta, recorte) # cabe com folga na janela
return rlm(pergunta, contexto=recorte) # agregação e cruzamentoHelena fechou a decisão por tipo de pergunta: RAG nas de localização, RLM nas de agregação e cruzamento, busca antes do RLM quando a pergunta cita um empreendimento. Os números que sustentam a escolha ainda são de ensaio e de benchmark alheio, e nenhum deles saiu das 120 perguntas do escritório com o protótipo completo.
A matriz saiu com cinco problemas em quatro quadrantes e uma aposta explícita no híbrido. Escreva, antes de rodar qualquer teste, a técnica que a matriz indica para cada uma das 120 perguntas e o número mínimo de acertos que justificaria trocar o RAG em agregação. Sem esse número registrado antes da medição, qualquer resultado vai parecer bom.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Voltar ao capítulo anterior: Comparar contexto longo, RAG e compactação antes de escolher o RLM
Todos os capítulos de RLM 2027
- 01Descobrir onde o modelo encontra cada informação que usa
- 02Medir o limite real do contexto e dividir o problema
- 03Guardar o acervo numa variável e deixar o modelo programar a leitura
- 04Desenhar a árvore de chamadas e decidir a profundidade
- 05Explorar o acervo antes de decidir onde cortar
- 06Processar as partes e juntar as respostas sem perder a evidência
- 07Comparar contexto longo, RAG e compactação antes de escolher o RLM
- 08Situar agentes, híbridos e RLM numa matriz de decisão
- 09Julgar um benchmark antes de acreditar no número dele
- 10Comparar métodos nas mesmas condições e ler os resultados contrários
- 11Preparar o acervo e rodar a biblioteca oficial rlm
- 12Montar o protótipo com dspy.RLM e auditar o rastro de cada resposta
- 13Decompor o custo de uma execução e pôr teto em cada parte
- 14Baixar o custo por pergunta e vigiar o que a média esconde
- 15Isolar o código gerado e tratar cada documento como dado
- 16Impedir que o erro de uma folha chegue à resposta final
- 17Treinar um modelo pequeno para decidir quando delegar
- 18Provar uma auto-melhoria antes de acreditar nela
- 19Julgar as apostas de recursão aprendida e execução previsível
- 20Mapear híbridos, imagem e trabalho prolongado com evidência e lacuna
- 21Ler 2027 por sinais observáveis em vez de apostar numa previsão
- 22Escolher onde o RLM entra primeiro e decidir o piloto
- 23Definir o problema e construir quatro alternativas comparáveis
- 24Avaliar as alternativas e dizer em quais condições o RLM compensa