RLM 2027 · Capítulo 22 de 24 · 12 min
Escolher onde o RLM entra primeiro e decidir o piloto
Qual problema merece um piloto de RLM, qual fica no RAG e quais indicadores fariam a Veredas voltar atrás na decisão.
Este capítulo faz parte do curso gratuito RLM 2027. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Com os quatro cenários no painel, a pergunta desce do mercado para a mesa de Helena: em que trabalho o RLM entra primeiro? Escolher mal custa de dois jeitos. Um piloto em perguntas de localização gasta dinheiro para empatar com o RAG, que já acerta 36 de 40 nesse tipo contra 37 de 40 do protótipo recursivo. Um piloto num problema que cabe na janela gasta meses para provar o que uma chamada de contexto longo resolveria.
O custo menos visível é político. Um piloto que empata vira argumento contra a próxima tentativa, mesmo quando a próxima seria a certa. Por isso a escolha do problema pesa mais que a escolha da biblioteca, e merece um documento próprio, com pressupostos que alguém consegue contestar.
Ao terminar, você separa aplicações candidatas pelo formato da pergunta e pelo tamanho do material, pesa custo, latência, rastro e risco antes de aprovar um piloto e escreve um parecer de adoção que diz de antemão quais números fariam a decisão mudar. O caso é o parecer que Helena assinou para a Veredas.
Que tipo de problema favorece a recursão
Quem formulou a pergunta com mais cuidado foram os próprios autores do RLM. Zhang, Kraska e Khattab mostram ganho em tarefas densas em informação, aquelas em que a resposta depende de ler quase tudo: contar ocorrências, agregar rótulos, cruzar pares. No OOLONG, com 131 mil tokens, o GPT-5 base marca 44,0 e o RLM com profundidade 1 marca 56,0. No OOLONG-Pairs, que pede cruzamento de pares, o salto vai de 0,1 para 58,0 de F1.
F1 é uma nota que combina acerto e cobertura, como avaliar um fiscal pelo que ele apontou certo e pelo que deixou passar. Nas perguntas de localizar um trecho, o quadro se inverte. Na reprodução independente de Daren Wang, os modelos base acertam 100% no S-NIAH, a busca de uma agulha num palheiro, e o DeepSeek v3.2 com RLM cai para 85% na profundidade 1 e 70% na profundidade 2, com a latência subindo de 3,6 para 89,3 segundos.
Há mais dois limites documentados. A Prime Intellect registrou que o RLM piora o ambiente de matemática com Python, e o SRLM da Apple observou que, dentro da janela nativa, a recursão muitas vezes degrada em relação ao modelo base. Juntando as peças, o RLM ganha quando a pergunta agrega ou cruza e quando o material passa da janela. Nos demais casos, empata ou perde, e cobra mais tempo.
Acervos maiores que a janela formam o outro lado da condição. No BrowseComp-Plus com 1.000 documentos, entre 6 e 11 milhões de tokens, o GPT-5 base marca 0,0 porque o material não cabe, e o RLM de profundidade 1 marca 91,3 ao custo médio de US$ 0,99. O artigo compara esse valor à conta de ingerir tudo no GPT-5-mini, de US$ 1,50 a US$ 2,75. Na mesma tabela, o OpenCode com o contexto em arquivo marcou 94,0, lembrando que o concorrente do RLM em acervo grande também inclui o agente de código bem configurado.
Fora do licenciamento ambiental, o mesmo filtro separa bem outros acervos. Uma auditoria de contratos que pergunta quantos têm cláusula de reajuste vencida agrega. Uma revisão de registros de atendimento que procura reclamações contraditórias sobre o mesmo pedido cruza pares. Uma área jurídica que só quer achar a cláusula de foro de um contrato localiza. As duas primeiras são candidatas; a terceira fica na busca, por maior que seja o arquivo.
Aplicações candidatas e a evidência pública mais próxima de cada uma
| Aplicação | Formato da pergunta | Evidência mais próxima (condição) | Leitura |
|---|---|---|---|
| Auditoria de obrigações em acervo documental | Contar e agregar | OOLONG, 131 mil tokens, GPT-5: 44,0 base contra 56,0 no RLM de profundidade 1 | Candidata forte |
| Laudos, cláusulas ou registros contraditórios | Cruzar pares | OOLONG-Pairs, 32 mil tokens, GPT-5: 0,1 base contra 58,0 de F1 | Candidata forte |
| Pesquisa em milhares de documentos | Buscar e compor | BrowseComp-Plus com 1.000 documentos (6 a 11 milhões de tokens): 91,3 no RLM; o base não cabe | Candidata, com busca ao lado |
| Perguntas sobre um código-base grande | Entender e localizar | CodeQA: 62,0 no RLM com GPT-5; no Qwen3-Coder, a profundidade 0 venceu com 66,0 | Testar sem subchamadas primeiro |
| Achar um trecho específico | Localizar | S-NIAH na reprodução de Wang: base 100%, RLM 85% e 70% | Fica no RAG ou na busca |
| Cálculo matemático | Calcular | Prime Intellect, math-python: o RLM piora | Fora do piloto |
Fonte: Zhang, Kraska e Khattab (v3, Tabela 1); Wang (março de 2026); Prime Intellect (janeiro de 2026).
Escolher pelo tamanho do acervo, e não pelo formato da pergunta, é o erro que mais desperdiça piloto. Armadilha comum: ver 52 milhões de tokens e concluir que tudo ali pede recursão. Na Veredas, 40 das 120 perguntas do conjunto de avaliação são de localização, e para elas a busca já resolve. O tamanho diz se o material cabe na janela; o formato diz se a leitura precisa ser completa. As duas perguntas juntas definem o quadrante.
Formato da pergunta e tamanho do material
Eixo horizontal: Formato: localizar (esquerda) ou agregar e cruzar (direita)Eixo vertical: Material: excede a janela (alto) ou cabe nela (baixo)
Busca ou RAG; RLM só se a busca falhar
- Onde está o laudo de março da PCH
- Qual parecer cita a outorga de 2019
Candidato forte ao piloto de RLM
- Condicionantes vencidas em todos os empreendimentos
- Laudos contraditórios entre campanhas
Contexto longo ou RAG; RLM desperdiça
- Achar uma data num relatório de 80 páginas
- Citar a cláusula de uma licença
Testar contexto longo antes do RLM
- Contar condicionantes de um empreendimento pequeno
- Cruzar duas campanhas de um mesmo ano
Como pesar custo, latência, rastro e risco antes do piloto
Passar no filtro de formato e tamanho abre a porta; quatro contas decidem se vale entrar. A primeira é valor contra custo por pergunta. O artigo mostra que a mediana do RLM sai mais barata que a do modelo base, mas a média sobe por causa de trajetórias fora da curva, com desvio-padrão maior que a própria média em vários casos. Quem orça pela média de dez perguntas de demonstração não enxerga a cauda que aparece na centésima.
Tempo é a segunda conta. O blog do autor fala em “alguns segundos a vários minutos” por consulta, sem garantia de teto. Um atendimento que precisa responder ao cliente em tempo real não aceita isso; um parecer técnico com prazo de dias aceita. Rastro vem em terceiro: o RLM guarda a trajetória de cada execução, o que permite mostrar de qual documento saiu cada número. Em licenciamento ambiental, resposta sem evidência vale pouco diante do órgão.
Na Tabela 1 do artigo, o RLM com GPT-5 e profundidade 2 no OOLONG custa US$ 1,10 de média com desvio-padrão de US$ 3,25. A média engana nos dois sentidos: boa parte das perguntas sai mais barata que ela e algumas saem muitas vezes mais caras. Para o orçamento do piloto, a pergunta útil é quanto custa a pergunta do percentil 95 e se o teto de chamadas corta essa cauda antes da fatura.
Risco fecha as quatro contas. O RLM escreve e executa código sobre documentos que vêm de terceiros, e o README da biblioteca oficial avisa que o ambiente local não serve para produção. No estudo de Samuel Korn, com GPT-5-mini e um único documento envenenado, o ataque teve sucesso em 24,4% das vezes contra o RLM e em 81,9% contra o RAG simples. É um resultado de um modelo e um conjunto de perguntas, e não autoriza dispensar o sandbox isolado.
Na prática, isolar significa escolher onde o código gerado roda. A biblioteca oficial separa os ambientes não isolados (local, IPython e Docker) dos que rodam em sandbox na nuvem: Modal, Prime Intellect, Daytona e E2B. O DSPy usa por padrão Deno com Pyodide, um sandbox WASM local. A Cyera mostrou em agosto de 2026 fugas de sandboxes Pyodide em sete produtos, sem testar o dspy.RLM. A leitura prudente é somar o isolamento do sistema operacional ao do WASM.
- Etapa 1 de 6: Formato
A pergunta agrega ou cruza? Se só localiza, fica no RAG
- Etapa 2 de 6: Tamanho
O material passa da janela? Se cabe, testar contexto longo antes
- Etapa 3 de 6: Valor e custo
Custo por pergunta pela mediana e pelo percentil alto, não pela média
- Etapa 4 de 6: Tempo
O prazo do usuário aceita minutos por resposta?
- Etapa 5 de 6: Rastro
Cada resposta precisa apontar documento e página?
- Etapa 6 de 6: Risco
Documentos de terceiros exigem sandbox isolado e tetos de chamada
Como a Veredas escreveu o parecer de adoção
Helena começou pelo recorte. Das 120 perguntas do conjunto de avaliação, 80 são de agregação ou cruzamento e 40 de localização. Nas 80, o RAG anterior acerta 28 (21 de agregação e 7 de cruzamento), e o RLM otimizado acerta 56. Nas 40 de localização, os dois ficam a um ponto de distância. O parecer recomendou um piloto de 90 dias só com perguntas de monitoramento hídrico que agregam ou cruzam, mantendo o RAG para localizar documentos.
Caio contestou a exclusão das perguntas de localização, porque o protótipo acertava uma a mais que o RAG. Helena mostrou a conta ao contrário: um acerto em 40 não paga minutos de espera por resposta nem o custo do RLM sobre perguntas que a busca responde em segundos. O ponto entrou no parecer como decisão, com a conta ao lado, para que ninguém o reabra sem número novo.
Os números que sustentam o parecer, no cenário da Veredas
28 de 80
RAG anterior em agregação e cruzamento
21 de 50 mais 7 de 30
56 de 80
RLM otimizado nas mesmas perguntas
93 de 120 no total, menos 37 de localização
US$ 0,41
Custo médio por pergunta do RLM otimizado
Mediana de 1 min 50 s
US$ 49,20
Custo mensal estimado do piloto
120 perguntas por mês vezes US$ 0,41
Fonte: Cenário composto da Veredas Ambiental; números ilustrativos do conjunto de 120 perguntas do curso.
Pressupostos vieram em seguida, cada um escrito com o número que ele assume. Volume: 120 perguntas por mês de agregação e cruzamento, estimativa de Helena pelo histórico de pedidos dos clientes. Custo: 120 vezes US$ 0,41 dá US$ 49,20 por mês de chamadas. Trabalho humano: cada resposta passa por revisão de evidência, estimada em 10 minutos, o que soma 1.200 minutos, ou 20 horas por mês. Esse é o custo que o parecer mais destaca, porque é maior que a fatura de API.
Profundidade também entrou no parecer como decisão de projeto, tomada antes do primeiro teste. No artigo, a profundidade 1, em que as subchamadas são modelos comuns, é o padrão. Mais profundidade não melhora de forma consistente: no GPT-5 ajuda no OOLONG-Pairs e piora no CodeQA, e no Qwen3-Coder piora o OOLONG. Na reprodução de Wang, a latência do DeepSeek v3.2 foi de 89,3 para 344,5 segundos ao passar da profundidade 1 para a 2. O piloto da Veredas fixou profundidade 1.
Noventa dias saíram de uma conta de amostra. Com 120 perguntas por mês, o piloto acumula cerca de 360 perguntas reais, três vezes o conjunto de avaliação, e passa por três retestes mensais. É o bastante para ver se a acurácia se sustenta fora das perguntas que Helena escreveu, e curto o bastante para que um erro de escolha custe pouco: 360 vezes US$ 0,41 dá US$ 147,60 em chamadas.
Cada pressuposto ganhou um indicador e um limiar que muda a decisão. Caio insistiu que o limiar fosse escrito antes do piloto começar, para ninguém ajustá-lo depois de ver o resultado. Helena acrescentou uma linha que vem do painel de cenários: se um modelo novo acertar mais de 38 de 50 perguntas de agregação no recorte de 900 mil tokens, a escolha de arquitetura reabre, mesmo com o piloto indo bem.
Pressupostos do parecer e os indicadores que mudariam a decisão
| Pressuposto | Valor assumido | Indicador | Limiar que muda a decisão |
|---|---|---|---|
| Custo por pergunta | US$ 0,41 de média | Custo semanal dividido pelo número de perguntas | Acima de US$ 1,00 por três semanas seguidas |
| Acurácia em agregação e cruzamento | 56 de 80 | Reteste mensal no conjunto de avaliação | Abaixo de 50 de 80 suspende o piloto |
| Rastro | Toda resposta com documento e página | Respostas sem evidência na revisão de Helena | Mais de 5% sem evidência volta à revisão manual |
| Tempo | Mediana de 1 min 50 s | Execuções encerradas pelo teto de 10 minutos | Mais de 5% no teto pede revisão dos limites |
| Segurança | Execução em sandbox isolado | Instrução embutida detectada em documento de terceiro | Um caso já dispara auditoria antes de seguir |
| Alternativa nativa | 31 de 50 no contexto longo | Teste trimestral do painel de cenários | Acima de 38 de 50 reabre a arquitetura |
Parecer do cenário composto da Veredas Ambiental. Volume de 120 perguntas por mês e revisão de 10 minutos por resposta são pressupostos, não medições.
Dois pareceres para o mesmo piloto
Parecer que não resiste à reunião
Evitar
- “O RLM é o futuro e devemos adotá-lo”
- Custo pela média de uma demonstração
- Nenhuma condição de saída
- Todas as perguntas no mesmo sistema
Parecer de Helena
Recomendado
- Piloto de 90 dias só em agregação e cruzamento hídrico
- Custo de API e de revisão humana, com a conta ao lado
- Seis limiares escritos antes de começar
- RAG mantido para localizar documentos
Nos sócios, a pergunta mais dura foi sobre o custo humano. Vinte horas por mês de revisão pareciam muito até Helena mostrar que a alternativa era cruzar laudos à mão, trabalho que hoje ninguém faz por completo porque não cabe na agenda. O parecer foi aprovado com uma condição dos sócios: a revisão de evidência cai para uma amostra de 30% se, depois de dois meses, menos de 5% das respostas vierem sem evidência.
Ficou registrado também o que o parecer não cobre. Perguntas sobre fauna, atas e pareceres de órgão ambiental continuam no RAG até que um segundo recorte temático passe pelo mesmo filtro de formato e tamanho. Ampliar o piloto sem esse filtro repetiria o erro que o parecer quis evitar desde o começo: escolher pelo tamanho do acervo.
No cenário da Veredas, o piloto nasceu estreito de propósito: 80 das 120 perguntas, uma área temática e seis limiares escritos antes do primeiro teste. Liste as três perguntas de negócio mais caras do seu acervo, classifique cada uma em localizar, agregar ou cruzar e anote se o material cabe numa janela de 1 milhão de tokens. Só as que agregam ou cruzam acima da janela entram na lista do piloto; se nenhuma entrar, o RLM ainda não é o seu problema.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Voltar ao capítulo anterior: Ler 2027 por sinais observáveis em vez de apostar numa previsão
Todos os capítulos de RLM 2027
- 01Descobrir onde o modelo encontra cada informação que usa
- 02Medir o limite real do contexto e dividir o problema
- 03Guardar o acervo numa variável e deixar o modelo programar a leitura
- 04Desenhar a árvore de chamadas e decidir a profundidade
- 05Explorar o acervo antes de decidir onde cortar
- 06Processar as partes e juntar as respostas sem perder a evidência
- 07Comparar contexto longo, RAG e compactação antes de escolher o RLM
- 08Situar agentes, híbridos e RLM numa matriz de decisão
- 09Julgar um benchmark antes de acreditar no número dele
- 10Comparar métodos nas mesmas condições e ler os resultados contrários
- 11Preparar o acervo e rodar a biblioteca oficial rlm
- 12Montar o protótipo com dspy.RLM e auditar o rastro de cada resposta
- 13Decompor o custo de uma execução e pôr teto em cada parte
- 14Baixar o custo por pergunta e vigiar o que a média esconde
- 15Isolar o código gerado e tratar cada documento como dado
- 16Impedir que o erro de uma folha chegue à resposta final
- 17Treinar um modelo pequeno para decidir quando delegar
- 18Provar uma auto-melhoria antes de acreditar nela
- 19Julgar as apostas de recursão aprendida e execução previsível
- 20Mapear híbridos, imagem e trabalho prolongado com evidência e lacuna
- 21Ler 2027 por sinais observáveis em vez de apostar numa previsão
- 22Escolher onde o RLM entra primeiro e decidir o piloto
- 23Definir o problema e construir quatro alternativas comparáveis
- 24Avaliar as alternativas e dizer em quais condições o RLM compensa