RLM 2027 · Capítulo 24 de 24 · 12 min
Avaliar as alternativas e dizer em quais condições o RLM compensa
A recomendação final da Veredas, com condições de ganho, custo por acerto e evidência pública, no formato que um comitê consegue contestar.
Este capítulo faz parte do curso gratuito RLM 2027. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Com as quatro alternativas rodando sobre as mesmas 120 perguntas, falta a parte que decide se o projeto valeu: dizer em quais condições o RLM melhora o resultado, quanto custa essa melhoria e quais evidências sustentam a recomendação de uso. Um placar sozinho não responde a nenhuma das três perguntas. “O híbrido acertou 99” não diz onde acertou, a que preço, nem se o ganho se repete fora do conjunto de teste.
Uma recomendação sem condições custa caro depois de aprovada. Quem lê “adote o RLM” adota em tudo, inclusive nas perguntas em que ele empata e demora. E quem a contesta num comitê encontra o ponto fraco em cinco minutos, porque todo resultado de RLM publicado até setembro de 2026 tem condição: um modelo, uma tarefa, um tamanho de contexto.
Ao terminar, você lê o resultado de um projeto por tipo de pergunta, calcula o custo de cada acerto adicional, separa a evidência interna da pública e escreve a recomendação em três partes que respondem ao critério central do curso. É o parecer que Helena apresentou aos sócios e ao primeiro cliente.
Por que a recomendação precisa de três respostas e não de um placar
Os próprios autores do RLM escrevem a recomendação com condições. Zhang, Kraska e Khattab mostram ganho do RLM em tarefas densas e em entradas acima da janela, e registram, na mesma Tabela 1, onde ele perde: no CodeQA com Qwen3-Coder, a profundidade 0, sem subchamadas, vence todas as variantes recursivas. Profundidade maior piora o OOLONG nesse modelo, de 48,0 para 26,0. Um resultado de RLM sem modelo, tarefa e tamanho não é um resultado.
Fora do artigo, as evidências contrárias pesam tanto quanto as favoráveis. Na reprodução de Daren Wang, o Kimi K2 cai de 86,6 no OOLONG para 60,0 ao ganhar recursão. O SRLM da Apple observa que, dentro da janela, a recursão muitas vezes degrada. O λ-RLM, com modelos abertos até 128 mil tokens, vence o RLM padrão em 29 de 36 comparações, o que mostra que o desenho do andaime muda o placar tanto quanto o modelo.
Para quem lê a recomendação, isso vira uma regra: cada número público entra no parecer com três rótulos, modelo, tarefa e tamanho de contexto. Um ganho de 12 pontos no OOLONG com GPT-5 a 131 mil tokens diz algo sobre agregação em contexto médio com um modelo de fronteira de 2025. Sozinho, ele não diz nada sobre laudos de monitoramento hídrico lidos por outro modelo em 2027.
Evidência pública que a recomendação usa, sempre com a condição
44,0 → 56,0
OOLONG, 131 mil tokens
GPT-5 base contra RLM de profundidade 1
0,1 → 58,0
OOLONG-Pairs, F1
GPT-5 base contra RLM de profundidade 1
100% → 85%
S-NIAH, agulha no palheiro
DeepSeek v3.2 base contra RLM de profundidade 1
86,6 → 60,0
OOLONG com Kimi K2
Base contra RLM de profundidade 1; 20 amostras
Fonte: Zhang, Kraska e Khattab (v3, Tabela 1, maio de 2026); Wang, reprodução independente (março de 2026).
O custo pede o mesmo cuidado com a forma de medir. O artigo registra que a mediana do RLM sai mais barata que a do modelo base, mas a média sobe por causa de trajetórias fora da curva, com desvios maiores que a média em vários casos. Armadilha comum: reportar só o custo médio de uma rodada e deixar a cauda fora do parecer. Quem aprova o orçamento precisa ver a mediana, o custo da pior execução e o teto que interrompe as que se perdem.
Tempo segue a mesma lógica do custo. O blog do autor avisa que cada consulta leva de alguns segundos a vários minutos, sem garantia de teto, e o artigo atribui a cauda de tempo às subchamadas sequenciais, sugerindo interromper por tempo-limite. Na reprodução de Wang, o Kimi K2 chegou a 545,5 segundos por consulta na profundidade 2. Uma recomendação que omite o tempo mediano e o teto deixa o usuário sem saber se espera a resposta ou volta mais tarde.
Como a Veredas chegou a 99 de 120 e ao custo de cada acerto
Caio rodou as quatro alternativas na mesma semana, com o registro comum. O híbrido acertou 99 de 120: 36 de 40 em localização, que são os acertos do RAG, 41 de 50 em agregação e 22 de 30 em cruzamento. O RLM sobre o acervo inteiro ficou em 93, com 37, 37 e 19. O RAG ficou nos seus 64. O contexto longo, que só cabia no recorte da mina e da barragem, repetiu os 31 de 50 em agregação.
Resultado das quatro alternativas nas 120 perguntas da Veredas
| Alternativa | Localização (40) | Agregação (50) | Cruzamento (30) | Total | Custo médio por pergunta | Mediana de tempo |
|---|---|---|---|---|---|---|
| RAG em produção | 36 | 21 | 7 | 64 de 120 | US$ 0,02 | 6 s |
| Contexto longo | não cabe | 31 no recorte | não cabe | só no recorte | US$ 3,60 no recorte | não medida |
| RLM sobre o acervo | 37 | 37 | 19 | 93 de 120 | US$ 0,41 | 1 min 50 s |
| Híbrido | 36 | 41 | 22 | 99 de 120 | US$ 0,23 | 6 s e 1 min 20 s |
Cenário composto da Veredas Ambiental; números ilustrativos. RAG: cerca de 8 mil tokens de entrada a US$ 2 por milhão mais 500 de saída a US$ 10 por milhão, preços do Sonnet 5, perto de US$ 0,02. Contexto longo: 0,9 milhão de tokens a US$ 4 por milhão no Opus 5.5. Híbrido: 40 perguntas a US$ 0,02 mais 80 a US$ 0,33, divididos por 120. No híbrido, 6 s é a mediana da localização e 1 min 20 s a da agregação e do cruzamento.
A conta do custo médio do híbrido cabe numa linha. As 40 perguntas de localização custam US$ 0,02 cada, ou US$ 0,80. As 80 de agregação e cruzamento custam US$ 0,33 cada, ou US$ 26,40. Somando, dá US$ 27,20 para 120 perguntas, perto de US$ 0,23 por pergunta. O RLM do híbrido sai mais barato que o RLM sobre o acervo porque lê só o recorte escolhido pela busca, e gasta menos iterações descobrindo onde procurar.
Custo de cada acerto adicional é a conta que os sócios entenderam de primeira. Contra o RAG, o híbrido acerta 35 perguntas a mais (99 menos 64) e custa US$ 0,21 a mais por pergunta, o que dá US$ 25,20 a mais por rodada de 120. Dividindo US$ 25,20 por 35, cada acerto adicional sai por cerca de US$ 0,72. Contra o RLM sobre o acervo, o híbrido acerta 6 a mais e custa menos, e aceita perder um acerto de localização em troca de responder em segundos.
Esses US$ 0,72 só fazem sentido ao lado do valor do acerto. Uma condicionante vencida que ninguém percebeu pode virar autuação e atrasar a renovação de uma licença. Helena não pôs valor em dinheiro nisso, porque não tinha como medir, e escreveu no parecer apenas que um acerto a mais por menos de um dólar dispensava a conta fina.
Helena olhou os 21 erros do híbrido um a um antes de escrever qualquer recomendação. Quatro vieram do roteador, que mandou pergunta de agregação ao RAG. Sete vieram da busca, que deixou de fora um empreendimento citado de forma indireta. Seis foram erros de leitura, quase todos em planilhas de laboratório com unidades trocadas entre campanhas. Os quatro restantes são as perguntas de localização que o RAG já errava. A pior execução levou 8 minutos, abaixo do teto de 10.
Os 21 erros do híbrido, por origem
| Origem do erro | Quantidade | O que o rastro mostrou | Correção proposta para o piloto |
|---|---|---|---|
| Roteador | 4 | Pergunta de agregação classificada como localização | Mandar ao RLM toda pergunta com número ou “quantas” |
| Busca por metadado | 7 | Empreendimento citado pelo nome antigo ficou fora do recorte | Tabela de nomes antigos e novos de cada empreendimento |
| Leitura do RLM | 6 | Planilhas de laboratório com unidades diferentes entre campanhas | Normalizar unidades antes de guardar o acervo |
| RAG na localização | 4 | Trecho certo fora dos 10 recuperados | Manter; o RLM acertaria só 1 a mais, a custo maior |
Cenário composto da Veredas Ambiental. As correções não foram medidas; entram no piloto como hipóteses a testar.
Ler os erros por origem mudou a conversa sobre o que melhorar. Dos 21, só seis são do RLM lendo mal; onze vêm das peças em volta dele, o roteador e a busca. Trocar o modelo raiz por um mais caro atacaria os seis, enquanto uma tabela de nomes antigos e uma regra de roteamento atacam onze a custo quase zero. As correções ainda não foram medidas e entram no piloto como hipóteses.
A resposta ao critério central, em três partes
Primeira parte, as condições. No cenário da Veredas, o RLM melhora o resultado quando a pergunta agrega ou cruza informação espalhada por muitos documentos e o material passa do que a busca entrega bem. Nessas 80 perguntas, o híbrido acerta 63 contra 28 do RAG. Nas de localização, o RLM empata com a busca e demora mais, então fica de fora. Fora do acervo da Veredas, a condição pública é a mesma: ganho em agregação e pares, perda ou empate em agulha no palheiro.
Segunda parte, o custo. O híbrido custa US$ 0,23 por pergunta em média, com cada acerto adicional sobre o RAG a cerca de US$ 0,72, mediana de 1 min 20 s nas perguntas recursivas e pior caso de 8 minutos sob teto de 10. A esse custo de API somam-se as 20 horas mensais de revisão de evidência previstas no parecer do piloto, o item mais caro da conta, que pode cair se a taxa de respostas sem evidência ficar abaixo de 5%.
Terceira parte, as evidências, separadas em dois pesos. A interna é o placar de 99 contra 64 na mesma régua, com a ressalva de que as 120 perguntas foram vistas durante a otimização e precisam ser confirmadas em perguntas reais. A pública é a Tabela 1 do artigo para agregação e pares, com GPT-5, e a reprodução de Wang e o SRLM como evidência contrária. Na segurança, o estudo de Korn (RLM com 24,4% de sucesso de ataque contra 81,9% do RAG simples) vale para um modelo e não dispensa o sandbox.
Parecer final da Veredas, em três partes
| Parte | Resposta no cenário da Veredas | O que reverteria a resposta |
|---|---|---|
| Em quais condições o RLM melhora o resultado | Perguntas de agregação e cruzamento sobre muitos documentos: 63 de 80 no híbrido contra 28 de 80 no RAG | Modelo novo acima de 38 de 50 em agregação no recorte de 900 mil tokens, sem recursão |
| Qual é o custo dessa melhoria | US$ 0,23 por pergunta em média; US$ 0,72 por acerto adicional; mediana de 1 min 20 s; 20 horas mensais de revisão | Custo acima de US$ 1,00 por pergunta por três semanas; mais de 5% das execuções no teto |
| Quais evidências sustentam a recomendação | Placar interno na mesma régua; Tabela 1 do artigo em agregação e pares; evidência contrária de Wang e da Apple registrada | Queda abaixo de 50 de 80 nas perguntas reais do piloto; reproduções que desmintam o ganho em agregação |
Cenário composto da Veredas Ambiental; números ilustrativos. Evidência pública com a condição de cada fonte: modelo, tarefa e tamanho de contexto.
O parecer vale para a Veredas e diz isso na primeira linha. Outra consultoria, com acervo menor ou com perguntas quase todas de localização, pode chegar a outra resposta usando o mesmo método. O que se transfere é o procedimento: ficha fechada antes do código, alternativas com o mesmo cuidado, erro lido por origem e recomendação em três partes com gatilho de reversão.
Nos sócios, Helena apresentou o parecer numa página, com a tabela de erros no verso. A pergunta mais difícil veio do sócio mais antigo: e se o fornecedor lançar em 2027 um modelo que faça isso sozinho? A resposta já estava escrita no painel de cenários. Se o modelo passar do gatilho no teste trimestral, a Veredas troca a peça e mantém a ficha, o conjunto de 120 perguntas e o registro comum, que valem para qualquer arquitetura.
A ordem da apresentação seguiu a cabeça de quem decide. Primeiro a pergunta de negócio e a resposta em uma frase. Depois o custo por acerto adicional, que traduz a técnica em orçamento. Em seguida a evidência, com a contrária na mesma página. Os gatilhos que reabrem a decisão vieram no fim. A arquitetura, a árvore de chamadas e o código ficaram num anexo, para quem quisesse conferir.
Recomendação que cai no comitê e recomendação que se sustenta
Recomendação frágil
Evitar
- “O RLM acertou 99 de 120; recomendamos adotar”
- Custo médio de uma rodada, sem mediana nem pior caso
- Só a evidência favorável
- Nenhuma condição que reverta a decisão
Recomendação de Helena
Recomendado
- RLM para agregar e cruzar, RAG para localizar
- US$ 0,72 por acerto adicional, mediana e pior caso
- Evidência interna, pública e contrária, com condição
- Gatilhos escritos que reabrem a decisão
A primeira resposta ao cliente saiu três semanas depois, já no piloto. O cliente perguntou quais condicionantes de monitoramento hídrico de uma barragem estavam com laudos contraditórios. O híbrido apontou duas, cada uma com os dois laudos e as páginas que discordavam. Helena conferiu as duas em quarenta minutos e respondeu com as evidências anexadas, trabalho que antes ninguém conseguia fazer inteiro.
No cenário da Veredas, a recomendação cabe numa frase que Helena defende diante do cliente: RLM para agregar e cruzar, RAG para localizar, US$ 0,23 por pergunta em média e documento com página em cada resposta, com revisão em 90 dias. Para levar o método ao seu acervo, escreva nesta semana 30 perguntas com resposta de referência, 10 de localizar, 10 de agregar e 10 de cruzar, e rode o sistema que você já usa.
Se ele errar mais de um terço das 20 perguntas de agregar e cruzar, há motivo medido para um piloto de RLM, e a ficha do projeto final serve de molde. Se errar menos, o seu problema está em outro lugar, e o RLM pode esperar pelo próximo sinal do painel.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Voltar ao capítulo anterior: Definir o problema e construir quatro alternativas comparáveis
Todos os capítulos de RLM 2027
- 01Descobrir onde o modelo encontra cada informação que usa
- 02Medir o limite real do contexto e dividir o problema
- 03Guardar o acervo numa variável e deixar o modelo programar a leitura
- 04Desenhar a árvore de chamadas e decidir a profundidade
- 05Explorar o acervo antes de decidir onde cortar
- 06Processar as partes e juntar as respostas sem perder a evidência
- 07Comparar contexto longo, RAG e compactação antes de escolher o RLM
- 08Situar agentes, híbridos e RLM numa matriz de decisão
- 09Julgar um benchmark antes de acreditar no número dele
- 10Comparar métodos nas mesmas condições e ler os resultados contrários
- 11Preparar o acervo e rodar a biblioteca oficial rlm
- 12Montar o protótipo com dspy.RLM e auditar o rastro de cada resposta
- 13Decompor o custo de uma execução e pôr teto em cada parte
- 14Baixar o custo por pergunta e vigiar o que a média esconde
- 15Isolar o código gerado e tratar cada documento como dado
- 16Impedir que o erro de uma folha chegue à resposta final
- 17Treinar um modelo pequeno para decidir quando delegar
- 18Provar uma auto-melhoria antes de acreditar nela
- 19Julgar as apostas de recursão aprendida e execução previsível
- 20Mapear híbridos, imagem e trabalho prolongado com evidência e lacuna
- 21Ler 2027 por sinais observáveis em vez de apostar numa previsão
- 22Escolher onde o RLM entra primeiro e decidir o piloto
- 23Definir o problema e construir quatro alternativas comparáveis
- 24Avaliar as alternativas e dizer em quais condições o RLM compensa