RLM 2027 · Capítulo 21 de 24 · 12 min
Ler 2027 por sinais observáveis em vez de apostar numa previsão
Quatro cenários condicionais para o RLM em 2027, cada um amarrado ao sinal público que o confirma e ao que o desmente.
Este capítulo faz parte do curso gratuito RLM 2027. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Com o mapa de oportunidades da Veredas pronto, sobra a pergunta que Helena leva à reunião de sócios: construir sobre o RLM agora ou esperar para ver o que o mercado faz em 2027? Quem responde com uma previsão erra de um jeito caro. Se apostar no RLM como padrão e ele virar detalhe interno dos fornecedores, a consultoria paga por uma camada que ninguém mais mantém. Se esperar e a recursão virar ferramenta comum, passa mais um ano com o RAG que conta errado.
Um cenário condicional troca a previsão por uma regra com três partes: se tal condição se confirmar, a decisão pende para tal lado, e este é o sinal que mostra a condição. Ninguém precisa acertar o futuro para operar assim. Basta saber o que observar, onde conferir e com que frequência revisar.
Ao terminar, você descreve quatro cenários de adoção para 2027, sabe qual sinal público confirma ou desmente cada um e monta um painel de acompanhamento que cabe numa revisão trimestral. Os sinais partem de fatos datados até 23 de setembro de 2026. Tudo o que vem depois disso é condição, e o texto diz qual é qual.
Por que cenário condicional protege melhor que previsão
Planejar por cenários é um hábito antigo de gestão de risco. Em vez de uma data e um número, descrevem-se alguns futuros plausíveis e o indicador que separa um do outro. Para modelos recursivos o método encaixa bem, porque a área tem menos de um ano de vida pública: o artigo de Zhang, Kraska e Khattab saiu em 31 de dezembro de 2025, e a versão atual, a v3, em 11 de maio de 2026.
Nesse intervalo curto, o terreno já mexeu. O DSPy lançou o módulo dspy.RLM em janeiro e, em 21 de agosto de 2026, depreciou o CodeAct e o ProgramOfThought em favor dele, com remoção prevista para a versão 3.5. Deprecar é marcar uma função como obsoleta, como a placa de “em breve fechado” numa estação de metrô. Os modelos de ponta das três grandes plataformas chegaram a janelas de 1 milhão de tokens.
O que já é fato em setembro de 2026
21/08/2026
DSPy 3.3.1 deprecia CodeAct e ProgramOfThought
Em favor do dspy.RLM, com remoção prevista no DSPy 3.5
1M
Tokens de janela nos modelos de ponta
Anthropic, OpenAI e Google; a Anthropic cobra o 1M sem prêmio
0.1.3
Versão atual do pacote rlms no PyPI
Publicada em 26/06/2026; a numeração ainda está na série 0.x
Nenhum
Modelo comercial de fronteira anunciado como RLM nativo
Situação em 23/09/2026
Fonte: Notas de versão do DSPy; PyPI do pacote rlms; páginas de modelos da Anthropic, da OpenAI e do Google, conferidas em 23/09/2026.
Do outro lado ficam as hipóteses, e elas vêm de gente séria. Zhang, Kraska e Khattab escrevem que treinar RLMs nativos pode virar “um novo eixo de escala”. A Prime Intellect aposta que ensinar modelos a gerir o próprio contexto por aprendizado por reforço será “o próximo grande avanço”. O texto do Prime Agent chama o aprendizado conjunto de modelo e harness de “paradigma dominante”. Os autores do λ-RLM defendem que a confiabilidade virá de ambientes formais verificáveis, e não de código livre.
Ignorar a diferença entre as duas colunas custa caro na hora de orçar. Armadilha comum: tratar a frase de quem pesquisa ou vende o método como sinal de mercado. Uma hipótese declarada é intenção. Ela só vira sinal quando aparece num artefato que qualquer pessoa confere sozinha: uma versão publicada no PyPI, um relatório com números e condição, um preço numa página oficial, um parâmetro documentado. A pergunta útil diante de um anúncio é sempre a mesma: onde eu confiro isso daqui a três meses?
Previsão e cenário condicional diante da mesma incerteza
Previsão
Evitar
- “Em 2027 o RLM será o padrão para documentos longos”
- Uma aposta única, sem data de revisão
- Frase de autor tratada como fato
- Descobre-se o erro quando o orçamento já foi gasto
Cenário condicional
Recomendado
- “Se o DSPy 3.5 remover o CodeAct, mantemos o andaime em DSPy”
- Quatro futuros, cada um com gatilho e dono
- Hipótese separada de sinal verificável
- Revisão trimestral com decisão já escrita para cada gatilho
Quatro cenários e o sinal que separa cada um
Duas perguntas bastam para desenhar os cenários. A primeira: a vantagem do RLM em tarefas densas, como contar e cruzar, persiste diante do contexto nativo dos modelos de 2027 ou encolhe? A segunda: onde a recursão mora, num andaime aberto que o desenvolvedor controla ou dentro de um produto fechado do fornecedor? Andaime aberto é o código de orquestração visível e editável, como a planta elétrica de uma casa que o dono pode abrir e alterar.
Quatro cenários de adoção do RLM para 2027
Eixo horizontal: Onde a recursão mora: andaime aberto (esquerda) ou produto fechado do fornecedor (direita)Eixo vertical: Vantagem em tarefas densas sobre o contexto nativo: persiste (alto) ou encolhe (baixo)
1. Andaime aberto vira ferramenta comum
- DSPy 3.5 remove CodeAct e ProgramOfThought
- dspy.RLM perde o aviso de experimental
- rlms sai da série 0.x
2. Recursão embutida no produto do fornecedor
- Modelo de fronteira anunciado como RLM nativo
- Relatório técnico completo do Prime Agent
- Harness que lê o contexto como variável ou arquivo
3. Nicho acima da janela
- Recursão degrada dentro da janela em modelos novos
- Ganho só em acervos maiores que a janela
- Avaliações independentes com modelos de 2026
4. Absorção silenciosa
- Modelo base acerta pares no OOLONG-Pairs sem REPL
- Compactação sai de beta nas plataformas
- Recursão, se existir, fica invisível ao cliente
A numeração dos quadrantes serve só para citar cada um e não ordena probabilidade. Ninguém tem hoje dado para dizer qual cenário é mais provável, e um curso que afirmasse isso estaria vendendo previsão com outro nome. O que se pode dizer é qual sinal cada cenário precisa ver primeiro para ganhar peso.
No primeiro cenário, a recursão vira ferramenta comum de biblioteca aberta, como hoje é o RAG. A condição é a vantagem persistir e as bibliotecas se firmarem. Os sinais são versões publicadas: o DSPy 3.5 sair com a remoção anunciada, o dspy.RLM perder o aviso de que a API pode mudar, o pacote rlms deixar a série 0.x. O contrasinal está nas reproduções independentes. Se modelos novos repetirem o que o Kimi K2 mostrou, caindo de 86,6 para 60,0 no OOLONG ao ganhar recursão, o cenário perde força.
Já no segundo, a vantagem persiste, mas mora dentro do produto do fornecedor: nos dynamic workflows do Claude Code, nos subagentes do Deep Agents, no Prime Agent ou num modelo treinado para operar o REPL sozinho. A evidência de base já existe na Tabela 1 do artigo: o Claude Code com o contexto descarregado em arquivo sobe de 12,0 para 62,0 no CodeQA. O sinal decisivo seria um modelo comercial de fronteira anunciado como RLM nativo, coisa que ninguém fez até 23 de setembro de 2026.
Terceiro cenário: a vantagem encolhe dentro da janela nativa e sobrevive acima dela. A pista vem da Apple, cujo SRLM registrou que, dentro da janela, o RLM com recursão muitas vezes degrada em relação ao modelo base. O sinal seria alguém repetir essa observação com os modelos de setembro de 2026, como Opus 5.5, Fable 5.1 ou GPT-6, avaliação independente que ainda não existe. Nesse mundo, o RLM vira ferramenta de nicho para acervos grandes demais.
Por último vem a absorção silenciosa. Contexto longo e compactação vendida como serviço resolvem a maior parte das tarefas densas, e a recursão, se existir, roda escondida no servidor. Compactação é o resumo automático do histórico quando ele passa de um limite, como o caderno que alguém reescreve em tópicos para liberar páginas. O sinal mais claro seria um modelo base acertar o OOLONG-Pairs sem REPL, onde o GPT-5 base marcou 0,1 de F1 e o agente de compactação também.
Sinais também têm peso diferente conforme a origem. Uma nota de versão no GitHub, um pacote no PyPI e uma página de preços são fontes primárias: quem publica é quem entrega. Um post de terceiro sobre o produto de outra empresa é fonte secundária, como no caso dos subagentes do Codex, conhecidos publicamente por um texto de Simon Willison. Resultado divulgado pela própria empresa, sem revisão por pares, fica no meio: o Prime Agent anunciou 95,5% no ARC-AGI-3 com Opus 5 e prometeu o relatório completo para depois.
Os quatro cenários, a condição e o que confere cada um
| Cenário | Condição | Sinal que confirma | Sinal que desmente |
|---|---|---|---|
| 1. Andaime aberto vira ferramenta comum | Vantagem persiste; bibliotecas abertas se firmam | DSPy 3.5 com a remoção de CodeAct; rlms fora da série 0.x | Reproduções com modelos novos repetem a queda do Kimi K2 (86,6 para 60,0 no OOLONG) |
| 2. Recursão embutida no produto | Vantagem persiste dentro de harness ou modelo fechado | Modelo de fronteira anunciado como RLM nativo; relatório técnico do Prime Agent | Harnesses sem acesso à trajetória nem ao custo por pergunta |
| 3. Nicho acima da janela | Vantagem some dentro da janela e fica acima dela | Avaliação independente com modelos de 2026 repete a degradação vista pela Apple | Ganhos do RLM também em entradas menores que a janela |
| 4. Absorção silenciosa | Contexto nativo e compactação resolvem tarefas densas | Modelo base com F1 alto no OOLONG-Pairs sem REPL; compactação fora de beta | Compactação segue perto de zero em cruzamento de pares |
Os cenários não se excluem: podem conviver por tipo de pergunta. Sinais de confirmação ainda não ocorreram em 23/09/2026, salvo quando indicado no texto.
Os cenários não disputam entre si como times num campeonato. O mesmo mercado pode viver o primeiro para agregação em acervos grandes e o quarto para perguntas curtas. É por isso que o painel acompanha sinais, e não um vencedor. A decisão da consultoria depende de qual cenário vale para o tipo de pergunta que ela responde, e não de qual cenário vence no mercado inteiro.
Um painel útil também tem prazo para cada sinal. Versões de biblioteca mudam em semanas: o DSPy foi da 3.1.1 à 3.4.0b1 em menos de oito meses. Preços mudam por trimestre. Avaliações independentes com modelos novos demoram mais, porque dependem de alguém repetir o experimento com amostra e orçamento próprios. Conferir tudo toda semana gasta atenção à toa, e conferir uma vez por ano deixa passar a troca de versão que quebra o código.
Como a Veredas montou o painel de sinais para 2027
Helena pediu a Caio uma folha só, com uma pergunta por cenário: o que muda na Veredas se ele se confirmar? A primeira resposta saiu da conta do acervo. São cerca de 52 milhões de tokens para uma janela de 1 milhão, portanto 52 milhões divididos por 1 milhão dão 52 janelas cheias. Mesmo no cenário mais favorável ao contexto nativo, o acervo inteiro não cabe numa chamada, e alguma forma de divisão continua necessária.
Caio fez em seguida a conta de ler tudo a cada pergunta, só de entrada. No Opus 5.5, a US$ 4 por milhão de tokens, 52 vezes 4 dá US$ 208 por pergunta. No GPT-6 Luna, a US$ 0,10, 52 vezes 0,10 dá US$ 5,20, e a OpenAI cobra o dobro acima de 272 mil tokens, o que leva a US$ 10,40. O RLM otimizado da Veredas custa US$ 0,41 por pergunta. A diferença mostra por que o quarto cenário ameaça a Veredas só se a compactação ficar barata e precisa ao mesmo tempo.
Para esse quarto cenário, Caio escolheu um teste que a própria Veredas consegue repetir. Na trilha de comparação, o contexto longo numa chamada acertou 31 de 50 perguntas de agregação no recorte da mina e da barragem, cerca de 900 mil tokens. O protótipo RLM acertou 38 de 50 em agregação. O gatilho ficou escrito assim: se um modelo novo passar de 38 de 50 nesse mesmo recorte, a arquitetura volta à mesa. Rodar o teste no Opus 5.5 custa 50 vezes 0,9 milhão de tokens vezes US$ 4, ou US$ 180 por trimestre.
Nos outros três cenários, o painel mudou menos coisas do que Helena esperava. Se o primeiro se confirmar, o código em DSPy fica e só acompanha a troca de versão, como já aconteceu quando max_iterations virou max_iters no DSPy 3.3.0. No caso do segundo, a Veredas aceita trocar o andaime próprio por um harness de fornecedor com uma condição inegociável: cada resposta devolve documento e página. O terceiro favorece a consultoria, porque 52 janelas cheias a põem do lado do nicho que continua precisando de recursão.
Caio registrou também o que desmentiria a leitura favorável ao nicho. Se os modelos de 2027 passarem a acertar contagens dentro de 1 milhão de tokens, a Veredas poderia dividir o acervo por empreendimento com uma regra simples de código e mandar cada parte a uma chamada de contexto longo, sem recursão. Seria mais previsível em tempo, e o painel precisa enxergar essa saída no dia em que ela ficar mais barata que o RLM.
Painel de sinais da Veredas, revisado a cada trimestre
| Sinal | Onde conferir | Gatilho | Decisão já escrita |
|---|---|---|---|
| Remoção de CodeAct no DSPy | Notas de versão do DSPy no GitHub | DSPy 3.5 publicado | Manter o andaime em DSPy e atualizar a versão fixada |
| Modelo de fronteira como RLM nativo | Páginas de modelos da Anthropic, da OpenAI e do Google | Anúncio com número em benchmark de agregação | Testar o modelo como raiz nas 120 perguntas antes de qualquer troca |
| Harness de fornecedor com rastro | Documentação do harness | Resposta com documento e página por pergunta | Avaliar troca do andaime próprio pelo harness |
| Contexto nativo no recorte de 900 mil tokens | Teste próprio com 50 perguntas de agregação | Acima de 38 de 50 | Reabrir a escolha de arquitetura |
| Preço de entrada por milhão de tokens | Páginas de preços das plataformas | Queda de metade ou mais no modelo de subchamada | Refazer a conta de custo por pergunta |
Painel do cenário composto da Veredas Ambiental. Os valores de 31, 38 e 50 perguntas vêm do conjunto de avaliação do curso.
Sinais datados e sinais que o painel espera
- 19 de janeiro de 2026Concluído
DSPy 3.1.1 lança o dspy.RLM
Módulo marcado como experimental, com aviso de que a API pode mudar.
- 11 de maio de 2026Concluído
v3 do artigo RLM
Recua de “duas ordens de grandeza” para “mais de uma ordem de grandeza” além da janela.
- 2 de junho de 2026Concluído
Dynamic workflows no Claude Code
Orquestração programática de subagentes dentro do produto do fornecedor.
- 5 de agosto de 2026Concluído
Prime Agent
Agente RLM que se automelhora; relatório técnico completo prometido para breve.
- 4 de setembro de 2026Agora
Compactação sob demanda da Anthropic em beta
Cabeçalho compact-2026-09-04; resumo escrito no servidor.
- Sem data anunciadaPrevisto
DSPy 3.5 com a remoção de CodeAct
Sinal do primeiro cenário; a remoção foi anunciada, a versão ainda não saiu.
Cada linha do painel ganhou um dono e uma data. Caio confere versões e preços; Helena roda o teste de 50 perguntas e decide. A primeira revisão ficou marcada para dezembro de 2026. Nenhuma linha diz o que vai acontecer em 2027, e Helena descobriu que isso tornava a apresentação aos sócios mais fácil, porque ninguém conseguia refutar uma regra do tipo “se acontecer isso, fazemos aquilo”.
No cenário da Veredas, a pergunta “o RLM vai vingar?” virou cinco gatilhos com dono, fonte e decisão escrita, e a conta das 52 janelas mostrou que três dos quatro cenários mantêm a recursão no trabalho da consultoria. Abra a sua lista de sinais, anote para cada um a página que você consegue conferir sozinho e marque a primeira revisão para daqui a 90 dias. O painel está pronto quando cada gatilho tiver um número ou uma versão que o dispara, e não um adjetivo.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Voltar ao capítulo anterior: Mapear híbridos, imagem e trabalho prolongado com evidência e lacuna
Todos os capítulos de RLM 2027
- 01Descobrir onde o modelo encontra cada informação que usa
- 02Medir o limite real do contexto e dividir o problema
- 03Guardar o acervo numa variável e deixar o modelo programar a leitura
- 04Desenhar a árvore de chamadas e decidir a profundidade
- 05Explorar o acervo antes de decidir onde cortar
- 06Processar as partes e juntar as respostas sem perder a evidência
- 07Comparar contexto longo, RAG e compactação antes de escolher o RLM
- 08Situar agentes, híbridos e RLM numa matriz de decisão
- 09Julgar um benchmark antes de acreditar no número dele
- 10Comparar métodos nas mesmas condições e ler os resultados contrários
- 11Preparar o acervo e rodar a biblioteca oficial rlm
- 12Montar o protótipo com dspy.RLM e auditar o rastro de cada resposta
- 13Decompor o custo de uma execução e pôr teto em cada parte
- 14Baixar o custo por pergunta e vigiar o que a média esconde
- 15Isolar o código gerado e tratar cada documento como dado
- 16Impedir que o erro de uma folha chegue à resposta final
- 17Treinar um modelo pequeno para decidir quando delegar
- 18Provar uma auto-melhoria antes de acreditar nela
- 19Julgar as apostas de recursão aprendida e execução previsível
- 20Mapear híbridos, imagem e trabalho prolongado com evidência e lacuna
- 21Ler 2027 por sinais observáveis em vez de apostar numa previsão
- 22Escolher onde o RLM entra primeiro e decidir o piloto
- 23Definir o problema e construir quatro alternativas comparáveis
- 24Avaliar as alternativas e dizer em quais condições o RLM compensa