Quando o acervo não cabe na janela, o modelo passa a ler por código
Revisado em
Uma consultoria ambiental guardava 14 anos de processos em 6.400 documentos, e o assistente com busca vetorial acertava onde estava um laudo, mas errava quantas condicionantes estavam vencidas. Este curso ensina a alternativa proposta no fim de 2025: deixar o acervo numa variável, examiná-lo por código e chamar o modelo sobre as partes. 24 capítulos em 12 trilhas cobrem como funciona, quando compensa, quanto custa, como proteger e o que esperar de 2027, com cada resultado acompanhado do modelo, da tarefa e do orçamento em que foi medido.
Trilha 1O problema que a recursão resolve
Separar o que o modelo sabe, o que recebe e o que alcança por ferramenta, entender por que a janela grande não garante leitura e o que significa dividir um problema e reaplicar o procedimento às partes.
Catorze anos de licenciamento ambiental cabem num servidor de arquivos, mas não cabem na cabeça de ninguém. A Veredas Ambiental, consultoria de Belo Horizonte, guarda os processos de 38 empreendimentos: minas, barragens de rejeito, loteamentos e uma pequena central hidrelétrica. São 6.400 documentos, cerca de 52 milhões de tokens. Token é o pedaço de palavra que o modelo lê e pelo qual a API cobra.
Helena, coordenadora técnica, responde aos clientes e assina os pareceres. Caio, engenheiro de dados, montou dois anos atrás um assistente de busca vetorial sobre esse acervo. Ele acertava perguntas do tipo “onde está o laudo de março da PCH” e errava perguntas do tipo “quantas condicionantes vencidas temos em todos os empreendimentos”. O erro de contagem é o mais caro, porque chega ao cliente com cara de certeza.
Onde o modelo encontra a informação: o diagnóstico antes da ferramenta
O capítulo 1 em vídeo: os três lugares de onde sai a resposta de um modelo, os quatro gestos de uma resposta, o limite do RAG na pergunta de contagem, o que é um RLM e as siglas que se confundem com ele, e o diagnóstico da Veredas Ambiental, caso fictício do curso, com 56 erros classificados em informação, contexto, raciocínio e execução.
Transcrição
0:00Boas-vindas a esta aula de abertura do primeiro capítulo do curso sobre modelos de linguagem recursivos, ou RLM. Para quem constrói ou decide o futuro de assistentes de inteligência artificial sobre acervos gigantes de documentos, seja atuando na engenharia de dados, na coordenação técnica ou na gestão de produto, existe um passo inegociável antes de trocar de ferramenta.
0:18É preciso descobrir, com precisão cirúrgica, por que o assistente atual erra. E esta análise foi desenhada exatamente com esse foco clínico e direto. Vamos lá! Nossa rota de hoje tem seis paradas. 1. O problema da Veredas. 2. Origens da resposta.
0:333. O limite do RAG. 4. O que é a RLM. 5. O diagnóstico de erros. E 6. O teto e a decisão. Ponto 1. O problema da Veredas. O diagnóstico antes da ferramenta. Para colocar a teoria no chão da fábrica, vamos analisar o caso da Veredas Ambiental.
0:52Vale declarar logo de cara que a Veredas, a coordenadora técnica Helena e o engenheiro de dados Caio formam um estudo de caso fictício criado especialmente para a didática deste curso. Mas a escala do desafio é super real.
1:06Imagine uma consultoria de Belo Horizonte com 14 anos de processos de licenciamento ambiental nas costas. Estamos falando de 38 empreendimentos, incluindo minas, barragens, loteamentos e uma pequena central hidrelétrica, a PCH. Tudo isso soma 6.400 documentos, O que, traduzindo por idioma da máquina, dá cerca de 52 milhões de tokens.
1:28O assistente de busca vetorial atual do Caio tem uma dupla personalidade bem clara. De um lado, ele acerta na mosca perguntas de localização tipo Onde está o laudo de março da PCH? Do outro, ele falha absurdamente em perguntas de agregação como quantas condicionantes vencidas temos em todos os empreendimentos.
1:46E é bom frisar, o erro de contagem é sempre o mais caro simplesmente porque ele chega ao cliente final com cara de certeza absoluta. Ponto 2. Origens da resposta. De onde vem a informação?
1:59Independentemente do modelo, a resposta sempre sai de três lugares possíveis. Primeiro, os parâmetros. Os bilhões de números ajustados lá no treino. É como aquela prova que a gente estudou há muitos anos. A memória é enorme, mas não tem um índice exato.
2:12O segundo lugar é o contexto. A janela onde a pergunta e os documentos são colados. Pense numa mesa onde se espalham vários papéis para a leitura.
2:19E o terceiro lugar são as ferramentas, como uma busca externa, que funcionam como uma calculadora em cima dessa mesa. Cada um desses lugares cobra um preço bem diferente, em termos de custo financeiro, frescor da informação e rastreabilidade.
2:32A falha de uma ferramenta, por exemplo, é devolver pouco, devolver demais ou devolver a coisa errada para a mesa. E tem um detalhe mecânico crucial aqui. Esses três lugares aparecem juntos no mesmo pedido, numa coreografia de quatro gestos sequenciais.
2:46O modelo precisa receber a pergunta, recuperar o que falta usando parâmetros ou ferramentas, usar esse material para raciocinar e, por fim, entregar a resposta. A regra implacável é que cada gesto quebra de um jeito totalmente próprio.
2:59Ou seja, consertar o gesto de recuperar não conserta, de forma alguma, o gesto de usar. 3. O limite do RAG. Geração aumentada por recuperação. Historicamente, a primeira arquitetura que ficou famosa para esse gesto de recuperar foi o RAG.
3:14Foi proposto lá em maio de 2020 por Patrick Lewis e mais 11 autores do Facebook AI Research, da UCL e da NYU. A ideia pegou como fogo porque resolve muito bem uma categoria específica, perguntas cuja resposta mora em poucos trechos que, por sua vez, são muito parecidos com a própria pergunta.
3:33Isso facilita imensamente a busca por semelhança de texto. Mas é exatamente aqui que a busca vetorial desmorona na hora da contagem.
3:40Pense bem. Perguntar quantas condicionantes venceram exige juntar informações que estão espalhadas em centenas de documentos diferentes. E o texto desses laudos não se parece em nada com a pergunta feita.
3:52A busca por semelhança quebra completamente ao tentar achar dados que não dividem a mesma cara, o mesmo formato lexical da dúvida. 4. O que é RLM? Modelo de linguagem recursivo.
4:05Acompanhando a cronologia exata, a ideia do RLM surgiu em 15 de outubro de 2025, num post de Alex L. Zhang e Omar Khattab. Em 31 de dezembro de 2025, Zhang, Tim Kraska e Khattab, do MIT CSAIL, soltaram a primeira versão do artigo no arXiv.
4:23A versão 3 saiu depois, em 11 de maio de 2026. Descascando o conceito, o RLM é puramente uma estrutura de inferência construída em volta de um modelo comum. Nela, o prompt vira uma variável dentro de um ambiente de programação.
4:36O modelo, então, escreve um código para ler essa variável aos pedaços. E recursivo quer dizer exatamente isso. E nada além disso. O modelo pode chamar a si mesmo, ou uma cópia menor dele, para operar sobre cada pedaço desse código.
4:49E vamos limpar os jargões para não haver confusão. RLM é uma estrutura de inferência, e não um produto de prateleira. É totalmente diferente de aprendizado por reforço, a sigla RL, que altera os pesos do modelo no treino.
5:03Também é diferente de memória persistente. E diferente de automelhoria recursiva. Um RLM puro não aprende com cada pergunta. Ele esquece tudo assim que a execução termina. O que temos hoje são bibliotecas que implementam essa estrutura, como a rlms, lá no PyPI, e o módulo dspy.RLM dentro do DSPy, que entrou na versão 3.1.1 em 19 de janeiro de 2026.
5:28Vale destacar que, pelo menos até 23 de setembro de 2026, nenhum modelo comercial de fronteira foi anunciado como treinado nativamente para operar como RLM. 5. O diagnóstico de erros. Os 56 erros da Veredas. Voltando para Veredas, diante da falha na contagem, a reação instintiva do mercado seria tentar trocar o modelo por um mais caro, mais pesado.
5:51Mas é uma armadilha clássica. Se o defeito mora no que chega até a janela de contexto, Fazer um upgrade no motor não resolve. O modelo mais caro, lendo os exatos mesmos oito trechos errados, simplesmente erra com mais eloquência. E os números provam isso.
6:07A equipe montou um conjunto de avaliação com 120 perguntas. O placar final, apenas 64 acertos. Mas o raio-x dessas categorias é o que revela fratura. Foram 36 acertos em 40 perguntas de localização.
6:20O desempenho cai para apenas 21 acertos em 50 perguntas de agregação e contagem. e desaba para incríveis sete acertos em 30 perguntas de cruzamento. É um assistente que acha muito bem, mas junta muito mal.
6:33O Caio pegou os 56 erros totais e aplicou regras de decisão severas. Erro de informação, quando o dado nem estava no índice. Erro de contexto, quando a informação existia, mas nunca chegou ao modelo. Raciocínio, quando chegou, mas o modelo concluiu errado.
6:49E execução, quando o formato quebrou. A Helena revisou de forma metódica. Sorteou 15 rótulos para auditar e discordou de apenas 2. Os totais dessa tabela confirmam o abismo.
7:00Tivemos 6 erros de informação, 12 de raciocínio, 7 de execução e, impressionantes, 31 erros estritamente de contexto. 6. O teto e a decisão. A matemática do limite de contexto. Esse diagnóstico desemboca numa matemática fria.
7:18Uma pergunta de contagem lá na Veredas exigia ler cerca de 300 documentos para ter uma resposta certa. Só que o assistente mandava, no máximo, os oito trechos mais parecidos. Oito dividido por 300 dá cerca de 2,7% do material. A realidade bate na porta.
7:34Nenhum modelo do mundo consegue contar aquilo que ele não leu. A decisão de gestão da Helena foi pragmática. Manter a ferramenta atual rodando para as perguntas de localização, onde o acerto bate na casa dos 90%, e, em paralelo, buscar uma nova arquitetura dedicada à agregação e ao cruzamento.
7:51O teto do contexto deixa isso claro. Mesmo que todos aqueles 31 erros de contexto fossem magicamente consertados, o placar só subiria de 64 para 95 acertos em 120, o que ainda está longe do ideal. E isso deixa a grande dúvida técnica do Caio no ar.
8:06Com 52 milhões de tokens num acervo e cerca de 1 milhão de tokens na maior janela de contexto que temos, como fazer a máquina ler tudo o que uma simples contagem exige? E é isso que nos leva ao próximo passo, um verdadeiro dever de casa sugerido pelo capítulo.
8:23O convite é aplicar esse mesmo método em qualquer sistema que esteja rodando agora. A tarefa é listar as perguntas de agregação que falharam por contexto e anotar, ao lado de cada uma, quantos documentos a resposta de referência exige. A régua é implacável.
8:37Toda pergunta que exija mais de 50 documentos já não cabe no desenho padrão de busca por trechos. Avaliar o limite do que chega na mesa do modelo antes de trocar o motor, eis o diagnóstico antes da ferramenta.
Onde o modelo encontra a informação, em conversa
Dois apresentadores percorrem o capítulo 1 cobrando a prova de cada afirmação: parâmetros, contexto e ferramentas, o RAG de 2020, a definição de RLM, a armadilha do modelo maior e o diagnóstico da Veredas Ambiental, caso fictício, com 31 erros de contexto em 56 e o teto de 95 acertos em 120.

Transcrição
0:00Sabe aquela expectativa, né, de que a inteligência artificial vai operar, tipo, uma mágica dentro da empresa? Ah, sempre tem essa ilusão.
0:07Pois é. Alguém digita uma pergunta lá no sistema interno e a ferramenta acerta o documento exato, bem no alvo, como um franco atirador.
0:15Mas aí, a realidade da operação do dia a dia bate na porta. E a nossa análise de hoje é feita sobre medida para uma pessoa muito específica. Ser enfocado na dor real de quem está na trincheira.
0:26Exato. A gente preparou esse mergulho para quem mantém um assistente de busca baseado em inteligência artificial que acerta perfeitamente onde está um documento isolado, mas erra feio e erra de forma catastrófica mesmo quando precisa contar, agregar ou cruzar informações de muitos documentos.
0:45É o cenário clássico. E detalhe, a gente está falando com a pessoa que exatamente nessa semana está lá com o dedo no gatilho, quase passando o cartão corporativo para trocar de ferramenta ou pagar por um modelo muito mais caro, tudo na esperança de resolver o problema.
1:01É, e esse é o momento perigoso da frustração com a arquitetura, sabe? A ferramenta funciona de maneira brilhante para localizar aquele detalhe microscópico, mas entra em colapso total quando o usuário exige uma visão geral.
1:16E o pior, trocar o motor do sistema antes de entender a anatomia exata desse erro é, na prática, gastar dinheiro duas vezes. Com certeza. Tipo, um modelo mais caro não vai resolver uma falha na fundação, né? Não vai mesmo.
1:29E para dissecar essa fundação, a gente vai usar como guia os conceitos que abrem a discussão sobre modelos de linguagem recursivos, ou RLM. E a melhor forma de entender essa dor na prática é olhar para o caso da Veredas Ambiental.
1:44Mas é, antes da gente avançar, eu preciso fazer um aviso de praxe. Justo. A Veredas, assim como a Helena e o Caio, que são os profissionais que a gente vai mencionar ao longo da nossa conversa, eles compõem um caso puramente fictício, tá?
1:58É um cenário desenhado estritamente para a didática do curso, para mostrar como essa tecnologia falha e evolui. É fundamental deixar isso claro. Sim, feito o aviso, vamos olhar para os números, porque eles ilustram a realidade de muitas empresas por aí.
2:13A Veredas é desenhada como uma consultoria de Belo Horizonte Com 14 anos de experiência em licenciamento ambiental O acervo deles reflete o histórico de 38 empreendimentos complexos E aí o volume de arquivos chega a 6.400 documentos E a escala de dados que acompanha esse é o que torna o problema super interessante A fonte aponta para cerca de 52 milhões de tokens Nossa, é muito token Absurdo E apenas para nivelar quem nos acompanha hoje, o token é aquele fragmento, sabe?
2:45O pedaço de palavra que o modelo de inteligência artificial efetivamente lê e o mais importante, pelo qual a provedora da API cobra lá na fatura no fim do mês. Pesado. Pois é.
2:5614 anos de arquivos de licenciamento até cabem facilmente num servidor comum de empresa, mas não cabem de forma alguma na cabeça de um único analista humano. É, ninguém memoriza 52 milhões de tokens.
3:08E é exatamente para resolver isso que entra a figura do Caio, o engenheiro de dados desse nosso caso ilustrativo. Ele foi lá e construiu um assistente de busca baseado em IA para ler esse acervo todo. Mas o sintoma que o Caio começou a relatar na operação é justamente a dor central que a gente descreveu na abertura.
3:26Que é a dupla personalidade do assistente. Isso. O assistente era perfeito em perguntas pontuais, tipo, onde está o laudo de março da PCH? A resposta vinha lindamente com a página exata.
3:37Só que o sistema desmoronava completamente diante de perguntas gerenciais. Coisas como quantas condicionantes vencidas temos em todos os empreendimentos. E aí a gente chega no núcleo do risco para qualquer negócio.
3:49A Helena, que atua como coordenadora técnica e assina os pareceres finais que vão para os clientes, ela percebe rapidamente que o erro de contagem é o mais caro e o mais perigoso de todos. Exatamente. A justificativa para isso é comportamental.
4:04O modelo de inteligência artificial não demonstra dúvida, ele não gagueja. Ele te entrega um número completamente inventado ou incompleto com a mesmíssima postura de certeza absoluta com que ele entrega um documento correto.
4:23É, ele tem aquela pose de quem sabe tudo. Exato. Ele veste o erro com uma linguagem impecável. Então, se quem opera o sistema diagnosticar esse erro de forma precipitada, vai acabar trocando a ferramenta de IA sem resolver a causa raiz.
4:40E para não cair nessa armadilha de trocar de modelo à toa, a gente precisa levantar o capô e olhar para o motor. De onde, afinal, o modelo tira a informação para montar uma resposta? É, tem que saber a origem.
4:53Basicamente, existem três fontes ou lugares possíveis. A primeira delas são os parâmetros. Estamos falando dos bilhões de números ajustados lá atrás durante o treinamento original daquele modelo gigantesco. A melhor analogia aqui é pensar nos parâmetros como a memória de alguém que estudou intensamente para uma prova uns anos atrás.
5:17Essa memória é super vasta, mas não tem um índice, né? E não tem carimbo de data. Isso. E os impactos práticos dessa primeira fonte são muito concretos no dia a dia. É um conhecimento, entre aspas, gratuito no momento da chamada, porque o custo dele já foi pago lá no treinamento.
5:33Porém, ele está desatualizado e sofre de um problema grave de rastreabilidade. O modelo não sabe dizer a origem, de qual página ele tirou aquilo. A segunda fonte é o contexto. Isso é crucial da gente entender.
5:46O contexto é aquele texto que chega colado na pergunta, junto com as instruções do sistema. A analogia perfeita aqui é o tamanho da mesa de trabalho. É ali que os papéis são espalhados. E os modelos mais recentes, agora em setembro de 2026, Anthropic, OpenAI, Google, eles têm janelas de cerca de um milhão de tokens.
6:08Só que essa mesa é enorme e cobra o seu preço, literalmente. O limitador do contexto é o bolso. É cobrado por token a cada uso. Mas, além disso, tem um detalhe mecânico implacável. Se o documento certo não for colocado em cima dessa mesa, o modelo falha, não importa o tamanho dele. Perfeito!
6:27E, por fim, a terceira fonte são as ferramentas, funções externas. Pense em isso como uma calculadora sobre a mesa. O modelo tem que saber o que digitar nela. E o custo dessa terceira fonte é o tempo de espera do usuário e, claro, a dependência enorme da precisão dessa busca. Se a busca trouxer o arquivo errado, já era.
6:50Exatamente. Agora, Agora, conectando de onde a informação vem para como ela é processada, a gente precisa detalhar os quatro gestos de uma resposta. Toda vez que a IA gera texto, ela executa o receber, que é o que entra direto na janela. Certo.
7:08Aí tem o recuperar, que é o esforço de ir buscar o que falta nos parâmetros ou nas ferramentas. Depois vem o usar, que é a parte cognitiva, o raciocinar em cima do material. E por último, entregar, que é o formato final.
7:24E aqui tem um aprofundamento essencial que, nossa, muita gente ignora. Cada gesto desse falha de forma independente. Totalmente independente. Consertar ou recuperar, tipo melhorar a ferramenta de busca, não conserta o usar, que é o raciocínio.
7:42E falando em recuperar, a gente esbarra na arquitetura clássica, o RAG. A geração aumentada por recuperação. O famoso RAG. Sim. Isso foi formalizado lá em maio de 2020.
7:56Patrick Lewis e mais 11 autores do Facebook AI Research, da UCL e da Universidade de Nova Iorque. A mecânica dividiu as coisas em memória paramétrica, os parâmetros, e memória não paramétrica, que é o índice.
8:11O modelo consulta passagens indexadas por significado. E aí vem a pergunta de um milhão de dólares. Por que o RAG é uma obra de arte para onde está o laudo de março? Mas falha tragicamente na pergunta quantas condicionantes vencidas? Esse é o X da questão.
8:31A falha temática do RAG acontece porque, no caso das condicionantes, a resposta está espalhada em centenas de documentos que, semanticamente, não se parecem em nada com a pergunta feita. Tipo, as palavras não dão match, né? Zero match.
8:46A pergunta usa palavras de contagem e tempo, tipo quantas e vencidas. O documento lá no PDF tem data limite ou status. Não tem sobreposição semântica, óbvia, para busca vetorial pescar.
9:02Aí ele traz coisas genéricas sobre a política de condicionantes em vez das licenças em si. É um abismo. E é justamente para lidar com esse limite que a gente transita para a fronteira, que é o RLM, modelo de linguagem recursivo.
9:16Tem um histórico literal aí que começa com um post do Alex L. Zhang e do Omar Khattab em 15 de outubro de 2025? Sim, e logo depois evolui. Pois né, em 31 de dezembro de 2025, sai um artigo no arXiv com o Tim Kraska lá do CSAIL do MIT, e a versão 3 saiu em 11 de maio de 2026.
9:35A estrutura do RLM não altera os pesos do modelo. O prompt vira uma variável no ambiente de programação, e o modelo escreve código para ler aos pedaços. Ele vai chamando a si mesmo, ou até uma cópia menor.
9:48O acervo de documentos sai de dentro do contexto e vira um objeto manipulado por código. Mas olha, como profissional da área, eu tenho que questionar isso aqui com um pouco de ceticismo.
9:59O artigo afirma que isso processa entradas mais de uma ordem de grandeza acima da janela. Processar dez vezes mais que o limite soa como um exagero, não acha? Eu entendo totalmente o ceticismo, mas essa é a declaração literal do próprio artigo.
10:14O grande objetivo do curso é justamente medir isso na prática, sem inflar os resultados. É pegar o acervo da Veredas e ver se a afirmação se sustenta no teste empírico rigoroso. Ok, vamos ver então.
10:27Mas antes, a gente tem que limpar uma confusão enorme de siglas que a indústria adora fazer. Ah, o banho de sopa de letrinhas. É uma estrutura de inferência. Ele esquece tudo ao final da execução. Não tem memória.
10:40Exato. Diferente do RL, que é aprendizado por reforço. Exatamente. RL é método de treino de pesos por recompensa. A terceira confusão é com memória persistente. Essa sobrevive entre conversas. O RLM puro não tem isso de fábrica.
10:58E a quarta é automelhoria recursiva, que é a ideia de que o agente reescreve as próprias regras. O RLM puro não vai aprender com cada pergunta que a Veredas faz ao longo dos dias. É, o RLM não é mágica e também não é um produto fechadinho de prateleira ainda.
11:16Existe a biblioteca rlms no PyPI e o dspy.RLM desde 19 de janeiro de 2026. Mas até 23 de setembro de 2026, pelo menos, nenhum modelo comercial de fronteira foi anunciado como treinado para operar nativamente como RLM.
11:35O que nos leva de volta à armadilha comum que a gente comentou no começo. Nossa, o risco de trocar um modelo por um maior quando o defeito está no que chega até ele. O modelo mais caro, lendo os mesmos trechos errados de antes, apenas erra com mais eloquência.
11:49Ele fala bonito, mas fala besteira. Falou tudo. E foi por isso que o diagnóstico da Veredas foi brilhante. A Helena e o Caio provaram isso com matemática rigorosa. Zero palpites. Eles pegaram 120 perguntas de avaliação. E como foi essa divisão?
12:04Foram 40 perguntas de localização, 50 de agregação ou contagem e 30 de cruzamento. E os acertos? De 120, tiveram só 64 acertos no total, sendo 36 em localização, 21 em agregação e ínfimos 7 acertos em cruzamento.
12:24Fica super claro. O sistema acha os papéis super bem, mas junta os dados muito mal. E aí tem que rotular os erros, né? São 56 erros, o Caio aplicou uma regra de decisão bem rígida, em ordem, e a Helena ainda sorteou 15 rótulos para auditar, e ela discordou de apenas dois que, no fim, terminaram como erro de contexto.
12:45É uma auditoria séria. Sim. E o total dos 56 erros ficou assim. Seis de informação, tipo aqueles PDFs super antigos e ilegíveis. Que o modelo nem consegue ler. Exato. 31 de contexto, 12 de raciocínio e 7 de execução. E o problema de fundo é assustador.
13:04Qual parte exatamente te assustou mais? A parte da agregação. A pergunta de agregação exigia leitura de cerca de 300 documentos simultâneos, só que o assistente enviava apenas os 8 trechos mais parecidos.
13:17Pois é. E 8 dividido por 300 é perto de 2,7% do material.
13:25Como é que a máquina vai contar as condicionantes se ela não viu nem 3% do material? Nenhum modelo conta o que não leu. E vale destacar, aqueles 12 erros de raciocínio que eles mapearam não somem com mais contexto. Tipo o quê?
13:38Misturar datas de emissão do laudo com a data de amostragem da água, por exemplo. Isso é deficiência no gesto de usar. E analisando os números friamente, a gente bate num teto de investimento.
13:49Se eles arrumarem todos os 31 erros de contexto mapeados, e só eles, O placar automático vai de 64 para 95 acertos em 120. O que mostra muito sobre onde investir dinheiro primeiro. Esse número de 95 acertos não é uma promessa comercial de venda. Ele é um mapa.
14:08Ele grita que a prioridade é melhorar a forma de expor o acervo para garantir que a informação chegue de fato à mesa, antes de gastar tubos de dinheiro com extração ou raciocínio hipercomplexo. Exato. E a conclusão de gestão da Helena foi bem cirúrgica.
14:22Ela decidiu manter o assistente atual na tarefa de localização, onde ele já bate 90% de acerto, e buscar uma outra arquitetura, nova, apenas para agregação e cruzamento. Uma decisão super pragmática.
14:36Mas aí vem a pergunta final do Caio, que é o nó na cabeça de todo mundo. Manda! Se o acervo tem 52 milhões de tokens e a janela dos modelos topo de linha é de cerca de 1 milhão, como fazer o modelo ler tudo o que uma contagem exige?
14:51O curso responde a isso a seguir. Mas por hoje, a nossa análise se encerra com uma diretriz clara. Uma missão para colocar em prática já na segunda-feira. Exatamente. Quem ouve tem que sair daqui hoje com uma tarefa muito objetiva.
15:05Na segunda-feira de manhã, vocês precisam classificar os erros do próprio assistente interno, separando-os em falhas de informação, contexto, raciocínio e execução, antes de sequer cogitar trocar qualquer peça do sistema.
15:19E detalhe, anotar obrigatoriamente quantos documentos cada pergunta de agregação exige na operação de vocês. Sem mapear isso, é um tiro no escuro. Mapeie o erro antes de comprar a solução.
Trocar de ferramenta antes de saber por que a atual erra é gastar duas vezes. Ao terminar, o leitor separa o que um modelo sabe do que ele recebe e do que ele busca. Também classifica cada falha num de quatro tipos e reconhece o vocabulário que o resto do curso usa. A sigla RLM, em especial, tem três vizinhas com nomes parecidos e sentidos diferentes.
Três lugares de onde sai a resposta de um modelo de linguagem
Todo modelo de linguagem responde com o que encontra em três lugares. O primeiro são os parâmetros: os bilhões de números ajustados no treino, que guardam o que o modelo aprendeu antes de você chegar. É uma memória parecida com a de quem estudou para uma prova anos atrás: vasta, sem índice e sem data. O modelo não sabe dizer de qual livro tirou cada frase.
Em segundo lugar vem o contexto: o texto que chega na chamada, com a pergunta, as instruções e os documentos colados. Janela de contexto é o limite de tokens que cabem numa chamada, como o tamanho da mesa em que alguém espalha os papéis para ler. Em setembro de 2026, os modelos mais recentes da Anthropic, da OpenAI e do Google anunciam janelas de cerca de 1 milhão de tokens.
Ferramentas formam o terceiro lugar. São funções que o modelo chama para buscar ou calcular fora de si: uma busca num índice, uma consulta a banco, um trecho de código executado. O resultado volta para o contexto e só então entra na resposta. Uma calculadora sobre a mesa ajuda quem sabe o que digitar nela; o modelo precisa decidir o que perguntar à ferramenta.
Cada lugar tem um preço diferente. O que está nos parâmetros sai de graça a cada chamada, mas não se atualiza nem cita a origem. O que está no contexto é cobrado por token, toda vez que entra na janela. O que vem de ferramenta acrescenta tempo de espera e depende de a busca acertar o alvo. Escolher onde pôr uma informação é escolher entre custo, frescor e rastreabilidade.
Os três lugares da informação e a falha típica de cada um
| Lugar | Como a informação chega | Falha típica | Exemplo na Veredas |
|---|---|---|---|
| Parâmetros | Aprendida no treino, antes da pergunta | Resposta plausível e desatualizada, sem origem | O modelo “lembra” uma norma genérica de outorga que não vale para Minas Gerais |
| Contexto | Colada na chamada, junto com a pergunta | O trecho certo ficou fora da janela ou se perdeu no meio dela | O laudo que contradiz o anterior não estava entre os trechos enviados |
| Ferramentas | Buscada ou calculada durante a execução | A ferramenta devolve pouco, demais ou a coisa errada | A busca vetorial traz 8 trechos parecidos com a pergunta e nenhum com a data de vencimento |
Exemplos do cenário composto da Veredas Ambiental, usado em todo o curso.
Os três lugares aparecem juntos num mesmo pedido, em três gestos: receber, recuperar e usar. O modelo recebe a pergunta e o que veio com ela. Recupera o que falta, pela memória dos parâmetros ou por uma ferramenta. Usa o material ao raciocinar e escrever a resposta. Cada gesto falha de um jeito próprio, e o conserto de um não conserta o outro.
- Etapa 1 de 4: Receber
Pergunta, instruções e documentos entram na janela de contexto
- Etapa 2 de 4: Recuperar
O que falta vem dos parâmetros ou de uma ferramenta de busca
- Etapa 3 de 4: Usar
O modelo raciocina sobre o material e escreve a resposta
- Etapa 4 de 4: Entregar
A resposta sai no formato pedido, dentro do limite de saída
A primeira arquitetura famosa para o gesto de recuperar é o RAG, sigla de geração aumentada por recuperação. Patrick Lewis e mais onze autores do Facebook AI Research, da UCL e da NYU publicaram a proposta em maio de 2020. O modelo consulta passagens da Wikipédia indexadas por significado e escreve a resposta com elas à vista. Na época, atingiu o melhor resultado em três testes de perguntas abertas.
Os autores chamavam os parâmetros de memória paramétrica e o índice de memória não paramétrica. A ideia pegou porque resolve bem um tipo de pergunta: aquela cuja resposta mora em poucos trechos, fáceis de achar por semelhança de texto. “Onde está o laudo de março” é uma pergunta assim. “Quantas condicionantes venceram” não é, porque a resposta está espalhada em centenas de documentos que não se parecem com a pergunta.
Justamente nessa fronteira mexem os RLMs. Em vez de buscar trechos por semelhança e colá-los na janela, o RLM guarda o material inteiro fora da janela e dá ao modelo uma ferramenta de programação para lê-lo. O acervo deixa de ser contexto e passa a ser um objeto que o modelo manipula por código, pedaço por pedaço, chamando outras instâncias de modelo para ler cada parte.
O vocabulário do curso e as siglas que parecem iguais
RLM quer dizer Recursive Language Model, modelo de linguagem recursivo. Alex L. Zhang e Omar Khattab apresentaram a ideia num post de blog em 15 de outubro de 2025. O artigo, assinado por Zhang, Tim Kraska e Khattab, os três do MIT CSAIL, saiu no arXiv em 31 de dezembro de 2025. A versão atual, a terceira, é de 11 de maio de 2026.
Pela definição do artigo, o RLM é uma estrutura de inferência montada em volta de um modelo comum. Estrutura de inferência é o programa que organiza as chamadas ao modelo na hora de responder, sem mudar os pesos dele. Por fora, a interface continua a de sempre: entra texto, sai texto. Por dentro, o prompt vira uma variável num ambiente de programação, e o modelo escreve código para ler essa variável aos pedaços.
Recursivo, aqui, significa que o código escrito pelo modelo pode chamar o próprio modelo, ou uma cópia menor dele, sobre um pedaço do material. Cada chamada devolve um resultado que o código guarda e combina. A resposta final nasce dessa árvore de chamadas, e nenhuma delas precisa ler o acervo inteiro. A versão atual do artigo afirma que isso processa entradas mais de uma ordem de grandeza acima da janela do modelo.
Quatro termos que circulam juntos e querem dizer coisas diferentes
| Termo | O que é | O que muda | Relação com o RLM |
|---|---|---|---|
| RLM (modelo de linguagem recursivo) | Estrutura de inferência em que o modelo lê o prompt por código e chama a si mesmo sobre pedaços | Como a pergunta é respondida, sem mexer nos pesos | É o assunto do curso |
| RL (aprendizado por reforço) | Método de treino que ajusta os pesos por recompensa a cada tentativa | O próprio modelo, depois do treino | Pode treinar um modelo para operar como RLM, mas é outra coisa |
| Memória persistente | Registro que sobrevive entre conversas, como notas ou banco de fatos do usuário | O que o assistente lembra na sessão seguinte | O REPL de um RLM guarda variáveis durante uma execução, e não entre sessões |
| Auto-melhoria recursiva | Sistema que reescreve as próprias regras ou ferramentas a partir do que fez | O agente muda de uma execução para outra | Um agente pode usar RLM e se automelhorar, como o Prime Agent de agosto de 2026 |
Os quatro termos aparecem juntos em anúncios e posts, e a mistura produz expectativa errada. Quem lê “modelo recursivo” e entende “modelo que melhora sozinho” espera que o sistema aprenda com cada pergunta da Veredas. Nada disso acontece num RLM puro. Ele responde melhor a perguntas difíceis porque organiza a leitura, e esquece tudo quando a execução termina.
Um pesquisador que lê a sigla com atenção evita outra confusão, a de que RLM seja um produto. Existe uma biblioteca oficial, publicada no PyPI como rlms, e existe um módulo dspy.RLM no DSPy desde a versão 3.1.1, de 19 de janeiro de 2026. Até 23 de setembro de 2026, nenhum modelo comercial de fronteira foi anunciado como treinado para operar como RLM.
De onde vem o vocabulário, em datas
- 22 de maio de 2020Concluído
RAG de Lewis et al.
Buscar passagens num índice e gerar a resposta com elas; aceito no NeurIPS 2020.
- 14 de julho de 2025Concluído
Context Rot, da Chroma
Dezoito modelos pioram à medida que a entrada cresce, mesmo em testes simples.
- 15 de outubro de 2025Concluído
Post de Alex L. Zhang
Primeira apresentação dos RLMs, com experimentos preliminares no OOLONG e no BrowseComp-Plus.
- 31 de dezembro de 2025Concluído
Artigo no arXiv, versão 1
Zhang, Kraska e Khattab, do MIT CSAIL, formalizam o método.
- 19 de janeiro de 2026Concluído
dspy.RLM no DSPy 3.1.1
Primeira implementação num framework amplo, marcada como experimental.
- 11 de maio de 2026Agora
Versão 3 do artigo
Profundidades de 0 a 3, novos comparativos e a formulação “mais de uma ordem de grandeza”.
Com as palavras no lugar, a pergunta útil deixa de ser “qual tecnologia é melhor” e passa a ser “em qual dos três gestos o meu sistema falha”. Uma falha de recuperação pede busca melhor. Uma falha de leitura pede outra forma de expor o material ao modelo. Armadilha comum: trocar o modelo por um maior quando o defeito está no que chega até ele. Um modelo mais caro lendo os mesmos oito trechos errados erra com mais eloquência.
Como a Veredas descobriu por que o assistente contava errado
Helena levou a Caio uma pergunta de negócio que o assistente nunca acertava: “quais condicionantes de monitoramento hídrico estão vencidas ou com laudos contraditórios, em quais empreendimentos, e com que evidência?”. Condicionante é a obrigação que o órgão ambiental impõe na licença, como medir a turbidez de um córrego a cada trimestre e entregar o laudo. Vencida quer dizer prazo passado sem laudo entregue.
Antes de trocar qualquer peça, os dois montaram um conjunto de avaliação. Helena escreveu 120 perguntas com a resposta de referência de cada uma: 40 de localização, 50 de agregação ou contagem e 30 de cruzamento entre pares de documentos. Cruzamento é comparar um documento com outro, como o laudo de 2023 com o de 2024 do mesmo poço, para achar contradição.
Rodado sobre as 120 perguntas, o assistente de busca vetorial acertou 64. O retrato por tipo de pergunta mostrou o padrão que Helena já sentia no dia a dia: 36 de 40 em localização, 21 de 50 em agregação e 7 de 30 em cruzamento. O sistema era bom em achar e ruim em juntar.
Caio então abriu cada um dos 56 erros e perguntou em qual gesto a resposta tinha quebrado. Criou quatro rótulos. Informação: o dado não existia no índice, como laudos escaneados sem texto legível. Contexto: o dado existia, mas não chegou ao modelo. Raciocínio: o dado chegou e o modelo concluiu errado, como comparar datas em formatos diferentes. Execução: a resposta quebrou no caminho, cortada ou fora do formato.
Para não rotular pelo palpite, Caio escreveu uma regra de decisão para cada rótulo e a aplicou na ordem. Primeiro checava se o dado existia no índice, depois se chegou ao modelo, depois se a conclusão batia com o material recebido. Helena sorteou 15 dos 56 rótulos para revisar e discordou de 2. Os dois eram laudos que chegaram ao modelo pela metade, e ambos ficaram como erro de contexto.
Os 56 erros do assistente anterior, por tipo de pergunta e origem da falha
| Tipo de pergunta | Erros | Informação | Contexto | Raciocínio | Execução |
|---|---|---|---|---|---|
| Localização (40) | 4 | 2 | 1 | 0 | 1 |
| Agregação e contagem (50) | 29 | 3 | 19 | 4 | 3 |
| Cruzamento entre pares (30) | 23 | 1 | 11 | 8 | 3 |
| Total (120) | 56 | 6 | 31 | 12 | 7 |
Cenário composto da Veredas Ambiental. Erros = perguntas menos acertos (40 − 36, 50 − 21, 30 − 7).
Trinta e um dos 56 erros, mais da metade, eram de contexto. O dado estava no acervo e no índice, e o modelo nunca o viu. A causa ficou clara quando Caio contou os documentos que cada resposta exigia. Uma pergunta de contagem sobre condicionantes hídricas em todos os empreendimentos precisava de cerca de 300 documentos. O assistente mandava ao modelo os 8 trechos mais parecidos com a pergunta.
A conta explica o resto. Oito trechos para uma resposta que depende de 300 documentos cobrem, no máximo, 8 dividido por 300, perto de 2,7 por cento do material. Nenhum modelo conta o que não leu. E a busca por semelhança escolhe os trechos que mais se parecem com a pergunta, geralmente os mais genéricos, e não os que trazem a data de vencimento.
Os 12 erros de raciocínio pesavam mais no cruzamento. Mesmo quando os dois laudos chegavam, o modelo misturava unidades, confundia o ponto de coleta ou aceitava a data de emissão como data de amostragem. Esses erros não somem com mais contexto e voltam ao longo do curso, na trilha de confiabilidade. Os 6 erros de informação pediam outra coisa: extrair texto dos PDFs escaneados.
Daí sai também um teto. Se uma nova arquitetura consertasse todos os 31 erros de contexto e nenhum outro, o placar subiria de 64 para 95 acertos em 120. Esse número não promete nada; ele diz até onde vale investir na forma de expor o acervo antes de atacar raciocínio e extração. Proposta que prometa mais precisa explicar qual dos outros três tipos de erro também resolve.
O diagnóstico da Veredas, antes e depois da classificação
Leitura inicial
Antes
- “O modelo é fraco em contas”
- Plano: trocar por um modelo maior
- Nenhuma medida por tipo de pergunta
- Erros discutidos caso a caso, de memória
Leitura depois dos 56 rótulos
Depois
- 31 erros vêm de material que nunca chegou ao modelo
- Plano: mudar a forma de expor o acervo ao modelo
- Placar de 36, 21 e 7 por tipo, guardado como linha de base
- 6 erros encaminhados à extração de texto, fora do modelo
Helena tirou da tabela uma decisão de gestão: manter o assistente atual nas perguntas de localização, em que acerta 90 por cento, e procurar outra arquitetura para agregação e cruzamento. Caio tirou uma pergunta técnica. Se o acervo tem 52 milhões de tokens e a maior janela disponível tem cerca de 1 milhão, como fazer o modelo ler tudo o que uma contagem exige?
O caso ganhou uma linha de base de 64 acertos em 120 e uma causa principal com número: 31 erros de contexto. Liste agora as perguntas de agregação que falharam por contexto e anote, ao lado de cada uma, quantos documentos a resposta de referência exige. A lista está completa quando cada pergunta tiver esse número, e toda pergunta acima de 50 documentos já não cabe no desenho de busca por trechos.
Trilha 2Anatomia de uma execução
Acompanhar o acervo guardado numa variável do REPL, o modelo principal que vê só metadados, as chamadas subordinadas sobre as partes e a resposta montada no ambiente.
Trilha 3Explorar, dividir e agregar
Inspecionar a estrutura do material antes de cortar, escolher a divisão que preserva as relações, decidir entre código e modelo em cada parte e juntar as respostas sem perder evidência.
Trilha 4RLM, RAG, contexto longo e agentes
Saber quando uma chamada direta basta, quando a recuperação resolve, o que a compactação apaga, como o RLM se relaciona com agentes e montar a matriz que escolhe a abordagem por tipo de tarefa.
Trilha 5Evidências e benchmarks
Julgar se um teste é difícil, justo e válido, ler as famílias de tarefas do artigo original, montar comparações controladas e levar a sério os resultados que contrariam a expectativa.
Trilha 6Laboratório: construir e inspecionar
Preparar um acervo com identificadores preservados, rodar a biblioteca oficial e o módulo dspy.RLM com limites explícitos e ligar cada conclusão à evidência que a sustenta.
Trilha 7Custo, desempenho e operação
Decompor o custo entre modelo principal, subchamadas e código, limitar chamadas, profundidade e tempo, testar paralelismo e reaproveitamento e monitorar a cauda lenta da execução.
Trilha 8Confiabilidade e segurança
Isolar o código que o modelo escreve, tratar o acervo como dado e nunca como instrução, conter o erro que sobe pela árvore e reexecutar só a parte que falhou.
Trilha 9Treinamento, memória e auto-melhoria
Distinguir o que muda durante a tarefa, entre tarefas e nos pesos, entender como se treina um modelo para operar recursivamente e exigir prova antes de aceitar uma alegação de auto-melhoria.
Trilha 10Perspectivas técnicas para 2027
Tratar como hipótese, com a evidência a acompanhar, a recursão aprendida, a execução com garantias, os sistemas híbridos, os dados multimodais e o trabalho prolongado.
Trilha 11Cenários de adoção em 2027
Ler quatro cenários condicionais pelos sinais que os confirmariam, escolher as aplicações candidatas e decidir o que experimentar, medir e adiar num piloto.
Trilha 12Projeto final
Definir tarefa e acervo, construir a referência, o RLM e o híbrido, avaliar com repetição e custo e escrever a recomendação de uso que as evidências sustentam.