Quando a resposta certa está no seu documento, e o modelo não a leu
Revisado em
Um assistente interno respondeu 180 dias de carência quando o contrato dizia 120, e ninguém conseguiu dizer de onde o número veio. Este curso ensina a construir e a auditar o caminho que leva o documento certo até a resposta: leitura, corte, índice, busca, reclassificação e a prova de que funcionou. 20 capítulos de leitura direta, em 6 trilhas, com cada número acompanhado de fonte e data.
Trilha 1Por que recuperar
Separar a pergunta que o modelo responde de memória da que exige abrir um documento seu, fazer a conta que compara recuperar com empilhar contexto e nomear em qual das seis etapas nasceu cada erro do seu sistema.
Um assistente interno respondeu que a carência para cirurgia eletiva era de 180 dias. O contrato do cliente dizia 120. A resposta saiu em dois segundos, em português impecável, sem nenhum sinal de dúvida na tela.
O número 180 não estava em documento nenhum. O modelo produziu a continuação mais provável para aquela frase, e 180 dias é o valor mais comum nos textos em português sobre planos de saúde. A resposta foi estatisticamente razoável e contratualmente falsa.
O custo disso aparece três dias depois, quando o cliente liga para reclamar da janela de agendamento que perdeu. Quem responde por atendimento descobre então que não existe como auditar a resposta: ninguém sabe de onde o número veio, porque ele não veio de lugar nenhum.
Essa aula separa dois tipos de pergunta. A que o modelo pode responder sozinho, porque a informação é pública e estável. E a que exige abrir um documento seu, porque a informação é privada, muda com aditivo e precisa ser citada para valer.
O mecanismo por trás do erro é o mesmo que produz os acertos. Um modelo de linguagem estima qual palavra vem a seguir, dado tudo que já foi escrito antes. Ele não guarda um campo dizendo se aquilo é lembrança ou invenção.
Por isso a segurança da resposta não informa nada sobre a veracidade dela. O texto sai igualmente fluente quando o modelo leu a informação milhares de vezes e quando está completando um padrão. Quem lê não tem como distinguir pela forma.
Glossário rápido
RAG (retrieval augmented generation, geração aumentada por recuperação)
Buscar trechos de documentos seus antes de gerar a resposta e colá-los no mesmo pedido que vai ao modelo. Ele deixa de responder de memória e passa a responder lendo o que você entregou naquele instante.
Alucinação
Resposta fluente e falsa. O nome sugere defeito raro, e o mecanismo é o mesmo dos acertos: o modelo estima a continuação provável. Ele não distingue lembrar de completar padrão.
Corte de conhecimento
A data em que terminou o material de treino. O que veio depois, e tudo que nunca esteve na internet pública, como o contrato do seu cliente, está fora do que o modelo pode saber sem que alguém entregue.
Contexto
O texto que viaja junto com a pergunta na mesma chamada: instruções, histórico e trechos recuperados. É a memória de curto prazo do modelo, reconstruída do zero a cada chamada.
Token
A unidade em que o texto é contado e cobrado. Em português um token fica perto de três caracteres e meio, então mil tokens dão cerca de 700 palavras. Preço, limite de contexto e latência usam essa unidade.
Aterramento (grounding)
Exigir que cada afirmação da resposta tenha um trecho recuperado por trás, com a citação ao lado. É o que transforma resposta plausível em resposta auditável.
Você já resolveu esse problema fora da tecnologia. O atendente novo que decora o padrão dos contratos acerta a maioria das vezes, porque a maioria segue o padrão. Ele erra justamente nos casos fora da curva, que são os que geram reclamação.
A saída nunca foi contratar alguém mais inteligente. Foi obrigar o atendente a abrir o documento do cliente antes de responder, e a dizer de qual cláusula tirou a informação. Recuperação é essa mesma obrigação, aplicada ao modelo.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
A troca que a recuperação faz é vantajosa por um motivo pouco citado. O problema deixa de ser conhecimento do modelo e passa a ser recuperação de informação, que é auditável por qualquer pessoa da operação.
Quando a resposta sai errada com recuperação ligada, dá para perguntar qual trecho o sistema entregou. Na Corretora Ventura essa pergunta levou três minutos para ser respondida: o sistema tinha entregue a cláusula do plano Essencial Individual quando a pergunta era sobre o Essencial PME.
O nome dos dois arquivos diferia em uma palavra. O conserto foi de metadado na ingestão, assunto da trilha 2, e custou meio dia. Nenhum modelo precisou ser trocado, retreinado ou reavaliado para chegar a essa conclusão.
A mesma pergunta sobre carência, nos dois regimes
Modelo respondendo de memória
Sem recuperação
- Devolve o valor mais frequente do idioma, não o do contrato
- Escreve com a mesma confiança quando sabe e quando completa padrão
- Não tem como citar origem, porque não existe origem
- Envelhece junto com o corte de conhecimento
- Corrigir exige treinar outro modelo
Modelo respondendo sobre trechos recuperados
Com recuperação
- Lê a cláusula do plano Essencial PME antes de responder
- Devolve ausência de resposta quando a busca volta vazia
- Cita documento, cláusula e data de vigência
- Acompanha o aditivo assim que o documento entra no índice
- Corrigir é corrigir o documento ou a busca
Armadilha comum: tratar citação como prova de correção. Se a busca trouxer o trecho errado, o modelo responde o trecho errado com a mesma fluência, agora com uma referência ao lado que aumenta a credibilidade do erro.
Citação prova procedência. Correção só se prova medindo, e é por isso que a trilha 6 dedica três aulas a conjunto dourado, fidelidade ao trecho e teste de regressão. Ligar recuperação sem medir troca um erro invisível por um erro com aparência de auditado.
O caso da Ventura terminou com um número que vale repetir. Na primeira semana com recuperação ligada, 62 por cento das respostas citaram o documento certo, 21 por cento citaram documento de nome parecido e 17 por cento não encontraram nada.
Os 21 por cento orientaram o projeto inteiro. Antes de melhorar o modelo, a equipe separou os planos por metadado e refez a nomeação dos arquivos. Pegue as vinte últimas perguntas reais do seu suporte e verifique quantas dependem de um documento que existe.
Trilha 2O que entra decide o que sai
Auditar o que a leitura do documento perdeu, escolher o corte do texto pela pergunta que o trecho precisa responder sozinho e projetar os metadados que permitem filtrar por produto, vigência e permissão.
Trilha 3Recuperar: palavra, sentido e reclassificação
Prever quais perguntas a busca por semelhança vai errar, fundir duas listas de resultados sem comparar notas, dimensionar a reclassificação pelo joelho da curva e decidir se a interação tardia compensa no seu acervo.
Trilha 4Índice, escala e a conta que ele traz
Ler os dois parâmetros que governam velocidade e cobertura, estimar a memória do índice antes de contratá-lo e reconhecer a pergunta que pede consulta estruturada ou grafo em vez de trecho de texto.
Trilha 5Recuperação agêntica
Transformar pergunta ambígua em consulta atendível, decompor e rotear a pergunta que precisa de mais de uma fonte com teto de tentativas, e cortar latência sem devolver resposta desatualizada.
Trilha 6Provar, proteger e saber parar
Montar o conjunto de perguntas que serve de régua, definir o portão que bloqueia regressão, fechar a porta do documento envenenado e reconhecer as onze situações em que recuperar não é o caminho.