Trabalho · IA Aplicada · 2026
Pesquisa sobre uma coleção fechada de documentos
Um sistema de perguntas e respostas fundamentadas sobre 307.689 palavras de ficção, para uma equipa editorial: pesquisa híbrida, um agente limitado, três verificações que correm depois do modelo terminar, e a avaliação de 52 casos que decidiu o desenho.
1. O sistema
O enunciado: uma ferramenta para a equipa editorial de uma editora sobre dois romances fornecidos, Little Women e Pride and Prejudice, 307.689 palavras no total. Os editores fazem perguntas fundamentadas, recebem respostas com citações que resolvem para livro e capítulo, e procuram passagens próximas entre autores, que é a pergunta de um departamento de direitos sobre uma submissão.
Foi entregue como aplicação de browser sobre um backend em Node e TypeScript, porque os utilizadores são editores e juristas. As passagens aparecem literalmente com as suas citações, e cada número na interface é um número sobre o qual o leitor pode agir. O registo de decisões do projeto tem 102 entradas, cada uma com o que foi escolhido, o que perdeu, e que evidência mudaria a escolha.
2. Dois braços de pesquisa e uma fusão
A ingestão divide na estrutura do documento. Os dois livros marcam capítulos de maneira diferente, e um padrão por livro parte em silêncio no terceiro livro, por isso o segmentador usa o sinal estrutural comum:
Little Women: <h2>I. Playing Pilgrims.</h2>
Pride & Prejudice: <h2><a id="Chapter_I"></a>CHAPTER I.</h2>3. Verificações depois do modelo
A pesquisa funde palavra-chave e vetores densos com reciprocal rank fusion, um reranker sobre os candidatos finais, e a profundidade escolhida a partir da precisão de contexto medida no conjunto de avaliação. A esta escala o índice vive no processo; uma base de dados vetorial ganha o seu peso operacional mais tarde, e o registo de decisões documenta o limiar.
O modelo corre dentro de um ciclo de ferramentas limitado, com nove ferramentas, e o âmbito de livro é imposto na camada das ferramentas, para que uma pergunta sobre um livro nunca leia o outro. Depois da geração correm três verificações em código: as citações têm de resolver para um capítulo real, uma auditoria por afirmação separa o que as fontes suportam do que apenas deixam por contradizer, e as citações literais são procuradas dentro do capítulo que reclamam.
4. A avaliação que encontrou a falha
A avaliação tem 52 casos, agrupados pelos quatro trabalhos que o enunciado nomeia, mais um conjunto de guarda para perguntas que o sistema deve recusar:
| Grupo | Trabalho | Casos |
|---|---|---|
| G1 | explorar e compreender o conteúdo dos livros | 5 |
| G2 | responder sobre partes específicas | 9 |
| G3 | identificar passagens relevantes | 28 |
| G4 | comparar conteúdo entre livros | 6 |
| guarda | recusar o que está fora de âmbito | 4 |
5. O que o agrupamento revelou
Uma versão anterior pontuava por mecanismo, qualidade da pesquisa aqui, qualidade da resposta ali, e a vista por mecanismo escondia um buraco: a primeira pergunta sobre um livro inteiro pontuava zero em fundamentação em todas as rondas, porque oito passagens recuperadas nunca conseguem descrever um romance. Agrupar a avaliação pelo trabalho do utilizador tornou a falha visível num único relatório, e a correção foi uma capacidade em falta, uma vista ao nível da coleção para a qual as pontuações por mecanismo nem tinham lugar.
O conjunto inclui também defeitos plantados, casos desenhados para falhar se uma proteção específica enfraquecer, para que uma regressão se anuncie como uma linha vermelha, e mudanças de parâmetros são decididas por comparação emparelhada.
6. O que levar daqui
- 1
Segmentar pela estrutura do documento. Padrões por documento são dívida que vence no terceiro documento.
- 2
A verificação pertence a depois da geração, em código: resolver citações, auditar afirmações, procurar as citações literais no capítulo que reclamam.
- 3
Agrupar a avaliação pelo trabalho do utilizador. As pontuações por mecanismo podem estar todas verdes com um trabalho inteiro a falhar.