人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

检索增强的工程流程

切分、检索、重排与引用的每一环都会独立地影响最终答案。

深色档案架上密集排列的文件索引,其中一份被黄色高亮并有一道淡淡的连线。
知识检索与召回示意。

一、切分决定信息边界

固定长度切分会割裂语义,按结构切分更贴合文档组织。切块大小与重叠需要一起调:块太小丢上下文,块太大稀释检索信号。

二、检索与重排是两件事

初次检索追求召回,重排追求精度。先宽后窄的两阶段流程比单阶段更可控。

三、生成必须带引用

让答案中的每个结论都能指回来源片段,是降低幻觉最有效的工程手段之一。来源不存在时应当回答不知道,而不是补全。

四、检索质量要单独评测

检索命中率与生成正确率需要分开统计。检索没召回时,生成层再强也无从纠正。

五、索引更新要单独设计

文档变更后,检索结果是否同步取决于索引刷新策略。全文重建成本高,增量更新则要处理删除与版本残留。上线前就要确定刷新频率与一致性要求。

六、可核对的来源

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,arXiv:2005.11401。

七、适用边界

检索增强不是万能方案。它降低过时与幻觉风险,但不替代对来源质量的核查。