RAG与知识库术语解析:检索增强生成核心概念梳理
RAG(检索增强生成)已成为AI落地关键,但其中术语繁多。这篇小词典带你快速搞懂核心概念,从基础到进阶一次理清。
基础核心:RAG、检索器与生成器
RAG
全称Retrieval-Augmented Generation,直译为检索增强生成。它不是一个单一模型,而是一种架构模式:先从一个知识库(通常是大量文档)中检索出与问题相关的片段,再把片段作为上下文输入给生成模型(如大语言模型),最终产出回答。RAG的核心价值在于让模型“临时查看资料”,避免只依赖训练时学到的知识,从而减少幻觉、提高回答的时效性和准确性。2026年,RAG已成为企业部署AI问答系统的基本方案。
检索器
负责从知识库中“找东西”的组件。它接收用户问题,通过计算相似度(比如向量距离)从海量文档中取出最相关的若干片段。检索器的效率和质量直接影响最终回答。常见检索方式有稀疏检索(如BM25)和稠密检索(基于向量嵌入)。实践中常将两者混合使用。
生成器
基于大语言模型构建,负责“写回答”。它把检索到的片段和原始问题拼接成提示,然后生成连贯、准确的回复。生成器需要具备理解上下文并筛选有用信息的能力,否则可能被无关片段干扰。
嵌入向量
把文字(单词、句子或段落)转换成数值列表的技术。向量越相似,表示文本语义越接近。通过嵌入,检索器能在向量空间中快速找到与问题语义匹配的内容。嵌入向量的维度通常在数百到数千,需要精心调优。
向量数据库
专门存储和检索向量数据的系统,如Milvus、Weaviate等。它支持近似最近邻搜索,能在毫秒级从百万级向量中找到最相似的。向量数据库的索引类型和参数设置(如HNSW、IVF)会影响搜索速度和准确率。
检索与组织:分块、解析、重排序
分块
文档通常很长,无法直接全喂给模型,需要切分成小块。分块大小(如512个字符)和策略(按段落、句子或固定长度)会显著影响检索效果。块太小可能丢失上下文,太大则噪音增加。常见做法是设置块重叠(比如20%),让相邻块有部分重复,避免信息被切碎。
文档解析
将PDF、Word、网页等格式转为纯文本的过程。简单的解析可能丢失表格、图片、标题层级;复杂的解析会保留结构信息(如标题、列表),帮助后续检索。解析质量差会导致关键信息被忽略或错乱,2026年许多工具已支持多模态解析。
重排序
第一轮检索返回数百个候选,但多数质量不高。重排序用更精细的模型(如交叉编码器)对候选重新评分,只保留最相关的十几个。这一步能大幅提升召回准确率,但计算成本较高。
融合检索
结合关键词匹配(BM25)和向量匹配的混合方法。关键词确保精确匹配(如姓名、编号),向量捕捉语义相似。两者按权重融合分数,可以兼顾两种优势。现已成为RAG的主流检索方式。
质量与优化:相关度、上下文窗口和评估
相关度
衡量检索到的文档与问题匹配程度的指标。相关度不仅依赖嵌入质量,还受分块策略和查询改写影响。实际应用中常用命中率(Hit Rate)和平均倒数排名(MRR)来评估检索器的召回效果。
上下文窗口
生成器一次能处理的输入tokens数量。RAG常把检索片段放入上下文,如果窗口太小(比如4K),装不下足够信息;太大(比如128K)则模型可能遗漏早期内容。动态调整上下文填充策略(优先级排序)是优化重点。
检索质量评估
除了离线指标,还需要在线衡量用户满意度。常见做法是人工打分、A/B测试,或者用更强的大模型(如GPT-4)作为裁判评估回答与检索内容的一致性和帮助性。注意避免评估结果被“污染”——评估模型可能偏爱自己的输出风格。
块重叠
分块时保留相邻块之间部分重复内容(如15%)。这样做可以防止关键信息恰好被切在边界上导致丢失。重叠比例根据文档结构和模型输入长度来定,过高会浪费存储和计算资源。
进阶与融合:知识图谱、记忆管理与多模态
知识图谱
将实体(人、地、概念)以及它们之间的关系以图结构存储。在RAG中引入知识图谱,可以检索实体间的关联(如“张三的老板是谁?”),而不仅是纯文本。这种检索方式更适合需要逻辑推理或多跳问题的场景。
记忆管理
处理多轮对话时,RAG需要记住之前讨论过的内容。短期记忆可通过上下文窗口自然实现,长期记忆则需要将历史对话摘要或关键点存储到知识库中。2026年,许多系统采用“滑动窗口+关键事件记录”的混合记忆方案。
多模态RAG
扩展RAG的能力范围,支持检索图片、视频、音频等非文本内容。例如,用户上传一张产品照片,系统先通过视觉嵌入找到相似产品图片,再基于关联文本描述生成回答。多模态的嵌入对齐和不同模态的融合是当前技术难点。
缓存机制
对高频问题或常见检索结果做缓存,避免重复计算嵌入和搜索。缓存策略(如LRU)以及缓存命中的失效条件(如知识库更新后清空)需要仔细设计,否则会导致回答过时。
查询改写
用户的问题往往不够精确,比如“那个苹果公司的便宜手机”需要改写成“iPhone SE价格”。通过小模型或提示工程对原始问题进行重写、补充关键词,可显著提升检索命中率。
常见问题
RAG和微调有什么区别
微调是直接修改模型参数,RAG是在生成时动态检索外部知识,不改变模型本身。RAG更适合需要实时更新知识的场景,微调适合固定领域调优。
向量数据库必须用专门的系统吗
不一定,但推荐。小规模可用内存中的向量索引,企业级则需专用系统来管理亿级向量、支持高并发和动态增删。
分块大小怎么确定
先按模型上下文窗口上限的30-50%作为单块大小,再根据文档结构调整。小文件可用整段,大文件需测试不同尺寸下的检索命中率。
重排序是否会降低实时性
是,重排序增加延迟,但能显著提升准确度。可在非实时场景(如报告生成)使用,或对前几十个结果做轻量重排序。
知识图谱和向量检索能结合吗
能。先用向量检索找相关实体,再沿图谱关系扩展,最后合并结果。这种混合检索对多跳问题效果较好。
多模态RAG的主要挑战是什么
不同模态的数据难以统一嵌入语义空间,且检索到的图片或视频需要额外处理才能送入生成模型。2026年已有跨模态对齐的预训练方案可用。
如何评估RAG系统整体效果
分三块:检索质量(命中率、MRR)、生成质量(答案准确率、相关性)、端到端用户满意度(人工评价)。定期用测试集做A/B测试更可靠。