检索增强生成(RAG)是一种让大模型先检索外部知识库、再把检索结果作为上下文进行生成的架构,用于解决模型知识陈旧、幻觉与企业私有数据接入问题,是当前企业级 AI 应用的主流范式。
AI Glossary
检索增强生成(Retrieval-Augmented Generation,简称 RAG)是一种让大模型「先检索、后生成」的架构:在回答用户问题之前,先从外部知识库(企业文档、网页、数据库)中检索出相关内容,把它们作为上下文一起交给大模型,再生成答案。
RAG 诞生于 2020 年(Meta 团队提出),本质是给大模型外挂一个「可检索的记忆」。它解决了两大痛点:一是模型知识只到训练截止日,无法覆盖最新信息与企业私有数据;二是模型容易「一本正经地胡说」(幻觉),而检索结果可以作为事实依据约束生成。
RAG 的流程可以拆成三步:
第一步是索引构建(离线):把知识库文档切分成段落(chunk),用嵌入模型转成向量,存入向量数据库,建立「语义索引」。
第二步是检索(在线):用户提问时,把问题同样转成向量,在向量数据库中做相似度检索,找出最相关的若干文档片段;也可结合关键词检索做混合召回。
第三步是生成(在线):把检索到的文档片段与用户问题拼接成提示词,交给大模型生成答案,并可在答案中标注引用来源。
这一流程让模型「言之有据」——它不再凭训练记忆瞎编,而是基于检索到的真实内容作答。
向量数据库:Milvus、Qdrant、Pinecone、Weaviate 等,负责存储与检索文档向量,是 RAG 的存储核心。
嵌入模型:把文本转成向量的模型(如 BGE、OpenAI embeddings),向量质量直接影响检索准确率。
编排框架:LangChain、LlamaIndex 等,负责把「切分→嵌入→检索→生成」串成可维护的流水线。
大模型:负责基于检索上下文生成最终答案,通常搭配提示词模板约束输出格式。
企业知识问答:把内部制度、产品文档、FAQ 接入模型,员工用自然语言查询。
客服与售前:让机器人基于最新商品信息与政策回答用户问题,替代过期话术。
研究报告与合规:检索法规、判例、内部审计资料,生成带引用的分析结论。
内容生产辅助:让模型基于检索到的素材写报告、做总结,减少凭空编造。
一是检索质量决定上限:切分粒度、嵌入模型、混合检索策略都会影响召回准确率,检索不到或检错,生成必然出错。
二是引用可靠性:模型可能把检索内容与自身知识混用,需要设计「仅基于检索内容作答」的约束与引用校验。
三是知识更新:知识库变动后需要重索引或增量更新,否则答案仍会过期。
RAG 是当前企业接入大模型最务实的方式:不需要重训模型,就能让 AI 掌握私有数据与最新信息,且答案可溯源。它与微调(Fine-tuning)互补——RAG 管「查得到的事实」,微调管「学得会的风格」。理解「切分—向量化—检索—生成」这条链路,就抓住了绝大多数企业 AI 应用的骨架。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。