本文深入剖析了朴素RAG的局限性,并详细介绍了7种进阶RAG架构,包括上下文增强RAG、多模态RAG、混合检索RAG、图RAG、智能体RAG、多智能体RAG和记忆型RAG。每种架构都针对基础RAG的特定失效问题,如上下文丢失、非文本文档处理、检索精度不足等,提供了有效的解决方案。文章强调根据实际需求选择合适的架构,而非盲目追求复杂,帮助读者更好地理解和应用RAG技术,提升大模型的效果。
我曾以为自己弄懂了RAG。我的第一条流水线非常简单:对文档进行分块、生成嵌入向量、检索排名靠前的匹配片段,把它们放进提示词,再交由大模型生成答案。
说实话,当时效果看着很不错。演示跑通了,回答听起来有理有据。我以为大功告成。
直到我开始向它提出真正关键的问题。
突然间,它会取出错误的文本块。有时虽然找到了正确文档,却漏掉我需要的那段内容。还有些时候,所需信息明明就在向量库里,模型却始终读不到。
最诡异的一点是:
系统本身没有任何报错。
流水线完全按照我编写的逻辑运行。
那一刻我意识到,大多数RAG教程都没有讲透一件事:把文档存入向量数据库只是简单环节。把正确的信息送入模型上下文,才是真正的难题。
我搭建的这套就是朴素RAG(Naive RAG)。朴素RAG并非一无是处,它是入门的起点。
但一旦文档内容杂乱、问题变得复杂,或是应用需要稳定可靠的表现,单次检索-回答的循环就会暴露局限。
这就是各类进阶RAG架构的用武之地。
本文会逐一拆解这7种架构,介绍每种架构解决什么问题、存在哪些缺陷,最重要的是,如何判断你的RAG系统实际需要哪一种。
用通俗语言理解RAG的本质
大语言模型仅掌握训练阶段学到的知识。
如果你向它询问企业内部文档或是近期发生的事情,它要么坦言不知情,更糟的是,会自信地编造内容。
RAG解决这个问题,就像开卷考试远比闭卷考试更容易答对题目。
在模型生成答案之前,系统会先检索相关资料,将资料作为参考素材交给模型,而不是让模型仅凭自身记忆作答。
朴素RAG的失效场景
基础RAG流水线的逻辑其实很简单:
在介绍高级架构前,我们快速了解基础RAG流水线的执行流程。
当用户提出问题,系统会执行以下步骤:
1
检索外部知识库,查找相关信息。
2
取出相关性最高的文本块。
3
将这些文本块加入提示词,和用户问题放在一起。
4
全部内容发送给大语言模型,模型基于这份上下文生成答案。
简单概括:问题 → 检索 → 获取片段 → 添加上下文 → LLM → 答案
当文档体量小、内容规整时,这套方案效果出奇的好。但现实场景中的数据很少这么理想。
文本块丢失上下文。一句“营收增长3%”的片段,无法说明属于哪家公司、哪个季度。
重要信息被遗漏。表格、图表以及扫描件,经常无法在基于文本的检索中被正常识别。
首次检索可能出错。基础RAG一般不会暂停并尝试其他检索策略。
对话历史无法留存。没有记忆能力,每次会话都从零开始。
事实之间相互割裂。分散在多份文档中的信息,需要建立关联才能推导出合理答案。
这些不是五个孤立的问题,正是不同RAG架构诞生的原因。
下面每种架构,都专门解决基础流水线里一类特定的失效问题。
1. 上下文增强RAG(Contextual RAG)
在存储文本块之前,附加一小段说明,描述该文本块的背景,这样片段被从原文抽离出来后,依然能够被理解。
可以这样简单理解:想象你从一本书里撕下一个段落,交给一个陌生人,没有书名、章节号,没有任何其他信息。对方根本看不懂这段内容在说什么。
而如果先在这页纸上钉一张便签:“本段出自第4章,介绍公司第二季度财报”,这就是该架构的核心思路。
原始文本块:"营收较上一季度增长3%" -> 哪家公司?哪一年?信息不明确 附加说明后:"来自ACME公司2023年第二季度财报。 营收较上一季度增长3%。" -> 现在单独看这段内容也能理解优点:
后续检索出来的文本块自带背景信息,不会因为脱离原文而语义残缺。
无需改动检索方式,只需要在入库阶段调整存储内容。
缺点:
需要为每一个文本块生成说明,入库阶段会消耗大量时间与成本。
写得不好的说明,同样会误导检索,和优质说明带来正向效果一样。
当文本块自带上下文后,下一个难题就是非纯文本类文档。
2. 多模态RAG(Multimodal RAG)
不再先把PDF页面转为文本再检索,而是让系统直接把页面当作图像进行读取,避免表格、图表在文本转换过程中被破坏。
简单理解:对比阅读别人对一张图表的文字描述,和直接看原图的差别。
文字描述可能遗漏细节,或是数字出现微小偏差;直接查看原图就不会有这类问题。
传统方式:PDF页面 -> 提取文本 -> 推测表格结构 -> 在文本中检索 (过程中数字和表格结构可能错乱) 多模态方式:PDF页面 -> 直接以图像形式检索页面 (表格保留表格形态,图表保留图表形态)优点:
能够处理文本提取容易损坏的表格、图表和扫描件。
移除流水线中脆弱的文本提取步骤,规避该环节带来的错误。
缺点:
相比纯文本检索,需要更高算力。
技术仍较新,可用工具和社区积累不如文本检索丰富。
3. 混合检索RAG(Hybrid Search RAG)
同时执行两种检索:一种理解语义含义,另一种匹配精确词汇,之后合并检索结果。
简单理解:想象有两位图书管理员帮你查找资料。一位擅长理解你的意图,哪怕你用词不精准也能找到相关资料。
另一位不懂上下文含义,但只要你输入特定编码,她一定能找到包含该精确文字的文档。理想情况下两者配合工作。
查询:"error E0502 borrow checker" 语义检索: 找到概念相近的文档,即便没有出现该精确短语 精确词汇检索:找到包含原文"E0502"字符串的内容 结果合并: 将两类结果融合成最终列表优点:
同时兼顾概念类宽泛问题和精确专业术语的检索需求。
解决一个非常普遍的缺陷:单独使用语义检索,往往很难处理编码、ID和专业术语。
缺点:
需要搭建和维护两套检索系统,而不是一套。
需要精细调参,决定两套检索结果各自的权重。
4. 图RAG(GraphRAG)
不再存储孤立的文本块,而是梳理文档里人物、公司、概念之间的关联,把相关内容归为一组,并提前为每组生成简短摘要。
当问题的答案无法由单个文本块承载时,系统会读取这些分组摘要,甚至自主判断需要读取哪些分组。
简单理解:假设你想知道“我们今年发布的所有资料中有哪些核心主题”。没有单篇文章能直接回答这个问题。但如果公司按部门划分,每个部门提前写了一页工作摘要,你只需阅读这些摘要就能快速得到答案。这就是知识图谱的思路。
更智能的版本,会由助手先判断哪些部门和你的问题相关,而不是不加筛选地读取全部部门摘要。
步骤1,构建图谱(一次性提前完成): 文档集合 -> 挖掘人物/概念之间的关联 -> 归类相关内容 -> 为每个分组生成简短摘要 步骤2,回答宽泛问题: "这份资料集合有哪些核心主题?" -> 筛选相关分组(智能版本会自动完成筛选) -> 读取对应分组摘要 -> 整合生成答案优点:
能够回答单个文本块无法覆盖的宏观、主题类问题。
可以一次性跨多份文档追溯关联关系,而非逐个文档检索。
智能自主筛选分组,避免读取无关摘要浪费资源。
缺点:
图谱构建本身是一项较大工程,不能快速搭建。
每当文档发生实质性变更,图谱的部分内容需要重新构建。
系统自主选择分组,这一步判断本身也可能出错。
梳理完整文档集可以解决宏观问题。但有些问题,无论图谱质量多高,都需要多次检索。
5. 智能体RAG(Agentic RAG)
不再只检索一次、拿到结果就直接回答;系统可以检索一次,查看返回结果,判断信息是否充足,如果不足就再次检索,循环多次直到信息足够。
简单理解:对比搜索引擎和研究助理的区别。搜索引擎只返回一轮结果就停止。
优秀的研究助理读完检索内容,发现信息不够,就会利用已获取的知识调整关键词再次检索。
收到用户问题 -> 检索一次 -> "现有信息足够作答吗?" -> 不足:利用刚刚获取的信息再次检索 -> 仍然不足:换个角度继续检索 -> 信息充足:生成答案优点:
处理那些确实需要多次查询才能妥善回答的问题。
不会像固定流水线那样,一次检索失败就直接放弃。
缺点:
每多一轮检索就增加一次接口调用,带来额外成本与延迟。
如果选择了错误检索方向,可能多次检索都在错误路径上,直到发现问题。
6. 多智能体RAG(Multi-Agent RAG)
不再由单一系统同时完成规划、检索、校验、写作,而是将任务拆分给多个小型专用系统,每个系统专精一项任务,由总控模块统筹整个流程。
简单理解:一个人同时做调研、写文稿、自查事实,往往每一项都做得平平。
而小型团队分工协作:一人规划调研内容、一人负责资料搜集、一人校验准确性、一人撰写最终文稿,每个环节质量都会更高。
收到用户问题 -> 规划智能体确定需要检索哪些内容 -> 检索智能体执行查询,有时并行查询多个数据源 -> 校验智能体核查返回资料的准确性 -> 写作智能体生成最终答案优点:
任务拆分,每个环节独立专注,而不是单一系统兼顾所有工作。
支持并行执行多项检索,而不是串行执行,节省耗时。
缺点:
多系统协同,单次问答成本更高。
最终答案出错时,需要逐层追溯多个环节定位问题,排查难度大。
7. 记忆型RAG(Memory RAG)
除了检索固定文档库,系统还可以检索和用户的历史对话,把过往对话当作可回溯资料,而不是对话结束就彻底遗忘。
简单理解:对比两种医生。一种每次问诊前都会翻阅你的病历;另一种每次都让你从头复述全部病史。你上次告知的信息,都保存在档案中。
这套系统思路与之类似:保存关键对话信息,相关时可以再次检索,不用每次对话都从零开始。
优点:
可以记住用户几天甚至几周前提到的信息,不需要一次性加载全部对话上下文。
非常适合持续性、个性化场景,不只是一次性文档查询。
缺点:
在文档检索系统之外,额外维护一套记忆系统,组件更多。
为节省空间,久远记忆会被压缩或摘要化,这个过程会丢失部分细节。
决策矩阵:该选择哪一种架构
值得记住的一点
朴素RAG不会明显报错。它不会崩溃,不会抛出异常。它只会基于错误信息给出答案,表面一切正常,直到有人核验内容。
本文列出的每一种架构,诞生的原因都是开发者追溯错误答案,找到了某个可修复的根源。
不要只因为架构更新,就盲目选用最复杂的方案。应当根据你的检索环节具体的失效类型,选择对应的架构。
今天就可以做的事
审视你当前的RAG流水线,诚实地问自己一个问题:系统给出错误答案时,根源是检索拿到了错误内容、文本块丢失上下文,还是系统没有二次检索?这个问题就能帮你锁定需要升级的架构。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》,下方扫码获取~
① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。
以上资料如何领取?
为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!
不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!
这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。