RAG 全称 Retrieval-Augmented Generation,意为检索增强生成,是一种将信息检索与大语言模型生成能力相结合的技术架构。当用户提问时,RAG 先从外部知识库(向量数据库、文档索引、搜索引擎)中检索相关片段,再将检索结果作为上下文注入 prompt,让模型基于真实信息生成回答。
你可以把它理解为给 AI 配了一本“可以实时翻阅的参考书”——模型不再只靠训练时学到的知识,而是每次回答前先去查资料。
RAG 的核心组件:
- 文档入库:将文档切片、向量化存入向量数据库
- 检索模块:根据用户问题检索最相关的文档片段
- 融合模块:将检索结果与原始问题拼接成 prompt
- 生成模块:LLM 基于增强后的上下文生成回答
大白话理解:
没有 RAG 的时候:
- 你问 AI “我们公司去年的销售额是多少?” → AI 不知道,因为它没学过你们公司的数据
- 你问 AI “这本书的第 3 章讲了什么?” → AI 只能凭训练时的记忆瞎猜
- AI 回答看起来很合理,但数据是编的 → 这就是“幻觉”
有了 RAG 之后:
- 你问 AI “我们公司去年的销售额” → AI 先去查公司数据库,找到真实数据,再回答
- 你问 AI “这本书第 3 章讲了什么” → AI 先去检索第 3 章的原文,再总结给你
- 回答有据可查,不再胡编乱造
打个比方:
|
纯 LLM |
RAG |
|---|---|
|
像闭卷考试,全靠脑子记 |
像开卷考试,可以翻书 |
|
记错了就胡说 |
查到什么说什么 |
|
知识截止于训练日期 |
可以接入最新数据和实时信息 |
一句话总结:
RAG 让 AI 在回答前先去查资料,解决了纯 LLM 的知识滞后和幻觉问题。