什么是 RAG?为什么带引用的答案更值得信
RAG——Retrieval-Augmented Generation,检索增强生成——意思是 AI 在回答之前先去查一下。系统不是从训练记忆里回想,而是搜索你的文档,把最相关的段落摆到模型面前,让它依据这些内容作答,并附上指回原文的引用。它修好了训练截止时间的问题、「它从没见过我的文件」的问题,以及很大一部分自信的编造。但它并没有把这些全部修好。
把问题说清楚
一个语言模型,实际上就是对它读过一遍的大量文本做的一次非常出色的压缩。这给了它流畅度和广度,也带来三个具体的弱点:训练截止之后的事它就不知道了;它从没见过任何私有内容;而当它不知道时,它照样会给出一个说得通的答案——因为生成说得通的文本本来就是它的全部工作。
你不可能每写一份文档就重新训练一次模型。所以你改的是答案从哪里来。
四个步骤
- 建索引。你的文档被切成一段段的片段——每段几个自然段——每个片段再被转成一种能捕捉其含义的数值表示。这件事只在前期做一次。
- 检索。你的问题用同样的方式转换,系统找出在含义上最接近它的片段。这不是关键词匹配:「关于延迟交付我们当时是怎么说定的」能找到一段写着「发货延误」、一个你的词都没用上的段落。
- 增强。那些片段连同你的问题,以及一条「依据所提供材料作答」的指令,一起被放进模型的上下文。
- 生成并引用。模型写出答案,而因为系统知道它拿到的是哪些片段,它可以把每一条说法指回来源。
就这些。聪明之处在第 2 步;可信之处在第 4 步。
为什么「粘进聊天窗口就行了」不是一回事
给一段对话附上一份文档,等于把整份内容放进这段对话的模型上下文里。对一篇论文来说这没问题。当它变成九十篇、当你下个月还要接着问、当相关的那一段在第 340 页而周围 339 页都是在争夺模型注意力的噪音时,它就不管用了。
RAG 只建一次索引,然后按问题去检索。你只付一次搭建成本,之后就能无限期地在整个文档集上提问。这个取舍我们在 GPT-5 对比 Gemini 里写得更深入——大上下文模型缩小了单份文档上的差距,但没有缩小你会反复回来查的文档集上的差距。
RAG 仍然会失败的地方
这里值得说准确,因为「有据可依」经常被当成「正确」来用:
- 检索漏掉了。如果正确的片段没被检出,模型就会依据它确实拿到的内容作答——自信而错误。那些需要跨许多分散片段综合的问题(「2023 年和 2026 年的政策之间改了什么?」)是经典的难例。
- 答案越过了证据。拿到相关片段的模型,仍然可能补上一句该片段并不支持的、听起来合理的话。这正是引用能抓住的东西,也是为什么一个带引用的答案里那句没有引用的说法值得怀疑。
- 来源本身是错的。有据可依意味着忠于你的文档,不意味着忠于事实。喂给它一份过期合同,你会得到过期的答案,而且引用得完全正确。
- 切块造成的假象。被切到两个片段里的表格,或者含义取决于四十页之前某个定义的条款,都很难被正确检出。跨越片段的结构,是这整套方法的软肋。
第二点背后的一般机制本身就值得理解——见 AI 为什么会编造。
什么时候值得花这份搭建成本
| 情形 | 用什么 |
|---|---|
| 一份文档,一个问题 | 粘进聊天窗口 |
| 一份长文档,你会反复查询 | 都行,略倾向 RAG |
| 同一主题下的几十份文档 | RAG |
| 别人会据以行事的答案 | RAG——为了引用,不是为了检索 |
| 混合媒介:PDF、视频、音频、网页 | RAG,只要它都能处理 |
| 常识性问题 | 都不用——直接问模型 |
做成产品是什么样
Neurobase 是我们的版本:你给一个 Neuron 一批来源——PDF、文本文件、视频、YouTube、网页、图片、音频——它把这些索引成一个专注的助理,回答时附上指回原始材料的引用。在你依赖某个答案之前,可以先在 Lab 里测试它;多个 Neuron 还能串成工作流,配上「摘要」「对比」「抽取」「翻译」这类操作。
如果你想要具体做法而不是概念,可以从 把一个 PDF 文件夹变成助理 开始。
常见问题
RAG 是什么?
检索增强生成:系统先搜索你的文档,把相关段落放进模型上下文,再让它据此作答——并附引用。
它解决了什么问题?
训练截止时间、模型没见过的私有文档,以及自信的编造。引用让你能核对而不是只能相信。
和上传文件一样吗?
不一样。附带文件适用于一次对话里的一份文档;RAG 索引一次、按问题检索,跨越多次对话。
RAG 能杜绝编造吗?
能大幅减少,不能杜绝。引用的作用是让这些失败可被核查。