什么是 RAG?为什么带引用的答案更值得信

TL;DR

RAG——Retrieval-Augmented Generation,检索增强生成——意思是 AI 在回答之前先去查一下。系统不是从训练记忆里回想,而是搜索你的文档,把最相关的段落摆到模型面前,让它依据这些内容作答,并附上指回原文的引用。它修好了训练截止时间的问题、「它从没见过我的文件」的问题,以及很大一部分自信的编造。但它并没有把这些全部修好。

把问题说清楚

一个语言模型,实际上就是对它读过一遍的大量文本做的一次非常出色的压缩。这给了它流畅度和广度,也带来三个具体的弱点:训练截止之后的事它就不知道了;它从没见过任何私有内容;而当它不知道时,它照样会给出一个说得通的答案——因为生成说得通的文本本来就是它的全部工作。

你不可能每写一份文档就重新训练一次模型。所以你改的是答案从哪里来

四个步骤

  1. 建索引。你的文档被切成一段段的片段——每段几个自然段——每个片段再被转成一种能捕捉其含义的数值表示。这件事只在前期做一次。
  2. 检索。你的问题用同样的方式转换,系统找出在含义上最接近它的片段。这不是关键词匹配:「关于延迟交付我们当时是怎么说定的」能找到一段写着「发货延误」、一个你的词都没用上的段落。
  3. 增强。那些片段连同你的问题,以及一条「依据所提供材料作答」的指令,一起被放进模型的上下文。
  4. 生成并引用。模型写出答案,而因为系统知道它拿到的是哪些片段,它可以把每一条说法指回来源。

就这些。聪明之处在第 2 步;可信之处在第 4 步。

Neurobase 展示一条有据可依的答案,引用可以链回原始材料。
引用才是重点。一个你没法核对的答案,不过是一个自信的观点。

为什么「粘进聊天窗口就行了」不是一回事

给一段对话附上一份文档,等于把整份内容放进这段对话的模型上下文里。对一篇论文来说这没问题。当它变成九十篇、当你下个月还要接着问、当相关的那一段在第 340 页而周围 339 页都是在争夺模型注意力的噪音时,它就不管用了。

RAG 只建一次索引,然后按问题去检索。你只付一次搭建成本,之后就能无限期地在整个文档集上提问。这个取舍我们在 GPT-5 对比 Gemini 里写得更深入——大上下文模型缩小了单份文档上的差距,但没有缩小你会反复回来查的文档集上的差距。

RAG 仍然会失败的地方

这里值得说准确,因为「有据可依」经常被当成「正确」来用:

第二点背后的一般机制本身就值得理解——见 AI 为什么会编造。

什么时候值得花这份搭建成本

情形用什么
一份文档,一个问题粘进聊天窗口
一份长文档,你会反复查询都行,略倾向 RAG
同一主题下的几十份文档RAG
别人会据以行事的答案RAG——为了引用,不是为了检索
混合媒介:PDF、视频、音频、网页RAG,只要它都能处理
常识性问题都不用——直接问模型

做成产品是什么样

Neurobase 是我们的版本:你给一个 Neuron 一批来源——PDF、文本文件、视频、YouTube、网页、图片、音频——它把这些索引成一个专注的助理,回答时附上指回原始材料的引用。在你依赖某个答案之前,可以先在 Lab 里测试它;多个 Neuron 还能串成工作流,配上「摘要」「对比」「抽取」「翻译」这类操作。

如果你想要具体做法而不是概念,可以从 把一个 PDF 文件夹变成助理 开始。

常见问题

RAG 是什么?

检索增强生成:系统先搜索你的文档,把相关段落放进模型上下文,再让它据此作答——并附引用。

它解决了什么问题?

训练截止时间、模型没见过的私有文档,以及自信的编造。引用让你能核对而不是只能相信。

和上传文件一样吗?

不一样。附带文件适用于一次对话里的一份文档;RAG 索引一次、按问题检索,跨越多次对话。

RAG 能杜绝编造吗?

能大幅减少,不能杜绝。引用的作用是让这些失败可被核查。