Что такое RAG? ИИ с опорой на источники

TL;DR

RAG — генерация с извлечением — означает, что ИИ сначала кое-что находит, а потом отвечает. Вместо припоминания из обучения система ищет по вашим документам, кладёт самые подходящие фрагменты перед моделью и просит ответить по ним, со ссылками на источник. Это чинит дату отсечения обучения, проблему «он никогда не видел моих файлов» и большую часть уверенных выдумок. Не всё.

Сформулируем проблему точно

Языковая модель — это, по сути, очень хорошее сжатие огромного объёма текста, прочитанного однажды. Отсюда её беглость и широта, и отсюда же три конкретные слабости: она перестаёт знать после даты отсечения обучения, она никогда не видела ничего личного, а когда чего-то не знает, всё равно выдаёт правдоподобный ответ — потому что выдавать правдоподобный текст и есть вся её работа.

Переобучать модель каждый раз, когда вы пишете документ, нельзя. Поэтому меняют другое — откуда берётся ответ.

Четыре шага

  1. Индексация. Ваши документы режутся на фрагменты — по несколько абзацев — и каждый фрагмент превращается в числовое представление, схватывающее его смысл. Это делается один раз, заранее.
  2. Извлечение. Ваш вопрос превращается тем же способом, и система находит фрагменты, ближайшие к нему по смыслу. Это не поиск по ключевым словам: «о чём мы договорились по поводу задержки поставки» может найти абзац, где сказано «сдвиги отгрузки» и нет ни одного вашего слова.
  3. Дополнение. Эти фрагменты кладут в контекст модели вместе с вашим вопросом и указанием отвечать по предоставленному материалу.
  4. Генерация и ссылки. Модель пишет ответ, и, поскольку система знает, какие фрагменты ей дали, она может указать источник каждого утверждения.

Вот и всё. Хитрость — во втором шаге; доверие — в четвёртом.

Neurobase показывает ответ с опорой на источники и ссылками на исходный материал.
Вся суть — в ссылке. Ответ, который нельзя проверить, — просто уверенное мнение.

Почему «просто вставь это в чат» — не то же самое

Когда вы прикрепляете документ к разговору, он целиком попадает в контекст модели — и живёт там до конца этого разговора. Для одной статьи это отлично работает. И перестаёт работать, когда статей девяносто, когда вы будете спрашивать и в следующем месяце или когда нужный абзац на 340-й странице, а окружающие 339 страниц — шум, конкурирующий за внимание модели.

RAG индексирует один раз и извлекает под каждый вопрос. Вы платите за настройку однажды, а потом спрашиваете по всей коллекции сколько угодно. Этот компромисс мы подробнее разобрали в тексте GPT-5 против Gemini: модели с большим контекстом сократили разрыв для одного документа, но не для коллекций, к которым вы возвращаетесь.

Где RAG всё ещё подводит

Здесь стоит быть точным, потому что слово «с опорой» употребляют так, будто оно значит «правильно»:

Механизм, стоящий за вторым пунктом, стоит разобрать отдельно — см. почему ИИ выдумывает.

Когда настройка того стоит

СитуацияЧто использовать
Один документ, один вопросВставьте его в чат
Один длинный документ, к которому вы будете возвращатьсяОба варианта, но скорее RAG
Десятки документов по одной темеRAG
Ответы, на которые будет опираться кто-то ещёRAG — ради ссылок, а не ради извлечения
Разные форматы: PDF, видео, аудио, веб-страницыRAG, если он их все понимает
Вопросы на общие знанияНи то ни другое — просто спросите модель

Как это выглядит в виде продукта

Neurobase — наша версия: вы даёте Нейрону источники (PDF, текстовые файлы, видео, YouTube, веб-страницы, изображения, аудио), и он индексирует их в сфокусированного ассистента, который отвечает со ссылками на исходный материал. Ответы можно проверить в Lab, прежде чем на них полагаться, а несколько Нейронов можно связать в цепочку с операциями «Пересказать», «Сравнить», «Извлечь» и «Перевести».

Если вам нужна не концепция, а конкретика, начните с превращения папки PDF в ассистента.

Частые вопросы

Что такое RAG?

Генерация с извлечением: система сначала ищет по вашим документам, кладёт подходящие фрагменты в контекст модели и просит ответить по ним — со ссылками.

Какую проблему решает?

Даты отсечения, личные документы, которых модель не видела, и уверенные выдумки. Ссылки позволяют проверять, а не доверять.

Это то же, что загрузить файл?

Нет. Прикрепление работает для одного документа в одном разговоре. RAG индексирует коллекцию один раз и извлекает под каждый вопрос.

Останавливает ли выдумывание?

Существенно сокращает, но не полностью. Извлечение может промахнуться, ответ выйти за пределы подтверждённого, источник оказаться неверным.