Что такое RAG? ИИ с опорой на источники
RAG — генерация с извлечением — означает, что ИИ сначала кое-что находит, а потом отвечает. Вместо припоминания из обучения система ищет по вашим документам, кладёт самые подходящие фрагменты перед моделью и просит ответить по ним, со ссылками на источник. Это чинит дату отсечения обучения, проблему «он никогда не видел моих файлов» и большую часть уверенных выдумок. Не всё.
Сформулируем проблему точно
Языковая модель — это, по сути, очень хорошее сжатие огромного объёма текста, прочитанного однажды. Отсюда её беглость и широта, и отсюда же три конкретные слабости: она перестаёт знать после даты отсечения обучения, она никогда не видела ничего личного, а когда чего-то не знает, всё равно выдаёт правдоподобный ответ — потому что выдавать правдоподобный текст и есть вся её работа.
Переобучать модель каждый раз, когда вы пишете документ, нельзя. Поэтому меняют другое — откуда берётся ответ.
Четыре шага
- Индексация. Ваши документы режутся на фрагменты — по несколько абзацев — и каждый фрагмент превращается в числовое представление, схватывающее его смысл. Это делается один раз, заранее.
- Извлечение. Ваш вопрос превращается тем же способом, и система находит фрагменты, ближайшие к нему по смыслу. Это не поиск по ключевым словам: «о чём мы договорились по поводу задержки поставки» может найти абзац, где сказано «сдвиги отгрузки» и нет ни одного вашего слова.
- Дополнение. Эти фрагменты кладут в контекст модели вместе с вашим вопросом и указанием отвечать по предоставленному материалу.
- Генерация и ссылки. Модель пишет ответ, и, поскольку система знает, какие фрагменты ей дали, она может указать источник каждого утверждения.
Вот и всё. Хитрость — во втором шаге; доверие — в четвёртом.
Почему «просто вставь это в чат» — не то же самое
Когда вы прикрепляете документ к разговору, он целиком попадает в контекст модели — и живёт там до конца этого разговора. Для одной статьи это отлично работает. И перестаёт работать, когда статей девяносто, когда вы будете спрашивать и в следующем месяце или когда нужный абзац на 340-й странице, а окружающие 339 страниц — шум, конкурирующий за внимание модели.
RAG индексирует один раз и извлекает под каждый вопрос. Вы платите за настройку однажды, а потом спрашиваете по всей коллекции сколько угодно. Этот компромисс мы подробнее разобрали в тексте GPT-5 против Gemini: модели с большим контекстом сократили разрыв для одного документа, но не для коллекций, к которым вы возвращаетесь.
Где RAG всё ещё подводит
Здесь стоит быть точным, потому что слово «с опорой» употребляют так, будто оно значит «правильно»:
- Извлечение промахивается. Если нужный фрагмент не извлечён, модель отвечает по тому, что получила, — уверенно и неверно. Вопросы, требующие синтеза по множеству разбросанных фрагментов («что изменилось между политиками 2023 и 2026 годов?»), — классический трудный случай.
- Ответ выходит за пределы подтверждённого. Модель, получившая подходящий фрагмент, всё равно может добавить правдоподобное предложение, которое этот фрагмент не подтверждает. Именно это ловят ссылки, и поэтому утверждение без ссылки внутри ответа со ссылками заслуживает подозрения.
- Источник неверен. Опора означает верность вашим документам, а не верность действительности. Дайте устаревший договор — получите устаревшие ответы, корректно снабжённые ссылками.
- Что ломается при нарезке. Таблица, разрезанная между двумя фрагментами, или пункт, смысл которого зависит от определения сорока страницами ранее, извлекаются плохо. Структура, пересекающая границы фрагментов, — слабое место всего подхода.
Механизм, стоящий за вторым пунктом, стоит разобрать отдельно — см. почему ИИ выдумывает.
Когда настройка того стоит
| Ситуация | Что использовать |
|---|---|
| Один документ, один вопрос | Вставьте его в чат |
| Один длинный документ, к которому вы будете возвращаться | Оба варианта, но скорее RAG |
| Десятки документов по одной теме | RAG |
| Ответы, на которые будет опираться кто-то ещё | RAG — ради ссылок, а не ради извлечения |
| Разные форматы: PDF, видео, аудио, веб-страницы | RAG, если он их все понимает |
| Вопросы на общие знания | Ни то ни другое — просто спросите модель |
Как это выглядит в виде продукта
Neurobase — наша версия: вы даёте Нейрону источники (PDF, текстовые файлы, видео, YouTube, веб-страницы, изображения, аудио), и он индексирует их в сфокусированного ассистента, который отвечает со ссылками на исходный материал. Ответы можно проверить в Lab, прежде чем на них полагаться, а несколько Нейронов можно связать в цепочку с операциями «Пересказать», «Сравнить», «Извлечь» и «Перевести».
Если вам нужна не концепция, а конкретика, начните с превращения папки PDF в ассистента.
Частые вопросы
Что такое RAG?
Генерация с извлечением: система сначала ищет по вашим документам, кладёт подходящие фрагменты в контекст модели и просит ответить по ним — со ссылками.
Какую проблему решает?
Даты отсечения, личные документы, которых модель не видела, и уверенные выдумки. Ссылки позволяют проверять, а не доверять.
Это то же, что загрузить файл?
Нет. Прикрепление работает для одного документа в одном разговоре. RAG индексирует коллекцию один раз и извлекает под каждый вопрос.
Останавливает ли выдумывание?
Существенно сокращает, но не полностью. Извлечение может промахнуться, ответ выйти за пределы подтверждённого, источник оказаться неверным.