RAG (retrieval-augmented generation, «генерация с поиском») — приём, при котором нейросеть отвечает не по общим знаниям, а по вашим документам. Это самый практичный способ получить ИИ, который знает вашу базу знаний, договоры или инструкции.
Как это работает
Разница с обычным вопросом в чате — в одном дополнительном шаге:
- Вы задаёте вопрос: «какой у нас срок гарантии по договору с подрядчиком?»
- Система сначала ищет в ваших документах фрагменты, относящиеся к вопросу.
- Найденные фрагменты вместе с вопросом отправляются модели.
- Модель отвечает, опираясь на них, — и может сослаться на конкретный документ.
То есть модель не «выучила» ваши документы, а прочитала нужный кусок прямо перед ответом.
Зачем это нужно
- Меньше галлюцинаций: ответ строится по тексту, а не по догадке.
- Свежесть: документы можно обновлять хоть каждый день, ничего не переобучая.
- Проверяемость: видно, из какого файла взят ответ.
- Экономия токенов: отправляется не вся база, а несколько нужных фрагментов — большая база в контекстное окно и не поместилась бы.
RAG или дообучение модели
Частый вопрос. Коротко:
- RAG — быстро, дёшево, легко обновлять, ответы проверяемы. Подходит почти всем.
- Дообучение (fine-tuning) — долго и дорого, меняет стиль и поведение модели, но не гарантирует точности фактов.
Практическое правило: если задача звучит как «отвечай по нашим материалам» — это RAG. Дообучение нужно, когда важен особый стиль или формат ответов.
Где вы с этим встречаетесь
- Корпоративные помощники по базе знаний — сценарий для бизнеса.
- ИИ-агенты, которые работают с вашими файлами: по сути они делают то же самое — находят нужный документ и читают его перед ответом.
- Чаты с загруженным документом в популярных сервисах.
Хорошая новость для обычного пользователя: чтобы получить эффект RAG, не обязательно строить систему. Достаточно агента с доступом к вашим папкам — он найдёт и прочитает нужное сам.
Другие термины — в глоссарии.