RAG простыми словами: как ИИ отвечает по документам компании

Как устроен RAG: поиск фрагментов в документах, передача контекста языковой модели, ответ со ссылками, обновление базы и контроль ошибок.

6 октября 2026 9 мин чтения
Схема RAG от вопроса и поиска до ответа по документам
Схема RAG от вопроса и поиска до ответа по документам

Коротко. RAG — схема, в которой система сначала находит подходящие фрагменты корпоративных документов, затем передаёт их языковой модели и просит сформировать ответ по найденному контексту. Качество зависит от документов, разбиения, поиска и правил ответа. Ссылки на источники и честный отказ обязательны: RAG снижает риск выдумки, но не устраняет его.

Аббревиатура означает retrieval-augmented generation — генерацию, дополненную поиском. Вместо попытки хранить все правила в параметрах модели система подставляет актуальные документы в каждый запрос. Это удобно для инструкций, базы знаний, каталога и внутренних регламентов.

Как работает RAG

  1. Документы очищают и делят на смысловые фрагменты.
  2. Фрагменты снабжают метаданными и индексируют.
  3. Вопрос пользователя преобразуют в поисковый запрос.
  4. Поиск возвращает несколько подходящих частей.
  5. Модель получает вопрос, контекст и правило ответа.
  6. Система показывает ответ, источники и уровень уверенности.
ЗвеноРезультатТипичная ошибка
ДокументыАктуальные знанияСтарые версии
ЧанкиСмысловые фрагментыПотерян контекст
ПоискКандидатыНе тот раздел
МодельСвязный ответДобавлен вымысел
СсылкиПроверяемостьИсточник не подтверждает тезис

Зачем делить документы на чанки

Целый файл часто не помещается в контекст и содержит много шума. Слишком короткий кусок теряет заголовок, условия и исключения. Поэтому границы проводят по разделам, абзацам и смыслу, сохраняя название документа, главу, дату и права доступа.

Перекрытие соседних фрагментов помогает не разорвать мысль, но создаёт дубли. Размер проверяют на реальных вопросах. Для таблиц, списков и договоров могут потребоваться отдельные правила обработки.

Как устроен поиск

Полнотекстовый поиск хорошо находит точные названия и номера. Семантический сопоставляет близкий смысл с помощью векторного представления. Гибридный объединяет подходы, а фильтры ограничивают продукт, регион, дату, язык и доступ.

СпособСильная сторонаПример
Ключевые словаТочные терминыНомер тарифа
СемантикаПерефразированиеКак вернуть заказ
ГибридБалансБольшая база знаний
ФильтрыКонтекст и доступТолько действующие правила

До выбора технологии соберите контрольные вопросы и правильные фрагменты. Иначе команда оптимизирует красивую метрику поиска, не зная, находит ли он нужные правила.

Чем RAG отличается от обучения модели

Дообучение меняет поведение или веса модели, RAG подаёт знания во время запроса. Документ в RAG можно заменить и переиндексировать без нового обучения всей модели. Дообучение полезнее для устойчивого формата и поведения, но не является удобным хранилищем ежедневно меняющихся цен.

ЗадачаRAGДообучение
Свежие документыПодходитТребует нового цикла
Ссылки на источникЕстественная частьСамо по себе не даёт
Формат ответаИнструкция и примерыМожно закрепить
Точные правилаНужна проверкаТоже не гарантирует

Какие документы подключать

Начните с материалов, у которых есть владелец, дата действия и понятная аудитория: инструкции, регламенты, справка продукта, карточки и утверждённые шаблоны. Не смешивайте черновики и действующие правила. Удаляйте дубли и храните связь с оригиналом.

Для каждого источника нужны метаданные: версия, раздел, дата обновления, продукт, язык и права. Если сотрудник не должен видеть документ напрямую, RAG не должен пересказывать его через чат.

Как система формирует ответ

Модели передают найденные фрагменты и инструкцию: отвечать только по контексту, указывать источники, сообщать о нехватке данных. Затем приложение проверяет формат, ссылки и доступ. Важные числа можно извлекать отдельным кодом, а не доверять свободной генерации.

Надёжное правило. Если найденные фрагменты не подтверждают ответ, система должна задать уточнение, предложить документы или честно отказаться, а не заполнять пробел общими знаниями.

Где RAG полезен бизнесу

СценарийИсточникиКонтроль
Помощник поддержкиСправка и регламентыЭскалация оператору
Поиск сотрудникаПолитики и инструкцииПрава доступа
КаталогКарточки товаровЦена из базы
ПродажиМатериалы продуктаЗапрет вымышленных условий
Юридический поискУтверждённые документыПроверка специалистом

RAG может стать инструментом ИИ-агента для бизнеса, но агент добавляет действия и состояние. Простому ответчику по базе не всегда нужны агентные возможности.

Почему RAG ошибается

Ошибка бывает до генерации: неверный документ, плохое разбиение, слабый запрос, неподходящий фильтр или недостаточное число кандидатов. Затем модель может пропустить условие или объединить несовместимые фрагменты. Отдельно проверяйте поиск и ответ.

СимптомПричинаИсправление
Нет ответаТермин не найденГибридный поиск
Старое правилоНет версииФильтр по дате
Ответ без условияЧанк слишком малРасширить контекст
Уверенная выдумкаНет правила отказаПорог и проверка цитат

Как оценивать качество

Соберите реальные вопросы, правильные источники и ожидаемые элементы ответа. Измеряйте, попал ли нужный фрагмент в первые результаты, подтверждает ли источник тезис, нет ли лишних утверждений и правильно ли система отказывается.

Добавьте задержку, стоимость, жалобы и долю передачи человеку. Средняя оценка скрывает опасные провалы, поэтому отдельно держите вопросы о деньгах, доступе, безопасности и обязательствах.

Как запустить пилот

  1. Выберите одну базу и одну группу пользователей.
  2. Назначьте владельцев документов.
  3. Очистите версии и права.
  4. Соберите контрольные вопросы.
  5. Настройте разбиение, поиск и ссылки.
  6. Добавьте отказ и передачу человеку.
  7. Протестируйте до подключения действий.
  8. Ведите журнал ошибок и обновлений.

Когда использовать обычный поиск

Если пользователю достаточно списка документов, генеративный слой может быть лишним. Обычный поиск быстрее показывает оригинал и не пересказывает условие. Для точной цены, статуса заказа или баланса нужен запрос к структурированной системе, а не поиск по текстовым фрагментам.

Добавляйте RAG, когда человеку приходится читать несколько частей и собирать объяснение. Даже тогда оставьте возможность открыть исходную выдачу. Пользователь должен отличать текст документа от интерпретации модели.

Как выбирать число найденных фрагментов

Один результат может пропустить исключение, десятки результатов создают шум и расходуют контекст. Подберите число на контрольном наборе и учитывайте разнообразие: пять почти одинаковых кусков хуже трёх дополняющих. Повторный ранжировщик может поднять наиболее подходящие кандидаты.

Для сложного вопроса полезно сначала уточнить продукт, регион или дату, затем искать. Уточнение часто надёжнее расширения выдачи. Логи таких диалогов показывают, каких метаданных не хватает базе.

Как показывать источники

Ссылка должна вести не просто на файл, а по возможности на раздел или страницу. Рядом показывайте название, версию и дату действия. Цитируемый фрагмент должен действительно подтверждать предложение ответа; совпадение по теме недостаточно.

Если ответ объединяет несколько документов, сопоставьте тезисы и источники. При противоречии не выбирайте удобный вариант молча: покажите конфликт и направьте владельцу знаний.

Как управлять стоимостью и задержкой

Измеряйте время поиска, подготовки контекста и генерации отдельно. Кешируйте только там, где ответ не зависит от прав, свежести и персонального состояния. Ограничьте длину фрагментов и не передавайте повторяющийся текст.

Экономить можно маршрутизацией: точные запросы отправлять к базе, навигационные — в поиск, сложные объяснения — в RAG. Но ошибку выбора пути тоже включают в тесты и наблюдение.

Как вести обратную связь

Кнопка «не помогло» без причины мало полезна. Предложите выбрать: не найден документ, ответ неверен, не хватает условия, источник устарел или нет доступа. Свяжите сигнал с запросом, найденными фрагментами и версией системы.

Не превращайте пользовательскую оценку в единственную метрику: человек может одобрить удобный, но неверный ответ. Выборочно проверяйте факты экспертами и добавляйте подтверждённые ошибки в контрольный набор.

Чек-лист RAG-системы

Пример: помощник по внутренним инструкциям

Сотрудник спрашивает, как согласовать возврат дороже установленного лимита. Поиск должен найти не общий документ о возвратах, а раздел с порогом, ролью согласующего и исключениями. Ответ перечисляет шаги и даёт ссылки на конкретные разделы. Если дата документа истекла, он не участвует в выдаче.

Контрольный набор включает прямой вопрос, разговорную формулировку, неверную предпосылку и случай, которого в инструкции нет. Последний особенно важен: система должна признать отсутствие правила и направить владельцу процесса, а не придумать разрешение.

Пример: ответы по каталогу

Покупатель спрашивает, подойдёт ли устройство для помещения определённой площади. Описание и руководство можно искать через RAG, но актуальную цену и остаток лучше получать точным запросом к базе. Ответ объединяет два источника, при этом каждое поле имеет владельца и время обновления.

Если характеристика отсутствует, система не выводит её из похожей модели. Она показывает найденные параметры и предлагает уточнить у специалиста. Такое разделение свободного текста и структурированных данных снижает риск красивого, но ложного ответа.

Как подготовить документы

Составьте реестр источников и уберите копии. Для каждого файла укажите владельца, область действия, дату начала и окончания, уровень доступа и канонический адрес. Сканированные страницы распознайте и выборочно сравните с оригиналом; ошибки распознавания особенно опасны в числах и отрицаниях.

ПроблемаПочему мешаетРешение
Несколько версийПоиск возвращает противоречияОдин действующий оригинал
Нет заголовковТеряется структураРазметить разделы
Скан плохого качестваИскажены слова и числаРаспознавание и сверка
Смешаны праваВозможна утечкаФильтр до извлечения
Нет датыНельзя выбрать актуальноеОбязательные метаданные

Как составить контрольный набор

Берите реальные вопросы из поиска, поддержки и интервью. Для каждого запишите ожидаемый источник, обязательные элементы ответа и допустимый отказ. Добавьте синонимы, опечатки, короткие вопросы без контекста и запросы, которые пользователь не имеет права задавать.

Разделите набор на настройку и независимую проверку. Если постоянно исправлять систему по всем примерам и ими же измерять качество, оценка станет завышенной. Новые ошибки добавляйте в регрессионный набор, чтобы обновление не возвращало старую проблему.

Как проверять найденные фрагменты

Метрика попадания показывает, оказался ли правильный фрагмент среди первых результатов. Но этого мало: лишние документы могут отвлечь модель. Оцените порядок, полноту и противоречия. Просматривайте запрос, найденный текст и финальный ответ одной цепочкой.

УровеньВопрос проверкиСбой
ПоискНайден правильный документ?Нет нужного фрагмента
КонтекстХватает условий?Потеряно исключение
ОтветКаждый тезис подтверждён?Добавлен вымысел
СсылкаВедёт к нужному месту?Файл не подтверждает
ДоступМожно показать источник?Утечка закрытого раздела

Как обновлять индекс

Изменение оригинала должно запускать обработку новой версии, удаление старых фрагментов и контрольный тест. Следите за неудачными загрузками: документ может обновиться в хранилище, но остаться старым в поиске. Показывайте пользователю дату источника.

Для срочного отзыва документа нужна возможность исключить его немедленно, не ожидая полного ночного пересчёта. Храните журнал: какой файл, когда и какой версией был проиндексирован.

Безопасность и защита от инструкций в документах

Найденный текст считается данными, а не командой системе. Документ может содержать фразу, предлагающую игнорировать правила или раскрыть секрет. Разделяйте системную инструкцию и контент, ограничивайте инструменты, проверяйте выход и не позволяйте найденному фрагменту повышать права.

Доступ фильтруют до передачи текста модели. Маскирование ответа после генерации слишком поздно: закрытая информация уже попала в контекст. Журналы также защищают, потому что в них остаются вопросы и фрагменты документов.

  • У каждого документа есть владелец и версия.
  • Черновики отделены от действующих правил.
  • Доступ проверяется до поиска.
  • Контрольный набор включает сложные случаи.
  • Поиск и генерация оцениваются отдельно.
  • Ответ показывает подтверждающие источники.
  • Есть честный отказ и эскалация.
  • Обновление документа запускает переиндексацию.
  • Чувствительные вопросы проверяет человек.

RAG — не волшебная память, а поисковая система с генеративным интерфейсом. Чем яснее документы и ответственность за них, тем надёжнее ответ.

Остался вопрос по теме статьи? Напишите его в предложку блога — отвечаю лично: задать вопрос в MAX. Частые вопросы разбираю отдельными статьями и присылаю ссылку тому, кто спросил.

Частые вопросы

Что такое RAG простыми словами?

RAG — схема, в которой система сначала находит подходящие фрагменты документов, а затем передаёт их языковой модели для ответа на вопрос.

Чем RAG отличается от обучения модели?

RAG не обязан менять веса модели: знания подаются в контексте каждого запроса. Документ можно обновить без нового обучения всей модели.

Зачем делить документы на чанки?

Поиск должен вернуть небольшой фрагмент с законченным смыслом. Целый длинный файл создаёт шум, слишком короткий кусок теряет контекст.

Обязательно ли использовать векторный поиск?

Нет. Применяют полнотекстовый, семантический или гибридный поиск и фильтры. Выбор зависит от вопросов, языка, объёма и требований к точности.

Устраняет ли RAG галлюцинации?

Нет. Он даёт модели более подходящий контекст, но поиск может ошибиться, а модель — исказить фрагмент. Нужны ссылки, порог уверенности и отказ от ответа.

Какие документы подходят для RAG?

Актуальные инструкции, регламенты, база знаний, карточки товаров и договорные шаблоны с владельцем, датой действия и понятными правами доступа.

Как оценивать RAG?

Отдельно измеряют качество поиска, обоснованность ответа источниками, полноту, корректный отказ, задержку и стоимость на контрольном наборе вопросов.

Когда RAG не нужен?

Когда ответ определяется простым фильтром, точным полем базы или жёстким правилом. Обычный поиск либо код будет дешевле и предсказуемее.

Статья помогла?
Николай Шаповалов Николай Шаповалов Основатель Tapbox, делает сервисы для MAX Канал автора в MAX

Читайте дальше