RAG — Подход, при котором языковая модель отвечает на основе найденных в ваших документах фрагментов, а не «из головы».
RAG (Retrieval-Augmented Generation) — архитектура ИИ-ассистента, в которой перед генерацией ответа система ищет релевантные фрагменты в базе знаний компании и передаёт их модели как контекст. Модель отвечает по документам и ссылается на источник.
Зачем нужен. Снимает три проблемы чистых LLM: галлюцинации, устаревание знаний и утечку данных. Обновили регламент — ассистент отвечает по-новому без дообучения.
Как устроен. Документы разбиваются на фрагменты, превращаются в векторы и хранятся в векторной базе (Qdrant, pgvector). Вопрос пользователя тоже векторизуется, ищутся ближайшие фрагменты, модель формирует ответ по ним.
Где применяется. Поддержка клиентов, внутренний поиск по регламентам, юридические и медицинские базы, ассистенты операторов колл-центра.