RAG · ответы по своим документам

RAG простыми словами: как ИИ отвечает по вашим документам

Нейросеть, которая отвечает не по памяти, а по вашей базе знаний. Разберём, как устроен конвейер, чем собрать RAG-систему без кода и кодом, сколько это стоит и почему она отвечает мимо.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 10.09.202612 мин чтения

RAG это способ работы нейросети, при котором она перед ответом находит нужный фрагмент в вашей базе документов и отвечает по нему, а не по тому, что запомнила при обучении. Название расшифровывается как retrieval-augmented generation, то есть генерация, дополненная поиском. Работает это в три такта: документы заранее нарезаются на куски и складываются в векторное хранилище, вопрос пользователя превращается в такой же вектор и находит самые близкие по смыслу куски, найденные куски вставляются в промпт вместе с требованием отвечать только по ним. Итог: ответ по вашему регламенту со ссылкой на конкретный документ вместо красивой выдумки.

Что узнаешь из гайда

  • Что такое RAG и откуда взялся термин
  • Чем это лучше, чем просто прикрепить файл в чат
  • Шесть шагов конвейера на человеческом языке
  • Чем собрать без кода и чем собрать руками
  • Реальные цены и пять причин ответов мимо

Часть 1 · Основа

Что такое RAG

Главное

RAG это не модель и не программа, а схема работы: сначала поиск по вашим данным, потом ответ по найденному. Модель при этом любая.

Термин появился в научной статье «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks», которую подала группа из двенадцати исследователей во главе с Патриком Льюисом 22 мая 2020 года. Идея у неё была простая и с тех пор не изменилась: языковая модель хорошо формулирует, но плохо помнит факты, поэтому факты надо не заучивать, а приносить ей в момент ответа.

Обычная нейросеть отвечает так: вы спросили, она достала ответ из того, что впитала при обучении. Отсюда две беды. Первая: про ваш внутренний регламент она не знает ничего, его в обучении не было. Вторая: когда точного знания нет, модель всё равно отвечает уверенно и складно, потому что её задача продолжать текст, а не признаваться в незнании. Это и есть галлюцинации нейросетей.

RAG обе беды закрывает одним движением. Между вопросом и ответом вставляется шаг поиска: система лезет в ваши документы, достаёт два-три подходящих фрагмента и передаёт их модели вместе с вопросом. Модель теперь не вспоминает, а пересказывает то, что у неё перед глазами, и может честно сослаться на источник.

Бытовая аналогия

Обычная модель это эрудит, который отвечает по памяти и никогда не говорит «не знаю». RAG это тот же эрудит, но с открытой папкой на столе и правилом отвечать только по бумагам из папки. Он не стал умнее, он перестал сочинять.


Часть 2 · Смысл

Зачем это, если можно просто вставить файл

Самый частый вопрос новичка. И на одном файле ответ честный: незачем, прикрепите файл в чат и работайте. Разница появляется, когда документов становится много.

Файл в чате против RAG
Что сравниваемФайл в чатеRAG
Объём базыдо контекстного окнапрактически без потолка
Расход токеноввесь файл на каждом сообщениитолько найденные куски
Обновление данныхзаново прикрепить в каждый чатзаменить файл в хранилище
Ссылка на источниккак получитсяизвестен конкретный фрагмент
Порог входанольот получаса до нескольких дней

Ключевая строка тут вторая. У модели нет памяти между сообщениями, она перечитывает весь диалог заново каждый раз, и прикреплённый документ перечитывается вместе с ним. Отчёт на сто страниц это примерно сто тысяч токенов, и они списываются на каждом вашем вопросе. Подробно эта механика разобрана в гайде про токены и контекстное окно.

Второе отличие важно для рабочих задач. RAG знает, из какого файла и из какого абзаца взят ответ, поэтому его можно заставить давать ссылку. Для юриста, бухгалтера или поддержки это не украшение, а условие, при котором ответом вообще можно пользоваться.


Часть 3 · Механика

Как устроен RAG: шесть шагов

Схема одинаковая независимо от того, собираете вы её мышью в конструкторе или пишете кодом. Первые четыре шага делаются один раз при загрузке документов, последние два выполняются на каждый вопрос.

  1. Собрать корпус. Отобрать только те файлы, по которым система обязана отвечать. Устаревшие версии и черновики выкинуть сразу: всё, что лежит в базе, рано или поздно всплывёт в ответе.
  2. Нарезать на куски. Каждый файл режется на фрагменты по 300-800 слов с небольшим нахлёстом, чтобы мысль не обрывалась на границе. Крупные куски тащат в ответ лишнее, мелкие теряют контекст.
  3. Посчитать эмбеддинги. Каждый кусок прогоняется через модель эмбеддингов и превращается в вектор, то есть длинный список чисел, который отражает смысл текста.
  4. Сложить в векторное хранилище. Векторы кладутся в базу, которая умеет быстро находить ближайшие. Рядом с вектором хранят сам текст куска и метаданные: имя файла, раздел, дата.
  5. Найти по вопросу. Вопрос пользователя тоже превращается в вектор, и хранилище отдаёт несколько самых близких кусков. Обычно берут от трёх до десяти.
  6. Собрать промпт и ответить. Найденные куски вставляются в запрос вместе с инструкцией отвечать только по ним и указывать источник, а если ответа в них нет, честно сказать об этом.

Почему поиск по смыслу, а не по словам

Обычный поиск по словам не найдёт ответ на вопрос «сколько дней отпуска после года работы», если в регламенте написано «ежегодный оплачиваемый отдых предоставляется в количестве 28 календарных дней». Общих слов почти нет. Эмбеддинги решают это тем, что сравнивают смысл: два текста об одном и том же дают близкие наборы чисел, даже если формулировки разные.


Часть 4 · Практика

Как собрать RAG без кода

Если задача не «построить систему на компанию», а «получить ответы по своим файлам к вечеру», начинать надо отсюда. Все варианты ниже не требуют программирования.

  • Готовый поиск по файлам у вендора. И у OpenAI, и у Google есть встроенный инструмент File search: вы загружаете документы, а нарезку, эмбеддинги и хранилище сервис берёт на себя. Это самый короткий путь и самый закрытый: настроек мало.
  • NotebookLM для личной базы. Загружаете документы в блокнот и спрашиваете по ним, ответы идут со сносками на источник. Отличный вариант для учёбы, ресёрча и личных заметок.
  • Проекты в Claude. Файлы прикрепляются к проекту один раз и доступны во всех чатах внутри него. Удобно, когда база небольшая и меняется редко.
  • Dify для своего бота. Визуальный конструктор, где база знаний и агент собираются мышью, а всё вместе разворачивается в Docker на своём сервере. Подходит, когда данные нельзя отдавать наружу.
  • n8n для сценариев. Когда RAG это часть более длинной цепочки: письмо пришло, документ нашёлся, ответ ушёл в CRM.

С чего начать, если сомневаетесь

Возьмите двадцать самых нужных документов, а не все триста. Соберите на них простейший вариант за вечер и посмотрите на реальных вопросах, что находится, а что нет. Почти всегда после этого меняется не инструмент, а состав документов и то, как они нарезаны. Строить сразу большую систему на неотобранной базе это самый дорогой способ узнать то же самое.


Часть 5 · Для разработчика

Как собрать RAG руками

Свой конвейер нужен, когда важны контроль над нарезкой, гибридный поиск, свои метаданные и хранение данных на своём железе. Набор деталей минимальный.

Из чего собирают RAG кодом
ДетальЧем закрывают
Нарезка документовLangChain или LlamaIndex, либо свои двадцать строк
Эмбеддингиtext-embedding-3-small у OpenAI, gemini-embedding у Google, локальные модели через Ollama
Векторное хранилищеQdrant, Chroma, расширение pgvector для Postgres
Оркестрация шаговLangGraph, если поиск это часть агента
Доступ из агентаMCP-сервер поверх своей базы

Отдельно про хранилище. Если у проекта уже есть Postgres, начинайте с расширения pgvector: не придётся заводить ещё один сервис, а для базы в десятки тысяч кусков этого хватает с запасом. Если нужна выделенная база, у Qdrant есть бесплатный тариф навсегда: один узел с половиной ядра, гигабайтом памяти и четырьмя гигабайтами диска. Для прототипа и небольшой рабочей базы этого достаточно.

Три приёма, которые дают основной прирост качества и почти ничего не стоят:

  1. Гибридный поиск. Смысловой поиск плюс обычный поиск по словам. Первый ловит переформулировки, второй не даёт потерять артикулы, номера статей и фамилии.
  2. Переранжирование. Достать двадцать кандидатов, отдать модели три лучших. Это заметно точнее, чем сразу брать три.
  3. Метаданные и фильтры. Хранить рядом с куском дату, отдел и версию документа, чтобы можно было искать только по действующей редакции.

Если конвейер живёт внутри агента, а не отдельным сервисом, посмотрите LangGraph и подборку MCP-серверов для Claude Code: через MCP свою базу можно отдать агенту как обычный инструмент.


Часть 6 · Деньги

Сколько это стоит

Главное заблуждение: люди думают, что дорого стоит индексация. На самом деле она стоит копейки, а деньги уходят на ответы модели. Цены сняты с официальных прайсов 10 сентября 2026 года.

Цена эмбеддингов за 1 млн токенов, доллары
МодельОбычный режимПакетно
text-embedding-3-small0,02нет отдельной ставки
text-embedding-3-large0,13нет отдельной ставки
gemini-embedding-0010,150,075
gemini-embedding-20,200,10

Посчитаем на пальцах. Тысяча страниц текста это примерно миллион токенов. Полная индексация такой базы на младшей модели OpenAI стоит два цента, на модели Google пятнадцать. Даже если переиндексировать всё каждую неделю, годовой счёт останется в пределах пары долларов. У Gemini на бесплатном уровне эмбеддинги вообще бесплатны.

Готовые инструменты вендоров считаются иначе, там платят за хранение и вызовы:

  • OpenAI File search. Хранение 0,10 доллара за гигабайт в сутки, первый гигабайт бесплатно. Вызов инструмента 2,50 доллара за тысячу обращений.
  • Google File search. Хранение бесплатно, платите только за эмбеддинги по 0,15 доллара за миллион токенов. Найденные куски документов считаются как обычные входные токены модели.
  • Своё хранилище. Бесплатный тариф Qdrant или свой сервер. Тут платите не деньгами, а временем на настройку и поддержку.

Где на самом деле счёт

В ответах. Каждый вопрос это найденные куски на вход плюс сгенерированный ответ на выход, а выход у старших моделей стоит в пять раз дороже входа. Поэтому экономят не на индексации, а на двух вещах: берут для ответа модель попроще там, где хватает, и не тащат в промпт десять кусков там, где хватает трёх.


Часть 7 · Отладка

Почему RAG отвечает мимо

Собранная за вечер система почти всегда сначала работает плохо. Это нормально. Ниже пять причин по частоте, с которой они встречаются.

  1. В базе мусор. Черновики, старые редакции, две версии одного регламента. Система честно находит обе и отвечает по той, что оказалась ближе. Лечится не промптом, а уборкой в документах.
  2. Куски нарезаны неудачно. Таблица разорвана пополам, заголовок отделён от содержания, пункт договора обрублен на середине. Помогает нахлёст между кусками и нарезка по структуре документа, а не по количеству символов.
  3. Вопрос и документ говорят разными словами. Пользователь пишет «отпуск», в документе «ежегодный оплачиваемый отдых». Лечится гибридным поиском и тем, чтобы хранить рядом с куском короткое описание, о чём он.
  4. Кусков слишком много. Двадцать похожих фрагментов в промпте не помогают, а мешают: модель теряет нужный среди похожих. Три хороших куска почти всегда лучше двадцати средних.
  5. Модели не запретили додумывать. Если в инструкции не написано «отвечай только по приложенным фрагментам, а если ответа в них нет, так и скажи», модель дополнит ответ своими знаниями и вы этого не заметите.

Чего делать не надо

Не начинайте отладку с переписывания промпта. В подавляющем большинстве случаев виноват поиск, а не формулировка. Сначала выведите на экран те фрагменты, которые нашлись по вопросу. Если нужного фрагмента среди них нет, никакой промпт не спасёт, а если есть, а ответ всё равно мимо, вот тогда занимайтесь инструкцией.

Коротко

  • RAG это поиск по вашим документам перед ответом модели.
  • Термин из статьи Патрика Льюиса и соавторов от 22 мая 2020 года.
  • Конвейер: нарезать, векторизовать, сложить, найти, ответить.
  • Модель не меняется, меняются только документы в хранилище.
  • Индексация тысячи страниц стоит центы, деньги уходят на ответы.
  • Без кода собирается в File search, Dify, n8n или NotebookLM.
  • Кодом это эмбеддинги плюс Qdrant, Chroma или pgvector.
  • Ответы мимо в девяти случаях из десяти это проблема поиска.

FAQ

Частые вопросы

Что такое RAG простыми словами

RAG это способ работы нейросети, при котором она перед ответом сначала ищет нужный фрагмент в вашей базе документов, а потом отвечает, опираясь именно на него. Расшифровывается как retrieval-augmented generation, то есть генерация, дополненная поиском. Термин появился в статье исследователей во главе с Патриком Льюисом, поданной 22 мая 2020 года. Смысл простой: модель перестаёт отвечать по памяти и начинает отвечать по вашему источнику.

Чем RAG отличается от простого прикрепления файла в чат

Прикреплённый файл целиком попадает в контекст и перечитывается заново на каждом вашем сообщении, поэтому длинный документ быстро съедает лимит и деньги. RAG вместо этого хранит документы отдельно и подтягивает только те два-три фрагмента, которые относятся к вопросу. На одном документе разница незаметна, на тысяче документов прикрепить всё просто невозможно.

Чем RAG отличается от дообучения модели

Дообучение меняет саму модель и требует данных, вычислений и повторения при каждом обновлении информации. RAG модель не трогает: меняются только документы в хранилище. Поменялся регламент, вы заменили файл, и система отвечает по новой версии через минуту. Для корпоративных знаний, которые постоянно обновляются, это решающее отличие.

Что такое эмбеддинги и векторная база

Эмбеддинг это перевод куска текста в набор чисел, который отражает смысл, а не буквы. Близкие по смыслу тексты дают близкие наборы чисел, даже если слова разные. Векторная база это хранилище таких наборов с быстрым поиском ближайших. Популярные варианты: Qdrant, Chroma и расширение pgvector для обычного Postgres, если базу и так держите на нём.

Сколько стоит собрать RAG

Дешевле, чем кажется. Разметка документов в векторы у OpenAI стоит 0,02 доллара за миллион токенов на модели text-embedding-3-small и 0,13 на старшей, у Google 0,15 доллара за миллион, а на бесплатном уровне Gemini бесплатно. База на тысячу страниц это порядка миллиона токенов, то есть считанные центы за полную переиндексацию. Основные деньги уходят не на поиск, а на сами ответы модели.

Можно ли сделать RAG без программирования

Да. Самый быстрый путь это готовые инструменты поиска по файлам у самих вендоров: у OpenAI это File search с хранением по 0,10 доллара за гигабайт в сутки при первом гигабайте бесплатно и 2,50 доллара за тысячу вызовов, у Google File search бесплатен по хранению и берёт только за эмбеддинги. Для сценариев без кода подходят Dify и n8n, для личной базы знаний хватает NotebookLM или проектов в Claude.

Почему RAG отвечает мимо вопроса

В девяти случаях из десяти проблема не в модели, а в поиске. Типичные причины: куски нарезаны слишком крупно и в ответ тащится лишнее, документы устарели и в базе лежат две противоречащие версии, вопрос задан другими словами, чем написано в документе, или найденных кусков слишком много и важный тонет среди похожих. Начинать отладку надо с того, чтобы посмотреть, какие именно фрагменты нашлись, а не переписывать промпт.

Нужен ли RAG, если контекст уже миллион токенов

Большой контекст не отменяет RAG, а меняет его роль. Загрузить миллион токенов можно, но это дорого при каждом обращении, медленно и на длинном контексте модель хуже удерживает детали в середине. RAG остаётся выгоднее, когда база больше окна, когда она часто меняется, когда нужны ссылки на конкретный документ и когда важно, чтобы одинаковые вопросы обходились в одинаковые копейки.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора