02.2
Модуль 2 · AI: от промпта до продукта

Урок 2. RAG: научите модель отвечать по вашим документам

Урок 2

Прямо сейчас: откройте notebooklm.google.com. Создайте блокнот. Загрузите любой ваш документ. Задайте вопрос по нему.

Зачем это L&D-специалисту

LLM-модели вроде ChatGPT знают много — но не знают ваших документов. Ваш учебный курс, корпоративный регламент, скрипт вебинара, база знаний отдела — всего этого нет в обучающей выборке модели. Если вы спросите «какой у нас регламент адаптации новых сотрудников», модель начнёт фантазировать. Она не врёт — она просто не знает.

RAG (Retrieval-Augmented Generation) решает эту проблему. Вы даёте модели доступ к вашим документам, и она отвечает по ним, а не по памяти. Для L&D это означает:

К концу урока вы поймёте, как это работает внутри, и сможете собрать простой RAG-конвейер.

Что такое RAG

RAG — это когда модель не отвечает по памяти, а сначала ищет нужную информацию в ваших документах и только потом формулирует ответ. Три шага: Retrieve (найти), Augment (добавить в промпт), Generate (сгенерировать ответ).

Метафора. Представьте, что вы нанимаете эксперта-консультанта. Вы не просите его помнить всё наизусть — вы даёте ему папку с документами и говорите: «Ответь, опираясь только на эти материалы». Модель — эксперт, ваши документы — папка, RAG — процесс «прочитай папку → ответь».

Без RAG модель опирается на то, что «запомнила» при обучении. Данные обучения заканчиваются определённой датой, а ваших документов там никогда не было. С RAG модель получает контекст из ваших документов прямо в запросе — и отвечает по нему.

Почему это важно для L&D: каждый ваш курс, каждый регламент, каждый скрипт — это уникальный контекст. Модель не может знать его заранее. RAG даёт ей этот контекст ровно в момент запроса.

➤ Микро-практика
Откройте ChatGPT или Claude. Спросите: «Расскажи содержание моего последнего рабочего документа». Модель не знает. Теперь скопируйте текст любого вашего документа и вставьте в чат со словами «Ответь по этому тексту: [ваш текст]». Спросите то же самое. Чувствуете разницу? Вы только что вручную сделали то, что RAG делает автоматически.

Конвейер RAG: три шага

RAG-конвейер — это последовательность действий, которые происходят между вопросом пользователя и ответом модели. Разберём каждый шаг.

Шаг 1. Индексация (подготовка документов)

Прежде чем отвечать на вопросы, нужно подготовить документы. Вы берёте свои файлы (PDF, DOCX, Markdown, страницы сайта), извлекаете текст и разбиваете его на чанки — небольшие осмысленные фрагменты.

Метафора: книга с закладками. Вы не можете дать модели целую книгу в 300 страниц — она «захлебнётся». Вы разрезаете книгу на страницы, вкладываете закладки с ключевыми словами и складываете в картотеку. Чанк — это одна страница с закладкой. Когда приходит вопрос, вы достаёте не всю книгу, а 3–5 нужных страниц.

Почему размер чанка важен:

Шаг 2. Эмбеддинги (превращаем текст в координаты)

Компьютер не понимает смысл слов. Чтобы найти «похожие по смыслу» фрагменты, текст нужно превратить в числа — эмбеддинги. Это как координаты на карте: два текста, близких по смыслу, получают близкие координаты.

Метафора: карта города. Эмбеддинг — это GPS-координаты смысла. «Как приготовить борщ» и «Рецепт свекольного супа» — это два разных адреса, но на карте они в одном районе. «Как приготовить борщ» и «Расписание электричек» — в разных концах города. Поиск по эмбеддингам находит «тот же район», даже если слова разные.
Поиск по ключевым словам (Ctrl+F) Поиск по эмбеддингам (RAG)
Ищет точное совпадение слов Ищет смысловую близость
«Адаптация сотрудников» найдёт только документы с этой фразой «Адаптация сотрудников» найдёт и «онбординг», и «введение в должность»
Не поймёт синонимы и перефразирования Понимает синонимы, переводы, перефразы
Быстро, дёшево, детерминировано Чуть медленнее, требует вычислительных ресурсов

Шаг 3. Генерация ответа

Когда пользователь задаёт вопрос:

  1. Вопрос превращается в эмбеддинг — находим его координаты на карте смыслов.
  2. Ищем ближайшие чанки — 3–5 фрагментов документов, которые ближе всего по смыслу к вопросу.
  3. Добавляем чанки в промпт — вместе с вопросом и инструкцией «отвечай только по этим документам».
  4. Модель генерирует ответ — опираясь на найденные чанки, а не на память.
Пользователь: «Какой у нас процесс адаптации?»
→ Эмбеддинг вопроса → поиск ближайших чанков
→ Найдено: [Regulation_01.md, Onboarding_2026.pdf]
→ Промпт модели: «Ответь на вопрос, используя ТОЛЬКО эти документы:
   [содержимое чанков]
   Вопрос: Какой у нас процесс адаптации?»
→ Ответ модели: «Согласно регламенту, адаптация длится 3 месяца и включает...»

Промежуточный итог

RAG-конвейер = индексация (разбили на чанки → сделали эмбеддинги → сложили в базу) + запрос (вопрос → эмбеддинг → поиск ближайших чанков → добавили в промпт → ответ). Три шага, которые превращают «модель не знает» в «модель отвечает по вашим документам».

В 9 из 10 вам нужен RAG. Быстро, дёшево, обратимо.

RAG vs Fine-tuning

Частый вопрос: «Может, просто дообучить модель на моих документах?» У этого подхода есть название — fine-tuning. Но для большинства L&D-задач он избыточен.

Fine-tuning — только для постоянной специализации модели. Если вы хотите, чтобы модель всегда говорила в вашем тоне и стиле, знала вашу терминологию и никогда не выходила за рамки — fine-tuning. Если нужно отвечать по документам, которые обновляются раз в неделю — RAG.
Критерий RAG Fine-tuning
Что делает Ищет ответ в ваших документах при каждом запросе «Вшивает» знания в саму модель на этапе обучения
Скорость внедрения Часы (загрузили документы — работает) Дни–недели (подготовка данных, обучение, валидация)
Обновление знаний Мгновенно: добавили документ — он в поиске Нужно переобучать модель заново
Стоимость Низкая: платите только за запросы к LLM Высокая: аренда GPU + время обучения
Точность на ваших данных Высокая: модель буквально цитирует документы Средняя: модель «помнит» не всё и может путать
Когда применять Базы знаний, FAQ, курсы, регламенты — всё что обновляется Стиль, тон, терминология — когда знания стабильны

Простое правило: если ваши документы обновляются — RAG. Если вы хотите изменить «личность» модели — fine-tuning. Подробнее о fine-tuning — в уроке 4 этого модуля.

Модель не знает ваших документов. Но ей не нужно знать всё — ей нужно знать где искать.

Вы не помните наизусть содержимое всех папок в шкафу. Вы помните, в какой папке что лежит, и открываете нужную, когда приходит запрос. RAG делает то же самое для модели: не заставляет помнить — даёт инструмент поиска.

Шпаргалка

Термины

Термин Что значит
RAG Retrieval-Augmented Generation — модель ищет в документах и отвечает по ним
Чанк (chunk) Фрагмент документа (500–1500 символов), единица поиска
Эмбеддинг (embedding) Вектор (массив чисел), представляющий смысл текста. Близкие по смыслу = близкие координаты
Векторная база (vector DB) Хранилище эмбеддингов с быстрым поиском ближайших соседей. Примеры: Chroma, Pinecone, Qdrant
Retriever Компонент, который по вопросу находит релевантные чанки
Fine-tuning Дообучение модели на своих данных — меняет «личность» модели, а не контекст запроса

Конвейер RAG

Этап Что происходит Бытовая метафора
1. Индексация Документы → чанки → эмбеддинги → векторная база Разложили документы по папкам с ярлыками
2. Поиск (Retrieve) Вопрос → эмбеддинг → поиск ближайших чанков По ключевому слову нашли нужную папку
3. Дополнение (Augment) Чанки + вопрос + инструкция → промпт модели Положили содержимое папки перед экспертом
4. Генерация (Generate) Модель читает чанки и пишет ответ Эксперт изучил документы и дал заключение

Когда что использовать

Задача Инструмент
Ответы по документам компании RAG
AI-тьютор по курсу RAG
Поиск по базе знаний RAG
Единый стиль и тон всех ответов Fine-tuning
Терминология предметной области Fine-tuning (как дополнение к RAG)
Документы обновляются каждую неделю Только RAG

Практика

Упражнение 1. Документ в чате — ручной RAG (10 мин)

Самый простой способ почувствовать RAG — сделать его руками.

  1. Возьмите любой ваш рабочий документ: регламент, программу курса, должностную инструкцию.
  2. Откройте ChatGPT или Claude. Не задавайте вопрос сразу.
  3. Сначала вставьте текст документа с префиксом: «Ответь на следующие вопросы, используя ТОЛЬКО этот документ: [ваш текст]».
  4. Задайте вопрос по документу. Например: «Какие этапы включает процесс?», «Кто ответственный за согласование?».
  5. Теперь задайте тот же вопрос в новом чате, без документа. Сравните ответы.

Что вы увидели: модель с документом отвечает точно, без документа — фантазирует или отказывается. Это и есть разница между RAG и обычным LLM.

Упражнение 2. NotebookLM — RAG для смертных (15 мин)
  1. Откройте notebooklm.google.com (нужен Google-аккаунт).
  2. Создайте новый блокнот. Назовите «Тест RAG».
  3. Загрузите 2–3 документа: можно PDF, можно Google Doc, можно скопировать текст.
  4. Задайте вопрос, который требует сопоставления информации из разных документов. Например: «Сравни процессы из документа А и документа Б. В чём отличия?»
  5. Посмотрите на ответ. Обратите внимание: под ответом есть ссылки на источники — модель показывает, из какого чанка взяла информацию.

NotebookLM — это Google-обёртка над RAG. Внутри тот же конвейер: чанки → эмбеддинги → поиск → генерация. Теперь вы знаете, как оно устроено.

Упражнение 3. Поиграйте с чанками (15 мин)
  1. Возьмите текст на 3000–5000 знаков. Подойдёт статья, глава из книги, методичка.
  2. Разбейте его на чанки тремя способами:
    • Мелко: по 2–3 предложения (200–400 знаков)
    • Средне: по 2–3 абзаца (800–1200 знаков)
    • Крупно: по 5–6 абзацев (2000–3000 знаков)
  3. Для каждого варианта придумайте 3 вопроса по тексту.
  4. «Проиграйте» поиск мысленно: в каком варианте чанков легче найти ответ? Где контекст теряется? Где чанк содержит лишнее?
  5. Запишите вывод: какой размер лучше для вашего типа документов и почему.

Инсайт: размер чанка — это компромисс. Мелко = точный поиск, но потеря контекста. Крупно = полный контекст, но размытый поиск. Идеального размера нет — он зависит от структуры ваших документов.

Упражнение 4. Поиск по ключевым словам vs смысловой поиск (10 мин)
  1. Откройте любой документ в текстовом редакторе.
  2. Выполните Ctrl+F по слову «обучение». Запишите, сколько совпадений и какие.
  3. Теперь мысленно поищите «развитие сотрудников» через Ctrl+F. Сколько совпадений? Скорее всего, ноль — хотя по смыслу это то же самое, что «обучение» во многих контекстах.
  4. Сформулируйте 3 пары «запрос — синоним» из вашей предметной области. Например: «адаптация — onboarding», «оценка — performance review», «ментор — наставник».
  5. Для каждой пары спросите себя: найдёт ли Ctrl+F документы по синониму? А эмбеддинг-поиск?

Это упражнение — не про код. Оно про понимание, почему эмбеддинги мощнее обычного поиска. Смысловой поиск находит то, что Ctrl+F пропустит.

Упражнение 5. Спроектируйте RAG-агента (20 мин)
  1. Выберите один L&D-сценарий:
    • AI-тьютор курса: студенты спрашивают — модель отвечает по материалам курса.
    • Поиск по базе знаний: сотрудники спрашивают — модель находит ответ в регламентах.
    • Анализатор обратной связи: загрузили 500 анкет — модель summarise по ним.
  2. Опишите для выбранного сценария:
    • Какие документы пойдут в индексацию?
    • Какой размер чанка выберете и почему?
    • Какие вопросы будут задавать пользователи? (3–5 примеров)
    • Что должно быть в системном промпте модели?
  3. Запишите результат в файл rag-agent-design.md в папке проекта.

Вы только что спроектировали RAG-систему. Без кода — но с пониманием всех компонентов. Когда дойдёте до технической реализации, у вас уже будет спецификация.

После практики

Чек-лист готовности

Артефакт урока

После урока в вашей папке проекта должен появиться файл:

ваш-проект/
└── rag-agent-design.md    ← спецификация RAG-агента (сценарий, документы, чанки, примеры вопросов)

Челлендж на завтра

Откройте рабочий документ — любой, с которым вы реально работаете. Регламент, программа курса, должностная инструкция. Скопируйте его в чат с моделью и задайте 5 вопросов. Заметьте: модель отвечает точно, ссылается на конкретные места в тексте, не придумывает. Это RAG в его простейшей форме. Теперь представьте, что то же самое может работать автоматически для всей базы знаний компании.

Что дальше

В следующем материале — AI-агенты. Вы узнаете, как модель может не просто отвечать, а выполнять цепочки действий: искать информацию, вызывать API, принимать решения. RAG — один из инструментов, который агент использует. Но сначала закрепите материал этого урока.

Проверь себя

1. Что такое RAG?

2. Что такое эмбеддинг?

3. Зачем нужна векторная база данных в RAG?

4. В чём главное преимущество RAG перед обычным промптом?