02.1
Модуль 2 · AI: от промпта до продукта

Урок 1. Как работают LLM: токены, контекст, температура, галлюцинации

Урок 1

Прямо сейчас: откройте OpenRouter Playground. Спросите «Что такое педагогический дизайн?» с T=0 и T=1.5. Сравните.

Зачем это L&D-специалисту

Если вы прошли Модуль 1, вы уже знаете как отправлять API-запросы. Но отправить запрос и получить полезный ответ — разные вещи. Одна и та же модель может выдать сухой справочный текст или креативную идею для курса. Разница — в настройках, которые вы передаёте в запросе.

LLM — это не магия. Это инструмент с ручками и рычагами: температура, контекстное окно, системный промпт, токены. Если вы не знаете, как они работают, — вы гадаете. Если знаете — вы управляете.

Этот урок — про то, чтобы заглянуть под капот. После него вы будете не просто «пользоваться ChatGPT», а осознанно настраивать модель под свою задачу: фасилитацию, генерацию контента, аналитику, код.

Что такое LLM

LLM (Large Language Model — большая языковая модель) — это программа, которая предсказывает следующее слово в тексте. Не думает, не понимает, не имеет мнения. Она смотрит на то, что вы написали, и вычисляет: какое слово вероятнее всего должно идти дальше.

Вы пишете: «Столица Франции — ...» Модель перебирает варианты: «Париж» — 99.7%, «Лион» — 0.1%, «Марсель» — 0.05%. Выбирает самый вероятный. Потом предсказывает следующее слово. И следующее. Так рождается ответ.

Метафора. Автодополнение в телефоне, которое доучили до степени PhD. Вы набираете «завтра будет...» — телефон предлагает «хорошая погода». LLM делает то же самое, но обучена на терабайтах текстов и учитывает не 3 последних слова, а всю историю диалога.
Это не магия — модель считает вероятности. Никакого сознания, понимания или intent. Только статистика: «после этих слов в похожих текстах чаще всего шло вот это».

Токены

Модель не работает с буквами или словами напрямую. Она разбивает текст на токены — смысловые кусочки. Слово может быть одним токеном, а может — несколькими.

Метафора. Кусочки пазла. Короткое слово вроде «кот» — один кусочек. Длинное вроде «педагогический» — два-три кусочка. Модель собирает ответ из этих кусочков, как пазл.

Почему это важно: вы платите за токены. И входные (ваш запрос), и выходные (ответ модели) считаются. Ограничение max_tokens в параметрах запроса задаёт максимум выходных токенов.

Текст Примерное количество токенов Примечание
Привет 2–3 Русские буквы = больше токенов
Hello 1 Английский токенизируется эффективнее
Педагогический дизайн 6–8 Длинные русские слова дробятся
Страница А4 (~2500 знаков) ~800–1000 Зависит от языка и структуры
Часовая лекция (транскрипт) ~10 000–15 000 Может не влезть в контекстное окно
Русский текст в 1.5–2 раза дороже английского в токенах. Одно и то же содержание на русском может стоить вдвое больше.

Как считать: В OpenRouter Playground количество токенов показывается под полем ввода. Правило большого пальца: 1 токен ≈ 0.75 слова на английском, ≈ 0.5 слова на русском. Точнее — через токенизатор OpenAI (platform.openai.com/tokenizer).

Контекстное окно

Контекстное окно — это сколько токенов модель может «видеть» одновременно. Всё, что в окне, модель учитывает при генерации следующего слова. Всё, что за окном, — не существует.

Метафора. Оперативная память. Открыли 100 вкладок в браузере — оперативка забилась, компьютер тормозит. Так же с LLM: чем больше контекстное окно, тем больше диалога и документов модель может держать в «голове» одновременно.
Memory ≠ контекст. Платформы вроде ChatGPT имитируют «память» через отдельный механизм (memory), который подшивает краткую сводку предыдущих диалогов в системный промпт. Это не контекстное окно. Не путайте.
Модель Контекстное окно Что влезает
GPT-4o 128K Книга ~300 страниц
Claude 3.5 Sonnet 200K Книга ~500 страниц
Claude 4 Sonnet 200K Книга ~500 страниц
Gemini 2.5 Pro 1M Видео + книга + документация
DeepSeek V3 128K Книга ~300 страниц

Важно: большой контекст = больше токенов = дороже запрос. Не гонитесь за максимумом. Для большинства L&D-задач (анализ вакансии, генерация карточки курса, ревью программы) хватает 8–16K.

И ещё: модели хуже «читают» середину длинного контекста (проблема lost-in-the-middle). Самое важное — в начало или конец запроса.

Температура

Температура (temperature) — параметр от 0 до 2, который управляет «креативностью» ответа. Технически: насколько модель готова выбирать не самое вероятное слово, а менее вероятные варианты.

Метафора. Готовить суп по рецепту. T=0 — строго по рецепту: 200 грамм моркови, 10 минут варки. Одинаково каждый раз. T=1.5 — «моркови где-то горсть, варить пока не надоест». Каждый раз разный суп.
T Поведение Когда использовать
0 Детерминированно. Всегда один и тот же ответ на один запрос Факты, извлечение данных, классификация, код
0.3–0.5 Сдержанно. Лёгкая вариативность Аналитика, структурированные тексты, отчёты
0.7–1.0 Сбалансированно. Разные формулировки, но по делу Письма, посты, описания курсов
1.2–1.5 Креативно. Неожиданные формулировки, идеи не по шаблону Мозговой штурм, идеи для курсов, сторителлинг
>1.5 Хаотично. Может уйти в бред Редко. Только для экспериментов
Одна модель с T=0 и T=1.5 — два разных человека. С T=0: дотошный бухгалтер. С T=1.5: фантазёр после второй чашки кофе.
➤ Попробуйте
Отправьте один и тот же запрос «Напиши описание курса по педагогическому дизайну» с T=0, T=0.7 и T=1.5. Сравните формулировки. При T=0 ответы будут идентичны при повторении. При T=1.5 — каждый раз новый вариант.

Галлюцинации

Галлюцинация — когда модель выдаёт уверенный, складный, но ложный ответ. Не потому что «врёт», а потому что предсказала неправильное слово и дальше достроила логичную, но вымышленную картину.

Метафора. Уверенный стажёр на собеседовании. Вы спрашиваете: «Как вы оцениваете ROI офлайн-тренингов в фарме?» Он не знает, но молчать неудобно — и он начинает уверенно говорить про вовлечённость, NPS и кейсы, которых не существует. Не со зла — просто модель так устроена.

5 способов снизить галлюцинации

  1. Системный промпт. Добавьте в system-сообщение: «Если ты не знаешь точного ответа — скажи об этом. Не придумывай факты, цифры, исследования и имена, которых нет в предоставленных материалах». Это снижает галлюцинации на 30–40%.
  2. T=0 или низкая температура. Для фактологических задач (даты, цифры, нормативы) — только детерминированный режим. Креативность здесь вредит.
  3. Внешний источник. Не спрашивайте модель «Какие KPI у L&D в IT-компаниях?» — дайте ей статью или исследование и попросите извлечь данные. Модель работает с тем, что вы положили в контекст, а не со своей «памятью».
  4. Самопроверка. Попросите модель: «Проверь свой ответ. Найди в нём утверждения, которые нельзя подтвердить, и отметь их». Или используйте две модели: одна генерирует, вторая проверяет.
  5. Формат вывода. Для фактов просите JSON или таблицу с обязательным полем "source" — это дисциплинирует модель и делает пробелы видными сразу.

Когда галлюцинации допустимы: мозговой штурм, идеи, сторителлинг, черновики постов. Если модель «придумала» несуществующий кейс для поста — не страшно. Вы проверите и поправите.

Когда галлюцинации критичны: цифры для отчёта, ссылки на закон, медицинские данные, статистика для руководства. Здесь — только T=0 + внешние источники + проверка.

Промежуточный итог

Три рычага: токены, контекст, температура. Комбинируя их — управляете моделью как пультом. Хотите факты — T=0 + короткий контекст с проверенным источником. Хотите идеи — T=1.2 + длинный контекст с примерами. Хотите дёшево — английский промпт + маленькая модель.

LLM — не собеседник. Это инструмент с настройками, которыми вы управляете.

Если ответ не тот, который вы ждали — вы просто не покрутили правильную ручку. Не «модель глупая», а «я поставил T=1.5 для фактологического вопроса». После этого урока у вас есть пульт. Пользуйтесь.

Шпаргалка

Параметры запроса к LLM

Параметр Что делает Типичные значения
model Какую модель использовать openai/gpt-4o, anthropic/claude-4-sonnet
temperature Креативность (0 — детерминированно, 2 — хаос) 0 для фактов, 0.7 для текстов, 1.2+ для идей
max_tokens Максимум токенов в ответе 500 для короткого, 2000–4000 для развёрнутого
top_p Альтернатива temperature (ядро вероятностей) 0.9 — стандарт. Не используйте вместе с temperature
frequency_penalty Штраф за повторение слов (−2 до 2) 0.3–0.5 если модель зациклилась
presence_penalty Штраф за уже использованные токены (−2 до 2) 0.3–0.5 для разнообразия тем

Роли сообщений

Роль Назначение Пример
system Инструкция модели: кто она, как отвечать, правила «Ты — методист. Отвечаешь на русском...»
user Сообщение пользователя (вопрос, задание) «Напиши структуру курса по онбордингу»
assistant Предыдущий ответ модели (для истории) Ответ модели из предыдущего шага

Практика

Упражнение 1. Токены (10 мин)

Зайдите в OpenRouter Playground. Напишите три варианта одного и того же запроса и сравните количество токенов:

  1. На русском: «Напиши определение педагогического дизайна в одном абзаце»
  2. На английском: «Write a definition of instructional design in one paragraph»
  3. На русском, но с требованием ответить на английском

Запишите количество токенов для каждого варианта. Сравните. Убедитесь, что русский промпт «дороже».

Упражнение 2. Температура (20 мин)

Возьмите один и тот же запрос: «Составь учебную программу тренинга по коммуникациям для middle-менеджеров на 2 дня».

  1. Отправьте с T=0. Сохраните ответ.
  2. Отправьте тот же запрос ещё раз с T=0. Ответ должен быть идентичным.
  3. Отправьте с T=0.7. Сохраните.
  4. Отправьте с T=1.5. Сохраните.
  5. Сравните три варианта. Что меняется: структура, формулировки, идеи упражнений?
  6. С T=1.5 отправьте ещё два раза. Каждый раз разный ответ?

Вывод запишите: для каких задач в L&D какую температуру брать.

Упражнение 3. Системный промпт (20 мин)

Системный промпт (role: system) — инструкция, которая задаёт тон и правила. Сравните ответы модели без system-промпта и с ним.

  1. Без system: просто user-сообщение «Напиши карточку курса по онбордингу»
  2. С system: «Ты — методист с 10-летним опытом в EdTech. Отвечаешь на русском. Всегда предлагаешь 2–3 альтернативных варианта. Избегаешь воды и общих фраз.» И тот же user-запрос.
  3. С system: «Ты — скептически настроенный CEO. Отвечаешь коротко, с цифрами и ROI. Не принимаешь аргументы без данных.» И тот же запрос.

Сравните три ответа. Убедитесь, что system-промпт радикально меняет характер ответа при том же user-запросе.

Упражнение 4. Контекстное окно (15 мин)
  1. Найдите статью или документ на 3–5 страниц по L&D-теме (например, отчёт LinkedIn Workplace Learning Report).
  2. Скопируйте текст в запрос и попросите модель извлечь 5 ключевых тезисов.
  3. Теперь сделайте второй запрос: «Какие тренды в корпоративном обучении в 2025 году?» — без статьи, просто из «памяти» модели.
  4. Сравните ответы: какой точнее, конкретнее, ссылается на данные?
  5. Попробуйте дать очень длинный текст (15+ страниц) и спросить про начало и конец — проверьте lost-in-the-middle.

Вывод: модель работает точнее, когда вы даёте ей материал, а не полагаетесь на её «знания».

Упражнение 5. Галлюцинация (15 мин)
  1. Спросите модель: «Какие исследования подтверждают эффективность микрообучения? Приведи 3 конкретных исследования с авторами и годами.» Запишите ответ.
  2. Проверьте в Google: существуют ли эти исследования на самом деле? Авторы, названия, годы — всё совпадает?
  3. Теперь добавьте в system-промпт: «Если ты не знаешь точного ответа — скажи об этом. Не придумывай исследования, авторов, цифры, которых нет в предоставленных материалах.» Повторите запрос.
  4. Сравните ответы. С system-промптом модель либо откажется выдумывать, либо сошлётся на реально известные работы.

Запишите в дневник: насколько ответы различались? Были ли галлюцинации в первом случае?

Упражнение 6. Дневник наблюдений (15 мин)
  1. Создайте файл llm-дневник.md в папке урока.
  2. Запишите туда свои наблюдения по каждому упражнению:
  • Сколько токенов занял русский vs английский запрос?
  • Как отличаются ответы при T=0, T=0.7, T=1.5?
  • Как system-промпт изменил ответ?
  • Были ли галлюцинации в упражнении 5?
  • Какой параметр оказался самым неожиданным?

Этот дневник пригодится для итогового проекта модуля.

После практики

Чек-лист готовности

Артефакт урока

После урока в вашем проекте должны появиться:

ваш-проект/
└── module-02/
    ├── llm-дневник.md          ← наблюдения по упражнениям
    ├── exercise-02-temp/       ← скриншоты/заметки по температуре
    └── exercise-05-hallucinations/  ← скриншоты галлюцинаций

Челлендж на завтра

Откройте OpenRouter Playground с утра. Попросите модель написать пост для LinkedIn на тему «Как я объясняю AI коллегам-гуманитариям». Поставьте T=1.2. Опубликуйте черновик в свой Telegram-канал «для своих». Один пост. 15 минут. Сделайте это — и вы перестанете бояться кнопки «Отправить».

Что дальше

В следующем материале — RAG (Retrieval-Augmented Generation). Вы научитесь подключать к модели внешние источники: документы, базы знаний, курсы. Модель будет отвечать не «из головы», а по вашим материалам. Это фундамент для AI-ассистента методиста.

Проверь себя

1. Что такое токен в контексте LLM?

2. Что делает параметр temperature (T)?

3. Что такое контекстное окно?

4. Что такое галлюцинация LLM?