Прямо сейчас: откройте OpenRouter Playground. Спросите «Что такое педагогический дизайн?» с T=0 и T=1.5. Сравните.
Зачем это L&D-специалисту
Если вы прошли Модуль 1, вы уже знаете как отправлять API-запросы. Но отправить запрос и получить полезный ответ — разные вещи. Одна и та же модель может выдать сухой справочный текст или креативную идею для курса. Разница — в настройках, которые вы передаёте в запросе.
LLM — это не магия. Это инструмент с ручками и рычагами: температура, контекстное окно, системный промпт, токены. Если вы не знаете, как они работают, — вы гадаете. Если знаете — вы управляете.
Этот урок — про то, чтобы заглянуть под капот. После него вы будете не просто «пользоваться ChatGPT», а осознанно настраивать модель под свою задачу: фасилитацию, генерацию контента, аналитику, код.
Что такое LLM
LLM (Large Language Model — большая языковая модель) — это программа, которая предсказывает следующее слово в тексте. Не думает, не понимает, не имеет мнения. Она смотрит на то, что вы написали, и вычисляет: какое слово вероятнее всего должно идти дальше.
Вы пишете: «Столица Франции — ...» Модель перебирает варианты: «Париж» — 99.7%, «Лион» — 0.1%, «Марсель» — 0.05%. Выбирает самый вероятный. Потом предсказывает следующее слово. И следующее. Так рождается ответ.
Токены
Модель не работает с буквами или словами напрямую. Она разбивает текст на токены — смысловые кусочки. Слово может быть одним токеном, а может — несколькими.
Почему это важно: вы платите за токены. И входные (ваш запрос), и выходные (ответ модели) считаются. Ограничение max_tokens в параметрах запроса задаёт максимум выходных токенов.
| Текст | Примерное количество токенов | Примечание |
|---|---|---|
Привет |
2–3 | Русские буквы = больше токенов |
Hello |
1 | Английский токенизируется эффективнее |
Педагогический дизайн |
6–8 | Длинные русские слова дробятся |
| Страница А4 (~2500 знаков) | ~800–1000 | Зависит от языка и структуры |
| Часовая лекция (транскрипт) | ~10 000–15 000 | Может не влезть в контекстное окно |
Как считать: В OpenRouter Playground количество токенов показывается под полем ввода. Правило большого пальца: 1 токен ≈ 0.75 слова на английском, ≈ 0.5 слова на русском. Точнее — через токенизатор OpenAI (platform.openai.com/tokenizer).
Контекстное окно
Контекстное окно — это сколько токенов модель может «видеть» одновременно. Всё, что в окне, модель учитывает при генерации следующего слова. Всё, что за окном, — не существует.
| Модель | Контекстное окно | Что влезает |
|---|---|---|
| GPT-4o | 128K | Книга ~300 страниц |
| Claude 3.5 Sonnet | 200K | Книга ~500 страниц |
| Claude 4 Sonnet | 200K | Книга ~500 страниц |
| Gemini 2.5 Pro | 1M | Видео + книга + документация |
| DeepSeek V3 | 128K | Книга ~300 страниц |
Важно: большой контекст = больше токенов = дороже запрос. Не гонитесь за максимумом. Для большинства L&D-задач (анализ вакансии, генерация карточки курса, ревью программы) хватает 8–16K.
И ещё: модели хуже «читают» середину длинного контекста (проблема lost-in-the-middle). Самое важное — в начало или конец запроса.
Температура
Температура (temperature) — параметр от 0 до 2, который управляет «креативностью» ответа. Технически: насколько модель готова выбирать не самое вероятное слово, а менее вероятные варианты.
| T | Поведение | Когда использовать |
|---|---|---|
| 0 | Детерминированно. Всегда один и тот же ответ на один запрос | Факты, извлечение данных, классификация, код |
| 0.3–0.5 | Сдержанно. Лёгкая вариативность | Аналитика, структурированные тексты, отчёты |
| 0.7–1.0 | Сбалансированно. Разные формулировки, но по делу | Письма, посты, описания курсов |
| 1.2–1.5 | Креативно. Неожиданные формулировки, идеи не по шаблону | Мозговой штурм, идеи для курсов, сторителлинг |
| >1.5 | Хаотично. Может уйти в бред | Редко. Только для экспериментов |
Отправьте один и тот же запрос «Напиши описание курса по педагогическому дизайну» с T=0, T=0.7 и T=1.5. Сравните формулировки. При T=0 ответы будут идентичны при повторении. При T=1.5 — каждый раз новый вариант.
Галлюцинации
Галлюцинация — когда модель выдаёт уверенный, складный, но ложный ответ. Не потому что «врёт», а потому что предсказала неправильное слово и дальше достроила логичную, но вымышленную картину.
5 способов снизить галлюцинации
- Системный промпт. Добавьте в system-сообщение: «Если ты не знаешь точного ответа — скажи об этом. Не придумывай факты, цифры, исследования и имена, которых нет в предоставленных материалах». Это снижает галлюцинации на 30–40%.
- T=0 или низкая температура. Для фактологических задач (даты, цифры, нормативы) — только детерминированный режим. Креативность здесь вредит.
- Внешний источник. Не спрашивайте модель «Какие KPI у L&D в IT-компаниях?» — дайте ей статью или исследование и попросите извлечь данные. Модель работает с тем, что вы положили в контекст, а не со своей «памятью».
- Самопроверка. Попросите модель: «Проверь свой ответ. Найди в нём утверждения, которые нельзя подтвердить, и отметь их». Или используйте две модели: одна генерирует, вторая проверяет.
- Формат вывода. Для фактов просите JSON или таблицу с обязательным полем
"source"— это дисциплинирует модель и делает пробелы видными сразу.
Когда галлюцинации допустимы: мозговой штурм, идеи, сторителлинг, черновики постов. Если модель «придумала» несуществующий кейс для поста — не страшно. Вы проверите и поправите.
Когда галлюцинации критичны: цифры для отчёта, ссылки на закон, медицинские данные, статистика для руководства. Здесь — только T=0 + внешние источники + проверка.
Промежуточный итог
Три рычага: токены, контекст, температура. Комбинируя их — управляете моделью как пультом. Хотите факты — T=0 + короткий контекст с проверенным источником. Хотите идеи — T=1.2 + длинный контекст с примерами. Хотите дёшево — английский промпт + маленькая модель.
LLM — не собеседник. Это инструмент с настройками, которыми вы управляете.
Если ответ не тот, который вы ждали — вы просто не покрутили правильную ручку. Не «модель глупая», а «я поставил T=1.5 для фактологического вопроса». После этого урока у вас есть пульт. Пользуйтесь.
Шпаргалка
Параметры запроса к LLM
| Параметр | Что делает | Типичные значения |
|---|---|---|
model |
Какую модель использовать | openai/gpt-4o, anthropic/claude-4-sonnet |
temperature |
Креативность (0 — детерминированно, 2 — хаос) | 0 для фактов, 0.7 для текстов, 1.2+ для идей |
max_tokens |
Максимум токенов в ответе | 500 для короткого, 2000–4000 для развёрнутого |
top_p |
Альтернатива temperature (ядро вероятностей) | 0.9 — стандарт. Не используйте вместе с temperature |
frequency_penalty |
Штраф за повторение слов (−2 до 2) | 0.3–0.5 если модель зациклилась |
presence_penalty |
Штраф за уже использованные токены (−2 до 2) | 0.3–0.5 для разнообразия тем |
Роли сообщений
| Роль | Назначение | Пример |
|---|---|---|
system |
Инструкция модели: кто она, как отвечать, правила | «Ты — методист. Отвечаешь на русском...» |
user |
Сообщение пользователя (вопрос, задание) | «Напиши структуру курса по онбордингу» |
assistant |
Предыдущий ответ модели (для истории) | Ответ модели из предыдущего шага |