Машинное обучение и наука о данных
16 ак.часов
Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов
-
О КУРСЕСпециализированный курс по методам обучения с подкреплением, адаптированным для задач обработки естественного языка. Программа охватывает путь от фундаментальных концепций RL (агент, среда, награда) через ключевые алгоритмы (Q-Learning, Policy Gradient, Actor-Critic) к практическому применению RLHF для выравнивания больших языковых моделей. Курс завершается разработкой адаптивной системы генерации ответов на базе LLaMA.
ML-инженеры, Python-разработчики, начинающие специалисты в области AI, разработчики игр и симуляций.
Блок 1. Введение в обучение с подкреплением (Основы)
Тема 1. От классического ML к RL: адаптация в реальном времени
Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом).
Тема 2. Анатомия RL: Агент, Среда и Награда
Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.
Блок 2. Ключевые алгоритмы глубокого обучения с подкреплением
Тема 3. Формализация задачи и алгоритм Q-Learning
Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent.
Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic
Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.
Блок 3. Специфика применения RL в NLP
Тема 5. RL для работы с текстами
RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем.
Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей
Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.
Блок 4. Практика и проектный кейс
Тема 7. Практикум: Разработка среды и политик
Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий.
Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов
Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.
-
По окончании курса слушатели смогут:
- Понимать фундаментальные отличия обучения с подкреплением от классического ML
- Владеть базовыми компонентами RL: Агент, Среда, Действие, Награда, Политика, Функция ценности
- Реализовывать ключевые алгоритмы: Q-Learning, Policy Gradient, Actor-Critic
- Применять RL для задач генерации текста, машинного перевода и диалоговых систем
- Освоить подход RLHF для выравнивания (alignment) моделей под предпочтения пользователей
- Разрабатывать адаптивные системы генерации ответов с интеграцией LLaMA и Q-Learning
-
Предварительные требования:
- знание Python,
- базовое понимание нейросетей,
- уверенная работа с NumPy и pandas
- опыт с ML-библиотеками приветствуется
-
Получаемый документ:
-
Необходимая подготовка
- Уверенное владение Python и библиотеками глубокого обучения
- Базовые знания нейронных сетей и принципов обучения
- Опыт работы с Hugging Face Transformers
- Знакомство с языковыми моделями (GPT, LLaMA) будет преимуществом


