Top.Mail.Ru
ИИ(Машинное обучение и искусственный интеллект)
#
#RL-ML # Машинное обучение и наука о данных # 16 ак.часов

Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов


37000 ₽
     
Онлайн класс. Удаленное подключение к очным курсам. Для обучения достаточно иметь доступ в Интернет. Время онлайн трансляции курса устанавливается в зависимости от города проведения очного обучения. Предусмотрено предоставление записей слушателям в отдаленных часовых поясах.

Технологии и инструменты, которыми будете владеть

#

RL-алгоритмы

#

Q-learning

#

SARSA

#

Cross-Entropy

#

OpenAI Gym

#

TensorFlow и Keras

Чему вы научитесь
строить прикладной AI
реализовывать стратегии
разрабатывать обучающихся агентов
работать с платформой OpenAI Gym
настраивать симуляционные среды
создавать нейронные сети для Deep Reinforcement Learning
применять TensorFlow и Keras для обучения моделей
Целевая аудитория
#

ML-инженеры, Python-разработчики, начинающие специалисты в области AI, разработчики игр и симуляций.

Программа курса
1

Блок 1. Введение в обучение с подкреплением (Основы)


Тема 1. От классического ML к RL: адаптация в реальном времени
Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом).

Тема 2. Анатомия RL: Агент, Среда и Награда
Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.

2

Блок 2. Ключевые алгоритмы глубокого обучения с подкреплением


Тема 3. Формализация задачи и алгоритм Q-Learning
Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent.

Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic
Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.

3

Блок 3. Специфика применения RL в NLP


Тема 5. RL для работы с текстами
RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем.

Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей
Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.

4

Блок 4. Практика и проектный кейс


Тема 7. Практикум: Разработка среды и политик
Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий.

Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов
Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.

0 отзывов

Об этом курсе отзывов пока нет. Будьте первым.

Чтобы оставить отзыв необходимо авторизоваться на сайте или зарегистрироваться.



#
#
Академия Айти

Ведущий консалтинговый центр получения дополнительного профессионального образования

Войдите в систему, чтобы получить все возможности платформы и доступ к образовательным курсам
Не запоминать
Забыли пароль?
Забыли пароль?
Введите e-mail, указанный при регистрации, пришлем вам инструкцию по восстановлению пароля.
CAPTCHA

CAPTCHA

15%
Шаг 1 из 2 Заполните данные
Далее Назад Зарегистрироваться
Корзина

Курс добавлен в корзину, теперь нужно