• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
2026/2027

Обучение с подкреплением

ID 1155112

Статус: Маго-лего
Когда читается: 3 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 40

Программа дисциплины

Аннотация

Курс посвящён обучению с подкреплением — области машинного обучения, в которой агент учится действовать оптимально, взаимодействуя со средой: обучающие данные не заданы заранее, а собираются самим агентом в процессе оптимизации. Слушатели познакомятся с теоретическими основами RL, реализуют на практике ключевые классические алгоритмы и научатся определять, в каких практических задачах RL даёт преимущество перед обучением с учителем.
Цель освоения дисциплины

Цель освоения дисциплины

  • Ознакомление студентов с основными подходами и алгоритмами обучения с подкреплением. Планируется дать понимание того, какие существуют подходы к решению задач обучения с подкреплением, научить выбирать алгоритм, наиболее подходящий для рассматриваемой студентом задачи, научить обучать модели с использованием современных нейросетевых библиотек.
Планируемые результаты обучения

Планируемые результаты обучения

  • Знать основные понятия RL и постановку оптимизационной задачи;
  • Знать и понимать вывод уравнений Беллмана;
  • Понимать отличие model-based и model-free подходов;
  • Понимать концепцию Temporal Difference Learning;
  • Знать алгоритм DQN и его недостатки;
  • Понимать природу различных модификаций;
  • Понимать вывод формулы градиента по стратегии, использующий log derivative trick;
  • Знать особенности применения RL алгоритмов к задачам с непрерывным пространством действий;
  • Понимать отличие в постановке задачи Многорукого бандита от постановки задачи классического RL;
  • Понимать теоретические основания для оценок сверху и снизу на Regret;
  • Понимать неэффективность эпсилон-жадных алгоритмов для задачи Многорукого бандита;
  • Уметь решать задачи динамического программирования в средах с заранее известной динамикой;
  • Знать теорию и уметь применять алгоритмы Policy Iteration и Value Iteration на практике;
  • Знать отличия алгоритмов Q-learning от алгоритмов из семейства SARSA, уметь применять их на практике для стандартных сред;
  • Понимать алгоритм REINFORCE и методы снижения дисперсии оценки стохастического градиента, концепции Advantage функции и ее использовании для понижения дисперсии, концепции Actor-Critic;
  • Знать алгоритмы TRPO и PPO, уметь применять их на практике для стандартных сред;
  • Уметь определять в среды, где действия агента не влияют на динамику среды;
  • Понимать теоретические основания, лежащие за алгоритмами UCB и Thompson Sampling, уметь применять их на практике;
  • Уметь реализовывать оптимизацию и применение обучения с подкреплением в практических задачах от постановки до работающего агента.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в Обучение с подкреплением: постановка задачи и отличие от обучения с учителем.
  • Уравнения Беллмана и Динамическое программирование: решение задач в среде с заранее известной динамикой.
  • Model-Free Табличный RL и Q-Learning: учим динамику простых сред.
  • Введение в глубинный RL, DQN, REINFORCE: обучение в непрерывных средах.
  • Углублённые алгоритмы Policy Gradient, TRPO & PPO: обучение первых SOTA алгоритмов RL.
  • Многорукие и контекстуальные бандиты: RL в средах, где действия не влияют на динамику.
Элементы контроля

Элементы контроля

  • неблокирующий Домашнее задание 3
    Выдается после лекции № 4 и содержит практические задачи, посвященные реализации алгоритмов DQN в Atari-среде.
  • блокирующий Практический проект (блокирующий)
    Выдается после лекции № 5 и предполагает творческую реализацию / разбор научной статьи, согласованной с преподавателем и отличающейся от разобранных алгоритмов в рамках курса.
  • неблокирующий Домашнее задание 2
    Выдается после лекции № 3 и содержит практические задачи, посвященные реализации алгоритмов Q-Learning / SARSA / E-SARSA в игровой среде.
  • неблокирующий Домашнее задание 1
    Выдается после лекции № 2 и содержит практические задачи, посвященные реализации алгоритмов Value Iteration и Policy Iteration.
  • неблокирующий Проверочная работа 2
    Проводится после лекции №4 и содержит 16 коротких вопросов и 1 вопрос с открытым ответом. Темы затрагивают Лекции и Семинары 1-2 и проверяют понимание разобранных алгоритмов, а также интуицию применения обсуждаемых подходов на практике. Студент может начать выполнение проверочной работы в любое время в течение одного дня.
  • неблокирующий Проверочная работа 1
    Проводится после лекции №2 и содержит 16 коротких вопросов и 1 вопрос с открытым ответом. Темы затрагивают Лекции и Семинары 1-2 и проверяют понимание разобранных алгоритмов, а также интуицию применения обсуждаемых подходов на практике. Студент может начать выполнение проверочной работы в любое время в течение одного дня.
  • неблокирующий Проверочная работа 3
    Проводится после лекции №6 и содержит 16 коротких вопросов и 1 вопрос с открытым ответом. Темы затрагивают Лекции и Семинары 1-2 и проверяют понимание разобранных алгоритмов, а также интуицию применения обсуждаемых подходов на практике. Студент может начать выполнение проверочной работы в любое время в течение одного дня.
  • неблокирующий Пересдача в формате экзамена
    Экзамен проводится в устной форме на платформе Zoom. Студент готовит к экзамену домашние работы из основного списка и устно защищает своё решение. После ответа студенту могут быть заданы дополнительные вопросы по программе курса. Такие вопросы не требуют проведения обширных вычислений и реализации кода.
  • неблокирующий Бонусная активность
    Бонусные баллы за активность на занятиях. Лекции включают в себя обсуждение вопросов, а семинары — реализацию алгоритмов вместе с преподавателем. Во время таких активностей можно получить дополнительные баллы за правильные ответы / идеи.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    Итог = Округление(0.3 * ДЗ + 0.3 * КР + 0.4 * П + 0.1 * А), где ДЗ — средняя оценка за все домашние задания, КР — средняя оценка за все проверочные работы, П — оценка за финальный проект, А — активность на занятиях.
Список литературы

Список литературы

Рекомендуемая основная литература

  • Обучение с подкреплением, Саттон, Р. С., 2011

Рекомендуемая дополнительная литература

  • Глубокое обучение с подкреплением : теория и практика на языке Python, Грессер, Л., 2022

Авторы

  • Ахмедова Гюнай Интигам кызы