Бакалавриат
2026/2027





Стохастическое оптимальное управление
Статус:
Курс по выбору (Прикладная математика и информатика)
Где читается:
Факультет компьютерных наук
Когда читается:
4-й курс, 1, 2 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
5
Контактные часы:
56
Программа дисциплины
Аннотация
После того, как мы научились оценивать математические модели по данным, встаёт интересный вопрос, что с ним делать дальше. Оптимальное управление -- про то, как это знание использовать оптимально: в частности, управлять сложными детерминированными или стохастическими процессами, добиваясь лучшей целевой метрики. В отдельных сообществах может быть лучше известно обучение с подкреплением (Reinforcement learning), эта область в какой-то момент развилась как конкретный подход к решению задач управления, где делаются только общие предположения про динамическую модель. Тем не менее во всех предметных областях часто уже есть априорное знание, которое всегда успешно используется как преимущество над методами RL. Задачи управления оказываются базовым основанием для финансовой математики, где, например, цена определяется как наилучший теоретически возможный выигрыш от использования продукта. В инженерных приложениях широко распространены задачи управления техническими устройствами, где нужно минимизировать расход топлива или энергии, при этом удовлетворив поставленным ограничениям. Аналитические отделы в центробанках и министерствах используют оптимальное управление для рационального долгосрочного и краткосрочного планирования своих действий и управления экономическими процессами.
В этом курсе мы увидим, как можно построить математический подход к управлению случайными процессами, которые используются как фундаментальный инструмент моделирования. Мы поймём как ставить и как решать задачи, возникающие в финансовой математике (например, хеджирование, оценка деривативов, управление портфелем), инженерных приложениях (стабилизация, навигация и выполнение задачи за скорейшее время) и других (местами неожиданных) областях. Основной акцент делается на математический фундамент, но также и на то, как решать конкретные задачи с помощью компьютера.
Темы курса включают в себя обзор детерминированного управления в дискретном и непрерывном времени, а также стохастическое управление на основе принципа максимума Понтрягина и уравнений Гамильтона-Якоби-Беллмана (HJB).
Цель освоения дисциплины
- Знать - Основные постановки задач оптимального управления в дискретном и непрерывном времени - Методологию динамического программирования и принципа максимума - Постановку задачи оптимальной остановки - Методологию декомпозиции модели на наблюдаемую и не наблюдаемую части - Отличия и схожести методологии обучения с подкреплением от методов теории оптимального управления
- Уметь - Использовать уравнение Гамильтона-Якоби-Беллмана для теоретического решения и верификации решений в непрерывном времени - Использовать принцип максимума для верификации решений задач оптимального управления - Использовать численные алгоритмы для решения задачи оптимальной остановки и оптимального управления
Планируемые результаты обучения
- Студенты умеют - Ставить задачу оптимального управления на основе неформальной постановки - Определять подходящую методологию для решения задачи - Проводить декомпозицию наблюдаемых и ненаблюдаемых значений - Изучать современную научную литературу по задачам оптимальной остановки и оптимального управления
Содержание учебной дисциплины
- Задачи детерминированного и стохастического управления
- Динамическое программирование и принцип максимума Понтрягина в детерминированных задачах
- Принцип динамического программирования для стохастического управления
- Задача оптимальной остановки: теоретические основы
- Задача линейного регулятора с квадратичным критерием (LQR) в стохастической постановке
- Обзор задач финансовой математики, формулируемых как задачи оптимального управления
- Случай ненаблюдаемых состояний: декомпозиция системы
- Алгоритм фильтрации Калмана
- Управление на основе предсказаний (Model-Predictive Control, MPC)
- RL-flashback: обучение с подкреплением против методологии оптимального управления
- Секция студенческих докладов
Элементы контроля
- Домашнее задание 1Набор теоретических задач и практический ipython-ноутбук для упражнений с базовой методологией в детерминированной и простой стохастической постановке. Выдаётся в двух частях: часть 1 между неделями 1-2 и часть два между неделями 2-3. На выполнение задания даётся 10 дней с момента выдачи части 2 + 7 дней периода сдачи со штрафом -30%.
- Домашнее задание 2Практический ipython-ноутбук для решения 2 больших задач стохастического управления. Выдаётся после недели 6. На выполнение задания даётся 14 дней + 7 дней периода сдачи со штрафом -30%.
- ДокладПодготовленное выступление с электронной презентацией в формате доклада с обзором предоставленной научной статьи. Даётся 20 минут на выступление и 20 минут на вопросы и обсуждения.
- Рецензия на докладКороткая рецензия на доклад, озвучиваемая после доклада во время обсуждений, содержащая развёрнутую обратную связь по следующим критериям: Эффективность доклада ( например, где можно добавить деталей, а где немного поменять изложение). Полнота раскрытия темы (степень разобранности статьи). Также рецензия должна включать в себя два содержательных вопроса по материалам доклада и статьи.
- ЭкзаменЭкзамен проводится в устной форме. Студенту даётся теоретический и практический вопрос (задача), а также 2 дополнительных вопроса в рамках программы экзамена. Список теоретических вопросов содержится в программе экзамена, которая публикуется примерно после недели 11. Список практических вопросов не публикуется.
Промежуточная аттестация
- 2026/2027 2nd moduleОитог = 0.25ДЗ1 + 0.25ДЗ2 + 0.5Экз + 0.2Доклад + 0.05Рецензия, при этом если получается оценка выше 10, то выставляется 10. Округляется только итоговая оценка с использованием арифметического округления.
Список литературы
Рекомендуемая основная литература
- Bernt Øksendal. (2010). Stochastic Differential Equations : An Introduction with Applications (Vol. 6th ed. 2003). Springer.
- Ikeda, N., & Watanabe, S. (1981). Stochastic Differential Equations and Diffusion Processes. North Holland.
- Monte Carlo methods in financial engineering, Glasserman, P., 2003
Рекомендуемая дополнительная литература
- Stochastic control in discrete and continuous time, Seierstad, A., 2009