Магистратура
2026/2027





Продвинутое машинное обучение
Статус:
Курс обязательный (Прикладные нейросетевые технологии)
Где читается:
Факультет компьютерных наук
Когда читается:
2-й курс, 1 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
3
Контактные часы:
32
Программа дисциплины
Аннотация
Курс предназначен для углубленного изучения современных методов и алгоритмов машинного обучения. Студенты освоят продвинутые техники обработки данных, построения моделей глубокого обучения, оптимизации гиперпараметров и оценки качества моделей. Особое внимание уделяется работе с большими объемами данных, применению специализированных библиотек Python (TensorFlow, PyTorch, Scikit-Learn), созданию кастомизированных архитектур нейронных сетей и решению практических задач бизнеса и науки.
Цель освоения дисциплины
- Знать устройство корректного ML-эксперимента: эмпирический и популяционный риск, схемы валидации, источники утечек данных.
- Знать разложение ошибки на смещение и дисперсию и его связь со сложностью модели.
- Уметь строить и настраивать решающие деревья CART, включая критерии разбиения и апостериорную обрезку.
- Знать принципы бэггинга, Random Forest и ExtraTrees и уметь получать OOB-оценку качества
- Знать градиентный бустинг как функциональный градиентный спуск и уметь выводить псевдоостатки и значения листьев.
- Уметь применять современные реализации GBDT (XGBoost, LightGBM, CatBoost) и строить пайплайны кодирования признаков без утечки таргета.
- Уметь подбирать гиперпараметры случайным и байесовским поиском, применять Hyperband/ASHA и early stopping, вести трекинг экспериментов.
Планируемые результаты обучения
- различает эмпирический и популяционный риск и выбирает подходящую схему валидации;
- диагностирует утечки данных и объясняет роль смещения, дисперсии и отбора модели;
- объясняет построение CART, критерии разбиения и апостериорную обрезку дерева;
- объясняет снижение дисперсии в Bagging, Random Forest и ExtraTrees и строит OOB-оценку;
- интерпретирует градиентный бустинг как функциональный градиентный спуск и выводит формулы псевдоостатков и значений листьев;
- сравнивает XGBoost, LightGBM и CatBoost и строит пайплайны признаков без утечки таргета;
- подбирает гиперпараметры, применяет регуляризацию и ведёт историю экспериментов;
- оценивает калибровку вероятностей и выбирает порог с учётом функции потерь;
Содержание учебной дисциплины
- Надёжность ML-экспериментов: эмпирический и популяционный риск, схемы валидации, bias-variance trade-off и утечки данных
- CART: меры нечистоты, поиск разбиений, апостериорная обрезка, oblique trees
- Bagging, Random Forest и ExtraTrees: снижение дисперсии, рандомизация и OOB-оценка
- Gradient Boosting: аддитивная модель и функциональный градиентный спуск
- Современные GBDT и feature engineering: Taylorи Newton-boosting, XGBoost, LightGBM, CatBoost, target encoding, пайплайны
- HPO и регуляризация: случайный и байесовский поиск, Hyperband/ASHA, early stopping, трекинг экспериментов
- Интерпретируемость и готовность к деплою: SHAP, PDP/ICE, model cards, сериализация, инференс и мониторинг
- Калибровка, неопределённость и выбор порога: метод Платта, изотоническая регрессия, ECE, пороги принятия решений
Элементы контроля
- Промежуточные тесты-2 работы (ПТ1 и ПТ2)Тесты выдаются после лекций №4 и 7 и включают в себя вопросы исключительно по уже пройденному материалу. Срок выполнения каждого теста — 25 минут в начале лекции.
- Домашнее задание 1 - Деревья РешенийВыдаётся после лекции № 3, срок выполнения — 2 недели. Штрафы за нарушение срока сдачи — см. раздел «Формула оценки и пересдачи».
- Домашнее задание 2 - БустингВыдаётся после лекции № 5, срок выполнения — 2 недели. Штрафы за нарушение срока сдачи — см. раздел «Формула оценки и пересдачи».
- Домашнее задание 3 - Основные методы оценки важности признаков для ML моделейВыдаётся после лекции № 7, срок выполнения — 1 неделя. Штрафы за нарушение срока сдачи — см. раздел «Формула оценки и пересдачи».
- Бонусные задания на лекциях и семинарахВыдаются на семинарах в течение модуля; сроки сдачи объявляются на соответствующем семинаре.
- Финальный экзамен (ФЭ)Проводится дистанционно в экзаменационный период по расписанию образовательной программы.
Промежуточная аттестация
- 2026/2027 1st moduleИтог = Округление(0,5 × ДЗ + 0,1 × ПТ1 + 0,1 × ПТ2 + 0,3 × ФЭ), где ДЗ — средняя арифметическая оценка за три домашних задания, ПТ1 — оценка за первый промежуточный тест, ПТ2 - оценка за второй промежуточный тест, ФЭ — оценка за финальный экзамен. Все составляющие оцениваются по 10-балльной шкале. Блокирующие формы контроля Блокирующие формы контроля в курсе отсутствуют. При этом финальный экзамен даёт 30% итоговой оценки, поэтому студент, не сдающий экзамен, получает ФЭ = 0, и его итоговая оценка не может превышать 7 баллов из 10. Бонусные баллы Бонусные баллы, полученные за ответы на вопросы на лекциях и/или выполнение дополнительных заданий на семинарах, суммируются за весь модуль и распределяются равномерно. Сначала они добавляются к оценкам за домашние задания — равными долями к каждому из трёх ДЗ, при этом оценка за отдельное домашнее задание не может превысить 10 баллов. Если после этого у студента остаются нераспределенные бонусные баллы, а оценка ДЗ уже максимальна, остаток равномерно добавляется к оценкам за промежуточные тесты — равными долями к каждому из двух тестов, при этом оценка за отдельный тест также не может превысить 10 баллов. Баллы, оставшиеся после заполнения обеих составляющих до максимума, не учитываются. Штрафы за нарушение срока сдачи домашних заданий Просрочка менее 24 часов — оценка за работу умножается на 0,7. Просрочка от 24 до 48 часов — оценка за работу умножается на 0,5. Просрочка 48 часов и более — работа не принимается и оценивается в 0 баллов.
Список литературы
Рекомендуемая основная литература
- 9780262046824 - Kevin P. Murphy - Probabilistic Machine Learning - 2022 - MIT Press - https://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=2932689 - nlebk - 2932689
- An Introduction to Statistical Learning, with Applications in R, Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, The Editor(s) (if applicable) and The Author(s), under exclusive license to Springer Science+Business Media, LLC, part of Springer Nature 2021, 978-1-0716-1418-1, published: 29 July 2021
- Hastie, T., Tibshirani, R., Friedman, J. The elements of statistical learning: Data Mining, Inference, and Prediction. – Springer, 2009. – 745 pp.
Рекомендуемая дополнительная литература
- Leo Breiman. (2001). Statistical modeling: the two cultures. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsbas&AN=edsbas.F84D2102