Бакалавриат
2026/2027





Прикладные методы анализа данных при создании информационно-аналитических систем
ID 1119999
Статус:
Курс обязательный (Информатика и вычислительная техника)
Когда читается:
4-й курс, 1-3 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Новиков Роман Сергеевич
Язык:
русский
Кредиты:
8
Контактные часы:
76
Программа дисциплины
Аннотация
Учебная дисциплина посвящена изучению возможностей и ограничений математического аппарата (машинного обучения и статистических методов), изучению опыта использования алгоритмов анализа данных при разработке и реализации информационно-аналитических систем (ИАС) в различных экономических сферах.
Курс включает в себя изучение постановки и решения задач методами анализа данных, подготовке данных к использованию математическими моделями, изучение особенностей и этапов применения данных, методов анализа данных (линейные модели, логические модели, ансамбли, нейронные сети) при создании ИАС, в том числе на языке программирования Python.
Пререквизиты: линейная алгебра, теория вероятностей и математическая статистика; базовое программирование на Python; базовые понятия машинного обучения.
Цель освоения дисциплины
- Развитие и закрепление практических навыков в построении математического обеспечения информационно-аналитических систем, включающих интеллектуальную обработку данных
- Приобретение студентами знаний о применении различных статистических, математических методов анализа данных
- Приобретение студентами навыка разработки и построения математического обеспечения корпоративных обучаемых экспертных систем, используемых для поддержки принятия решений
Планируемые результаты обучения
- Объясняет общие принципы построения и цели создания информационно-аналитических систем для решения прикладных задач.
- Различает и выявляет типы данных, пропуски, аномалии и выбросы в рамках описательного анализа
- Преобразовывает переменные, обрабатывает пропуски и выбросы, используя общие возможности Python для предобработки данных
- Рассчитывает и решает задачи балансировки классов и оптимизации гиперпараметров классических моделей ML
- Сравнивает метрики качества для оценки эффективности моделей линейной и логистической регрессии, деревьев решений
- Различает и распознаёт типы задач, для решения которых применяются бэггинг, бустинг, методы кластеризации и KNN.
- Объясняет принципы работы ансамблевых методов (бэггинг, бустинг), методов снижения размерности и кластеризации
- Рассчитывает расстояния для метода ближайших соседей и преобразовывает данные для снижения размерности
- Аргументирует выбор конкретного алгоритма машинного обучения и его конфигурации для решения поставленной бизнес-задачи
- Разрабатывает скрипты с использованием MLflow для трекинга экспериментов
- Объясняет базовые принципы работы и архитектуры нейронных сетей (сверточных) и основ причинного вывода (uplift-моделирование)
- Прогнозирует потенциальный эффект (uplift) от маркетинговых вмешательств, используя методы причинного вывода
- Сравнивает подходы к построению рекомендательных систем (коллаборативная фильтрация, контентно-ориентированные) и взвешивает их альтернативы
- Доказывает результативность своего решения в ходе презентации итоговой исследовательской работы, обосновывая выбор методов и интерпретируя полученные результаты
- Объясняет жизненный цикл ML-модели и принципы MLOps в ИАС
- Ведёт эксперименты в MLflow и обеспечивает воспроизводимость решения
- Настраивает мониторинг качества моделей, отслеживает дрейф
Содержание учебной дисциплины
- Основы построения ИАС, подготовка данных и классические модели MLВ ходе изучения данного раздела студент в рамках самостоятельной работы студент начнет работу над индивидуальной исследовательской работой в качестве собственного сквозного кейса: постановка задачи и поиск данных, предварительный анализ и обработка данных, моделирование и оценка моделей
- Построение классических моделей машинного обученияВ ходе изучения данного раздела студент продолжает работу над индивидуальной исследовательской работой как сквозным кейсом: дополнительный анализ и обработка данных, моделирование и оценка более сложных моделей (ансамбли), интерпретация работы модели.
- Некоторые продвинутые подходы к решению специализированных задач анализа данныхВ ходе изучения данного раздела студент продолжает работу над индивидуальной исследовательской работой как сквозным кейсом: постановка дополнительной задачи, дополнительный анализ и обработка данных, моделирование и оценка специализированных моделей.
- MLOps и продуктивизация моделейВ ходе изучения данного раздела студент завершает работу над индивидуальной исследовательской работой как сквозным кейсом: ведение экспериментов, упаковка лучшей модели в контейнер, разворачивание сервиса, оформление аналитического отчета и доклад с презентацией.
Элементы контроля
- Индивидуальная письменная исследовательская работа и доклад по ее результатам с презентациейПостановка задачи: студент согласует свою бизнес-задачу с преподавателем, формулирует цель, метрику успеха, ограничения. Исходные данные: согласованный обезличенный реальный набор данных (таблица). Требуемые артефакты: скрипты с EDA, обучением и оценкой моделей; отчёт по шаблону; презентация. Данная работа является сквозным кейсом, над которым студент будет работать на протяжений всей дисциплины. Студент может выбирать по согласованию с преподавателем: - тему - тип итоговой задачи: классификация/регрессия, uplift/рекомендации/прогноз временного ряда - данные
- АктивностьПреподаватель оценивает участие и общую активность студентов на практических занятиях (дискуссии и обсуждения). На практических занятиях предусмотрено тестирование на 10-15 минут по пройденному материалу. Тест состоит из 10-15 вопросов с вариантами ответа.
- ЭкзаменЭкзамен проводится в виде ответа на теоретические вопросы по пройденным материалам из билета перед преподавателем. Каждый студент получает билет с 2 вопросами. На подготовку к ответу дается 40 минут. По желанию студента возможен досрочный ответ.
Промежуточная аттестация
- 2026/2027 2nd module0.5 * Активность
- 2026/2027 3rd module0.1 * Активность + 0.4 * Индивидуальная письменная исследовательская работа и доклад по ее результатам с презентацией + 0.5 * Экзамен
Список литературы
Рекомендуемая основная литература
- Data Science : наука о данных с нуля, Грас, Дж., 2018
- Data science for business : what you need to know about data mining and data-analytic thinking, Provost, F., 2013
- Python и анализ данных : первичная обработка данных с применением pandas, NumPy и Jupiter, Маккинни, У., 2023
Рекомендуемая дополнительная литература
- Введение в автоматизированное машинное обучение (AutoML) - Хуттер Ф., Коттхофф Л., Ваншорен Х. - Издательство "ДМК Пресс" - 978-5-93700-196-2 - 2023 - русский - https://e.lanbook.com/book/348104 - ЛАНЬ - 348104