Бакалавриат
2026/2027





Научно-исследовательский семинар "Генеративные модели ИИ в биологии"
Статус:
Курс обязательный (Когнитивная нейробиология)
Кто читает:
Базовая кафедра Института биоорганической химии им. академиков М.М. Шемякина и Ю.А. Овчинникова РАН
Где читается:
Факультет биологии и биотехнологии
Когда читается:
3-й курс, 3, 4 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
4
Контактные часы:
60
Программа дисциплины
Аннотация
НИС «Генеративные модели ИИ в биологии» посвящен внедрению современных технологий искусственного интеллекта в биологические исследования и практику. Участники курса познакомятся с основами генеративных моделей и их применением для решения актуальных задач в области биологии, включая анализ геномных данных и обработку биологических и медицинских изображений.
Цель освоения дисциплины
- • сформировать у слушателей практических и систематических навыков анализа биомедицинских данных; • сформировать представления о применении современных технологий обработки биомедицинской информации; • познакомить слушателей с основными принципами и приёмами статистической обработки данных • научить слушателей основным понятиям и постановкам задач машинного обучения, возникающих в биологических и биомедицинских задачах; • дать теоретические основы ключевых методов машинного обучения; • познакомить с принципами построения композиций моделей машинного обучения; • познакомить с основными метриками качества для регрессии и классификации; • научить выполнять полный цикл построения модели; • научить обучать основные модели машинного обучения, оценивать их качество; • научить выполнять кластеризацию и визуализацию данных; • дать базовые знания об архитектурах искусственных нейронных сетей, базовых методах их обучения и оценки качества.
Планируемые результаты обучения
- Студент проводит описательный анализ медицинских данных, вычисляя основные описательные характеристики исследуемых величин: среднее, стандартное отклонение, дисперсия, доверительные интервалы, ошибки среднего, медиана, квартили и др.
- Студент проводит обработку выбросов различными методами (методы 1.5 IQR и 2 STD / 3 STD), строит интерактивные графики разных типов (гистограммы, диаграммы рассеяния, графики ящики-усы, графики средних с ошибками, линейные графики, матрицы корреляций и др).
- Студент корректно поводит корреляционный анализ и содержательно интерпретирует коэффициенты корреляции на основе шкалы Чеддока.
- Студент корректно использует для практического анализа данных библиотеки NumPy и Pandas, проводит с их помощью основные операции над массивами и таблицами данных.
- Студент оценивает законы распределения случайных величин, проводит точечное и интервальное оценивание числовых характеристик случайных величин.
- Студент ставит и проверяет статистические гипотезы различного вида о законах и о параметрах распределения, вычисляя уровень статистической значимости, проводит различные статистические тесты: парный, двух- и одновыборочный t-тесты, U-тест Манна–Уитни, одновыборочный Z-тест, Z-тест для пропорций.
- Студент владеет критерием хи-квадрат и адекватно оценивает границы его применимости.
- Студент проводит простейший дисперсионный анализ биологических и медицинских данных.
- Студент формулирует основные концепции и принципы, связанные с построением элементарных нейросетевых моделей, описывает модель МакКаллока-Питтса как линейный классификатор, формулирует модель перцептрона Розенблатта.
- Студент формулирует определение и свойства функций активации, описывает проблему полноты, задачу исключающего или, формулирует алгоритм обратного распространения ошибок, обосновывает полноту двухслойных сетей в пространстве булевых функций.
- Студент настраивает и применяет в практических задачах библиотеку PyTorch, использует torch.Tensor для основных операций над тензорами.
- Студент имплементирует с помощью PyTorch базовые модели машинного обучения: линейную регрессию и многослойный перцептрон, обучает MLP для задач классификации.
- Студент корректно формулирует свойства задачи кластеризации и соответствующие метрики качества, использует методы K-Means, графовые методы кластеризации, методы иерархическое кластеризации, а также метод DBSCAN и прочие методы, основанные на плотности.
- Студент проводит снижение размерности задач, а также факторный анализ с помощью метода главных компонент.
- Студент реализует различные алгоритмы кластеризации на Python (K-means, иерархическая кластеризация, DBSCAN).
- Студент формулирует основные концепции и определения, связанные с решающими деревьями, описывает общий алгоритм построения решающих деревьев и формулирует критерии информативности, ветвления и останова.
- Студент применяет модели деревьев для задач классификации и регрессии.
- Студент формулирует основные подходы, концепции и понятия, связанные с композицией алгоритмов: базовый алгоритм, корректирующая операция, голосование (простое, взвешенное), бутстрап, бэггинг и бустинг.
- Студент строит основные композиции алгоритмов на основе базовых алгоритмов решающих деревьев и имплементирует их с помощью библиотек catboost и xgboost.
- Студент ставит и решает задачи классификации, обучая линейные классификаторы с различными метриками качества, проводит оценку точности различными методами (матрица ошибок, точность, полнота и F-мера; Area Under Curve (AUC), кривая receiver operating characteristic (ROC-кривая); Precison-recall кривая).
- Студент формулирует и обучает линейные модели регрессии с различными функциями потерь и способами регуляризации, проводит для них оценку обобщающей способности и кросс-валидацию и содержательно интерпретирует оценки коэффициентов.
- Студент ориентируется в основных типах задач машинного обучения, проводит классификацию задачи и выбирает подходящий метод машинного обучения для его решения; формулирует основные термины и концепции машинного обучения (объекты и признаки, типы шкал, модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, переобучение и недообучение).
- Студент умеет решать простейшие задачи машинного обучения с помощью библиотеки scikit-learn
Содержание учебной дисциплины
- Введение в анализ данных
- Основы математической статистики
- Введение в машинное обучение. Основные термины, постановки задач и примеры применения.
- Регрессионные методы и модели
- Методы классификации.
- Решающие деревья и композиции моделей
- Обучение без учителя и кластеризация
- Основы искусственных нейронных сетей
Элементы контроля
- Итоговая контрольная работа
- Семинарская активность
- Домашние задания
- Экзаменационная работа
Промежуточная аттестация
- 2026/2027 4th module0.025 * Семинарская активность + 0.025 * Домашние задания + 0.7 * Итоговая контрольная работа + 0.2 * Экзаменационная работа
Список литературы
Рекомендуемая основная литература
- Python для сложных задач: наука о данных и машинное обучение. - 978-5-4461-0914-2 - Плас Дж. Вандер - 2021 - Санкт-Петербург: Питер - https://ibooks.ru/products/376830 - 376830 - iBOOKS
- Python и анализ данных : первичная обработка данных с применением pandas, NumPy и Jupiter, Маккинни, У., 2023
- Python и анализ данных, Маккинни, У., 2015
- PyTorch : освещая глубокое обучение, Стивенс, Э., 2022
- Бизнес, статистика и котики, Савельев, В. В., 2023
- Машинное обучение с помощью Python : руководство для специалистов по работе с данными, Мюллер, А., 2022
- Машинное обучение. - 978-5-496-02989-6 - Бринк Хенрик, Ричардс Джозеф, Феверолф Марк - 2018 - Санкт-Петербург: Питер - https://ibooks.ru/products/355472 - 355472 - iBOOKS
- Наумов, В. Н. Анализ данных и машинное обучение. Методы и инструментальные средства : учебное пособие / В. Н. Наумов. — Москва : Дело РАНХиГС, 2020. — 260 с. — ISBN 978-5-89781-667-5. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/466085 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.
- Теория вероятностей и математическая статистика. Оценка параметров распределений : учебное пособие, Иванов, А. В., 2009