Бакалавриат
2026/2027


Компьютерное зрение
Статус:
Курс обязательный (Прикладная математика)
Кто читает:
Департамент прикладной математики
Когда читается:
4-й курс, 3 модуль
Охват аудитории:
для всех кампусов НИУ ВШЭ
Язык:
русский
Кредиты:
5
Контактные часы:
68
Программа дисциплины
Аннотация
Курс посвящен современным методам и алгоритмам компьютерного зрения и обработки изображений и видео. Рассматриваются как классические подходы (предобработка, выделение признаков и методы классификации на признаках), так и нейросетевые методы на основе сверточных и трансформерных архитектур, включая мультимодальные модели. Существенное внимание уделяется математическим основам ключевых методов и практическим аспектам построения воспроизводимых пайплайнов: подготовке данных, обучению, оценке качества и применению моделей в Python (PyTorch, OpenCV). В рамках курса изучаются задачи классификации и сегментации изображений, детекции объектов на изображении, а также генеративные модели для синтеза и преобразования изображений (VAE/VQ-VAE, GAN, диффузионные модели), методы их адаптации и управления генерацией.
Цель освоения дисциплины
- Понимание классических и современных методов и моделей компьютерного зрения для решения прикладных задач
Планируемые результаты обучения
- Владеет навыками решения задач компьютерного зрения и может реализовывать решения на языке Python с использованием библиотек машинного обучения и обработки изображений (PyTorch, OpenCV). Знает основные постановки задач компьютерного зрения
- Знает процесс формирования изображений, а также способы представления, хранения и сжатия изображений и видео. Владеет базовыми методами обработки изображений: преобразованием значений яркости, фильтрами, морфологическими операциями, геометрическими преобразованиями.
- Знает основные методы компьютерного зрения и этапы классического пайплайна обработки: предобработку, выделение признаков (границы, гистограммы, HOG, дескрипторы), применение классических моделей поверх признаков (SVM, kNN, деревья решений, каскады), постобработку результатов.
- Знает основные методы компьютерного зрения и этапы классического пайплайна обработки: предобработку, выделение признаков (границы, гистограммы, HOG, дескрипторы), применение классических моделей поверх признаков (SVM, kNN, деревья решений, каскады), постобработку результатов
- Знает основные типы свёрток и ключевые архитектуры на их основе для задач компьютерного зрения. Понимает механизм внимания и трансформерные архитектуры для компьютерного зрения.
- Применяет для базовых задач основные методы машинного обучения и глубокого обучения в компьютерном зрении: классификацию изображений, детекцию объектов и сегментацию изображений.
- Понимает принципы метрического обучения. Знает устройство, принципы обучения и способы применения базовых моделей CLIP и DINO.
- Знает особенности решения задачи распознавания текста (OCR) с помощью нейросетей: одностадийные и двухстадийные подходы, CTC loss.
- Понимает принципы и математические основы вариационных автоэнкодеров (VAE) и векторно-квантованных вариационных автоэнкодеров (VQ-VAE).
- Знает устройство и принципы обучения авторегрессионных моделей для генерации изображений, в частности DALL-E.
- Понимает принципы генеративно-состязательных сетей (GAN) и их теоретические основы, а также типичные сложности обучения GAN и применяемые функции потерь (WGAN-GP, hinge loss). Знает устройство и принципы обучения StyleGAN и подход CycleGAN для кросс-доменного преобразования изображений.
- Применяет принципы диффузионных моделей в задачах компьютерного зрения. Владеет навыками файнтюнинга (текстовой инверсией, prompt tuning, LoRA, DreamBooth) и методами управления генерацией (ControlNet, IP-Adapter).
- Понимает устройство мультимодальных моделей и применяет принципы обучения мультимодальных моделей на практике.
- Владеет инструментами практической разработки в области компьютерного зрения и строит воспроизводимые рабочие пайплайны для прикладных задач: подготовки данных, обучения, оценки качества, внедрения/инференса.
Содержание учебной дисциплины
- Введение в компьютерное зрение. Основы обработки изображений
- Классические методы в компьютерном зрении
- Работа с видео
- Операция свертки. Сверточные нейронные сети
- Обзор архитектур нейросетей. Подготовка датасета
- Классификация изображений. Постановка задачи классификации изображений
- Метрическое обучение
- Разбор базовых моделей Clip и DINO
- Детекция объектов на изображении. Постановка задачи локализации объекта на изображении
- Сегментация изображений. Постановка задачи сегментации изображений
- Распознавание текста
- Генеративно-состязательные сети GAN. Методы оценки качества изображений
- Автоэнкодеры и вариационные автоэнкодеры
- Векторно-квантованные вариационные автоэнкодеры и авторегрессионные модели для генерации изображений
- Генерация реалистичных изображений с помощью диффузионного подхода
- Файнтюнинг диффузионных моделей. Оптимизация инференса моделей
- Мультимодальные модели