• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Компьютерное зрение

Статус: Курс обязательный (Прикладная математика)
Когда читается: 4-й курс, 3 модуль
Охват аудитории: для всех кампусов НИУ ВШЭ
Язык: русский
Кредиты: 5
Контактные часы: 68

Программа дисциплины

Аннотация

Курс посвящен современным методам и алгоритмам компьютерного зрения и обработки изображений и видео. Рассматриваются как классические подходы (предобработка, выделение признаков и методы классификации на признаках), так и нейросетевые методы на основе сверточных и трансформерных архитектур, включая мультимодальные модели. Существенное внимание уделяется математическим основам ключевых методов и практическим аспектам построения воспроизводимых пайплайнов: подготовке данных, обучению, оценке качества и применению моделей в Python (PyTorch, OpenCV). В рамках курса изучаются задачи классификации и сегментации изображений, детекции объектов на изображении, а также генеративные модели для синтеза и преобразования изображений (VAE/VQ-VAE, GAN, диффузионные модели), методы их адаптации и управления генерацией.
Цель освоения дисциплины

Цель освоения дисциплины

  • Понимание классических и современных методов и моделей компьютерного зрения для решения прикладных задач
Планируемые результаты обучения

Планируемые результаты обучения

  • Владеет навыками решения задач компьютерного зрения и может реализовывать решения на языке Python с использованием библиотек машинного обучения и обработки изображений (PyTorch, OpenCV). Знает основные постановки задач компьютерного зрения
  • Знает процесс формирования изображений, а также способы представления, хранения и сжатия изображений и видео. Владеет базовыми методами обработки изображений: преобразованием значений яркости, фильтрами, морфологическими операциями, геометрическими преобразованиями.
  • Знает основные методы компьютерного зрения и этапы классического пайплайна обработки: предобработку, выделение признаков (границы, гистограммы, HOG, дескрипторы), применение классических моделей поверх признаков (SVM, kNN, деревья решений, каскады), постобработку результатов.
  • Знает основные методы компьютерного зрения и этапы классического пайплайна обработки: предобработку, выделение признаков (границы, гистограммы, HOG, дескрипторы), применение классических моделей поверх признаков (SVM, kNN, деревья решений, каскады), постобработку результатов
  • Знает основные типы свёрток и ключевые архитектуры на их основе для задач компьютерного зрения. Понимает механизм внимания и трансформерные архитектуры для компьютерного зрения.
  • Применяет для базовых задач основные методы машинного обучения и глубокого обучения в компьютерном зрении: классификацию изображений, детекцию объектов и сегментацию изображений.
  • Понимает принципы метрического обучения. Знает устройство, принципы обучения и способы применения базовых моделей CLIP и DINO.
  • Знает особенности решения задачи распознавания текста (OCR) с помощью нейросетей: одностадийные и двухстадийные подходы, CTC loss.
  • Понимает принципы и математические основы вариационных автоэнкодеров (VAE) и векторно-квантованных вариационных автоэнкодеров (VQ-VAE).
  • Знает устройство и принципы обучения авторегрессионных моделей для генерации изображений, в частности DALL-E.
  • Понимает принципы генеративно-состязательных сетей (GAN) и их теоретические основы, а также типичные сложности обучения GAN и применяемые функции потерь (WGAN-GP, hinge loss). Знает устройство и принципы обучения StyleGAN и подход CycleGAN для кросс-доменного преобразования изображений.
  • Применяет принципы диффузионных моделей в задачах компьютерного зрения. Владеет навыками файнтюнинга (текстовой инверсией, prompt tuning, LoRA, DreamBooth) и методами управления генерацией (ControlNet, IP-Adapter).
  • Понимает устройство мультимодальных моделей и применяет принципы обучения мультимодальных моделей на практике.
  • Владеет инструментами практической разработки в области компьютерного зрения и строит воспроизводимые рабочие пайплайны для прикладных задач: подготовки данных, обучения, оценки качества, внедрения/инференса.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в компьютерное зрение. Основы обработки изображений
  • Классические методы в компьютерном зрении
  • Работа с видео
  • Операция свертки. Сверточные нейронные сети
  • Обзор архитектур нейросетей. Подготовка датасета
  • Классификация изображений. Постановка задачи классификации изображений
  • Метрическое обучение
  • Разбор базовых моделей Clip и DINO
  • Детекция объектов на изображении. Постановка задачи локализации объекта на изображении
  • Сегментация изображений. Постановка задачи сегментации изображений
  • Распознавание текста
  • Генеративно-состязательные сети GAN. Методы оценки качества изображений
  • Автоэнкодеры и вариационные автоэнкодеры
  • Векторно-квантованные вариационные автоэнкодеры и авторегрессионные модели для генерации изображений
  • Генерация реалистичных изображений с помощью диффузионного подхода
  • Файнтюнинг диффузионных моделей. Оптимизация инференса моделей
  • Мультимодальные модели
Элементы контроля

Элементы контроля

  • неблокирующий Практическая работа 1
  • неблокирующий Практическая работа 2
  • блокирующий Экзамен
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    Практическая работа: Практическая работа 1 * 0.300 + Практическая работа: Практическая работа 2 * 0.300 + Экзамен: Устный опрос * 0.400.

Авторы

  • Сластников Сергей Александрович
  • Юнышева Анастасия Владимировна
  • Князева Ирина Васильевна