• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
2026/2027

Дополнительные архитектуры генеративного искусственного интеллекта

ID 1134906

Статус: Маго-лего
Когда читается: 1 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 28

Программа дисциплины

Аннотация

Дисциплина посвящена изучению современных архитектур и методов генерации, выходящих за рамки классического трансформера. В рамках курса рассматриваются авторегрессионные модели, линейное внимание, рекуррентные и гибридные архитектуры, разреженное внимание, а также диффузионные модели и методы flow matching. Особое внимание уделяется анализу вычислительной стоимости генерации с точки зрения объёма используемой памяти и количества проходов нейронной сети. Дисциплина направлена на формирование практических навыков реализации генеративных механизмов на чистом PyTorch, профилирования моделей, анализа научных статей, сравнения различных целей обучения и экспериментальной проверки архитектурных гипотез в условиях ограниченного вычислительного бюджета.
Цель освоения дисциплины

Цель освоения дисциплины

  • Изучение современных архитектур и методов генерации в нейросетевых моделях, включая авторегрессионные, линейные и диффузионные подходы.
  • Формирование навыков анализа вычислительной эффективности генеративных архитектур, их реализации на чистом PyTorch, экспериментальной проверки архитектурных гипотез и интерпретации результатов исследований.
Планируемые результаты обучения

Планируемые результаты обучения

  • Знание принципов авторегрессионной и диффузионной генерации, а также особенности архитектур, альтернативных классическому трансформеру
  • Понимание взаимосвязи между архитектурой модели, объёмом используемой памяти, количеством проходов сети и качеством генерации
  • Умение выводить, реализовывать и проверять эквивалентность различных форм вычисления линейного оператора
  • Умение реализовывать на чистом PyTorch механизмы линейного внимания, включая механизмы забывания, гейты и вычисления в половинной точности
  • Умение объяснять принципы работы и сравнивать архитектуры Mamba, RWKV, RetNet, Hyena, гибридные модели и модели с разреженным вниманием
  • Знание основных подходов к обучению диффузионных моделей, включая flow matching, rectified flow и score matching, и уметь реализовывать соответствующие функции потерь
  • Умение обучать и оценивать генеративные модели, исследовать влияние количества проходов сети на качество генерации и профилировать использование памяти и скорость работы
  • Умение анализировать научные статьи, формулировать и проверять архитектурные гипотезы с учётом baseline, метрик и ресурсного бюджета
  • Умение интерпретировать результаты экспериментов и представлять выводы, в том числе при отрицательном результате
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Современные подходы к генерации и вычислительная стоимость генеративных моделей: память, KV-кэш и количество проходов сети
  • Подготовка и защита командного проекта
  • Профилирование моделей, исследование вычислений в fp16 и сравнение различных целей обучения
  • Анализ научных статей и экспериментальная проверка архитектурных гипотез в условиях заданного ресурсного бюджета
  • Единая система сравнения генеративных архитектур
  • Диффузионные языковые модели и малошаговая генерация
  • Диффузионные модели, flow matching, rectified flow и score matching
  • Архитектура DiT, управление генерацией и методы сокращения числа шагов.
  • Авторегрессионная генерация и переход от классического внимания к линейному
  • Рекуррентная, параллельная и поблочная формы вычисления линейного оператора
  • Состояние модели, механизмы его обновления, забывания и гейты
  • Архитектуры Mamba, RWKV, RetNet и Hyena
  • Гибридные архитектуры, длинные свёртки и разреженное внимание
  • Практическая реализация механизмов линейного внимания и генеративных моделей на чистом PyTorch
Элементы контроля

Элементы контроля

  • неблокирующий Домашнее задание
    Каждая домашняя работа выдаётся на одну неделю. После дедлайна работа принимается ещё в течение 72 часов со снижением оценки: ● опоздание до 24 часов — минус 20%; ● опоздание от 24 до 48 часов — минус 40%; ● опоздание от 48 до 72 часов — минус 60%; ● более 72 часов — работа не принимается.
  • неблокирующий Домашнее задание
    Каждая домашняя работа выдаётся на одну неделю. После дедлайна работа принимается ещё в течение 72 часов со снижением оценки: ● опоздание до 24 часов — минус 20%; ● опоздание от 24 до 48 часов — минус 40%; ● опоздание от 48 до 72 часов — минус 60%; ● более 72 часов — работа не принимается.
  • неблокирующий Проект
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 1st module
    0.4 * Проект + 0.3 * Домашнее задание + 0.3 * Домашнее задание
Список литературы

Список литературы

Рекомендуемая основная литература

  • 19213 - Глубокое обучение - А.Гудфеллоу; А.Курвилль; И.Бенджио - ДМК Пресс - 9785970606186 - 2018 - https://hse.alpinadigital.ru/document/19213 - Alpina
  • Мясников, В. В. Распознавание образов и машинное обучение. Основные подходы : учебное пособие / В. В. Мясников. — Самара : Самарский университет, 2023. — 196 с. — ISBN 978-5-7883-1929-2. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/406508 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.

Рекомендуемая дополнительная литература

  • Ферлитш, Э. Шаблоны и практика глубокого обучения / Э. Ферлитш , перевод с английского А. В. Логунова. — Москва : ДМК Пресс, 2022. — 538 с. — ISBN 978-5-93700-113-9. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/241199 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.