Диссертации, представленные на защиту и подготовленные в НИУ ВШЭ
Сортировка:по дате защитыпо имени научного руководителяпо имени соискателя
Показаны работы: 1 - 1 из 1
Трансформеры в условиях ограниченных ресурсов: масштабируемость и эффективность обучения и инференсаКандидатская диссертацияУченая степень НИУ ВШЭ
Соискатель:
Мезенцев Глеб Владимирович
Руководитель:
Оселедец Иван Валерьевич
Дисс. совет:
Совет по компьютерным наукам
Дата защиты:
16.06.2026
Трансформеры широко применяются для моделирования последовательностей, однако по мере роста размера моделей и объёмов данных, их обучение и применение требуют всё больше вычислительных ресурсов и всё чаще упираются в практические ограничения. В реальных условиях вычислительные ресурсы и доступная память всегда конечны, поэтому повышение эффективности важно как для научных исследований, так и для промышленного использования.
В диссертации предлагаются методы повышения эффективности моделей на основе трансформеров, направленные на снижение затрат видеопамяти и уменьшение времени выполнения при сохранении конкурентоспособного качества моделей. Подходы оцениваются в задачах обработки естественного языка (NLP) и рекомендательных систем (RecSys) - двух прикладных областях крупномасштабного моделирования последовательностей. Во-первых, предлагается метод параметроэффективного дообучения (PEFT), который разреживает обновления линейных преобразований в MLP: обновления переносятся в более информативное низкоразмерное пространство, благодаря чему в ходе дообучения изменяется лишь небольшая структурированная часть весов модели. Во-вторых, вводятся два метода обучения для последовательных рекомендаций при большом каталоге, использующие стохастические аппроксимации целевой функции кросс-энтропии, что делает оптимизацию масштабируемой. Наконец, исследуется феномен неавторегрессионного декодирования в авторегрессионных больших языковых моделях: выявляются и анализируются внутренние представления, обеспечивающие возможность такого поведения. Эксперименты в NLP и RecSys показывают, что предложенные подходы устойчиво превосходят сильные базовые методы при сопоставимых вычислительных бюджетах.
В диссертации предлагаются методы повышения эффективности моделей на основе трансформеров, направленные на снижение затрат видеопамяти и уменьшение времени выполнения при сохранении конкурентоспособного качества моделей. Подходы оцениваются в задачах обработки естественного языка (NLP) и рекомендательных систем (RecSys) - двух прикладных областях крупномасштабного моделирования последовательностей. Во-первых, предлагается метод параметроэффективного дообучения (PEFT), который разреживает обновления линейных преобразований в MLP: обновления переносятся в более информативное низкоразмерное пространство, благодаря чему в ходе дообучения изменяется лишь небольшая структурированная часть весов модели. Во-вторых, вводятся два метода обучения для последовательных рекомендаций при большом каталоге, использующие стохастические аппроксимации целевой функции кросс-энтропии, что делает оптимизацию масштабируемой. Наконец, исследуется феномен неавторегрессионного декодирования в авторегрессионных больших языковых моделях: выявляются и анализируются внутренние представления, обеспечивающие возможность такого поведения. Эксперименты в NLP и RecSys показывают, что предложенные подходы устойчиво превосходят сильные базовые методы при сопоставимых вычислительных бюджетах.
Диссертация [*.pdf, 12.25 Мб] (дата размещения 10.02.2026)
Резюме [*.pdf, 2.06 Мб] (дата размещения 10.02.2026)
Summary [*.pdf, 2.03 Мб] (дата размещения 10.02.2026)