• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Диссертации, представленные на защиту и подготовленные в НИУ ВШЭ

Сортировка:по дате защитыпо имени научного руководителяпо имени соискателя

Показаны работы: 1 - 3 из 3

Трансформеры в условиях ограниченных ресурсов: масштабируемость и эффективность обучения и инференсаКандидатская диссертацияУченая степень НИУ ВШЭ

Соискатель:
Мезенцев Глеб Владимирович
Руководитель:
Оселедец Иван Валерьевич
Дисс. совет:
Совет по компьютерным наукам
Дата защиты:
16.06.2026
Трансформеры широко применяются для моделирования последовательностей, однако по мере роста размера моделей и объёмов данных, их обучение и применение требуют всё больше вычислительных ресурсов и всё чаще упираются в практические ограничения. В реальных условиях вычислительные ресурсы и доступная память всегда конечны, поэтому повышение эффективности важно как для научных исследований, так и для промышленного использования.

В диссертации предлагаются методы повышения эффективности моделей на основе трансформеров, направленные на снижение затрат видеопамяти и уменьшение времени выполнения при сохранении конкурентоспособного качества моделей. Подходы оцениваются в задачах обработки естественного языка (NLP) и рекомендательных систем (RecSys) - двух прикладных областях крупномасштабного моделирования последовательностей. Во-первых, предлагается метод параметроэффективного дообучения (PEFT), который разреживает обновления линейных преобразований в MLP: обновления переносятся в более информативное низкоразмерное пространство, благодаря чему в ходе дообучения изменяется лишь небольшая структурированная часть весов модели. Во-вторых, вводятся два метода обучения для последовательных рекомендаций при большом каталоге, использующие стохастические аппроксимации целевой функции кросс-энтропии, что делает оптимизацию масштабируемой. Наконец, исследуется феномен неавторегрессионного декодирования в авторегрессионных больших языковых моделях: выявляются и анализируются внутренние представления, обеспечивающие возможность такого поведения. Эксперименты в NLP и RecSys показывают, что предложенные подходы устойчиво превосходят сильные базовые методы при сопоставимых вычислительных бюджетах.
Диссертация [*.pdf, 12.25 Мб] (дата размещения 10.02.2026)
Резюме [*.pdf, 2.06 Мб] (дата размещения 10.02.2026)
Summary [*.pdf, 2.03 Мб] (дата размещения 10.02.2026)

Оценка неопределенности в задачах обработки естественного языкаКандидатская диссертацияУченая степень НИУ ВШЭ

Соискатель:
Важенцев Артем Андреевич
Руководитель:
Панченко Александр Иванович
Дисс. совет:
Совет по компьютерным наукам
Дата защиты:
21.11.2025
Uncertainty quantification (UQ) has emerged as a promising approach for addressing several key challenges in natural language processing (NLP), particularly in mitigating the risks of errors in text classification and detecting hallucinations or low-quality outputs in text generation. Although UQ is a rapidly growing field within classification tasks, state-of-the-art methods often show poor performance or underperform trivial methods for ambiguous tasks such as toxicity detection. Furthermore, despite significant progress in UQ techniques for text classification tasks, applying UQ to large language models (LLMs) introduces additional complexity due to the conditional dependency between generation steps and the varying influence of tokens on the predictions in autoregressive models. As a result, many UQ techniques that are effective for classification models are either ineffective or not directly applicable to LLMs. This thesis addresses these challenges by developing novel methods for robust uncertainty quantification for both text classification and text generation tasks. For classification tasks, we propose a hybrid approach that combines both epistemic and aleatoric uncertainty, outperforming existing methods and providing a more reliable selective classification. For LLMs, we introduce several innovative techniques that leverage attention-based features or token embeddings to quantify uncertainty effectively. These methods are designed to handle the sequential and conditional nature of LLM outputs, enabling improved selective generation and fact-checking.
Диссертация [*.pdf, 5.47 Мб] (дата размещения 19.09.2025)
Резюме [*.pdf, 1.56 Мб] (дата размещения 19.09.2025)
Summary [*.pdf, 1.53 Мб] (дата размещения 19.09.2025)

Методы оценивания языковых моделей в задачах понимания естественного языкаКандидатская диссертацияУченая степень НИУ ВШЭ

Руководители
Шаврина Татьяна Олеговна, Воронцов Константин Вячеславович
Дисс. совет:
Совет по компьютерным наукам
Дата защиты:
12.10.2023
В связи с бурным развитием языкового моделирования и языковых моделей на основе архитектуры «Трансформер», особую актуальность приобретают вопросы, связанные с оценкой языковых моделей и того, насколько хорошо они понимают естественный язык. Возникает необходимость в разработке методов количественного оценивания языковых моделей, а также в разработке систем тестов и инструментов, с помощью которой можно оценивать те или иные аспекты языкового моделирования и сравнивать модели между собой. В данном исследовании предложен метод оценивания устойчивости языковых моделей в задаче распознавания причинно-следственных связей. В работе разработана методология для мультиязычного оценивания моделей на пяти языках и проведено оригинальное исследование стабильности мультиязычной модели BERT в задаче распознавания причинно-следственных связей. Помимо этого, в рамках создания первого русскоязычного набора тестов на понимание естественного языка в работе представлен фреймворк для оценивания языковых моделей на данном наборе тестов, с помощью которого проведено оригинальное исследование по оцениванию ряда предобученных моделей архитектуры BERT для русского языка.
Диссертация [*.pdf, 20.69 Мб] (дата размещения 27.07.2023)
Резюме [*.pdf, 865.79 Кб] (дата размещения 27.07.2023)
Summary [*.pdf, 752.14 Кб] (дата размещения 27.07.2023)