Диссертации, представленные на защиту и подготовленные в НИУ ВШЭ
Сортировка:по дате защитыпо имени научного руководителяпо имени соискателя
Показаны работы: 1 - 2 из 2
Методология тестирования способностей генеративных фундаментальных моделейКандидатская диссертацияУченая степень НИУ ВШЭ
Соискатель:
Руководитель:
Дисс. совет:
Совет по компьютерным наукам
Диссертационная работа Алены Сергеевны Феногеновой посвящена разработке комплексной методологии оценки генеративных фундаментальных моделей, в частности больших языковых моделей (БЯМ, англ. LLM), для русского языка. Актуальность исследования обусловлена стремительным развитием LLM, демонстрирующих беспрецедентные способности, и одновременным отсутствием объективных, воспроизводимых и методологически выверенных инструментов для их сравнения на русском языке. Существующие бенчмарки англоцентричны и не учитывают лингвистическую и культурную специфику нерусских языков, а их механический перевод приводит к систематическим искажениям и неадекватной оценке возможностей моделей.
В работе решается фундаментальная научная проблема, связанная с дефицитом всесторонней системы оценки LLM для русского языка. Автор анализирует эволюцию подходов к бенчмаркингу от классических тестов на понимание языка (Russian SuperGLUE) до первых бенчмарков для генеративных моделей (TAPE), выявляя их ключевые ограничения. На этой основе разработан и представлен новый, масштабный бенчмарк MERA, который включает более 20 задач в инструктивном формате, охватывающих 10 ключевых навыков — от базового понимания и экспертных знаний до программирования и этических оценок. Методологически MERA опирается на тесты с закрытыми ответами, что минимизирует риск «загрязнения» данных и обеспечивает высокую воспроизводимость и автоматизируемость результатов.
Основной вклад работы заключается не только в создании самого бенчмарка, но и в проведении масштабного тестирования: в рамках исследования было протестировано более 100 моделей и их конфигураций. Полученные результаты, сопоставленные с эталонными человеческими показателями, предоставили детализированную картину сильных и слабых сторон фундаментальных моделей.
Разработанные в диссертации методологические фреймворки, открытая кодовая база и лидерборд MERA стали де-факто стандартом для независимого тестирования русскоязычных моделей, получив поддержку ведущих индустриальных и академических организаций. Практическая значимость работы заключается в предоставлении инструментов для оценки и целевого совершенствования русскоязычных моделей в сфере искусственного интеллекта.
В работе решается фундаментальная научная проблема, связанная с дефицитом всесторонней системы оценки LLM для русского языка. Автор анализирует эволюцию подходов к бенчмаркингу от классических тестов на понимание языка (Russian SuperGLUE) до первых бенчмарков для генеративных моделей (TAPE), выявляя их ключевые ограничения. На этой основе разработан и представлен новый, масштабный бенчмарк MERA, который включает более 20 задач в инструктивном формате, охватывающих 10 ключевых навыков — от базового понимания и экспертных знаний до программирования и этических оценок. Методологически MERA опирается на тесты с закрытыми ответами, что минимизирует риск «загрязнения» данных и обеспечивает высокую воспроизводимость и автоматизируемость результатов.
Основной вклад работы заключается не только в создании самого бенчмарка, но и в проведении масштабного тестирования: в рамках исследования было протестировано более 100 моделей и их конфигураций. Полученные результаты, сопоставленные с эталонными человеческими показателями, предоставили детализированную картину сильных и слабых сторон фундаментальных моделей.
Разработанные в диссертации методологические фреймворки, открытая кодовая база и лидерборд MERA стали де-факто стандартом для независимого тестирования русскоязычных моделей, получив поддержку ведущих индустриальных и академических организаций. Практическая значимость работы заключается в предоставлении инструментов для оценки и целевого совершенствования русскоязычных моделей в сфере искусственного интеллекта.
Диссертация [*.pdf, 1.18 Мб] (дата размещения 19.08.2026)
Резюме [*.pdf, 533.85 Кб] (дата размещения 19.08.2026)
Summary [*.pdf, 464.44 Кб] (дата размещения 19.08.2026)
Ценовые искажения, вмешательство государства и ценообразование на финансовых рынкахКандидатская диссертацияУченая степень НИУ ВШЭ
Соискатель:
Руководитель:
Вукович Дарко
Дисс. совет:
Совет по экономике
Дата защиты:
27.10.2025
This study investigates the impact of Central Bank interventions on the pricing dynamics of selectedfinancial markets. The research employs the instrumental variables two- and three-stage least square (TSLS) model approaches. It analyses the effects of variations in the Federal Reserve (Fed) and the European Central bank (ECB) balance sheet size as a proxy for their Unconventional Monetary Policy (UMP) across four distinct intervention scenarios: the 2008–2013 Great Recession, the 2010-2012 Sovereign Debt crisis, the 2020–2021 COVID-19 pandemic periods, and an overarching analysis spanning these timelines. The findings indicate that changes in the size of the Fed’s and the ECB’s balance sheet correlate significantly with the pricing of the principal U.S. and European equity market indices. Notably, while the ECB’s interventions during the COVID-19 crisis are associated with drops in the German treasury yields for a respective rise in the European equity prices, the effectson the U.S. treasury yields are inverse for the Fed’s interventions during the same period, although the top U.S. equity indices also rise, suggesting price distortions within each financial market analyzed. Other forms of Central Bank interventions such as that of the Swiss National Bank (SNB) on the Swiss franc before and after January of 2015 were also analyzed in this study. The findings suggest that unexpected large currency price shocks from the SNB currency dis-intervention of 2015may have long-term implications on the pricing of the debt market in Switzerland, such as widening the municipal bond spreads. All results in this study are found to be robust under the appropriate tests for each of the model specifications.
Диссертация [*.pdf, 7.04 Мб] (дата размещения 27.08.2025)
Резюме [*.pdf, 901.44 Кб] (дата размещения 27.08.2025)
Summary [*.pdf, 709.20 Кб] (дата размещения 27.08.2025)