Методология тестирования способностей генеративных фундаментальных моделейMethodology for testing the capabilities of generative foundation models
Соискатель:
Руководитель:
Члены комитета:
Гращенков Павел Валерьевич (МГУ им М.В. Ломоносова, д.филол.,н., член комитета), Громов Василий Александрович (НИУ ВШЭ, д.ф.-м.н., член комитета), Ильвовский Дмитрий Алексеевич (НИУ ВШЭ, к.т.н., член комитета), Макаров Илья Андреевич (АНО «Институт искусственного интеллекта», PhD, член комитета), Плетенев Сергей Александрович (АНО «Институт искусственного интеллекта», к.филол.н., член комитета)
Диссертация принята к предварительному рассмотрению:
20.07.2026
Диссертация принята к защите:
27.08.2026
Дисс. совет:
Совет по компьютерным наукам
Диссертационная работа Алены Сергеевны Феногеновой посвящена разработке комплексной методологии оценки генеративных фундаментальных моделей, в частности больших языковых моделей (БЯМ, англ. LLM), для русского языка. Актуальность исследования обусловлена стремительным развитием LLM, демонстрирующих беспрецедентные способности, и одновременным отсутствием объективных, воспроизводимых и методологически выверенных инструментов для их сравнения на русском языке. Существующие бенчмарки англоцентричны и не учитывают лингвистическую и культурную специфику нерусских языков, а их механический перевод приводит к систематическим искажениям и неадекватной оценке возможностей моделей.
В работе решается фундаментальная научная проблема, связанная с дефицитом всесторонней системы оценки LLM для русского языка. Автор анализирует эволюцию подходов к бенчмаркингу от классических тестов на понимание языка (Russian SuperGLUE) до первых бенчмарков для генеративных моделей (TAPE), выявляя их ключевые ограничения. На этой основе разработан и представлен новый, масштабный бенчмарк MERA, который включает более 20 задач в инструктивном формате, охватывающих 10 ключевых навыков — от базового понимания и экспертных знаний до программирования и этических оценок. Методологически MERA опирается на тесты с закрытыми ответами, что минимизирует риск «загрязнения» данных и обеспечивает высокую воспроизводимость и автоматизируемость результатов.
Основной вклад работы заключается не только в создании самого бенчмарка, но и в проведении масштабного тестирования: в рамках исследования было протестировано более 100 моделей и их конфигураций. Полученные результаты, сопоставленные с эталонными человеческими показателями, предоставили детализированную картину сильных и слабых сторон фундаментальных моделей.
Разработанные в диссертации методологические фреймворки, открытая кодовая база и лидерборд MERA стали де-факто стандартом для независимого тестирования русскоязычных моделей, получив поддержку ведущих индустриальных и академических организаций. Практическая значимость работы заключается в предоставлении инструментов для оценки и целевого совершенствования русскоязычных моделей в сфере искусственного интеллекта.
В работе решается фундаментальная научная проблема, связанная с дефицитом всесторонней системы оценки LLM для русского языка. Автор анализирует эволюцию подходов к бенчмаркингу от классических тестов на понимание языка (Russian SuperGLUE) до первых бенчмарков для генеративных моделей (TAPE), выявляя их ключевые ограничения. На этой основе разработан и представлен новый, масштабный бенчмарк MERA, который включает более 20 задач в инструктивном формате, охватывающих 10 ключевых навыков — от базового понимания и экспертных знаний до программирования и этических оценок. Методологически MERA опирается на тесты с закрытыми ответами, что минимизирует риск «загрязнения» данных и обеспечивает высокую воспроизводимость и автоматизируемость результатов.
Основной вклад работы заключается не только в создании самого бенчмарка, но и в проведении масштабного тестирования: в рамках исследования было протестировано более 100 моделей и их конфигураций. Полученные результаты, сопоставленные с эталонными человеческими показателями, предоставили детализированную картину сильных и слабых сторон фундаментальных моделей.
Разработанные в диссертации методологические фреймворки, открытая кодовая база и лидерборд MERA стали де-факто стандартом для независимого тестирования русскоязычных моделей, получив поддержку ведущих индустриальных и академических организаций. Практическая значимость работы заключается в предоставлении инструментов для оценки и целевого совершенствования русскоязычных моделей в сфере искусственного интеллекта.
Диссертация [*.pdf, 1.18 Мб] (дата размещения 19.08.2026)
Резюме [*.pdf, 533.85 Кб] (дата размещения 19.08.2026)
Summary [*.pdf, 464.44 Кб] (дата размещения 19.08.2026)
Публикации, в которых излагаются основные результаты диссертации
Отзывы
Отзыв научного руководителя
- Тутубалина Елена Викторовна (дата размещения 21.07.2026)
См. на ту же тему
Методы и наборы данных для оценки моделей информационного поиска и обработки естественного языкаДокторская диссертация
Соискатель: Браславский Павел Исаакович
Дата защиты: 15.04.2026
Хранение и доступ к морфологически родственным словам в ментальном лексиконе при восприятии речиКандидатская диссертация
Соискатель: Чуприна Анастасия Олеговна
Руководитель: Слюсарь Наталия Анатольевна
Дата защиты: 15.05.2023
Корпусные методы как инструмент исследования микродиахронии русского языка XVIII-XXI вековДокторская диссертация
Соискатель: Добрушина Екатерина Роландовна
Дата защиты: 15.12.2022