Бакалавриат
2025/2026




Информационный поиск и извлечение данных
ID 980079
Статус:
Курс обязательный (Фундаментальная и прикладная лингвистика)
Когда читается:
4-й курс, 3 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
4
Контактные часы:
26
Программа дисциплины
Аннотация
Дисциплина предназначена для студентов 4-го курса направления "Фундаментальная и прикладная лингвистика". Рассматриваются различные вопросы работы с большими языковыми моделями: от подготовки данных на основе открытых источников, представленных на платформе HuggingFace, до оценки качества модели на наборе автоматических метрик и тонкой донастройки модели на специфической задаче.
Цель освоения дисциплины
- Уметь подготавливать датасет для оценки качества языковой модели
- Уметь осуществлять инференс языковой модели
- Уметь осуществлять оценку качества языковой модели
- Уметь проводить тонкую настройку языковой модели
- Уметь проводить оптимизацию языковой модели для её инференса
Планируемые результаты обучения
- уметь определить тип задачи, описать интерфейс нейросетевой модели, решающей эту задачу
- уметь подготавливать датасет в вид, необходимый для последующей оценки качества модели
- уметь осуществить инференс модели
- уметь осуществить оценку качества большой языковой модели
- уметь осуществить тонкую настройку большой языковой модели
- уметь осуществить оптимизацию большой языковой модели
Содержание учебной дисциплины
- Современные задачи в области NLP
- Датасеты в экосистеме HuggingFace
- Инференс языковых моделей
- Тонкая настройка языковых моделей с помощью метода LoRA
- Оценка качества работы языковых моделей
- Оптимизация инференса языковых моделей
Элементы контроля
- Лабораторная работа. Оценка качества большой языковой модели
- Лабораторная работа. Тонкая настройка больших языковых моделей
- Экзамен
Промежуточная аттестация
- 2025/2026 3rd module0.24 * Лабораторная работа. Тонкая настройка больших языковых моделей + 0.36 * Лабораторная работа. Оценка качества большой языковой модели + 0.4 * Экзамен