Магистратура
2026/2027


Глубинное обучение для текстовых данных
Статус:
Курс по выбору (Анализ данных в девелопменте)
Где читается:
Факультет компьютерных наук
Когда читается:
2-й курс, 2 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
3
Контактные часы:
28
Программа дисциплины
Аннотация
Дисциплина посвящена применению методов глубокого обучения к обработке естественного языка (NLP). В курсе последовательно рассматриваются все этапы работы с текстом: от токенизации и векторного представления слов до современных трансформерных архитектур (BERT, GPT) и генеративных моделей. Особое внимание уделяется практической реализации моделей для классификации текстов, машинного перевода, анализа тональности и построения диалоговых систем с использованием фреймворков PyTorch и Hugging Face Transformers.
Цель освоения дисциплины
- Сформировать у студентов системные знания и практические навыки в области глубокого обучения для текстовых данных, включая архитектуры нейросетей (RNN, LSTM, Transformer), методы предобработки текста, техники fine-tuning и оценку качества NLP-моделей.
Планируемые результаты обучения
- Знать современные архитектуры нейросетей для текстов (RNN, LSTM, Attention, Transformer), методы эмбеддингов (Word2Vec, GloVe, BERT), подходы к решению задач классификации, генерации и перевода.
- Уметь предобрабатывать текстовые данные (токенизация, лемматизация, очистка), строить пайплайны обучения моделей, выполнять fine-tuning предобученных трансформеров под конкретные задачи.
- Владеть инструментами Hugging Face, библиотеками для работы с текстом (NLTK, SpaCy, Transformers), навыками оценки моделей (BLEU, ROUGE, F1-score) и развертывания NLP-сервисов.
Содержание учебной дисциплины
- Введение в NLP и предобработка текста
- Векторные представления слов (Эмбеддинги)
- Рекуррентные нейронные сети (RNN) и их модификации
- Механизм внимания (Attention) и архитектура Transformer
- Предобученные языковые модели (BERT, GPT)
- Генерация текста и диалоговые системы