• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Магистратура 2026/2027

Искусственный интеллект в NLP-анализе рынка криптоактивов

Когда читается: 1-й курс, 3 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 38

Программа дисциплины

Аннотация

Курс «Искусственный интеллект в NLP-анализе рынка криптоактивов» является углубленным продолжением дисциплины «Анализ данных и моделирование рынка криптоактивов» и предназначен для студентов, желающих освоить современные методы обработки естественного языка и глубокого обучения применительно к задачам анализа и прогнозирования криптовалютных рынков. Курс фокусируется на практическом применении продвинутых архитектур нейронных сетей (CNN, TCN, LSTM, BERT, GPT, FinBERT) для анализа текстовых данных из социальных сетей, новостных лент, форумов и блокчейн-платформ. Студенты освоят методы построения предиктивных моделей для прогнозирования настроений рыночных участников, рыночных трендов криптоактивов на основе анализа сентимента и выявления информационных сигналов в неструктурированных текстовых данных. В рамках дисциплины подробно рассматриваются: архитектуры современных языковых моделей, методы тонкой настройки предобученных моделей (fine-tuning), техники работы с дисбалансированными датасетами, продвинутые подходы к векторизации текста, мультимодальный анализ (текст + временные ряды), а также методы интерпретации решений моделей (SHAP, LIME). Курс включает практические занятия по сбору и обработке больших объемов текстовых данных, созданию собственных датасетов с разметкой, обучению и валидации моделей, а также оценке их влияния на прогностическую способность финансовых моделей.
Цель освоения дисциплины

Цель освоения дисциплины

  • Целью учебной дисциплины «Искусственный интеллект в NLP-анализе рынка криптоактивов» является формирование у студентов практических компетенций в области применения методов обработки естественного языка и глубокого обучения для анализа, интерпретации и прогнозирования поведения рынка криптоактивов на основе неструктурированных текстовых данных. 1. Получить знания о продвинутых методах обработки естественного языка и глубокого обучения, включая трансформерные архитектуры (BERT, FinBERT, GPT), и их применении на рынке криптоактивов. 2. Разработать практические навыки предобработки, векторизации и классификации текстовых данных о криптоактивах на русском и английском языках. 3. Освоить методы построения и валидации авторских метрик сентимента на основе результатов классификации текста, включая оценку их предиктивной силы. 4. Улучшить навыки работы с языком программирования Python для построения мультимодальных прогнозных моделей, объединяющих текстовые и рыночные данные. 5. Активное участие в семинарских занятиях, разборе примеров и обсуждении результатов, что способствует практическому применению полученных знаний.
Планируемые результаты обучения

Планируемые результаты обучения

  • Применять принципы классической (BoW, OHE, TF-IDF, Word2Vec) и современной (трансформерной) векторизации текста.
  • Оценивать и различать методы предобработки текстовых данных (токенизация, стемминг, лемматизация, работа со стоп-словами) для русско- и англоязычных корпусов.
  • Оценивать и распознавать устройства и различия архитектур RNN/LSTM/BiLSTM, CNN, TCN и трансформерных моделей (BERT/FinBERT/GPT и др.).
  • Строить и валидировать индекс сентимента на основе предсказаний классификатора, оценивать его предиктивную силу.
  • Обучать и сравнивать классификаторы тональности текста на основе различных архитектур, включая настройка гиперпараметров и дообучение трансформерных моделей.
  • Использовать и оценивать методы работы с несбалансированными классами (SMOTE, class weights, аугментация текста).
  • Формировать признаковое пространство, объединяющее сентимент-метрики и рыночные данные, с корректным контролем утечки данных во времени.
  • Строить и оценивать модель-предиктор (классификатор направления цены или регрессор доходности) с использованием текстовых и количественных признаков.
  • Владеть основами интерпретации моделей машинного обучения (SHAP, LIME) и умение анализировать вклад текстовых и ценовых признаков в прогноз.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Вводная лекция по NLP-анализу и обработке текстовых данных
  • Предобработка и векторизация текстовых данных
  • Классические архитектуры-классификаторы текста
  • Тест на знание базовых подходов NLP-анализа
  • Трансформерные модели и построение метрик сентимента
  • Формирование мультимодальных обучающих выборок, построение и обучение предикторов на основе ИИ
  • Реализация индивидуального проекта
Элементы контроля

Элементы контроля

  • неблокирующий Активность на семинарах
    Работа на семинарах, активное участие в обсуждении вопросов и задача в рамках рассматриваемых тем. Оценивается по итогам проведения семинара с озвучиванием / публикации оценок за данную активность.
  • неблокирующий Тест на знание базовых подходов NLP-анализа
    Проведение промежуточного контроля на знание основных подходов обработки текстовых данных и построения базовых методов векторизации текстовых массивов с последующим построение и обучением классификаторов на основе ИИ.
  • неблокирующий Защита проекта
    Устная защита итогового индивидуального проекта (предобработка и классификация текстовых данных, построение индекса сентимента, построение предиктора доходности/направления цены криптоактива) с обязательной демонстрацией работающего кода студента и ответами на вопросы преподавателя по каждому из трёх блоков курса.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    0.3 * Тест на знание базовых подходов NLP-анализа + 0.1 * Активность на семинарах + 0.6 * Защита проекта
Список литературы

Список литературы

Рекомендуемая основная литература

  • 9781119603825 - Mark J. S. Keenan - Advanced Positioning, Flow, and Sentiment Analysis in Commodity Markets : Bridging Fundamental and Technical Analysis, 2nd ed. - 2019 - John Wiley & Sons - https://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=2340891 - nlebk - 2340891
  • Advanced positioning, flow, and sentiment analysis in commodity markets : bridging fundamental and technical analysis, Keenan, M. J. S., 2020
  • An introduction to applied econometrics : a time series approach, Patterson, K., 2000
  • Müller, A. C., & Guido, S. (2017). Introduction to Machine Learning with Python : A Guide for Data Scientists: Vol. First edition. Reilly - O’Reilly Media.

Рекомендуемая дополнительная литература

  • 9781838827724 - Antonio Gulli; Amita Kapoor; Sujit Pal - Deep Learning with TensorFlow 2 and Keras : Regression, ConvNets, GANs, RNNs, NLP, and More with TensorFlow 2 and the Keras API, 2nd Edition - 2019 - Packt Publishing - http://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=2339879 - nlebk - 2339879
  • Alblawi, A. S. (2018). Big Data and Learning Analytics in Higher Education: Demystifying Variety, Acquisition, Storage, NLP and Analytics.
  • Clive Matthews. (2016). An Introduction to Natural Language Processing Through Prolog. Routledge.
  • Data mining : practical machine learning tools and techniques, Witten, I. H., 2011
  • Introduction to natural language processing, Eisenstein, J., 2019

Авторы

  • Файзулин Максим Сергеевич