• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Основы работы с большими данными

ID 1270046

Статус: Курс по выбору (Прикладная математика)
Когда читается: 4-й курс, 3 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 40

Программа дисциплины

Аннотация

Курс посвящён современным технологиям хранения и обработки данных в масштабе. Рассматриваются архитектурные подходы к построению хранилищ данных: от реляционных СУБД и Data Warehouse к концепциям Data Lake и Lakehouse на основе облачных объектных хранилищ и открытых табличных форматов (Apache Iceberg, Delta Lake). Изучаются инструменты аналитической обработки данных — PostgreSQL, ClickHouse и MPP-системы, Apache Spark — и построение современных ELT-пайплайнов с использованием Apache Airflow и dbt. Отдельное внимание уделяется потоковой обработке данных (Apache Kafka, Spark Streaming), захвату изменений (CDC, Debezium) и контролю качества данных. Курс также охватывает алгоритмические основы анализа больших данных: приближенные методы (MinHash, LSH, SimHash), распределенную кластеризацию и классификацию (K-Means, XGBoost на Spark), рекомендательные системы на основе матричной факторизации (ALS). Практическая составляющая курса реализована через работу с реальными наборами данных в среде PySpark, ClickHouse и Kafka.
Цель освоения дисциплины

Цель освоения дисциплины

  • Освоение современного стека технологий хранения, интеграции и распределенной обработки данных, а также алгоритмических методов анализа больших данных, необходимых для проектирования и эксплуатации масштабируемых data-платформ.
Планируемые результаты обучения

Планируемые результаты обучения

  • Студенты знают эволюцию архитектур хранилищ данных: от реляционных СУБД к Data Lake, Lakehouse и облачным Data Platform. Понимают роль колоночных форматов (Parquet, ORC) и открытых табличных форматов (Apache Iceberg, Delta Lake) в современной аналитической инфраструктуре. Знают различие между файловыми и объектными хранилищами, принципы работы HDFS и S3 как основы Data Lake.
  • Студенты знают принципы проектирования корпоративных хранилищ данных (DWH): слоистую архитектуру (Raw/ODS/DDS/витрины), подходы к моделированию (схемы «звезда» и «снежинка» по Kimball, Data Vault 2.0, SCD). Понимают парадигму ELT и умеют строить пайплайны данных с использованием Apache Airflow и dbt
  • Студенты знают внутреннее устройство PostgreSQL: механизмы MVCC, WAL, индексы, секционирование, репликацию (Patroni). Владеют навыками администрирования, оптимизации запросов (EXPLAIN/ANALYZE) и обеспечения высокой доступности PostgreSQL.
  • Студенты знают принципы колоночного хранения и архитектуру ClickHouse (семейство движков MergeTree, материализованные представления, интеграции с внешними системами). Понимают отличия OLAP-колоночных СУБД от строковых и их место относительно класса NoSQL. Знают принципы массивно-параллельных систем (MPP) на примере Greenplum/Arenadata DB
  • Студенты знают архитектуру Apache Spark (драйвер, executors, менеджер ресурсов) и модели данных RDD/DataFrame/Dataset. Понимают принципы потоковой обработки данных: архитектуру Apache Kafka, гарантии доставки сообщений, захват изменений (CDC, Debezium). Ориентируются в смежных технологиях (Apache Flink, Cassandra, MongoDB, NewSQL) как контексте выбора технологии под задачу
  • Студенты понимают фундаментальные ограничения алгоритмов на больших данных: однопроходные алгоритмы, модель BSP, приближенные методы, сложность по коммуникациям и памяти. Знают классические задачи анализа больших данных: кластеризацию, классификацию, рекомендательные системы, приближенный подсчет
  • Студенты знают методы поиска похожих элементов: меру Жаккара, MinHash, Locality-Sensitive Hashing (LSH), SimHash. Умеют применять их для обнаружения дубликатов и кластеризации текстовых данных в распределенной среде
  • Студенты знают методы распределенной классификации: логистическую регрессию с SGD, случайные леса и XGBoost на Spark. Владеют навыками настройки гиперпараметров через кросс-валидацию, оценки качества моделей на больших данных и анализа кривых обучения
  • Студенты понимают принципы матричной факторизации и алгоритма ALS (Alternating Least Squares) для построения рекомендательных систем. Умеют настраивать и оценивать модель ALS на реальных данных, включая обработку холодного старта и оценку качества по метрикам precision@k, recall@k, MAP
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Архитектура хранилищ данных: от Data Lake к Lakehouse
  • Системная аналитика и моделирование DWH. ELT-пайплайны
  • PostgreSQL как DWH-движок и администрирование
  • Колоночная аналитика: ClickHouse и MPP-системы
  • Распределённая и потоковая обработка данных. Качество данных
  • Введение в алгоритмы анализа больших данных
  • Поиск похожих элементов и Locality-Sensitive Hashing (LSH)
  • Кластеризация
  • Классификация в распределенной среде
  • Рекомендательные системы (ALS)
Элементы контроля

Элементы контроля

  • неблокирующий Домашнее задание: Домашние задания 1-4
  • неблокирующий Тест 1
    Описание: Тест будет дан для проверки изученного материала во время семинара.
  • неблокирующий Домашнее задание: Домашние задания 5-6
  • неблокирующий Тест 2: Тест
    Описание: Тест будет дан для проверки изученного материала во время семинара.
  • блокирующий Экзамен
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    Формула оценивания: Домашнее задание: SUM(Домашние задания 1-4) * 0,500 + Домашнее задание: SUM(Домашние задания 5-6) * 0,200 + Тест: SUM(Тесты 1-2) * 0.100 + Экзамен: Практическая работа* 0.300
Список литературы

Список литературы

Рекомендуемая основная литература

  • Адаптивные алгоритмы управления распределением нагрузки в многосерверных системах : дис. ... канд. технических наук : 05.13.15, Калашников, Е. И., 2010

Рекомендуемая дополнительная литература

  • Реляционные базы данных : практ. приемы оптимальных решений, Мирошниченко, Г. А., 2005

Авторы

  • Гайдуков Роман Константинович
  • Князева Ирина Васильевна
  • Юнышева Анастасия Владимировна