Бакалавриат
2026/2027





Основы работы с большими данными
ID 1270046
Статус:
Курс по выбору (Прикладная математика)
Кто читает:
Департамент прикладной математики
Когда читается:
4-й курс, 3 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
3
Контактные часы:
40
Программа дисциплины
Аннотация
Курс посвящён современным технологиям хранения и обработки данных в масштабе. Рассматриваются архитектурные подходы к построению хранилищ данных: от реляционных СУБД и Data Warehouse к концепциям Data Lake и Lakehouse на основе облачных объектных хранилищ и открытых табличных форматов (Apache Iceberg, Delta Lake). Изучаются инструменты аналитической обработки данных — PostgreSQL, ClickHouse и MPP-системы, Apache Spark — и построение современных ELT-пайплайнов с использованием Apache Airflow и dbt. Отдельное внимание уделяется потоковой обработке данных (Apache Kafka, Spark Streaming), захвату изменений (CDC, Debezium) и контролю качества данных. Курс также охватывает алгоритмические основы анализа больших данных: приближенные методы (MinHash, LSH, SimHash), распределенную кластеризацию и классификацию (K-Means, XGBoost на Spark), рекомендательные системы на основе матричной факторизации (ALS). Практическая составляющая курса реализована через работу с реальными наборами данных в среде PySpark, ClickHouse и Kafka.
Цель освоения дисциплины
- Освоение современного стека технологий хранения, интеграции и распределенной обработки данных, а также алгоритмических методов анализа больших данных, необходимых для проектирования и эксплуатации масштабируемых data-платформ.
Планируемые результаты обучения
- Студенты знают эволюцию архитектур хранилищ данных: от реляционных СУБД к Data Lake, Lakehouse и облачным Data Platform. Понимают роль колоночных форматов (Parquet, ORC) и открытых табличных форматов (Apache Iceberg, Delta Lake) в современной аналитической инфраструктуре. Знают различие между файловыми и объектными хранилищами, принципы работы HDFS и S3 как основы Data Lake.
- Студенты знают принципы проектирования корпоративных хранилищ данных (DWH): слоистую архитектуру (Raw/ODS/DDS/витрины), подходы к моделированию (схемы «звезда» и «снежинка» по Kimball, Data Vault 2.0, SCD). Понимают парадигму ELT и умеют строить пайплайны данных с использованием Apache Airflow и dbt
- Студенты знают внутреннее устройство PostgreSQL: механизмы MVCC, WAL, индексы, секционирование, репликацию (Patroni). Владеют навыками администрирования, оптимизации запросов (EXPLAIN/ANALYZE) и обеспечения высокой доступности PostgreSQL.
- Студенты знают принципы колоночного хранения и архитектуру ClickHouse (семейство движков MergeTree, материализованные представления, интеграции с внешними системами). Понимают отличия OLAP-колоночных СУБД от строковых и их место относительно класса NoSQL. Знают принципы массивно-параллельных систем (MPP) на примере Greenplum/Arenadata DB
- Студенты знают архитектуру Apache Spark (драйвер, executors, менеджер ресурсов) и модели данных RDD/DataFrame/Dataset. Понимают принципы потоковой обработки данных: архитектуру Apache Kafka, гарантии доставки сообщений, захват изменений (CDC, Debezium). Ориентируются в смежных технологиях (Apache Flink, Cassandra, MongoDB, NewSQL) как контексте выбора технологии под задачу
- Студенты понимают фундаментальные ограничения алгоритмов на больших данных: однопроходные алгоритмы, модель BSP, приближенные методы, сложность по коммуникациям и памяти. Знают классические задачи анализа больших данных: кластеризацию, классификацию, рекомендательные системы, приближенный подсчет
- Студенты знают методы поиска похожих элементов: меру Жаккара, MinHash, Locality-Sensitive Hashing (LSH), SimHash. Умеют применять их для обнаружения дубликатов и кластеризации текстовых данных в распределенной среде
- Студенты знают методы распределенной классификации: логистическую регрессию с SGD, случайные леса и XGBoost на Spark. Владеют навыками настройки гиперпараметров через кросс-валидацию, оценки качества моделей на больших данных и анализа кривых обучения
- Студенты понимают принципы матричной факторизации и алгоритма ALS (Alternating Least Squares) для построения рекомендательных систем. Умеют настраивать и оценивать модель ALS на реальных данных, включая обработку холодного старта и оценку качества по метрикам precision@k, recall@k, MAP
Содержание учебной дисциплины
- Архитектура хранилищ данных: от Data Lake к Lakehouse
- Системная аналитика и моделирование DWH. ELT-пайплайны
- PostgreSQL как DWH-движок и администрирование
- Колоночная аналитика: ClickHouse и MPP-системы
- Распределённая и потоковая обработка данных. Качество данных
- Введение в алгоритмы анализа больших данных
- Поиск похожих элементов и Locality-Sensitive Hashing (LSH)
- Кластеризация
- Классификация в распределенной среде
- Рекомендательные системы (ALS)
Элементы контроля
- Домашнее задание: Домашние задания 1-4
- Тест 1Описание: Тест будет дан для проверки изученного материала во время семинара.
- Домашнее задание: Домашние задания 5-6
- Тест 2: ТестОписание: Тест будет дан для проверки изученного материала во время семинара.
- Экзамен
Промежуточная аттестация
- 2026/2027 3rd moduleФормула оценивания: Домашнее задание: SUM(Домашние задания 1-4) * 0,500 + Домашнее задание: SUM(Домашние задания 5-6) * 0,200 + Тест: SUM(Тесты 1-2) * 0.100 + Экзамен: Практическая работа* 0.300
Список литературы
Рекомендуемая основная литература
- Адаптивные алгоритмы управления распределением нагрузки в многосерверных системах : дис. ... канд. технических наук : 05.13.15, Калашников, Е. И., 2010
Рекомендуемая дополнительная литература
- Реляционные базы данных : практ. приемы оптимальных решений, Мирошниченко, Г. А., 2005