2026/2027




Методы анализа больших данных в исследованиях поведения покупателей
Статус:
Маго-лего
Кто читает:
Департамент социологии
Где читается:
Факультет социальных наук
Когда читается:
3, 4 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Пашков Станислав Георгиевич
Язык:
русский
Кредиты:
6
Контактные часы:
56
Программа дисциплины
Аннотация
Курс «Методы анализа больших данных в исследованиях поведения покупателей» формирует у магистрантов-социологов компетенцию полного цикла аналитики клиентского пути (Customer Journey Analytics) на языке R — от профилирования покупателей и сегментации до предсказания их будущего поведения и оценки эффективности маркетинговых вмешательств. Курс построен вокруг нарратива Customer Journey (Acquisition → Segmentation → Prediction → Experimentation), в котором методы не перечисляются изолированно, а последовательно встраиваются в исследовательский сюжет. Курс опирается на преемственность с предыдущим курсом программы («Автоматизированный сбор больших данных в экономико-социологических исследованиях»): предполагается, что студенты уже владеют базовым R и инструментами сбора данных. Это позволяет с первого занятия перейти к аналитике рыночных данных, используя уже освоенный язык в новом предметном контексте. В качестве предметных областей используются транзакционные данные e-commerce, CRM-логи, кликстрим, панельные опросы потребителей и корпусы открытых отзывов.
Цель освоения дисциплины
- Формирование у студентов целостной компетенции в области продуктовой аналитики поведения покупателей, сочетающей теоретическое понимание потребительского поведения с практическими навыками работы с реляционными данными, применением статистических и машинно-обучающих методов для диагностики, сегментации, прогнозирования и оценки каузальных эффектов, а также проектирования информационно-аналитических решений.
Планируемые результаты обучения
- Рассчитывать ключевые маркетинговые метрики (LTV, CAC, ARPU, Churn, Retention, RFM) и интерпретировать их в бизнес-контексте.
- Проводить разведочный анализ рыночных данных с учётом их специфики (long-tail распределения, когортная структура, сезонность).
- Формировать когорты покупателей и готовить данные для последующего когортного анализа через dplyr/lubridate/tidyr.
- Применять RFM-анализ для сегментации покупателей с интерпретацией результатов в терминах классических маркетинговых сегментов.
- Выполнять поведенческую кластеризацию (k-means, DBSCAN, GMM) с обоснованием числа кластеров и переводом статистических профилей в маркетинговые персоны.
- Интегрировать качественные данные (отзывы) в сегментацию через тематическое моделирование для содержательного обогащения профилей.
- Строить модели оттока через survival analysis (Kaplan-Meier, Cox PH) с интерпретацией hazard ratio и медианного времени до события.
- Оценивать Lifetime Value параметрическими BTYD-моделями и ML-подходами, понимая trade-off между interpretability и predictive power.
- Строить propensity-модели через tidymodels (или опционально scikit-learn) с корректной кросс-валидацией и feature engineering для поведенческих данных.
- Применять панельную регрессию (FE/RE через plm/fixest) и Difference-in-Differences (включая staggered DiD) для оценки эффекта маркетинговых вмешательств на наблюдательных данных.
- Проектировать A/B-тесты с расчётом статистической мощности, стратифицированной рандомизацией и байесовской интерпретацией результатов.
- Строить uplift-модели для сегментации респондентов на кампании и оценивать эффект макро-кампаний через CausalImpact в квази-экспериментальных сценариях.
- Создавать воспроизводимые бизнес-отчёты в Quarto с профессиональным оформлением, narrative structure и executive summary.
- Разрабатывать интерактивные дашборды (Shiny/flexdashboard) для self-service analytics бизнес-пользователей.
- Презентовать результаты Customer Analytics в формате бизнес-рекомендаций, переводя статистические метрики (p-values, coefficients) в бизнес-язык (ROI, uplift, revenue impact).
Содержание учебной дисциплины
- [Б1] Foundations & Customer Data: от сырых рыночных данных к структурированному взгляду на покупателя
- [Б2] Customer Segmentation: кто наши покупатели и как они различаются
- [Б3] Predictive Customer Analytics: что сделает покупатель в будущем и сколько он принесёт
- [Б4] Marketing Experimentation & Causal Inference: как измерить эффект наших вмешательств
- [Б5] Business Reporting & Dashboarding: от аналитики к бизнес-решениям
Элементы контроля
- Активность на семинареЕженедельная оценка вовлечённости, складывается из трёх компонентов: 1) Участие в семинарах, включая вопросы, live-coding, разбор кейсов. 2) Активность в форуме LMS: помощь одногруппникам, публикация template-скриптов, обсуждение архитектурных решений. 3) Мини-квизы: 8 коротких квизов (по одному в неделю), 5 вопросов каждый, 2 попытки, автотест.
- Лабораторная №1 — Customer SegmentationСтудент проводит полный цикл сегментации покупательской базы: рассчитывает RFM-метрики (Recency, Frequency, Monetary), присваивает квинтильные скоры и выделяет классические маркетинговые сегменты (Champions, At Risk, Hibernating). Далее выполняется поведенческая кластеризация методами k-means, иерархического анализа и DBSCAN с обоснованием числа кластеров через silhouette score и gap statistic. Завершающий этап — перевод статистических кластеров в маркетинговые персоны с содержательными названиями (например, «Охотники за скидками», «Лояльные премиум-клиенты») и формулирование триггерных кампаний для каждого сегмента.
- Лабораторная работа №2: Predictive Customer AnalyticsЛабораторная работа решает три взаимосвязанные задачи приоритизации маркетинговых вмешательств. (1) Churn prediction через survival analysis: кривые Каплана-Майера по когортам и Cox Proportional Hazards модель с RFM-ковариатами (преемственность с курсом «Непараметрика»). (2) LTV modeling: сравнение интерпретируемых BTYD-моделей (Pareto/NBD, BG/NBD через пакет BTYD) с ML-подходом (Random Forest через tidymodels) — обсуждение trade-off interpretability vs predictive power. (3) Propensity to buy: бинарная классификация вероятности покупки в следующие 14 дней с feature engineering на основе поведенческих паттернов и оценкой через Precision-Recall curve. Опциональный Python-трек для ML-части через scikit-learn/catboost.
- Лабораторная работа №3: Causal InferenceЛабораторная посвящена причинно-следственному анализу маркетинговых вмешательств. Студент оценивает эффект региональной промо-кампании через (1) панельную регрессию с фиксированными эффектами и (2) Difference-in-Differences + Event Study plot для проверки предпосылки параллельных трендов. Далее оценивается эффект общесайтовой распродажи (макро-событие, где A/B-тест невозможен) через (3) байесовский CausalImpact с построением синтетического контроля и оценкой incremental revenue. Завершающая часть — (4) uplift modeling на данных рандомизированной email-рассылки: построение Qini curve и выделение сегмента «Sleeping Dogs» (тех, кого кампания раздражает).
- Финальный проектФинальная часть курса в формате Quarterly Business Review (QBR) — студенты выступают в роли аналитика по продуктам, условно выступая с советом директоров. Проект интегрирует результаты всех трех лабораторных исследований (сегментация → прогнозирование → причинный вывод) и упаковывает их в четыре бизнес-артефакта: Аналитический конвейер (Quarto/RMarkdown) — воспроизводимый R-скрипт, связывающий все этапы анализа + Бизнес-отчет (PDF через Quarto, 6–8 страниц) — статический отчёт для уровня C с кратким описанием, ключевыми выводами и стратегическими рекомендациями + интерактивная информационная панель (Shiny/flexdashboard) — веб-приложение с фильтрами по сегментам/времени/географии, интерактивными когортными тепловыми картами и uplift-графиками.
Промежуточная аттестация
- 2026/2027 4th module0.3 * Финальный проект + 0.1 * Активность на семинаре + 0.05 * Активность на семинаре + 0.2 * Лабораторная работа №2: Predictive Customer Analytics + 0.2 * Лабораторная работа №3: Causal Inference + 0.15 * Лабораторная №1 — Customer Segmentation