• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
2026/2027

Методы анализа больших данных в исследованиях поведения покупателей

Статус: Маго-лего
Когда читается: 3, 4 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 6
Контактные часы: 56

Программа дисциплины

Аннотация

Курс «Методы анализа больших данных в исследованиях поведения покупателей» формирует у магистрантов-социологов компетенцию полного цикла аналитики клиентского пути (Customer Journey Analytics) на языке R — от профилирования покупателей и сегментации до предсказания их будущего поведения и оценки эффективности маркетинговых вмешательств. Курс построен вокруг нарратива Customer Journey (Acquisition → Segmentation → Prediction → Experimentation), в котором методы не перечисляются изолированно, а последовательно встраиваются в исследовательский сюжет. Курс опирается на преемственность с предыдущим курсом программы («Автоматизированный сбор больших данных в экономико-социологических исследованиях»): предполагается, что студенты уже владеют базовым R и инструментами сбора данных. Это позволяет с первого занятия перейти к аналитике рыночных данных, используя уже освоенный язык в новом предметном контексте. В качестве предметных областей используются транзакционные данные e-commerce, CRM-логи, кликстрим, панельные опросы потребителей и корпусы открытых отзывов.
Цель освоения дисциплины

Цель освоения дисциплины

  • Формирование у студентов целостной компетенции в области продуктовой аналитики поведения покупателей, сочетающей теоретическое понимание потребительского поведения с практическими навыками работы с реляционными данными, применением статистических и машинно-обучающих методов для диагностики, сегментации, прогнозирования и оценки каузальных эффектов, а также проектирования информационно-аналитических решений.
Планируемые результаты обучения

Планируемые результаты обучения

  • Рассчитывать ключевые маркетинговые метрики (LTV, CAC, ARPU, Churn, Retention, RFM) и интерпретировать их в бизнес-контексте.
  • Проводить разведочный анализ рыночных данных с учётом их специфики (long-tail распределения, когортная структура, сезонность).
  • Формировать когорты покупателей и готовить данные для последующего когортного анализа через dplyr/lubridate/tidyr.
  • Применять RFM-анализ для сегментации покупателей с интерпретацией результатов в терминах классических маркетинговых сегментов.
  • Выполнять поведенческую кластеризацию (k-means, DBSCAN, GMM) с обоснованием числа кластеров и переводом статистических профилей в маркетинговые персоны.
  • Интегрировать качественные данные (отзывы) в сегментацию через тематическое моделирование для содержательного обогащения профилей.
  • Строить модели оттока через survival analysis (Kaplan-Meier, Cox PH) с интерпретацией hazard ratio и медианного времени до события.
  • Оценивать Lifetime Value параметрическими BTYD-моделями и ML-подходами, понимая trade-off между interpretability и predictive power.
  • Строить propensity-модели через tidymodels (или опционально scikit-learn) с корректной кросс-валидацией и feature engineering для поведенческих данных.
  • Применять панельную регрессию (FE/RE через plm/fixest) и Difference-in-Differences (включая staggered DiD) для оценки эффекта маркетинговых вмешательств на наблюдательных данных.
  • Проектировать A/B-тесты с расчётом статистической мощности, стратифицированной рандомизацией и байесовской интерпретацией результатов.
  • Строить uplift-модели для сегментации респондентов на кампании и оценивать эффект макро-кампаний через CausalImpact в квази-экспериментальных сценариях.
  • Создавать воспроизводимые бизнес-отчёты в Quarto с профессиональным оформлением, narrative structure и executive summary.
  • Разрабатывать интерактивные дашборды (Shiny/flexdashboard) для self-service analytics бизнес-пользователей.
  • Презентовать результаты Customer Analytics в формате бизнес-рекомендаций, переводя статистические метрики (p-values, coefficients) в бизнес-язык (ROI, uplift, revenue impact).
Содержание учебной дисциплины

Содержание учебной дисциплины

  • [Б1] Foundations & Customer Data: от сырых рыночных данных к структурированному взгляду на покупателя
  • [Б2] Customer Segmentation: кто наши покупатели и как они различаются
  • [Б3] Predictive Customer Analytics: что сделает покупатель в будущем и сколько он принесёт
  • [Б4] Marketing Experimentation & Causal Inference: как измерить эффект наших вмешательств
  • [Б5] Business Reporting & Dashboarding: от аналитики к бизнес-решениям
Элементы контроля

Элементы контроля

  • неблокирующий Активность на семинаре
    Еженедельная оценка вовлечённости, складывается из трёх компонентов: 1) Участие в семинарах, включая вопросы, live-coding, разбор кейсов. 2) Активность в форуме LMS: помощь одногруппникам, публикация template-скриптов, обсуждение архитектурных решений. 3) Мини-квизы: 8 коротких квизов (по одному в неделю), 5 вопросов каждый, 2 попытки, автотест.
  • неблокирующий Лабораторная №1 — Customer Segmentation
    Студент проводит полный цикл сегментации покупательской базы: рассчитывает RFM-метрики (Recency, Frequency, Monetary), присваивает квинтильные скоры и выделяет классические маркетинговые сегменты (Champions, At Risk, Hibernating). Далее выполняется поведенческая кластеризация методами k-means, иерархического анализа и DBSCAN с обоснованием числа кластеров через silhouette score и gap statistic. Завершающий этап — перевод статистических кластеров в маркетинговые персоны с содержательными названиями (например, «Охотники за скидками», «Лояльные премиум-клиенты») и формулирование триггерных кампаний для каждого сегмента.
  • неблокирующий Лабораторная работа №2: Predictive Customer Analytics
    Лабораторная работа решает три взаимосвязанные задачи приоритизации маркетинговых вмешательств. (1) Churn prediction через survival analysis: кривые Каплана-Майера по когортам и Cox Proportional Hazards модель с RFM-ковариатами (преемственность с курсом «Непараметрика»). (2) LTV modeling: сравнение интерпретируемых BTYD-моделей (Pareto/NBD, BG/NBD через пакет BTYD) с ML-подходом (Random Forest через tidymodels) — обсуждение trade-off interpretability vs predictive power. (3) Propensity to buy: бинарная классификация вероятности покупки в следующие 14 дней с feature engineering на основе поведенческих паттернов и оценкой через Precision-Recall curve. Опциональный Python-трек для ML-части через scikit-learn/catboost.
  • неблокирующий Лабораторная работа №3: Causal Inference
    Лабораторная посвящена причинно-следственному анализу маркетинговых вмешательств. Студент оценивает эффект региональной промо-кампании через (1) панельную регрессию с фиксированными эффектами и (2) Difference-in-Differences + Event Study plot для проверки предпосылки параллельных трендов. Далее оценивается эффект общесайтовой распродажи (макро-событие, где A/B-тест невозможен) через (3) байесовский CausalImpact с построением синтетического контроля и оценкой incremental revenue. Завершающая часть — (4) uplift modeling на данных рандомизированной email-рассылки: построение Qini curve и выделение сегмента «Sleeping Dogs» (тех, кого кампания раздражает).
  • неблокирующий Финальный проект
    Финальная часть курса в формате Quarterly Business Review (QBR) — студенты выступают в роли аналитика по продуктам, условно выступая с советом директоров. Проект интегрирует результаты всех трех лабораторных исследований (сегментация → прогнозирование → причинный вывод) и упаковывает их в четыре бизнес-артефакта: Аналитический конвейер (Quarto/RMarkdown) — воспроизводимый R-скрипт, связывающий все этапы анализа + Бизнес-отчет (PDF через Quarto, 6–8 страниц) — статический отчёт для уровня C с кратким описанием, ключевыми выводами и стратегическими рекомендациями + интерактивная информационная панель (Shiny/flexdashboard) — веб-приложение с фильтрами по сегментам/времени/географии, интерактивными когортными тепловыми картами и uplift-графиками.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 4th module
    0.3 * Финальный проект + 0.1 * Активность на семинаре + 0.05 * Активность на семинаре + 0.2 * Лабораторная работа №2: Predictive Customer Analytics + 0.2 * Лабораторная работа №3: Causal Inference + 0.15 * Лабораторная №1 — Customer Segmentation
Список литературы

Список литературы

Рекомендуемая основная литература

  • Derya Birant. (2011). Data Mining Using RFM Analysis. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsbas&AN=edsbas.B99B7782

Авторы

  • Десятова Мария Ивановна
  • Пашков Станислав Георгиевич