• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Прикладной анализ многомерных и потоковых социально-экономических данных на языке R

Статус: Курс обязательный (Социология)
Когда читается: 4-й курс, 1, 2 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 6
Контактные часы: 48

Программа дисциплины

Аннотация

Курс предлагает слушателям углубленное знакомство с основными аспектами работы в статистической среде R (CRAN R), применяемой для решения задач социально-экономических исследований и обработки естественного языка в рамках качественных исследований. В ходе обучения акцентируется внимание на принципах организации программного кода, системах типов данных и основах функционального программирования. Основное внимание уделяется прикладным методам статистического анализа, включая работу с микроданными (социология) и макроданными (социально-экономическая статистика). Рассматриваются актуальные вопросы статистической теории и прикладного анализа данных, введения в Байесовскую статистики. Отдельно рассмотрена теория графов, которая позволяет исследовать возможности количественно-качественных методов обработки структурированных текстовых и сетевых данных. Кроме того, курс охватывает продвинутые методы анализа данных (машинное обучение, алгоритмы кластеризации), вопросы хранения и обработки больших объемов данных с использованием SQL-подходов, на примере реляционных баз данных, таких как SQLite. Слушатели изучат техники предсказательной аналитики, которые помогут в принятии обоснованных решений на основе полученных результатов. В процессе изучения материала акцентируется внимание на организации аналитических процессов ("пайплайнов"), формулировании исследовательских гипотез, выявлении социально-экономических проблем и определении инсайтов для оперативной аналитики. В качестве источников данных рассматриваются массивы социологических данных из ЕАЭСД ВШЭ, RLMS, Росстата, баз данных СМИ.
Цель освоения дисциплины

Цель освоения дисциплины

  • Применять язык R для воспроизводимого анализа социально-экономических данных, включая разведочный анализ, визуализацию и оформление отчётов в формате R Markdown.
  • Извлекать и обрабатывать данные из реляционных баз данных с помощью SQL, интегрировать их в аналитические пайплайны на R и использовать в социальных исследованиях.
  • Выявлять скрытые структуры в данных с помощью методов снижения размерности (PCA), факторного (EFA, CFA) и кластерного анализа, интерпретируя результаты в контексте социальных наук.
  • Анализировать качественные текстовые данные с применением методов NLP: тематического моделирования (LDA), анализа тональности и построения семантических сетей.
  • Строить и интерпретировать регрессионные модели (линейные, логистические), оценивать их качество и представлять результаты в публикационном формате.
  • Анализировать структуру социальных и семантических сетей с использованием пакета igraph: вычислять центральность, выделять сообщества и визуализировать связи между социальными акторами или понятиями.
  • Решать прикладные задачи анализа данных, комбинируя методы количественного, текстового и сетевого анализа в едином воспроизводимом рабочем процессе.
Планируемые результаты обучения

Планируемые результаты обучения

  • Формировать практику создания воспроизводимых аналитических проектов средствами R.
  • Проводить разведочный анализ социологических данных с использованием современных диагностических пакетов (VIM, inspectdf, ggplot2).
  • Оформлять результаты анализа в формате воспроизводимого отчёта с интеграцией кода, визуализаций и нарратива.
  • Формулировать SQL-запросы (SELECT, JOIN, GROUP BY, подзапросы) для извлечения и агрегации социологических данных
  • Интегрировать реляционные базы данных (SQLite, PostgreSQL) с R через пакеты DBI/RSQLite.
  • Строить аналитические пайплайны, комбинирующие SQL-обработку на стороне СУБД и статистический анализ в R.
  • Применять методы снижения размерности (PCA, EFA, CFA) для выявления латентных структур в социологических данных.
  • Выполнять кластерный анализ (k-means, иерархический, DBSCAN, GMM) с оценкой качества через силуэт и gap statistic.
  • Интерпретировать факторные и кластерные решения в социологическом контексте, переводя статистические профили в содержательные типологии.
  • Строить и диагностировать линейные и логистические регрессионные модели с проверкой статистических предпосылок
  • Интерпретировать регрессионные коэффициенты, odds ratio и предельные эффекты в содержательных терминах.
  • Оформлять результаты регрессионного анализа в публикационном формате через modelsummary/stargazer.
  • Обрабатывать текстовые данные (очистка, токенизация, векторизация TF-IDF) с помощью пакетов quanteda/tm/tidytext.
  • Применять тематическое моделирование (LDA) к корпусам открытых ответов с интерпретацией выделенных тем.
  • Анализировать тональность текстов и визуализировать семантические структуры (тематические карты, облака слов).
  • Строить и валидировать модели машинного обучения (деревья, Random Forest) через tidymodels с кросс-валидацией.
  • Строить семантические сети на основе текстовых данных с вычислением центральности и выделением сообществ.
  • Интерпретировать сетевые структуры как модели дискурса или когнитивных паттернов.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • [Б1] Введение в R и разведочный анализ данных
  • [Б2] SQL и интеграция с реляционными базами данных
  • [Б3] Многомерный анализ: снижение размерности и кластеризация
  • [Б4] Регрессионный анализ
  • [Б5] Анализ текстовых данных и NLP
  • [Б6] Продвинутые методы: машинное обучение и сетевой анализ
Элементы контроля

Элементы контроля

  • неблокирующий Активность на семинарах
    Форма контроля оценивает вовлечённость студента в учебный процесс на протяжении всего курса. Активность складывается из двух компонентов: офлайн-участие на семинарах (до 10%) и присутствие на занятиях (до 5%). Офлайн-компонент оценивает не просто присутствие, а участие в разборе кейсов, задавание содержательных вопросов, помощь одногруппникам с техническими проблемами в R, участие в коллективных обсуждениях аналитических решений.
  • неблокирующий Домашнее задание №1 — EDA и интеграция с SQL
    Домашнее задание закладывает фундамент курса и служит «мягким входом» в аналитический рабочий процесс. Студент получает персональный датасет из социологической базы (подвыборка RLMS-HSE или ЕАЭСД ВШЭ, сгенерированная с seed = student_id), хранящийся в SQLite-базе, и должен провести полный цикл разведочного анализа с интеграцией SQL и R. Задание начинается с написания SQL-запросов для извлечения и агрегации данных через DBI/RSQLite, после чего извлечённые tibble-объекты подвергаются EDA с использованием ggplot2, VIM, inspectdf и SmartEDA. Студент обязан оценить целостность данных, визуализировать распределения ключевых переменных, выявить пропуски и выбросы, а также сформулировать 3–4 исследовательских гипотезы, которые могут быть проверены на последующих этапах курса.
  • неблокирующий Домашнее задание №2 — Факторный анализ
    Домашнее задание посвящено методам снижения размерности и выявления латентных структур. Студент работает с тем же датасетом из ДЗ №1 (что обеспечивает сквозную логику курса), фокусируясь на батарее шкал (например, вопросы о доверии институтам, ценностных ориентациях или установках). Требуется провести полный цикл факторного анализа: проверка пригодности данных (KMO, тест Бартлетта), эксплораторный факторный анализ (EFA) с обоснованием числа факторов (критерий Кайзера, график каменистой осыпи, parallel analysis), применение вращения (varimax для ортогональных, oblimin для коррелированных факторов) и содержательная интерпретация выделенных факторов. Опционально — подтверждающий факторный анализ (CFA) через lavaan для проверки гипотез о структуре. Результат оформляется в RMarkdown-отчёте с обязательной визуализацией: heatmap факторных нагрузок, график каменистой осыпи, диаграмма путей CFA (если выполнен).
  • неблокирующий Домашнее задание №3 — Кластерный анализ
    Третье домашнее задание посвящено методам кластеризации и сегментации респондентов. Студент работает с тем же датасетом, используя либо исходные переменные, либо факторные оценки, полученные в ДЗ №2. Требуется применить минимум 3 метода кластеризации: k-means, иерархический анализ (метод Уорда) и один плотностной/модельный метод (DBSCAN или GMM через mclust). Для каждого метода — обоснование числа кластеров через силуэт, gap statistic (NbClust, factoextra) и содержательную интерпретируемость. Ключевой элемент — социологическая интерпретация кластеров: студент должен перевести статистические профили в содержательные типологии (например, «традиционалисты», «модернисты», «амбиваленты») и проиллюстрировать их через профили средних значений и cross-tabulation с внешними переменными. Задание сопровождается template-ноутбуком с готовыми блоками визуализации (factoextra::fviz_cluster(), cluster::clusplot()) и sample answer.
  • неблокирующий Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining)
    Лабораторная работа предлагает студенту возможность выбора направления в зависимости от предпочтений -- это может быть продвинутый анализ данных до финального моделирования (регрессионного моделирования), либо переключение на качественные методы в лице обработки текстовых данных (NLP, Парсинг, Сетевой анализ).
  • неблокирующий Финальный проект
    Финальный проект — завершающая часть курса, требующая самостоятельного исследования с применением методов, освоенных в течение года. Студент формулирует исследовательский вопрос в области социологии/экономики/политологии, выбирает датасет (из предложенного меню или самостоятельно с одобрением преподавателя), проводит полный аналитический цикл (от EDA до интерпретации) и оформляет результаты в виде отчёта + презентации. Проект может быть выполнен индивидуально или в паре (не более 2 человек; требования для пар удваиваются: больше методов, глубже теоретическая рамка, расширенная презентация). Обязательный элемент — proposal gate: за 3 недели до дедлайна студент подаёт 1-страничный Research Proposal (вопрос + датасет + планируемые методы + 3+ ссылки на литературу), который должен быть одобрен преподавателем. Проекты без одобренного proposal не принимаются и получают максимум 4 балла. Финальная защита — синхронная презентация на семинаре, в зависимости от логистики модуля.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 2nd module
    0.1 * Домашнее задание №1 — EDA и интеграция с SQL + 0.075 * Активность на семинарах + 0.15 * Домашнее задание №3 — Кластерный анализ + 0.2 * Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining) + 0.3 * Финальный проект + 0.1 * Домашнее задание №2 — Факторный анализ
Список литературы

Список литературы

Рекомендуемая основная литература

  • SQL: быстрое погружение. - 978-5-4461-1835-9 - Шилдс Уолтер - 2022 - Санкт-Петербург: Питер - https://ibooks.ru/products/389413 - 389413 - iBOOKS

Рекомендуемая дополнительная литература

  • SQL стандарт в современных СУБД: манипулирование данными - Семенова И. И., Шершнева Е. О. - Сибирский государственный автомобильно-дорожный университет - 978-5-00113-242-4 - 2023 - русский - https://e.lanbook.com/book/407393 - ЛАНЬ - 407393
  • Каратеев А.Ю. - Язык R для решения задач социально-политического анализа - 978-5-9729-2456-1 - Инфра-Инженерия - 2025 - https://znanium.ru/catalog/document?id=469360 - 469360 - ZNANIUM

Авторы

  • Пашков Станислав Георгиевич