Бакалавриат
2026/2027





Прикладной анализ многомерных и потоковых социально-экономических данных на языке R
Статус:
Курс обязательный (Социология)
Кто читает:
Департамент социологии
Где читается:
Факультет социальных наук
Когда читается:
4-й курс, 1, 2 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Пашков Станислав Георгиевич
Язык:
русский
Кредиты:
6
Контактные часы:
48
Программа дисциплины
Аннотация
Курс предлагает слушателям углубленное знакомство с основными аспектами работы в статистической среде R (CRAN R), применяемой для решения задач социально-экономических исследований и обработки естественного языка в рамках качественных исследований. В ходе обучения акцентируется внимание на принципах организации программного кода, системах типов данных и основах функционального программирования. Основное внимание уделяется прикладным методам статистического анализа, включая работу с микроданными (социология) и макроданными (социально-экономическая статистика). Рассматриваются актуальные вопросы статистической теории и прикладного анализа данных, введения в Байесовскую статистики. Отдельно рассмотрена теория графов, которая позволяет исследовать возможности количественно-качественных методов обработки структурированных текстовых и сетевых данных. Кроме того, курс охватывает продвинутые методы анализа данных (машинное обучение, алгоритмы кластеризации), вопросы хранения и обработки больших объемов данных с использованием SQL-подходов, на примере реляционных баз данных, таких как SQLite. Слушатели изучат техники предсказательной аналитики, которые помогут в принятии обоснованных решений на основе полученных результатов. В процессе изучения материала акцентируется внимание на организации аналитических процессов ("пайплайнов"), формулировании исследовательских гипотез, выявлении социально-экономических проблем и определении инсайтов для оперативной аналитики. В качестве источников данных рассматриваются массивы социологических данных из ЕАЭСД ВШЭ, RLMS, Росстата, баз данных СМИ.
Цель освоения дисциплины
- Применять язык R для воспроизводимого анализа социально-экономических данных, включая разведочный анализ, визуализацию и оформление отчётов в формате R Markdown.
- Извлекать и обрабатывать данные из реляционных баз данных с помощью SQL, интегрировать их в аналитические пайплайны на R и использовать в социальных исследованиях.
- Выявлять скрытые структуры в данных с помощью методов снижения размерности (PCA), факторного (EFA, CFA) и кластерного анализа, интерпретируя результаты в контексте социальных наук.
- Анализировать качественные текстовые данные с применением методов NLP: тематического моделирования (LDA), анализа тональности и построения семантических сетей.
- Строить и интерпретировать регрессионные модели (линейные, логистические), оценивать их качество и представлять результаты в публикационном формате.
- Анализировать структуру социальных и семантических сетей с использованием пакета igraph: вычислять центральность, выделять сообщества и визуализировать связи между социальными акторами или понятиями.
- Решать прикладные задачи анализа данных, комбинируя методы количественного, текстового и сетевого анализа в едином воспроизводимом рабочем процессе.
Планируемые результаты обучения
- Формировать практику создания воспроизводимых аналитических проектов средствами R.
- Проводить разведочный анализ социологических данных с использованием современных диагностических пакетов (VIM, inspectdf, ggplot2).
- Оформлять результаты анализа в формате воспроизводимого отчёта с интеграцией кода, визуализаций и нарратива.
- Формулировать SQL-запросы (SELECT, JOIN, GROUP BY, подзапросы) для извлечения и агрегации социологических данных
- Интегрировать реляционные базы данных (SQLite, PostgreSQL) с R через пакеты DBI/RSQLite.
- Строить аналитические пайплайны, комбинирующие SQL-обработку на стороне СУБД и статистический анализ в R.
- Применять методы снижения размерности (PCA, EFA, CFA) для выявления латентных структур в социологических данных.
- Выполнять кластерный анализ (k-means, иерархический, DBSCAN, GMM) с оценкой качества через силуэт и gap statistic.
- Интерпретировать факторные и кластерные решения в социологическом контексте, переводя статистические профили в содержательные типологии.
- Строить и диагностировать линейные и логистические регрессионные модели с проверкой статистических предпосылок
- Интерпретировать регрессионные коэффициенты, odds ratio и предельные эффекты в содержательных терминах.
- Оформлять результаты регрессионного анализа в публикационном формате через modelsummary/stargazer.
- Обрабатывать текстовые данные (очистка, токенизация, векторизация TF-IDF) с помощью пакетов quanteda/tm/tidytext.
- Применять тематическое моделирование (LDA) к корпусам открытых ответов с интерпретацией выделенных тем.
- Анализировать тональность текстов и визуализировать семантические структуры (тематические карты, облака слов).
- Строить и валидировать модели машинного обучения (деревья, Random Forest) через tidymodels с кросс-валидацией.
- Строить семантические сети на основе текстовых данных с вычислением центральности и выделением сообществ.
- Интерпретировать сетевые структуры как модели дискурса или когнитивных паттернов.
Содержание учебной дисциплины
- [Б1] Введение в R и разведочный анализ данных
- [Б2] SQL и интеграция с реляционными базами данных
- [Б3] Многомерный анализ: снижение размерности и кластеризация
- [Б4] Регрессионный анализ
- [Б5] Анализ текстовых данных и NLP
- [Б6] Продвинутые методы: машинное обучение и сетевой анализ
Элементы контроля
- Активность на семинарахФорма контроля оценивает вовлечённость студента в учебный процесс на протяжении всего курса. Активность складывается из двух компонентов: офлайн-участие на семинарах (до 10%) и присутствие на занятиях (до 5%). Офлайн-компонент оценивает не просто присутствие, а участие в разборе кейсов, задавание содержательных вопросов, помощь одногруппникам с техническими проблемами в R, участие в коллективных обсуждениях аналитических решений.
- Домашнее задание №1 — EDA и интеграция с SQLДомашнее задание закладывает фундамент курса и служит «мягким входом» в аналитический рабочий процесс. Студент получает персональный датасет из социологической базы (подвыборка RLMS-HSE или ЕАЭСД ВШЭ, сгенерированная с seed = student_id), хранящийся в SQLite-базе, и должен провести полный цикл разведочного анализа с интеграцией SQL и R. Задание начинается с написания SQL-запросов для извлечения и агрегации данных через DBI/RSQLite, после чего извлечённые tibble-объекты подвергаются EDA с использованием ggplot2, VIM, inspectdf и SmartEDA. Студент обязан оценить целостность данных, визуализировать распределения ключевых переменных, выявить пропуски и выбросы, а также сформулировать 3–4 исследовательских гипотезы, которые могут быть проверены на последующих этапах курса.
- Домашнее задание №2 — Факторный анализДомашнее задание посвящено методам снижения размерности и выявления латентных структур. Студент работает с тем же датасетом из ДЗ №1 (что обеспечивает сквозную логику курса), фокусируясь на батарее шкал (например, вопросы о доверии институтам, ценностных ориентациях или установках). Требуется провести полный цикл факторного анализа: проверка пригодности данных (KMO, тест Бартлетта), эксплораторный факторный анализ (EFA) с обоснованием числа факторов (критерий Кайзера, график каменистой осыпи, parallel analysis), применение вращения (varimax для ортогональных, oblimin для коррелированных факторов) и содержательная интерпретация выделенных факторов. Опционально — подтверждающий факторный анализ (CFA) через lavaan для проверки гипотез о структуре. Результат оформляется в RMarkdown-отчёте с обязательной визуализацией: heatmap факторных нагрузок, график каменистой осыпи, диаграмма путей CFA (если выполнен).
- Домашнее задание №3 — Кластерный анализТретье домашнее задание посвящено методам кластеризации и сегментации респондентов. Студент работает с тем же датасетом, используя либо исходные переменные, либо факторные оценки, полученные в ДЗ №2. Требуется применить минимум 3 метода кластеризации: k-means, иерархический анализ (метод Уорда) и один плотностной/модельный метод (DBSCAN или GMM через mclust). Для каждого метода — обоснование числа кластеров через силуэт, gap statistic (NbClust, factoextra) и содержательную интерпретируемость. Ключевой элемент — социологическая интерпретация кластеров: студент должен перевести статистические профили в содержательные типологии (например, «традиционалисты», «модернисты», «амбиваленты») и проиллюстрировать их через профили средних значений и cross-tabulation с внешними переменными. Задание сопровождается template-ноутбуком с готовыми блоками визуализации (factoextra::fviz_cluster(), cluster::clusplot()) и sample answer.
- Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining)Лабораторная работа предлагает студенту возможность выбора направления в зависимости от предпочтений -- это может быть продвинутый анализ данных до финального моделирования (регрессионного моделирования), либо переключение на качественные методы в лице обработки текстовых данных (NLP, Парсинг, Сетевой анализ).
- Финальный проектФинальный проект — завершающая часть курса, требующая самостоятельного исследования с применением методов, освоенных в течение года. Студент формулирует исследовательский вопрос в области социологии/экономики/политологии, выбирает датасет (из предложенного меню или самостоятельно с одобрением преподавателя), проводит полный аналитический цикл (от EDA до интерпретации) и оформляет результаты в виде отчёта + презентации. Проект может быть выполнен индивидуально или в паре (не более 2 человек; требования для пар удваиваются: больше методов, глубже теоретическая рамка, расширенная презентация). Обязательный элемент — proposal gate: за 3 недели до дедлайна студент подаёт 1-страничный Research Proposal (вопрос + датасет + планируемые методы + 3+ ссылки на литературу), который должен быть одобрен преподавателем. Проекты без одобренного proposal не принимаются и получают максимум 4 балла. Финальная защита — синхронная презентация на семинаре, в зависимости от логистики модуля.
Промежуточная аттестация
- 2026/2027 2nd module0.1 * Домашнее задание №1 — EDA и интеграция с SQL + 0.075 * Активность на семинарах + 0.15 * Домашнее задание №3 — Кластерный анализ + 0.2 * Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining) + 0.3 * Финальный проект + 0.1 * Домашнее задание №2 — Факторный анализ
Список литературы
Рекомендуемая основная литература
- SQL: быстрое погружение. - 978-5-4461-1835-9 - Шилдс Уолтер - 2022 - Санкт-Петербург: Питер - https://ibooks.ru/products/389413 - 389413 - iBOOKS
Рекомендуемая дополнительная литература
- SQL стандарт в современных СУБД: манипулирование данными - Семенова И. И., Шершнева Е. О. - Сибирский государственный автомобильно-дорожный университет - 978-5-00113-242-4 - 2023 - русский - https://e.lanbook.com/book/407393 - ЛАНЬ - 407393
- Каратеев А.Ю. - Язык R для решения задач социально-политического анализа - 978-5-9729-2456-1 - Инфра-Инженерия - 2025 - https://znanium.ru/catalog/document?id=469360 - 469360 - ZNANIUM