Бакалавриат
2026/2027





Прикладной анализ многомерных и потоковых социально-экономических данных на языке R
Статус:
Курс обязательный (Социология)
Кто читает:
Департамент социологии
Где читается:
Факультет социальных наук
Когда читается:
4-й курс, 1, 2 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Пашков Станислав Георгиевич
Язык:
русский
Кредиты:
6
Контактные часы:
48
Программа дисциплины
Аннотация
Курс предлагает слушателям углубленное знакомство с основными аспектами работы в статистической среде R (CRAN R), применяемой для решения задач социально-экономических исследований и обработки естественного языка в рамках качественных исследований. В ходе обучения акцентируется внимание на принципах организации программного кода, системах типов данных и основах функционального программирования. Основное внимание уделяется прикладным методам статистического анализа, включая работу с микроданными (социология) и макроданными (социально-экономическая статистика). Рассматриваются актуальные вопросы статистической теории и прикладного анализа данных, введения в Байесовскую статистики. Отдельно рассмотрена теория графов, которая позволяет исследовать возможности количественно-качественных методов обработки структурированных текстовых и сетевых данных. Кроме того, курс охватывает продвинутые методы анализа данных (машинное обучение, алгоритмы кластеризации), вопросы хранения и обработки больших объемов данных с использованием SQL-подходов, на примере реляционных баз данных, таких как SQLite. Слушатели изучат техники предсказательной аналитики, которые помогут в принятии обоснованных решений на основе полученных результатов. В процессе изучения материала акцентируется внимание на организации аналитических процессов ("пайплайнов"), формулировании исследовательских гипотез, выявлении социально-экономических проблем и определении инсайтов для оперативной аналитики. В качестве источников данных рассматриваются массивы социологических данных из ЕАЭСД ВШЭ, RLMS, Росстата, баз данных СМИ.
Цель освоения дисциплины
- Применять язык R для воспроизводимого анализа социально-экономических данных, включая разведочный анализ, визуализацию и оформление отчётов в формате R Markdown.
- Извлекать и обрабатывать данные из реляционных баз данных с помощью SQL, интегрировать их в аналитические пайплайны на R и использовать в социальных исследованиях.
- Выявлять скрытые структуры в данных с помощью методов снижения размерности (PCA), факторного (EFA, CFA) и кластерного анализа, интерпретируя результаты в контексте социальных наук.
- Анализировать качественные текстовые данные с применением методов NLP: тематического моделирования (LDA), анализа тональности и построения семантических сетей.
- Строить и интерпретировать регрессионные модели (линейные, логистические), оценивать их качество и представлять результаты в публикационном формате.
- Анализировать структуру социальных и семантических сетей с использованием пакета igraph: вычислять центральность, выделять сообщества и визуализировать связи между социальными акторами или понятиями.
- Решать прикладные задачи анализа данных, комбинируя методы количественного, текстового и сетевого анализа в едином воспроизводимом рабочем процессе.
Планируемые результаты обучения
- Формировать практику создания воспроизводимых аналитических проектов средствами R.
- Проводить разведочный анализ социологических данных с использованием современных диагностических пакетов (VIM, inspectdf, ggplot2).
- Оформлять результаты анализа в формате воспроизводимого отчёта с интеграцией кода, визуализаций и нарратива.
- Формулировать SQL-запросы (SELECT, JOIN, GROUP BY, подзапросы) для извлечения и агрегации социологических данных
- Интегрировать реляционные базы данных (SQLite, PostgreSQL) с R через пакеты DBI/RSQLite.
- Строить аналитические пайплайны, комбинирующие SQL-обработку на стороне СУБД и статистический анализ в R.
- Применять методы снижения размерности (PCA, EFA, CFA) для выявления латентных структур в социологических данных.
- Выполнять кластерный анализ (k-means, иерархический, DBSCAN, GMM) с оценкой качества через силуэт и gap statistic.
- Интерпретировать факторные и кластерные решения в социологическом контексте, переводя статистические профили в содержательные типологии.
- Строить и диагностировать линейные и логистические регрессионные модели с проверкой статистических предпосылок
- Интерпретировать регрессионные коэффициенты, odds ratio и предельные эффекты в содержательных терминах.
- Оформлять результаты регрессионного анализа в публикационном формате через modelsummary/stargazer.
- Обрабатывать текстовые данные (очистка, токенизация, векторизация TF-IDF) с помощью пакетов quanteda/tm/tidytext.
- Применять тематическое моделирование (LDA) к корпусам открытых ответов с интерпретацией выделенных тем.
- Анализировать тональность текстов и визуализировать семантические структуры (тематические карты, облака слов).
- Строить и валидировать модели машинного обучения (деревья, Random Forest) через tidymodels с кросс-валидацией.
- Строить семантические сети на основе текстовых данных с вычислением центральности и выделением сообществ.
- Интерпретировать сетевые структуры как модели дискурса или когнитивных паттернов.
Содержание учебной дисциплины
- [Б1] Введение в R и разведочный анализ данных
- [Б2] SQL и интеграция с реляционными базами данных
- [Б3] Многомерный анализ: снижение размерности и кластеризация
- [Б4] Регрессионный анализ
- [Б5] Анализ текстовых данных и NLP
- [Б6] Продвинутые методы: машинное обучение и сетевой анализ
Элементы контроля
- Активность на семинарахФорма контроля оценивает вовлечённость студента в учебный процесс на протяжении всего курса. Активность складывается из двух компонентов: офлайн-участие на семинарах (до 10%) и присутствие на занятиях (до 5%). Офлайн-компонент оценивает не просто присутствие, а участие в разборе кейсов, задавание содержательных вопросов, помощь одногруппникам с техническими проблемами в R, участие в коллективных обсуждениях аналитических решений.
- Домашнее задание №1 — EDA и интеграция с SQLДомашнее задание закладывает фундамент курса и служит «мягким входом» в аналитический рабочий процесс. Студент получает персональный датасет из социологической базы (подвыборка RLMS-HSE или ЕАЭСД ВШЭ, сгенерированная с seed = student_id), хранящийся в SQLite-базе, и должен провести полный цикл разведочного анализа с интеграцией SQL и R. Задание начинается с написания SQL-запросов для извлечения и агрегации данных через DBI/RSQLite, после чего извлечённые tibble-объекты подвергаются EDA с использованием ggplot2, VIM, inspectdf и SmartEDA. Студент обязан оценить целостность данных, визуализировать распределения ключевых переменных, выявить пропуски и выбросы, а также сформулировать 3–4 исследовательских гипотезы, которые могут быть проверены на последующих этапах курса.
- Домашнее задание №2 — Факторный анализДомашнее задание посвящено методам снижения размерности и выявления латентных структур. Студент работает с тем же датасетом из ДЗ №1 (что обеспечивает сквозную логику курса), фокусируясь на батарее шкал (например, вопросы о доверии институтам, ценностных ориентациях или установках). Требуется провести полный цикл факторного анализа: проверка пригодности данных (KMO, тест Бартлетта), эксплораторный факторный анализ (EFA) с обоснованием числа факторов (критерий Кайзера, график каменистой осыпи, parallel analysis), применение вращения (varimax для ортогональных, oblimin для коррелированных факторов) и содержательная интерпретация выделенных факторов. Опционально — подтверждающий факторный анализ (CFA) через lavaan для проверки гипотез о структуре. Результат оформляется в RMarkdown-отчёте с обязательной визуализацией: heatmap факторных нагрузок, график каменистой осыпи, диаграмма путей CFA (если выполнен).
- Домашнее задание №3 — Кластерный анализТретье домашнее задание посвящено методам кластеризации и сегментации респондентов. Студент работает с тем же датасетом, используя либо исходные переменные, либо факторные оценки, полученные в ДЗ №2. Требуется применить минимум 3 метода кластеризации: k-means, иерархический анализ (метод Уорда) и один плотностной/модельный метод (DBSCAN или GMM через mclust). Для каждого метода — обоснование числа кластеров через силуэт, gap statistic (NbClust, factoextra) и содержательную интерпретируемость. Ключевой элемент — социологическая интерпретация кластеров: студент должен перевести статистические профили в содержательные типологии (например, «традиционалисты», «модернисты», «амбиваленты») и проиллюстрировать их через профили средних значений и cross-tabulation с внешними переменными. Задание сопровождается template-ноутбуком с готовыми блоками визуализации (factoextra::fviz_cluster(), cluster::clusplot()) и sample answer.
- Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining)Лабораторная работа предлагает студенту возможность выбора направления в зависимости от предпочтений -- это может быть продвинутый анализ данных до финального моделирования (регрессионного моделирования), либо переключение на качественные методы в лице обработки текстовых данных (NLP, Парсинг, Сетевой анализ).
- Финальный проектФинальный проект — завершающая часть курса, требующая самостоятельного исследования с применением методов, освоенных в течение года. Студент формулирует исследовательский вопрос в области социологии/экономики/политологии, выбирает датасет (из предложенного меню или самостоятельно с одобрением преподавателя), проводит полный аналитический цикл (от EDA до интерпретации) и оформляет результаты в виде отчёта + презентации. Проект может быть выполнен индивидуально или в паре (не более 2 человек; требования для пар удваиваются: больше методов, глубже теоретическая рамка, расширенная презентация). Обязательный элемент — proposal gate: за 3 недели до дедлайна студент подаёт 1-страничный Research Proposal (вопрос + датасет + планируемые методы + 3+ ссылки на литературу), который должен быть одобрен преподавателем. Проекты без одобренного proposal не принимаются и получают максимум 4 балла. Финальная защита — синхронная презентация на семинаре, в зависимости от логистики модуля.
Промежуточная аттестация
- 2026/2027 2nd module0.1 * Домашнее задание №1 — EDA и интеграция с SQL + 0.075 * Активность на семинарах + 0.15 * Домашнее задание №3 — Кластерный анализ + 0.2 * Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining) + 0.3 * Финальный проект + 0.1 * Домашнее задание №2 — Факторный анализ
Список литературы
Рекомендуемая основная литература
- 9781491981627 - Silge, Julia; Robinson, David - Text Mining with R : A Tidy Approach - 2017 - O'Reilly Media - http://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=1533983 - nlebk - 1533983
- Brown, T. A. (2015). Confirmatory Factor Analysis for Applied Research, Second Edition (Vol. Second edition). New York: The Guilford Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=831411
- Date, C. J. (2015). SQL and Relational Theory : How to Write Accurate SQL Code (Vol. Third edition). Sebastopol, CA: O’Reilly Media. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1099367
- King R. S. Cluster Analysis and Data Mining: An Introduction. - Mercury Learning, 2015. - ЭБС Books 24x7.
- Munzert, S. (2014). Automated Data Collection with R : A Practical Guide to Web Scraping and Text Mining. HobokenChichester, West Sussex, United Kingdom: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=878670
- Ren, K. (2016). Learning R Programming. Birmingham: Packt Publishing. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1409189
- SQL: быстрое погружение. - 978-5-4461-1835-9 - Шилдс Уолтер - 2022 - Санкт-Петербург: Питер - https://ibooks.ru/products/389413 - 389413 - iBOOKS
- Trejo, O., & C. Figliozzi, P. (2017). R Programming By Example : Practical, Hands-on Projects to Help You Get Started with R. Birmingham: Packt Publishing. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1682395
- Wasserman, S., & Faust, K. (1994). Social Network Analysis : Methods and Applications. Cambridge: Cambridge eText. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=490515
- Weisberg, S. (2005). Applied Linear Regression (Vol. 3rd ed). Hoboken, N.J.: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=128514
- Zhao, Y., & Cen, Y. (2013). Data Mining Applications with R. Amsterdam: Academic Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=543675
Рекомендуемая дополнительная литература
- Berry, M. W., & Kogan, J. (2010). Text Mining : Applications and Theory. Chichester, U.K.: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=314553
- Carrington, P. J., Scott, J., & Wasserman, S. (2005). Models and Methods in Social Network Analysis. Cambridge: Cambridge University Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=132264
- Fox, J., Jr, & Weisberg, H. S. (2010). An R Companion to Applied Regression. Thousand Oaks: SAGE Publications, Inc. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1236075
- Kantardzic, M., & Recorded Books, I. (2019). Data Mining : Concepts, Models, Methods, and Algorithms (Vol. Third edition). [Place of publication not identified]: Wiley-IEEE Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=2282578
- Keith McNulty. (2021). Handbook of Regression Modeling in People Analytics : With Examples in R and Python. Chapman and Hall/CRC.
- Linoff, G. (2016). Data Analysis Using SQL and Excel: Vol. Second edition. Wiley.
- Каратеев А.Ю. - Язык R для решения задач социально-политического анализа - 978-5-9729-2456-1 - Инфра-Инженерия - 2025 - https://znanium.ru/catalog/document?id=469360 - 469360 - ZNANIUM
- Семенова, И. И. SQL стандарт в современных СУБД: манипулирование данными : учебное пособие / И. И. Семенова, Е. О. Шершнева. — 2-е изд., деривативн., испр. и доп. — Омск : СибАДИ, 2023. — 54 с. — ISBN 978-5-00113-242-4. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/407393 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.