• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Прикладной анализ многомерных и потоковых социально-экономических данных на языке R

Статус: Курс обязательный (Социология)
Когда читается: 4-й курс, 1, 2 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 6
Контактные часы: 48

Программа дисциплины

Аннотация

Курс предлагает слушателям углубленное знакомство с основными аспектами работы в статистической среде R (CRAN R), применяемой для решения задач социально-экономических исследований и обработки естественного языка в рамках качественных исследований. В ходе обучения акцентируется внимание на принципах организации программного кода, системах типов данных и основах функционального программирования. Основное внимание уделяется прикладным методам статистического анализа, включая работу с микроданными (социология) и макроданными (социально-экономическая статистика). Рассматриваются актуальные вопросы статистической теории и прикладного анализа данных, введения в Байесовскую статистики. Отдельно рассмотрена теория графов, которая позволяет исследовать возможности количественно-качественных методов обработки структурированных текстовых и сетевых данных. Кроме того, курс охватывает продвинутые методы анализа данных (машинное обучение, алгоритмы кластеризации), вопросы хранения и обработки больших объемов данных с использованием SQL-подходов, на примере реляционных баз данных, таких как SQLite. Слушатели изучат техники предсказательной аналитики, которые помогут в принятии обоснованных решений на основе полученных результатов. В процессе изучения материала акцентируется внимание на организации аналитических процессов ("пайплайнов"), формулировании исследовательских гипотез, выявлении социально-экономических проблем и определении инсайтов для оперативной аналитики. В качестве источников данных рассматриваются массивы социологических данных из ЕАЭСД ВШЭ, RLMS, Росстата, баз данных СМИ.
Цель освоения дисциплины

Цель освоения дисциплины

  • Применять язык R для воспроизводимого анализа социально-экономических данных, включая разведочный анализ, визуализацию и оформление отчётов в формате R Markdown.
  • Извлекать и обрабатывать данные из реляционных баз данных с помощью SQL, интегрировать их в аналитические пайплайны на R и использовать в социальных исследованиях.
  • Выявлять скрытые структуры в данных с помощью методов снижения размерности (PCA), факторного (EFA, CFA) и кластерного анализа, интерпретируя результаты в контексте социальных наук.
  • Анализировать качественные текстовые данные с применением методов NLP: тематического моделирования (LDA), анализа тональности и построения семантических сетей.
  • Строить и интерпретировать регрессионные модели (линейные, логистические), оценивать их качество и представлять результаты в публикационном формате.
  • Анализировать структуру социальных и семантических сетей с использованием пакета igraph: вычислять центральность, выделять сообщества и визуализировать связи между социальными акторами или понятиями.
  • Решать прикладные задачи анализа данных, комбинируя методы количественного, текстового и сетевого анализа в едином воспроизводимом рабочем процессе.
Планируемые результаты обучения

Планируемые результаты обучения

  • Формировать практику создания воспроизводимых аналитических проектов средствами R.
  • Проводить разведочный анализ социологических данных с использованием современных диагностических пакетов (VIM, inspectdf, ggplot2).
  • Оформлять результаты анализа в формате воспроизводимого отчёта с интеграцией кода, визуализаций и нарратива.
  • Формулировать SQL-запросы (SELECT, JOIN, GROUP BY, подзапросы) для извлечения и агрегации социологических данных
  • Интегрировать реляционные базы данных (SQLite, PostgreSQL) с R через пакеты DBI/RSQLite.
  • Строить аналитические пайплайны, комбинирующие SQL-обработку на стороне СУБД и статистический анализ в R.
  • Применять методы снижения размерности (PCA, EFA, CFA) для выявления латентных структур в социологических данных.
  • Выполнять кластерный анализ (k-means, иерархический, DBSCAN, GMM) с оценкой качества через силуэт и gap statistic.
  • Интерпретировать факторные и кластерные решения в социологическом контексте, переводя статистические профили в содержательные типологии.
  • Строить и диагностировать линейные и логистические регрессионные модели с проверкой статистических предпосылок
  • Интерпретировать регрессионные коэффициенты, odds ratio и предельные эффекты в содержательных терминах.
  • Оформлять результаты регрессионного анализа в публикационном формате через modelsummary/stargazer.
  • Обрабатывать текстовые данные (очистка, токенизация, векторизация TF-IDF) с помощью пакетов quanteda/tm/tidytext.
  • Применять тематическое моделирование (LDA) к корпусам открытых ответов с интерпретацией выделенных тем.
  • Анализировать тональность текстов и визуализировать семантические структуры (тематические карты, облака слов).
  • Строить и валидировать модели машинного обучения (деревья, Random Forest) через tidymodels с кросс-валидацией.
  • Строить семантические сети на основе текстовых данных с вычислением центральности и выделением сообществ.
  • Интерпретировать сетевые структуры как модели дискурса или когнитивных паттернов.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • [Б1] Введение в R и разведочный анализ данных
  • [Б2] SQL и интеграция с реляционными базами данных
  • [Б3] Многомерный анализ: снижение размерности и кластеризация
  • [Б4] Регрессионный анализ
  • [Б5] Анализ текстовых данных и NLP
  • [Б6] Продвинутые методы: машинное обучение и сетевой анализ
Элементы контроля

Элементы контроля

  • неблокирующий Активность на семинарах
    Форма контроля оценивает вовлечённость студента в учебный процесс на протяжении всего курса. Активность складывается из двух компонентов: офлайн-участие на семинарах (до 10%) и присутствие на занятиях (до 5%). Офлайн-компонент оценивает не просто присутствие, а участие в разборе кейсов, задавание содержательных вопросов, помощь одногруппникам с техническими проблемами в R, участие в коллективных обсуждениях аналитических решений.
  • неблокирующий Домашнее задание №1 — EDA и интеграция с SQL
    Домашнее задание закладывает фундамент курса и служит «мягким входом» в аналитический рабочий процесс. Студент получает персональный датасет из социологической базы (подвыборка RLMS-HSE или ЕАЭСД ВШЭ, сгенерированная с seed = student_id), хранящийся в SQLite-базе, и должен провести полный цикл разведочного анализа с интеграцией SQL и R. Задание начинается с написания SQL-запросов для извлечения и агрегации данных через DBI/RSQLite, после чего извлечённые tibble-объекты подвергаются EDA с использованием ggplot2, VIM, inspectdf и SmartEDA. Студент обязан оценить целостность данных, визуализировать распределения ключевых переменных, выявить пропуски и выбросы, а также сформулировать 3–4 исследовательских гипотезы, которые могут быть проверены на последующих этапах курса.
  • неблокирующий Домашнее задание №2 — Факторный анализ
    Домашнее задание посвящено методам снижения размерности и выявления латентных структур. Студент работает с тем же датасетом из ДЗ №1 (что обеспечивает сквозную логику курса), фокусируясь на батарее шкал (например, вопросы о доверии институтам, ценностных ориентациях или установках). Требуется провести полный цикл факторного анализа: проверка пригодности данных (KMO, тест Бартлетта), эксплораторный факторный анализ (EFA) с обоснованием числа факторов (критерий Кайзера, график каменистой осыпи, parallel analysis), применение вращения (varimax для ортогональных, oblimin для коррелированных факторов) и содержательная интерпретация выделенных факторов. Опционально — подтверждающий факторный анализ (CFA) через lavaan для проверки гипотез о структуре. Результат оформляется в RMarkdown-отчёте с обязательной визуализацией: heatmap факторных нагрузок, график каменистой осыпи, диаграмма путей CFA (если выполнен).
  • неблокирующий Домашнее задание №3 — Кластерный анализ
    Третье домашнее задание посвящено методам кластеризации и сегментации респондентов. Студент работает с тем же датасетом, используя либо исходные переменные, либо факторные оценки, полученные в ДЗ №2. Требуется применить минимум 3 метода кластеризации: k-means, иерархический анализ (метод Уорда) и один плотностной/модельный метод (DBSCAN или GMM через mclust). Для каждого метода — обоснование числа кластеров через силуэт, gap statistic (NbClust, factoextra) и содержательную интерпретируемость. Ключевой элемент — социологическая интерпретация кластеров: студент должен перевести статистические профили в содержательные типологии (например, «традиционалисты», «модернисты», «амбиваленты») и проиллюстрировать их через профили средних значений и cross-tabulation с внешними переменными. Задание сопровождается template-ноутбуком с готовыми блоками визуализации (factoextra::fviz_cluster(), cluster::clusplot()) и sample answer.
  • неблокирующий Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining)
    Лабораторная работа предлагает студенту возможность выбора направления в зависимости от предпочтений -- это может быть продвинутый анализ данных до финального моделирования (регрессионного моделирования), либо переключение на качественные методы в лице обработки текстовых данных (NLP, Парсинг, Сетевой анализ).
  • неблокирующий Финальный проект
    Финальный проект — завершающая часть курса, требующая самостоятельного исследования с применением методов, освоенных в течение года. Студент формулирует исследовательский вопрос в области социологии/экономики/политологии, выбирает датасет (из предложенного меню или самостоятельно с одобрением преподавателя), проводит полный аналитический цикл (от EDA до интерпретации) и оформляет результаты в виде отчёта + презентации. Проект может быть выполнен индивидуально или в паре (не более 2 человек; требования для пар удваиваются: больше методов, глубже теоретическая рамка, расширенная презентация). Обязательный элемент — proposal gate: за 3 недели до дедлайна студент подаёт 1-страничный Research Proposal (вопрос + датасет + планируемые методы + 3+ ссылки на литературу), который должен быть одобрен преподавателем. Проекты без одобренного proposal не принимаются и получают максимум 4 балла. Финальная защита — синхронная презентация на семинаре, в зависимости от логистики модуля.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 2nd module
    0.1 * Домашнее задание №1 — EDA и интеграция с SQL + 0.075 * Активность на семинарах + 0.15 * Домашнее задание №3 — Кластерный анализ + 0.2 * Лабораторная работа — Продвинутая аналитика по направлению (Регрессионный анализ, NLP+Text Mining) + 0.3 * Финальный проект + 0.1 * Домашнее задание №2 — Факторный анализ
Список литературы

Список литературы

Рекомендуемая основная литература

  • 9781491981627 - Silge, Julia; Robinson, David - Text Mining with R : A Tidy Approach - 2017 - O'Reilly Media - http://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=1533983 - nlebk - 1533983
  • Brown, T. A. (2015). Confirmatory Factor Analysis for Applied Research, Second Edition (Vol. Second edition). New York: The Guilford Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=831411
  • Date, C. J. (2015). SQL and Relational Theory : How to Write Accurate SQL Code (Vol. Third edition). Sebastopol, CA: O’Reilly Media. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1099367
  • King R. S. Cluster Analysis and Data Mining: An Introduction. - Mercury Learning, 2015. - ЭБС Books 24x7.
  • Munzert, S. (2014). Automated Data Collection with R : A Practical Guide to Web Scraping and Text Mining. HobokenChichester, West Sussex, United Kingdom: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=878670
  • Ren, K. (2016). Learning R Programming. Birmingham: Packt Publishing. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1409189
  • SQL: быстрое погружение. - 978-5-4461-1835-9 - Шилдс Уолтер - 2022 - Санкт-Петербург: Питер - https://ibooks.ru/products/389413 - 389413 - iBOOKS
  • Trejo, O., & C. Figliozzi, P. (2017). R Programming By Example : Practical, Hands-on Projects to Help You Get Started with R. Birmingham: Packt Publishing. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1682395
  • Wasserman, S., & Faust, K. (1994). Social Network Analysis : Methods and Applications. Cambridge: Cambridge eText. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=490515
  • Weisberg, S. (2005). Applied Linear Regression (Vol. 3rd ed). Hoboken, N.J.: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=128514
  • Zhao, Y., & Cen, Y. (2013). Data Mining Applications with R. Amsterdam: Academic Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=543675

Рекомендуемая дополнительная литература

  • Berry, M. W., & Kogan, J. (2010). Text Mining : Applications and Theory. Chichester, U.K.: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=314553
  • Carrington, P. J., Scott, J., & Wasserman, S. (2005). Models and Methods in Social Network Analysis. Cambridge: Cambridge University Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=132264
  • Fox, J., Jr, & Weisberg, H. S. (2010). An R Companion to Applied Regression. Thousand Oaks: SAGE Publications, Inc. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1236075
  • Kantardzic, M., & Recorded Books, I. (2019). Data Mining : Concepts, Models, Methods, and Algorithms (Vol. Third edition). [Place of publication not identified]: Wiley-IEEE Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=2282578
  • Keith McNulty. (2021). Handbook of Regression Modeling in People Analytics : With Examples in R and Python. Chapman and Hall/CRC.
  • Linoff, G. (2016). Data Analysis Using SQL and Excel: Vol. Second edition. Wiley.
  • Каратеев А.Ю. - Язык R для решения задач социально-политического анализа - 978-5-9729-2456-1 - Инфра-Инженерия - 2025 - https://znanium.ru/catalog/document?id=469360 - 469360 - ZNANIUM
  • Семенова, И. И. SQL стандарт в современных СУБД: манипулирование данными : учебное пособие / И. И. Семенова, Е. О. Шершнева. — 2-е изд., деривативн., испр. и доп. — Омск : СибАДИ, 2023. — 54 с. — ISBN 978-5-00113-242-4. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/407393 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.

Авторы

  • Пашков Станислав Георгиевич