• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Магистратура 2026/2027

Методы хранения данных для больших языковых моделей

ID 1271938

Когда читается: 2-й курс, 1 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 28

Программа дисциплины

Аннотация

Дисциплина посвящена проектированию и эксплуатации систем хранения данных для задач искусственного интеллекта. Рассматриваются типы данных и хранилищ, применяемых в ИИ-системах: данные для обучения моделей, оперативные данные, долговременная память, история взаимодействий, данные для семантического поиска и внешние источники. Особое внимание уделяется корпоративным платформам данных, потоковой обработке информации, векторным представлениям и семантическому поиску, архитектурам систем дополнения запросов (RAG-подходы), хранилищам признаков, а также эксплуатационным аспектам: наблюдаемости, стоимости хранения, безопасности и импортозамещению. Практическая часть курса включает проектирование архитектуры системы хранения данных для выбранного типа ИИ-системы (чат-бот, рекомендательная система, интеллектуальный поиск или аналитическая платформа) с обоснованием выбора технологий и потоков данных.
Цель освоения дисциплины

Цель освоения дисциплины

  • Сформировать у студентов целостное понимание архитектуры систем хранения данных для задач искусственного интеллекта и практические навыки проектирования таких систем с учётом требований к масштабируемости, актуальности данных, задержкам обработки и стоимости хранения.
Планируемые результаты обучения

Планируемые результаты обучения

  • Понимать роль различных типов данных и хранилищ в ИИ-системах (обучение, онлайн-сервисы, память, поиск, аналитика).
  • Владеть подходами к проектированию корпоративных платформ данных (Data Lake, DWH, витрины данных, мастер-данные, каталоги данных).
  • Уметь проектировать потоки данных, включая потоковую обработку и обновление признаков и индексов в реальном времени.
  • Понимать принципы работы векторных хранилищ и семантического поиска, а также ограничения их применения.
  • Владеть базовыми подходами к архитектуре систем дополнения запросов (RAG-системы, внешние источники знаний, долговременная память).
  • Уметь проектировать хранилища признаков (online/offline) с учётом согласованности и качества данных.
  • Учитывать эксплуатационные аспекты: наблюдаемость, безопасность, стоимость хранения, уровни данных (hot/warm/cold), работу с персональными данными и импортозамещение.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Архитектура данных в системах ИИ
  • Платформа данных для ИИ
  • Потоки данных и обработка в реальном времени
  • Векторные хранилища и семантический поиск
  • Архитектура систем дополнения запросов (RAG)
  • Хранение признаков и оперативные расчёты
  • Эксплуатация систем хранения данных для ИИ
Элементы контроля

Элементы контроля

  • неблокирующий Домашние задания
  • неблокирующий Итоговый проект
    Проект по проектированию системы хранения данных для ИИ-системы.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 1st module
    0.7 * Итоговый проект + 0.3 * Домашние задания
Список литературы

Список литературы

Рекомендуемая основная литература

  • Kleppmann, M. (2017). Designing Data-Intensive Applications : The Big Ideas Behind Reliable, Scalable, and Maintainable Systems. Sebastopol, CA: O’Reilly Media. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1487643
  • System Design : подготовка к сложному интервью, Сюй, А., 2023

Рекомендуемая дополнительная литература

  • Inmon, W. H., Linst, D., & Levins, M. (2019). Data Architecture: A Primer for the Data Scientist : A Primer for the Data Scientist (Vol. Second Edition). London: Academic Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1951596
  • The cloud data lake : a guide to building robust cloud data architecture, Gopalan, R., 2023

Авторы

  • Емашева Валерия Анатольевна