Магистратура
2026/2027




Методы хранения данных для больших языковых моделей
ID 1271938
Статус:
Курс по выбору (Исследования и предпринимательство в искусственном интеллекте)
Где читается:
Факультет компьютерных наук
Когда читается:
2-й курс, 1 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
3
Контактные часы:
28
Программа дисциплины
Аннотация
Дисциплина посвящена проектированию и эксплуатации систем хранения данных для задач искусственного интеллекта. Рассматриваются типы данных и хранилищ, применяемых в ИИ-системах: данные для обучения моделей, оперативные данные, долговременная память, история взаимодействий, данные для семантического поиска и внешние источники.
Особое внимание уделяется корпоративным платформам данных, потоковой обработке информации, векторным представлениям и семантическому поиску, архитектурам систем дополнения запросов (RAG-подходы), хранилищам признаков, а также эксплуатационным аспектам: наблюдаемости, стоимости хранения, безопасности и импортозамещению.
Практическая часть курса включает проектирование архитектуры системы хранения данных для выбранного типа ИИ-системы (чат-бот, рекомендательная система, интеллектуальный поиск или аналитическая платформа) с обоснованием выбора технологий и потоков данных.
Цель освоения дисциплины
- Сформировать у студентов целостное понимание архитектуры систем хранения данных для задач искусственного интеллекта и практические навыки проектирования таких систем с учётом требований к масштабируемости, актуальности данных, задержкам обработки и стоимости хранения.
Планируемые результаты обучения
- Понимать роль различных типов данных и хранилищ в ИИ-системах (обучение, онлайн-сервисы, память, поиск, аналитика).
- Владеть подходами к проектированию корпоративных платформ данных (Data Lake, DWH, витрины данных, мастер-данные, каталоги данных).
- Уметь проектировать потоки данных, включая потоковую обработку и обновление признаков и индексов в реальном времени.
- Понимать принципы работы векторных хранилищ и семантического поиска, а также ограничения их применения.
- Владеть базовыми подходами к архитектуре систем дополнения запросов (RAG-системы, внешние источники знаний, долговременная память).
- Уметь проектировать хранилища признаков (online/offline) с учётом согласованности и качества данных.
- Учитывать эксплуатационные аспекты: наблюдаемость, безопасность, стоимость хранения, уровни данных (hot/warm/cold), работу с персональными данными и импортозамещение.
Содержание учебной дисциплины
- Архитектура данных в системах ИИ
- Платформа данных для ИИ
- Потоки данных и обработка в реальном времени
- Векторные хранилища и семантический поиск
- Архитектура систем дополнения запросов (RAG)
- Хранение признаков и оперативные расчёты
- Эксплуатация систем хранения данных для ИИ
Элементы контроля
- Домашние задания
- Итоговый проектПроект по проектированию системы хранения данных для ИИ-системы.
Список литературы
Рекомендуемая основная литература
- Kleppmann, M. (2017). Designing Data-Intensive Applications : The Big Ideas Behind Reliable, Scalable, and Maintainable Systems. Sebastopol, CA: O’Reilly Media. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1487643
- System Design : подготовка к сложному интервью, Сюй, А., 2023
Рекомендуемая дополнительная литература
- Inmon, W. H., Linst, D., & Levins, M. (2019). Data Architecture: A Primer for the Data Scientist : A Primer for the Data Scientist (Vol. Second Edition). London: Academic Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1951596
- The cloud data lake : a guide to building robust cloud data architecture, Gopalan, R., 2023