• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Глубинное обучение для поисковых систем

ID 1270986

Когда читается: 3-й курс, 1, 2 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 5
Контактные часы: 56

Программа дисциплины

Аннотация

Поиск — область, где классические алгоритмы и современные нейросетевые методы работают не вместо, а вместе друг с другом. Обратный индекс и BM25 не ушли в прошлое с появлением трансформеров: production-поиск сегодня — это каскад, в котором быстрые классические и разреженные методы отбирают кандидатов, а нейросетевые модели их переранжируют. На курсе вы пройдёте полный путь построения поисковой системы: от классического информационного поиска (TF-IDF, BM25, обратный индекс) через нейросетевой поиск (эмбеддинги, bi- и cross-энкодеры, ColBERT, SPLADE, гибридные схемы) к масштабированию (приближённый поиск ближайших соседей, векторные базы данных) и генерации ответов на основе найденного — RAG, включая его оценку и агентные архитектуры. Особое внимание уделяется инженерной стороне: проектированию поисковой системы как ML-системы для production, честной оценке качества ранжирования, компромиссам между качеством, задержкой и стоимостью, а также вопросам этики и безопасности поисковых и RAG-систем. Итогом курса станет собственный поисковый проект, который необходимо представить и защитить.
Цель освоения дисциплины

Цель освоения дисциплины

  • Целью освоения курса станет создание собственного поискового проекта, который необходимо представить и защитить.
Планируемые результаты обучения

Планируемые результаты обучения

  • проектировать архитектуру поисковой системы для production: каскад «отбор кандидатов → переранжирование», выбор компонентов с учётом требований к качеству, задержке и стоимости
  • строить классический полнотекстовый поиск на основе обратного индекса, TF-IDF и BM25 и объединять результаты нескольких ранжировщиков (Rank Fusion, RRF)
  • оценивать качество ранжирования с помощью метрик Recall@k, Precision@k, MRR, MAP и nDCG, корректно строить разметку релевантности и понимать ограничения метрик (эффект Гудхарта)
  • применять нейросетевые методы поиска: эмбеддинги слов и предложений, контрастивное обучение, bi-энкодеры (DPR, SBERT), cross-энкодеры и многостадийные пайплайны переранжирования
  • использовать модели позднего взаимодействия (ColBERT), разреженные нейросетевые представления (SPLADE), гибридный поиск и методы Learning to Rank
  • масштабировать векторный поиск с помощью алгоритмов приближённого поиска ближайших соседей (HNSW, IVF, PQ), библиотеки FAISS и векторных баз данных, включая квантизацию, кэширование и оптимизацию задержки
  • строить системы RAG: разбиение документов на фрагменты, понимание и переформулирование запросов, оценка качества (RAGAS, LLM-as-judge), агентные схемы (ReAct, Self-RAG, CRAG), multi-hop и GraphRAG, мультимодальный поиск (CLIP, ColPali)
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Информационный поиск и проектирование ML-систем
  • NLP, токенизация (BPE и родственные методы) и меры близости
  • Классический поиск
  • Метрики качества ранжирования
  • Эмбеддинги слов и снижение размерности
  • Плотные и контекстные эмбеддинги, контрастивное обучение, трансформеры и механизм внимания
  • bi-энкодеры (DPR, SBERT), cross-энкодеры и многостадийные пайплайны
  • Позднее взаимодействие (ColBERT), SPLADE, гибридный поиск, Learning to Rank
  • Приближённый поиск ближайших соседей (HNSW, IVF, PQ), FAISS, векторные базы данных и эксплуатация в production
  • Основы RAG
  • Оценка RAG (RAGAS, LLM-as-judge) и агентный RAG (ReAct, Self-RAG, CRAG)
  • Продвинутый RAG
Элементы контроля

Элементы контроля

  • неблокирующий Домашние задания № 1–3
  • неблокирующий Лабораторные работы № 1–3
  • неблокирующий Промежуточный экзамен (midterm)
  • неблокирующий Итоговый экзамен
  • неблокирующий Защита проекта
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 2nd module
    0.2 * Защита проекта + 0.15 * Домашние задания № 1–3 + 0.2 * Промежуточный экзамен (midterm) + 0.3 * Итоговый экзамен + 0.15 * Лабораторные работы № 1–3
Список литературы

Список литературы

Рекомендуемая основная литература

  • Ian Goodfellow and Yoshua Bengio and Aaron Courville. Deep Learning, 2016. URL: http://www.deeplearningbook.org

Рекомендуемая дополнительная литература

  • Neural Networks and Deep Learning - CCBY4_068 - Michael Nielson - 2022 - Open Educational Resources: libretexts.org - https://ibooks.ru/products/390854 - 390854 - iBOOKS