Векторный, полнотекстовый и гибридный поиск в YDB: контекст для моделей на реальных данных

Базы данных и системы хранения

Базы данных, обработка данных
YDB

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Доклад будет полезен разработчикам, архитекторам и техническим руководителям, которые строят поиск по большим объемам данных: внутренние базы знаний, RAG-платформы, агентные инструменты, хранилища документов, рекомендательные и аналитические сервисы. Отдельно - тем, кто выбирает между внешним поисковым движком, векторной БД и поиском внутри транзакционной базы.

Тезисы

В RAG и агентных сценариях модель отвечает тем, что ей нашли. В маленьком примере достаточно построить эмбеддинги, добавить полнотекстовый индекс и объединить лексический и семантический поиск. В распределенной базе это быстро становится отдельной инженерной задачей.

Я расскажу не про API поиска, а про инженерные решения при встраивании поиска в YDB: обновления вместе с таблицей, фильтры и права доступа, шардинг, сбои, SQL-план и ранжирование. Разберу кластеризованный векторный индекс, полнотекстовый индекс с BM25, цену N-грамм и фильтров, а также 'HybridRank'.

Руководитель группы, кандидат технических наук, доцент.

Видео

Другие доклады секции

Базы данных и системы хранения