JOIN на поисковом индексе

Базы данных и системы хранения

Поисковые системы
Базы данных / другое
Оптимизация производительности
Разработка библиотек, включая open source библиотеки
Алгоритмы и их сравнение

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Разработчики поисковых систем, продуктовых каталогов и NoSQL баз данных.

Тезисы

Рассмотрим особенности устройства поисковых индексов Apache Lucene. Ответим на вопрос почему JOIN работает медленно в Elasticsearch и OpenSearch, и почему для реализации, например фильтра по остаткам товаров в реальном времени нам приходится идти на компромиссы. Далее я предложу высокопроизводительный алгоритм соединения (semi-JOIN) с использованием индекса для операции соединения. К интересным чертам алгоритма можно отнести: параллелизация вычислений; ленивое исполнение; поддержка обновлений индексов. Рассматриваемый алгоритм представляет интерес для широкого ряда LSM-tree движков.

Начинал разработку с Java backend, однажды начал заниматься поисковыми системами. С 2015 коммитер проектов Apache Lucene/Solr, есть принятые изменения в OpenSearch. Сейчас больше занят Python, интеграцией и внедрением БЯМ и агентов.

Видео

Другие доклады секции

Базы данных и системы хранения