Запись в ClickHouse без остановки для смены лидера: как мы переехали на ClickHouse Keeper в продакшене без потери метаданных
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Высоконагруженные кластера ClickHouse в случайный момент переходят в read-only. По мониторингу кластер выглядит здоровым - ресурсов хватает, количество запросов в рамках ожидаемого. На деле оказывается, что счетчик транзакций ZooKeeper переполнился и запустился механизм смены эпохи. Знакомая боль каждого, кто работал с ZooKeeper. Для решения проблемы мы запустили сервис ClickHouse Keeper, как замену ZooKeeper в кластерах ClickHouse.
В докладе разберём, что такое zxid overflow и почему он бьёт даже по здоровым кластерам, воспроизведём отказ ZooKeeper и посмотрим как справится Keeper. Честно перечислим ошибки, на которые мы напоролись уже с Keeper, и покажем миграцию с ZK на Keeper в Yandex Cloud без пересоздания кластера.
9 лет в IT, разрабатывал Т-Инвестиции и Яндекс.Мессенджер. В настоящее время строит платформу управляемой СУБД ClickHouse в Yandex Cloud
Видео
Другие доклады секции
Базы данных и системы хранения