Запись в ClickHouse без остановки для смены лидера: как мы переехали на ClickHouse Keeper в продакшене без потери метаданных

Базы данных и системы хранения

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

middle/middle+ администраторы баз данных (DBA), работающие с ClickHouse или Kafka; junior/middle/middle+ DevOPS и разработчики кто имеет опыт работы с zookeeper

Тезисы

Высоконагруженные кластера ClickHouse в случайный момент переходят в read-only. По мониторингу кластер выглядит здоровым - ресурсов хватает, количество запросов в рамках ожидаемого. На деле оказывается, что счетчик транзакций ZooKeeper переполнился и запустился механизм смены эпохи. Знакомая боль каждого, кто работал с ZooKeeper. Для решения проблемы мы запустили сервис ClickHouse Keeper, как замену ZooKeeper в кластерах ClickHouse.

В докладе разберём, что такое zxid overflow и почему он бьёт даже по здоровым кластерам, воспроизведём отказ ZooKeeper и посмотрим как справится Keeper. Честно перечислим ошибки, на которые мы напоролись уже с Keeper, и покажем миграцию с ZK на Keeper в Yandex Cloud без пересоздания кластера.

9 лет в IT, разрабатывал Т-Инвестиции и Яндекс.Мессенджер. В настоящее время строит платформу управляемой СУБД ClickHouse в Yandex Cloud

Видео

Другие доклады секции

Базы данных и системы хранения