ClickHouse Safety System в X5: система отлова рискованных запросов до OOM на основе искусственного интеллекта

Базы данных и системы хранения

Python
Отказоустойчивость
Распределенные системы
Безопасность программного кода, SQL и прочие инъекции
Архитектура данных, потоки данных, версионирование
Менеджмент в эксплуатации
Администрирование баз данных
ClickHouse
Управление инцидентами
Надёжность продакшена
Тестирование новых продуктов
Доверие команды внутри и снаружи
DevOps / SRE

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Инженеры эксплуатации, администраторы баз данных (DBA), инженеры надежности (SRE) и платформенные команды, у которых ClickHouse - общий ресурс многих команд

Тезисы

Слушатель уйдет с рабочим рецептом проактивного слоя стабильности на основе искусственного интеллекта: рискованный запрос виден за минуты - до падения узла, а не после, - а его автор получает причину и конкретное исправление. В докладе - систематика признаков, по которым запрос выдает себя заранее; методика калибровки порогов по данным query_log вместо экспертных догадок; принципы наблюдения, при которых наблюдатель не роняет наблюдаемое; и рамка применения ИИ в эксплуатации: LLM объясняет и рекомендует, schema-retriever заземляет ее на реальную схему и статистику (подход RAG), исходы запросов сами собираются в размеченный набор данных - а вердикт о риске остается за детерминированными правилами, поэтому отказ модели не останавливает систему. В финале - контрольный список «как повторить у себя».

Алексей Филинский

ООО «ИТ Икс 5 Технологии»

7 лет в IT
Прошел путь от аналитика до архитектора

Видео

Другие доклады секции

Базы данных и системы хранения