От множества алертов к одному инциденту: как найти первопричину каскадного сбоя

SRE и эксплуатация систем

Логирование и мониторинг
Сетевое администрирование
Devops / другое
Управление инцидентами
Observability в enterprise
Логи, метрики, ошибки
Автоматизация разработки, доставки, эксплуатации
DevOps / SRE

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

SRE и DevOps-инженеры, специалисты по эксплуатации, архитекторы систем мониторинга и observability, технические лидеры и руководители эксплуатации, которые работают с большим потоком событий из нескольких источников и отвечают за обнаружение и разбор инцидентов. Доклад будет полезен командам, использующим Zabbix, Prometheus, Alertmanager и другие системы мониторинга, но столкнувшимся с информационным шумом, дублированием событий и длительным поиском первопричины. Для понимания материала достаточно базового представления о мониторинге и микросервисной архитектуре. Знание машинного обучения не требуется.

Тезисы

Во время каскадного сбоя одна техническая проблема может породить сотни алертов от разных сервисов и систем мониторинга. Дежурному инженеру приходится вручную определять, какие события относятся к одному инциденту, что является причиной, а что следствием. В докладе разберём, как построить конвейер обработки событий: от сбора данных из различных систем, до нормализации, дедупликации, обогащении, кластеризации и причинно-следственной корреляции. На воспроизводимом сценарии каскадного сбоя покажем, как множество алертов, возникших за пять минут, объединяется в один инцидент с предполагаемой первопричиной.

Слушатели получат практическую схему построения такого решения, требования к качеству входных данных и набор метрик, по которым можно оценить, действительно ли корреляция уменьшает алерт-шум и ускоряет работу инженеров.

7 лет в айти, руководитель продукта Artimate.

Видео

Другие доклады секции

SRE и эксплуатация систем