От множества алертов к одному инциденту: как найти первопричину каскадного сбоя
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Во время каскадного сбоя одна техническая проблема может породить сотни алертов от разных сервисов и систем мониторинга. Дежурному инженеру приходится вручную определять, какие события относятся к одному инциденту, что является причиной, а что следствием. В докладе разберём, как построить конвейер обработки событий: от сбора данных из различных систем, до нормализации, дедупликации, обогащении, кластеризации и причинно-следственной корреляции. На воспроизводимом сценарии каскадного сбоя покажем, как множество алертов, возникших за пять минут, объединяется в один инцидент с предполагаемой первопричиной.
Слушатели получат практическую схему построения такого решения, требования к качеству входных данных и набор метрик, по которым можно оценить, действительно ли корреляция уменьшает алерт-шум и ускоряет работу инженеров.
7 лет в айти, руководитель продукта Artimate.
Видео
Другие доклады секции
SRE и эксплуатация систем