Как считать качество тысяч сервисов ежеминутно — дёшево, но честно
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
SLO — одновременно аналитика за месяцы/годы и инструмент ранней детекции проблем ежеминутно. Но часто пользовательские метрики прореживаются и удаляются — «честный» ответ на вопрос «как сервис работал год назад» либо невозможен, либо неподъёмно дорог при хранении полных исходных данных и расчёте в лоб. Расскажу, как мы свели время от конфигурации SLO до ответа на вопрос «стали лучше или хуже за год» с нескольких часов до десятка секунд — за счёт гибрида точности (прореженные данные на больших окнах, точные — только у границы инцидента), расчёта в одной точке вместо размазывания по кластеру и автозаведения SLO на появляющихся ресурсах, покрывая тысячи ресурсов без ручных действия пользователя.
9 лет в IT. Четыре года развивал и продолжаю улучшать обзервабилити-платформу в Яндексе. Прошел путь от совмещения стажировки с учебой в СПбГУ до старшего разработчика сервиса Monium.
Видео
Другие доклады секции
SRE и эксплуатация систем