Как считать качество тысяч сервисов ежеминутно — дёшево, но честно

SRE и эксплуатация систем

Логирование и мониторинг
Логи, метрики, ошибки
Оптимизация

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

- SRE и observability-инженерам - Платформенным командам мониторинга - Инженерным менеджерам и tech lead'ам - Ответственным за сервисы, которым важно отслеживать качество предоставляемых услуг каждому пользователю в отдельности - Всем, кто уже сталкивался с потерей исторических метрик из-за прореживания/удаления и искал способ честно отвечать на вопрос «как менялось качество»

Тезисы

SLO — одновременно аналитика за месяцы/годы и инструмент ранней детекции проблем ежеминутно. Но часто пользовательские метрики прореживаются и удаляются — «честный» ответ на вопрос «как сервис работал год назад» либо невозможен, либо неподъёмно дорог при хранении полных исходных данных и расчёте в лоб. Расскажу, как мы свели время от конфигурации SLO до ответа на вопрос «стали лучше или хуже за год» с нескольких часов до десятка секунд — за счёт гибрида точности (прореженные данные на больших окнах, точные — только у границы инцидента), расчёта в одной точке вместо размазывания по кластеру и автозаведения SLO на появляющихся ресурсах, покрывая тысячи ресурсов без ручных действия пользователя.

9 лет в IT. Четыре года развивал и продолжаю улучшать обзервабилити-платформу в Яндексе. Прошел путь от совмещения стажировки с учебой в СПбГУ до старшего разработчика сервиса Monium.

Видео

Другие доклады секции

SRE и эксплуатация систем