Прод упал. Кто виноват? Никто. И это правильно. Blameless post-mortem для 1С-команд
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Прод упал в пятницу в 18:45. Дежурный поднял всех. Три часа паники. Восстановили. В понедельник собрались на разбор. И началось: «Кто деплоил? Кто не проверил? Кто не настроил мониторинг?» Три человека в глухой обороне. Реальная причина не найдена. Action items: «усилить контроль», «быть внимательнее». Через месяц та же авария повторяется. Это blaming culture - культура поиска виноватых. Когда за ошибку наказывают, люди скрывают инциденты, замалчивают проблемы, боятся экспериментировать. Аварии повторяются. SRE предлагает другой подход: blameless post-mortem. Мы не ищем виноватых. Мы ищем системные причины. Не «кто нажал не ту кнопку», а «почему нажатие не той кнопки привело к падению прода». Не «кто не настроил мониторинг», а «почему мониторинг настраивается вручную, а не автоматически». В этом докладе я покажу: • Почему blaming culture убивает надёжность, а blameless post-mortem её повышает • Структуру post-mortem: таймлайн событий, пять «почему» до корневой причины, action items с владельцами и дедлайнами • SLI, SLO и Error Budget - как измерить надёжность в цифрах и принимать решения на основе данных • Как провести post-mortem встречу за 60 минут без поиска виноватых • Реальные кейсы из практики 1С: падение после деплоя, переполнение очереди RabbitMQ, блокировка входа пользователям • Дам репозиторий: шаблон post-mortem, чек-лист ведущего, калькулятор SLI/SLO/Error Budget, шаблон runbook, примеры реальных разборов
Работаю Главным разработчиком в Центре экспертизы Магнита
(очень широкий стек технологий)
В мире 1С с 2002 года
Начинал с 1С 7.7
Видео
Другие доклады секции
SRE и эксплуатация систем