PostMortem Copilot: как LLM + MinHash LSH снижают повторяемость инцидентов

Внедрение AI в SDLC

Управление инцидентами
DevOps / SRE

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

SRE-инженеры, DevOps-инженеры, инженеры дежурных смен и координаторы инцидентов, тимлиды и руководители платформенных команд, отвечающие за надёжность highload-систем. А также ML/AI-инженеры, которые внедряют LLM в операционные процессы и ищут практические паттерны продакшн-применения

Тезисы

Каждый второй PostMortem заканчивается спором о причине, а половина «мер по недопущению» умирает в тексте документа. Мы построили инструмент — PostMortem Copilot, — который на базе LLM и поиска похожих инцидентов через MinHash LSH автоматически формирует гипотезу корневой причины, альтернативные версии, факторы инцидента и конкретные меры по четырём целям: «не повторится», «заметим раньше», «пострадаем меньше», «починим быстрее».

Расскажу, почему мы отказались от эмбеддингов в пользу коэффициента Жаккара, как эмпирически нашли оптимальный порог схожести, как построили AI-судью для объективного выбора LLM из десятка on-prem моделей и почему модель — это лишь 30% успеха. Покажу продовые результаты. И расскажу, куда мы двигаемся дальше.

Евгений Лачугин

МТС Диджитал

руководитель экосистемной дежурной смены в МТС, специализирующийся на управлении и координации высокоприоритетных инцидентов в режиме 24/7. Ведет команду Mission Control Center, обеспечивая непрерывное наблюдение и оперативное реагирование на критические события в ИТ-инфраструктуре компании. Евгений обладает богатым опытом в проведении postmortem-анализа и эскалации высококритичных инцидентов, а также в организации и ведении оперштабов и emergency room. Его глубокие знания и навыки в области управления инцидентами делают его незаменимым специалистом в обеспечении надежности и устойчивости экосистемы МТС

Видео

Другие доклады секции

Внедрение AI в SDLC