От алерта до готового MR без человека — и почему сложнее всего было не это

Внедрение AI в SDLC

Java
Методы и техника разработки ПО
Проектирование информационных систем
Управление инцидентами
Логи, метрики, ошибки

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

SRE и инженеры эксплуатации; backend-разработчики, дежурящие по своим сервисам; техлиды, отвечающие за инцидент-процесс

Тезисы

Когда ломается бизнес-процесс, дороже всего обходится не починка, а всё, что до неё: понять, что у клиента не открывается счёт, а не просто выросла latency; найти владельца среди сотен сервисов; руками вывесить баннер в мобильном приложении; собрать логи и деплой-контекст. У нас на это уходило до нескольких часов, а клиенты в это время звонили в поддержку — до десяти тысяч аварийных обращений в месяц. Мы собрали конвейер на Java и Spring, который проходит первые три шага без человека: детектор доступности поверх OpenTelemetry-трассировки и VictoriaMetrics, сервис-классификатор инцидентов с хранением в PostgreSQL и агент, открывающий merge request владельцу сломанного процесса. Путь от срабатывания алерта до готового к ревью MR сократился с часов до минут. Главное в докладе — три точки, где мы применили LLM, и что с ними стало.

Александр Ерашев

Райффайзен Банк

Более 10 лет в IT, 7 лет в Райффайзен Банке. Последний год проектирую AI-агентов в SDLC-процессе. Считаю, что качество агента определяется не моделью, а обвязкой вокруг неё.

Видео

Другие доклады секции

Внедрение AI в SDLC