ИИ в SRE: как построить harness и модель мира для быстрого расследования инцидентов
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Для крупных комплексных ИТ-продуктов и распределённых ИТ-инфраструктур возникновение инцидентов является рядовым явлением. Умение как можно быстрее переходить от алерта или тикета к проверяемым гипотезам и действиям критически важно. Скорость устранения напрямую влияет на доступность сервисов и пользовательский опыт. В докладе мы расскажем об опыте создания AI-платформе “Сигнал” компании ЭМС — совместного предприятия Selectel и ИТМО. В реализованном продукте AI-агенты помогают собирать контекст, исследовать зависимости и проводить первичную диагностику. Главную роль играет не сама LLM, а правильно организованный harness, который адаптирует агента к существующей инфраструктуре, источникам данных, runbook’ам и ограничениям безопасности. Все решение при этом может быть использовано и как облачное, и как on-premise инсталяция с соблюдением всех необходимых требований к безопасности. Разберём, с какими проблемами столкнулись при создании такой платформы: разрозненность источников, разное качество данных, отсутствие единой модели зависимостей и то, что сама инфраструктура часто «не знает о себе достаточно», чтобы агент мог быстро восстановить контекст. Из-за этого поведение агента сильно зависит от того, как организованы доступы, нормализация данных и связность между системами. Покажем, как архитектурные подходы — LangGraph-оркестрация, MCP-интеграции? Plan/Executor с подтверждением инженера и др. — позволяют превратить набор разрозненных инструментов в управляемый процесс расследования. Ключевую роль играет модель мира: она предоставляет топологию сервисов и зависимостей, помогает агенту не искать вслепую, а сразу работать с релевантным контекстом и корректно приоритизировать источники данных. Покажем, как сократить время расследования за счёт автоматизации сбора контекста, корреляции алертов, проверки типовых гипотез и подготовки отчёта. Обсудим, где необходим human-in-the-loop и почему агент должен оставаться управляемым помощником, а не автономным оператором production.
Окончил УлГУ в 2012 году по специальности «математическое обеспечение и администрированиеинформационных систем». В 2015 получил степень кандидата технических наук в Университете ИТМО.
C 2016 занимается научными исследованиями, R'n'D-проектами и коммерческими разработками, тесно связанными с областями анализа данных, распределенной обработки данных, LLM и мультиагентными ИИ системами. Руководит смешанными коллективами из разработчиков и ИИ-инженеров. В настоящее время совмещает работу в коммерческом секторе в компании ЭМС в роли архитектора ИИ решений с преподаванием в ИТМО.
Видео
Другие доклады секции
SRE и эксплуатация систем