Agent Platform Engineering: как запустить AI-агентов для тысяч инженеров и не сжечь бюджет на GPU
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Многие компании начинают внедрение AI-агентов с экспериментов: подключают coding assistant, дают командам доступ к модели и ждут роста эффективности. Но когда агентами начинают пользоваться не десятки энтузиастов, а тысячи инженеров, задача резко меняется. На первый план выходят не промпты, а platform engineering: как выдержать нагрузку, не разориться на инференсе, защитить внутренние системы, контролировать действия агентов и обеспечить стабильность сервиса, который становится частью инженерного контура.
В докладе разберу, из каких слоев состоит агентная платформа в реальной эксплуатации: on-premise-инференс, vLLM, GPU-кластер, Kubernetes, балансировка нагрузки, очереди, квоты, кэширование, observability, MCP-шлюзы, политики доступа и guardrails. На практическом кейсе от Центра гибридного интеллекта в группе Рунити покажу, какие решения нужно принять до масштабирования: строить свой инференс или покупать внешний, как считать стоимость токена, как оценивать загрузку GPU, где появляются OOM, что происходит с KV-cache под длинным контекстом и почему «добавим еще железа» не всегда решает проблему.
Отдельно затрону безопасность и управляемость автономных агентов. Чем полезнее агент, тем больше доступов ему нужно: к репозиториям, CI/CD, документации, задачам, внутренним API и инструментам разработки. Но широкие доступы быстро превращаются в риск: утечки, неверные действия, обход правил, случайные изменения в production-контуре. Разберу, как разработчикам и ML-инженерам проектировать MCP-шлюзы, политики OPA/Rego, технические учетные записи, ограничения действий и guardrails так, чтобы агент мог помогать инженерам, но не мог сломать критичные системы.
Тезисы: - Как понять, что AI-агенты перестали быть экспериментом и становятся highload-платформой. - Считаем экономику on-premise-инференса: CapEx, OpEx, стоимость токена и окупаемость GPU. - Проектируем inference layer на vLLM, Kubernetes и GPU-кластере под ежедневную нагрузку. - Разберем, как находить и устранять bottleneck: OOM, KV-cache, длинный контекст, очереди, квоты и деградация под нагрузкой. - Как дать агентам доступ к внутренним системам через MCP-шлюзы и не открыть лишнего. - Практики применения OPA/Rego, guardrails и политики действий без превращения агента в бесполезный read-only chatbot. - Наблюдаем за агентной платформой: метрики инференса, latency, стоимость запросов, ошибки, действия агентов и audit trail. - Определяем предел автономности: что агент может делать сам, где нужен human-in-the-loop, а где автоматизация опасна.
В ИТ-сфере более 20 лет. Окончил МИТХТ им. М. В. Ломоносова по направлению «Прикладная информатика в экономике и управлении», где в том числе участвовал в создании ERP ВУЗа, автоматизировал процессы обучения и приема абитуриентов. Карьеру в ИТ начинал в рекламном бизнесе, позднее работал в e-commerce и руководил B2B-направлением разработки, разрабатывал решения в части оптимизации работы высоконагруженных систем (МТС, Pladform). Сегодня руководит продуктовым направлением и разработкой в Центре гибридного интеллекта в группе Рунити (объединяет Руцентр, Рег.ру. Рег.облако, SpaceWeb и другие ИТ-компании), где более двух лет успешно сочетает обязательства по поддержке крупного legacy-монолита с внедрением новых практик и мотивацией команды к совершенствованию системы.
Видео
Другие доклады секции
Агентная платформа