От vLLM в Docker до промышленного AI API: как модель превращается в сервис

GenAI и большие языковые модели (LLM)

Системы прав доступа
API
Архитектурные паттерны
Отказоустойчивость
Оптимизация производительности
Распределенные системы
Технологии виртуализации и контейнеризации
Инфраструктура как сервис (IaaS), платформы как сервис (PaaS)
Big Data и Highload в Enterprise
DevOps на собственном (арендованном) оборудовании
Логи, метрики, ошибки
ML
DevOps / Кубер
DevOps / SRE
Инфраструктура

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

DevOps/SRE, инженеры платформ, backend-архитекторы, инженеры ML-платформ, технические руководители провайдеров и внутренних платформенных команд, которые запускают LLM в своём контуре или строят AI API для внутренних команд и клиентов.

Тезисы

Запустить LLM сегодня можно быстро: взять GPU, поднять vLLM или SGLang, получить OpenAI-compatible API и показать демо. На этом этапе всё выглядит почти слишком хорошо: модель отвечает, curl работает, первые пользователи довольны.

Проблемы начинаются, когда демо превращается в сервис для нескольких команд или клиентов. Появляются разные модели, GPU-профили, ключи, права доступа, обновления, остановки, переносы между узлами и вопрос «кто сколько использовал».

В докладе покажу, как вокруг движка инференса вырастает платформенный слой: каталог моделей, стабильные имена в API, развёртывание через Kubernetes, доступы для организаций и команд, метрики, учёт использования и статусы жизненного цикла модели.

Разбор пойдёт в формате «вызов -> решение». Начнём с одного vLLM-контейнера, затем добавим несколько моделей, команды, ключи, права на модели, учёт токенов и эксплуатационные метрики. Производительность, GPU-пулы и роутинг запросов будут фоном; основной фокус - управляемый AI API как сервис.

Слушатели унесут инженерный чек-лист: что добавить после первого успешного запуска модели, чтобы AI API не превратился в набор ручных команд, общих ключей и забытых ресурсов в Kubernetes.

15 лет в production-инфраструктуре: от Unix-кластеров под телефонию до Kubernetes-платформ для финтеха и телекомов. CEO AdminDivision (DevOps/инфра, 150+ проектов) и Впрод (LLM as a Service платформа).

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)