От vLLM в Docker до промышленного AI API: как модель превращается в сервис
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Запустить LLM сегодня можно быстро: взять GPU, поднять vLLM или SGLang, получить OpenAI-compatible API и показать демо. На этом этапе всё выглядит почти слишком хорошо: модель отвечает, curl работает, первые пользователи довольны.
Проблемы начинаются, когда демо превращается в сервис для нескольких команд или клиентов. Появляются разные модели, GPU-профили, ключи, права доступа, обновления, остановки, переносы между узлами и вопрос «кто сколько использовал».
В докладе покажу, как вокруг движка инференса вырастает платформенный слой: каталог моделей, стабильные имена в API, развёртывание через Kubernetes, доступы для организаций и команд, метрики, учёт использования и статусы жизненного цикла модели.
Разбор пойдёт в формате «вызов -> решение». Начнём с одного vLLM-контейнера, затем добавим несколько моделей, команды, ключи, права на модели, учёт токенов и эксплуатационные метрики. Производительность, GPU-пулы и роутинг запросов будут фоном; основной фокус - управляемый AI API как сервис.
Слушатели унесут инженерный чек-лист: что добавить после первого успешного запуска модели, чтобы AI API не превратился в набор ручных команд, общих ключей и забытых ресурсов в Kubernetes.
15 лет в production-инфраструктуре: от Unix-кластеров под телефонию до Kubernetes-платформ для финтеха и телекомов. CEO AdminDivision (DevOps/инфра, 150+ проектов) и Впрод (LLM as a Service платформа).
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)