Почему Kubernetes не справляется с AI-задачами: продвинутый GPU планировщик на базе Volcano
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Для ML/AI задач стандартного планирования Kubernetes часто недостаточно: GPU задачи конкурируют за ограниченные ресурсы, требуют очередей, приоритизации и более гибкого распределения вычислительных мощностей кластера. В докладе я покажу, зачем ML инфраструктуре нужен отдельный планировщик GPU задач, и разберу это на примере того, как мы реализовали это в Nova AI.
Основной фокус доклада - Volcano как практический инструмент для оркестрации GPU нагрузок. Сравню его с Kueue и Kai Scheduler, объясню, как устроен Volcano, разберу динамическое дробление видеокарт.
Покажу прикладные кейсы: как настраивать очереди для задач разной важности, как Volcano можно использовать вместе с KubeRay для запуска распределенного инференса LLM.
Я MLOps-инженер, занимаюсь развитием и поддержкой ML-платформы. Внедряю новые сервисы, развертываю и обучаю LLM-модели, а также интегрирую их в корпоративные системы.
Видео
Другие доклады секции
Edge Computing и распределенные вычисления