KAI Scheduler: как устроен планировщик для GPU-нагрузок в Kubernetes

Platform Engineering

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

MLOps-инженеры платформенные инженеры и SRE архитекторы и техлиды

Тезисы

В докладе разберём KAI Scheduler — открытый планировщик от NVIDIA, выросший из Run:ai. Пройдём по внутреннему устройству: как podgrouper автоматически собирает PodGroup для разных типов ворклоадов, как устроен цикл планирования с действиями allocate, reclaim, preempt и consolidate, как работает иерархия очередей с гарантированной квотой, лимитом и перераспределением излишков через overQuotaWeight. Покажу на примере, что происходит с задачей от момента подачи манифеста до момента, когда она получает карты, и почему иногда не получает

Go разработчик в Kubernetes as a Service. Разработчик операторов Kubernetes. Лидер проекта для анализа кластера с помощью AI + RAG.

Видео

Другие доклады секции

Platform Engineering