Inference Cluster Gateway: как мы мигрировали с LiteLLM на APISIX

GenAI и большие языковые модели (LLM)

Логи, метрики, ошибки

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

MLOps-инженеры и команды, разворачивающие self-hosted LLM

Тезисы

Мы расскажем о нашем опыте замены LiteLLM на Apache APISIX в роли AI Gateway для внутреннего Inference Cluster: как обеспечили бесшовный переход с сохранением клиентских приложений и выданных API-ключей, какие плагины и маршрутизацию использовали, а также как организовали сбор метрик, учёт потребления и observability-интеграции

Разработчик инференс-кластера в YADRO
ex VPU Compiler Engineer @ Intel
ex NPU Compiler Engineer @ Samsung
МГТУ им. Н.Э. Баумана, ИУ2, 2017

Разработчик инференс-кластера в YADRO
ex VPU Compiler Engineer @ Intel

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)