Экономика инференса: когда выгоднее API, облако или своё железо

Агентная платформа

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Архитекторы и platform engineers, ML/AI-инженеры, SRE, DevOps, инфраструктурные инженеры

Тезисы

Для AI-агента миллион токенов — далеко не вся себестоимость. Еще важны профиль нагрузки, latency, утилизация GPU, пики и стоимость простоя. В докладе покажу, как можно считать реальную стоимость инференса и где проходит точка безубыточности между API, облачным GPU и собственным контуром. Обсудим, почему при высокой и стабильной нагрузке экономика меняется, зачем агентной платформе гибридный подход и как выбирать, где именно запускать конкретный inference workload. Не претендую на единственный истинный способ подсчета экономики — просто делюсь своими наработками и тем, что вижу у коллег

Старший менеджер продукта (AI-платформа) Selectel. Есть опыт в международных стартапах в DS/ML/AI, успешный экзит. С 2019 работаю с нейросетями и их прикладным применением в enterprise. Хобби: горные лыжи, музыка, игры, книги, мото, единоборства, вейкборд, вейксерф, серфскейт, яхтинг, и еще всякого понемногу.

Видео

Другие доклады секции

Агентная платформа