Экономика инференса: когда выгоднее API, облако или своё железо
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Для AI-агента миллион токенов — далеко не вся себестоимость. Еще важны профиль нагрузки, latency, утилизация GPU, пики и стоимость простоя. В докладе покажу, как можно считать реальную стоимость инференса и где проходит точка безубыточности между API, облачным GPU и собственным контуром. Обсудим, почему при высокой и стабильной нагрузке экономика меняется, зачем агентной платформе гибридный подход и как выбирать, где именно запускать конкретный inference workload. Не претендую на единственный истинный способ подсчета экономики — просто делюсь своими наработками и тем, что вижу у коллег
Старший менеджер продукта (AI-платформа) Selectel. Есть опыт в международных стартапах в DS/ML/AI, успешный экзит. С 2019 работаю с нейросетями и их прикладным применением в enterprise. Хобби: горные лыжи, музыка, игры, книги, мото, единоборства, вейкборд, вейксерф, серфскейт, яхтинг, и еще всякого понемногу.
Видео
Другие доклады секции
Агентная платформа