Evals в production: как измерить пользу LLM-агента в вашей системе
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Публичные лидерборды говорят, какая модель "умнее", но не сообщают о главном - будет ли агент полезен именно в вашей системе - с вашим API, компилятором, legacy и ограничениями.
Разрыв между public score и production usefulness - первое, с чем сталкивается команда, внедряющая LLM агентов.
Расскажу, как мы строили собственный evals benchmark для AI агентов, встроенных в игровой движок и его скриптовую экосистему: - почему оценивать важно систему, а не модель, и как спроектировать eval задачи, как изолированные воспроизводимые sandbox среды - как вместо единого score построить карту навыков агента: исправление ошибок, работа с документацией и API, end-to-end сценарии, безопасность - зачем мы отказались от агрегированного score в пользу семи независимых диагностических сигналов
Слушатель уйдет с практическим фреймворком, который можно адаптировать под свой стек.
Senior AI Engineer в Gaijin Entertainment (известны игрой War Thunder). Обучаю проприетарные модели генерации 3D-ассетов для игровых пайплайнов и владею полным MLOps-стеком: от инфраструктуры претрейна до деплоя. Строю eval-фреймворки для AI-агентов от диагностики отказов до систематической оценки качества генеративных моделей. 8 лет опыта в индустрие на стыке C++, ML и real-time 3D. Пишу технические статьи про evals и диагностику AI-агентов (Habr, Medium), публиковался в официальном Unreal Engine Tech Blog от Epic Games
Видео
Другие доклады секции
Внедрение AI в SDLC