Evals в production: как измерить пользу LLM-агента в вашей системе

Внедрение AI в SDLC

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Инженеры и тимлиды, внедряющие LLM-агентов в свои продукты и процессы разработки. Все, кто хочет понять, насколько реально можно доверять AI-агенту в production и как это измерить. Опыт построения evals не требуется.

Тезисы

Публичные лидерборды говорят, какая модель "умнее", но не сообщают о главном - будет ли агент полезен именно в вашей системе - с вашим API, компилятором, legacy и ограничениями.

Разрыв между public score и production usefulness - первое, с чем сталкивается команда, внедряющая LLM агентов.

Расскажу, как мы строили собственный evals benchmark для AI агентов, встроенных в игровой движок и его скриптовую экосистему: - почему оценивать важно систему, а не модель, и как спроектировать eval задачи, как изолированные воспроизводимые sandbox среды - как вместо единого score построить карту навыков агента: исправление ошибок, работа с документацией и API, end-to-end сценарии, безопасность - зачем мы отказались от агрегированного score в пользу семи независимых диагностических сигналов

Слушатель уйдет с практическим фреймворком, который можно адаптировать под свой стек.

Артем Тарасов

Gaijin Entertainment

Senior AI Engineer в Gaijin Entertainment (известны игрой War Thunder). Обучаю проприетарные модели генерации 3D-ассетов для игровых пайплайнов и владею полным MLOps-стеком: от инфраструктуры претрейна до деплоя. Строю eval-фреймворки для AI-агентов от диагностики отказов до систематической оценки качества генеративных моделей. 8 лет опыта в индустрие на стыке C++, ML и real-time 3D. Пишу технические статьи про evals и диагностику AI-агентов (Habr, Medium), публиковался в официальном Unreal Engine Tech Blog от Epic Games

Видео

Другие доклады секции

Внедрение AI в SDLC