AI Agent Observability: как понять, что агент делает не так

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Доклад будет полезен разработчикам, техническим руководителям и platform-инженерам, которые уже используют AI-агентов и хотят улучшать их работу на основании данных, а не отдельных удачных или неудачных запусков.

Тезисы

• Как мы сократили инструкции с 10 000 строк до 553 и улучшили работу агента • Где агент теряет время и расходует лишние токены? • Почему он ходит по кругу, повторяет действия и использует не те инструменты? • Как понять, что агенту не хватает контекста, знаний, skill или MCP? • Какие проверки действительно помогают, а какие только замедляют работу? • Как отличить ошибку агента от проблемы внешней инфраструктуры? • Как проверить, что изменение промпта, модели или harness улучшило результат? • Как начать с локальных логов и нескольких метрик, не создавая сразу сложную платформу мониторинга?

Ключевой вывод: Мониторинг нужен не для красивого дашборда и отчёта о стоимости. Он создаёт обратную связь: позволяет увидеть поведение агента, найти причину проблемы, изменить harness и проверить, действительно ли стало лучше.

10 лет в IT, сейчас – тимлид команды CaIla (https://caila.io), AI-платформы, которая агрегирует доступ к LLM и coding-агентам (Claude Code, Cursor, OpenCode) через единое API с контролем бюджетов и data protection.
До этого — full-stack на Spring Boot/Hibernate: поднимал образовательную платформу на Docker + VDS, писал парсеры объявлений на Kotlin, проектировал облачное хранилище. Окончил курс Mail.ru Group «Java-разработчик высоконагруженных приложений».

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)