Что нужно агенту, чтобы занять топ-3 на BIRD-SQL?

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Дата-инженеры и разработчики LLM-систем, инженеры внедряющие кодинг-агентов

Тезисы

BIRD-SQL — бенчмарк text-to-SQL на настоящих базах: 95 баз, 33 ГБ, закрытый тест. Люди-эксперты дают на нём 92.96%, а модели «в один промпт» — нет: GPT-5.5 на максимальном рассуждении набирает 72.55% и уступает трём десяткам специализированных решений. Весь топ занят не моделями, а обвязкой вокруг них.

Мы такую обвязку собрали — 17 шагов, 81.33% на закрытом тесте, третье место. Ни один шаг не написал человек: всё спроектировал и написал кодинг-агент, мы построили ему харнесс и читали предложения на ревью.

В докладе разберу:

анатомию пайплайна text2sql - отбор таблиц, построение схемы, генерация и судья, точечные починки, нормализаторы: что делает каждая группа устройство харнесса - что писать в трейсы, как раскладывать расхождение результатов до отдельных ячеек, как добиться, чтобы код агента приезжал уже с инструментацией; один оборот цикла на живом примере: от повторяющейся ошибки в трейсах до измеренного эффекта и почему данную задачу не сделали полностью автоматом; свои грабли - какие шаги приняли и потом откатили, какие не сработали ни разу, где метод упёрся в потолок;

Работаю в Сбере, в исследовательской команде SberData: аналитическая платформа, data-инженерия и агентная инфраструктура поверх неё. Курирую студенческие исследования и преподаю. Публикуюсь и патентую. В ИТ больше 15 лет: программировать начал раньше, чем пошёл в школу, а теперь проектирую обвязку и разбираю результаты, пока код всё чаще пишет агент.

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)