Современный Text2SQL: разрушение мифов и выход на качество более 85%

Внедрение AI в SDLC

ML
Хранилища

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Platform, Data, ML-инженеры и все, кто хоть раз пытался сгенерировать SQL с помощью LLM и потерпел неудачу.

Тезисы

Большинство Text2SQL-систем по-прежнему строятся вокруг одной гипотезы: если SQL получился неправильным, модели не хватило контекста. Поэтому начинает переписываться промпт, к нему добавляются фрагменты схем хранилища, метаданные из data catalog и задача вновь отправляется той же модели. В production DWH упрётся в потолок 35% качества. Если у вас есть впечатление, что семантический слой - не серебряная пуля, решающая задачу Text2SQL, то вы правы.

Приходите на доклад, где мы разберём: * как создать agent-facing проекцию данных хранилища и перестать угадывать решения задач, которые не описаны в скиллах; * почему важно создать таксономию Human-in-the-Loop как контракт между человеком и Text2SQL; * какие есть способы генерации SQL агентами и зачем их динамически выбирать их по риск-метрикам; * какие эксперименты и метрики позволяют доказать, что сгенерированный SQL содержит ответ на вопрос пользователя.

6 лет в IT. Сейчас занимаюсь RnD в части внедрения AI в платформу данных Т-Банка.

Видео

Другие доклады секции

Внедрение AI в SDLC