AI-исполнитель в Yandex Crowd: от микросервиса до LLMOps-пайплайна
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
В докладе я расскажу, как мы развивали инфраструктуру авторазметки на LLM/VLM-моделях внутри платформы разметки Yandex Crowd Solutions: от простого вызова API моделей, до продового LLMOps-пайплайна с уверенностью модели, очередями, квотами, RPS/inflight-лимитами и отдельным транспортным сервисом для запросов к моделям. Данный переход позволил повысить утилизацию VLM на 20 п.п. и снизить количество ошибок на моделях.
Разберём, какие проблемы появляются, когда один продуктовый сценарий начинает использовать несколько моделей с разными RPS, latency и ограничениями на параллельные запросы: переполнение очередей, перегруз одних моделей и недоутилизация других, таймауты и риск нарушения SLA разметки. Отдельно покажу, как расчет уверенности модели через несколько модельных вызовов на одно задание усложняет расчёт реальной нагрузки и влияет на архитектуру пайплайна.
Работал над внедрением ML в аудиторских процессах Сбера, настраивал автоматизацию клиентской поддержки и C&B в ecom.tech (ex. Samokat.tech) через RAG пайплайны. Сейчас Lead ML Engineer в Crowd ML, занимаюсь автоматизацией разметки данных на платформе Yandex Crowd Solutions через генеративные модели.
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)