AI-исполнитель в Yandex Crowd: от микросервиса до LLMOps-пайплайна

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML-инженеры, backend-разработчики, MLOps/LLMOps-инженеры, системные архитекторы и технические лиды, которые внедряют LLM/VLM-модели в продуктовые сценарии и сталкиваются с задачами надёжной эксплуатации моделей под нагрузкой.

Тезисы

В докладе я расскажу, как мы развивали инфраструктуру авторазметки на LLM/VLM-моделях внутри платформы разметки Yandex Crowd Solutions: от простого вызова API моделей, до продового LLMOps-пайплайна с уверенностью модели, очередями, квотами, RPS/inflight-лимитами и отдельным транспортным сервисом для запросов к моделям. Данный переход позволил повысить утилизацию VLM на 20 п.п. и снизить количество ошибок на моделях.

Разберём, какие проблемы появляются, когда один продуктовый сценарий начинает использовать несколько моделей с разными RPS, latency и ограничениями на параллельные запросы: переполнение очередей, перегруз одних моделей и недоутилизация других, таймауты и риск нарушения SLA разметки. Отдельно покажу, как расчет уверенности модели через несколько модельных вызовов на одно задание усложняет расчёт реальной нагрузки и влияет на архитектуру пайплайна.

Олег Лайок

Яндекс Крауд

Работал над внедрением ML в аудиторских процессах Сбера, настраивал автоматизацию клиентской поддержки и C&B в ecom.tech (ex. Samokat.tech) через RAG пайплайны. Сейчас Lead ML Engineer в Crowd ML, занимаюсь автоматизацией разметки данных на платформе Yandex Crowd Solutions через генеративные модели.

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)