Почему один большой VLM не заменяет OCR pipeline

GenAI и большие языковые модели (LLM)

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Computer Vision инжинеры

Тезисы

Доклад посвящен практическому кейсу из moderation/OCR pipeline. Была гипотеза, что одну из частей OCR можно заменить end-to-end решением на базе большой VLM/LLM, дообученной через LoRA-адаптеры под OCR. В ожиданиях это выглядело логично, но в production условиях результат оказался хуже и менее надежным, чем модульный OCR pipeline из нескольких специализированных моделей.

Являюсь Senior ML-инженером в Wildberries & Russ
Разрабатываю OCR модели в команде в DS платформы модерации
Ранее работал в ГК ЭФКО и МФТИ (видеоаналитика в промышленности, беспилотный транспорт, модерация AI контента)

Видео

Другие доклады секции

GenAI и большие языковые модели (LLM)