Почему один большой VLM не заменяет OCR pipeline
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Доклад посвящен практическому кейсу из moderation/OCR pipeline. Была гипотеза, что одну из частей OCR можно заменить end-to-end решением на базе большой VLM/LLM, дообученной через LoRA-адаптеры под OCR. В ожиданиях это выглядело логично, но в production условиях результат оказался хуже и менее надежным, чем модульный OCR pipeline из нескольких специализированных моделей.
Являюсь Senior ML-инженером в Wildberries & Russ
Разрабатываю OCR модели в команде в DS платформы модерации
Ранее работал в ГК ЭФКО и МФТИ (видеоаналитика в промышленности, беспилотный транспорт, модерация AI контента)
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)