VLM-платформа X5: автоматизация документооборота ритейлера с 400 000 сотрудников
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Многие компании — не только в ритейле с его сложной структурой и большой логистической составляющей — сталкиваются с тем, что заметная часть документооборота всё ещё живёт на бумаге: накладные, сертификаты, кадровые документы, корреспонденция и многое другое. Люди перечитывают и перепечатывают их вручную. Классический OCR не спасает — под каждый тип документа нужны разметка и обучение, а типов десятки. Мы пошли через VLM — и выяснили, что «прикрутить модельку» и построить промышленный сервис — очень разные задачи: модель ошибается молча (выдумывает реквизиты, пропускает записи, путает похожие поля), сканы бывают плохими, документы — стостраничными, комплекты — разнородными.
Расскажу, как мы прошли путь от модельки под один процесс до VLM-платформы компании на 400 тысяч сотрудников: какая автоматизация реально достижима; откуда берутся ошибки VLM и как мы боремся с каждым их источником — от контура лёгких CV-моделей перед VLM и дисциплины промптов со structured output до дообучения под домен; как устроена архитектура под тысячи документов в день — Kafka, stateless-сервис, свой DSL для пайплайнов, on-prem инференс; и почему в итоге мы написали агента, который собирает пайплайны вместо пользователей. Доклад для тех, кто внедряет VLM/LLM в продакшн и хочет заранее знать, где будет больно.
Прошел путь от инженера в нефтяной промышленности до технического менеджера продуктов в X5Tech. Специализируется продуктивизации LLM/VLM, внедрении агентов и CV аналитике.
Увлекается теннисом и горными лыжами
Видео
Другие доклады секции
Platform Engineering