CV + LLM = объяснимый инцидент. Как мы построили систему, которая понимает, когда на событие действительно стоит реагировать
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Можно ли подключить тысячи городских камер и автоматически понимать, где произошла авария, возник пожар, появился человек на проезжей части или внезапно собралась толпа? А главное можно ли всё сделать в кратчайшие сроки, обработку вести в реальном времени и не разориться на вызовах больших моделей?
В докладе покажем работающий подход, который мы реализовали. Для каждой камеры формируется индивидуальная «карта нормы» (camera card), она учитывает особенности сцены, типичные паттерны поведения. Потенциально аномальные фрагменты направляются в VLM для детального описания ситуации, а затем LLM сопоставляет полученную информацию с нормативной картиной конкретной камеры и формирует обоснованное решение. Разберем архитектуру, которая рассчитана на обработку более 10 000 потоков и включает локальные VL‑модели, модели детекторы, очереди, контроль стоимости, дедупликацию событий и операторский интерфейс.
На примере реального видео с ДТП мы покажем полный путь от исходных кадров до готовой карточки инцидента с фотографией, точным временем, типом аномалии и полной цепочкой принятия решения, отражающей логику работы каждого слоя системы.
Наша практика показывает, что интеграция real‑time CV с возможностями LLM действительно достижима при условии грамотного проектирования архитектуры. Вместо того чтобы возлагать всю нагрузку на одну модель, мы выстраиваем продуманный каскад, опирающийся на контекст каждой отдельной камеры и строгую инженерную дисциплину. Именно об этом и расскажем подробно.
Руководитель практики ML/AI ГК Юзтех с опытом 15+ лет. Закончил Московский государственный университет им. М.В. Ломоносова и аспирантуру факультета ВМК. Кандидат физико-математических наук, автор более 30 научных работ в журналах уровня Applicable analysis, Mathematical and Computational Applications (MDPI), Journal of Marine Scince and Engineering. На протяжении последних 11 лет разрабатывает математические модели с использованием машинного обучения для разных классов задач. В последнее время активно занимается технологией траекторной обработки векторных трехмерных данных.
Видео
Другие доклады секции
GenAI и большие языковые модели (LLM)