6 нейросетей на одном Jetson: как уместить два CV-пайплайна в 16 ГБ и выйти с 3 на 15 FPS
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Как запустить шесть нейросетей на одном Jetson Orin NX с 16 ГБ памяти, обрабатывать два видеопотока в реальном времени и при этом получить не 2–3 FPS, а стабильные 15 — без упрощения моделей и покупки более мощного железа?
Разберём этот кейс на примере системы автоматического контроля сборки заказов на складе. Камеры установлены прямо на рохле, вычисления выполняются локально, без облака, а на каждом кадре одновременно работают три модели: детектор объектов, оценка глубины и Re-ID для трекинга. В сумме — шесть инференсов на одном ускорителе.
Покажу, где на самом деле теряется производительность на edge-устройствах и какие изменения дали основной прирост. Поговорим о совместном использовании моделей между несколькими потоками, оптимизации обмена данными, квантизации, подборе параметров TensorRT и динамического батчинга, а также о том, почему замена одного алгоритма в трекере оказалась эффективнее очередной оптимизации инференса.
Во второй части перейдём от одного устройства к промышленной эксплуатации. Обсудим, как управлять сотнями Jetson в распределительных центрах, доставлять обновления, маршрутизировать команды до конкретной тележки и какие архитектурные решения позволяют такой системе оставаться управляемой и масштабируемой.
Доклад будет полезен инженерам, которые работают с компьютерным зрением, TensorRT, Triton Inference Server и edge AI, а также всем, кто строит ML-системы, где ограничение — это не качество моделей, а ресурсы железа.
PhD in Engineering. До X5, 3 года занимался ML в различных компаниях в Великобритании. На текущем. месте работы занимаюсь разработкой масштабируемых CV Решений для оптимизации процессов компании.
Видео
Другие доклады секции
Edge Computing и распределенные вычисления