6 нейросетей на одном Jetson: как уместить два CV-пайплайна в 16 ГБ и выйти с 3 на 15 FPS

Edge Computing и распределенные вычисления

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

ML Инженеры, Дата саентисты

Тезисы

Как запустить шесть нейросетей на одном Jetson Orin NX с 16 ГБ памяти, обрабатывать два видеопотока в реальном времени и при этом получить не 2–3 FPS, а стабильные 15 — без упрощения моделей и покупки более мощного железа?

Разберём этот кейс на примере системы автоматического контроля сборки заказов на складе. Камеры установлены прямо на рохле, вычисления выполняются локально, без облака, а на каждом кадре одновременно работают три модели: детектор объектов, оценка глубины и Re-ID для трекинга. В сумме — шесть инференсов на одном ускорителе.

Покажу, где на самом деле теряется производительность на edge-устройствах и какие изменения дали основной прирост. Поговорим о совместном использовании моделей между несколькими потоками, оптимизации обмена данными, квантизации, подборе параметров TensorRT и динамического батчинга, а также о том, почему замена одного алгоритма в трекере оказалась эффективнее очередной оптимизации инференса.

Во второй части перейдём от одного устройства к промышленной эксплуатации. Обсудим, как управлять сотнями Jetson в распределительных центрах, доставлять обновления, маршрутизировать команды до конкретной тележки и какие архитектурные решения позволяют такой системе оставаться управляемой и масштабируемой.

Доклад будет полезен инженерам, которые работают с компьютерным зрением, TensorRT, Triton Inference Server и edge AI, а также всем, кто строит ML-системы, где ограничение — это не качество моделей, а ресурсы железа.

PhD in Engineering. До X5, 3 года занимался ML в различных компаниях в Великобритании. На текущем. месте работы занимаюсь разработкой масштабируемых CV Решений для оптимизации процессов компании.

Видео