AI-дубляж видео без обязательного дата-центра: гибридный пайплайн

Архитектура и масштабируемость

Автоматизация разработки и тестирования
Управление разработкой
Удаленная работа
Метрики
Лайфхаки
Методологии

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Выступление будет полезно разработчикам, архитекторам и техническим лидерам, которые проектируют ML-сервисы и длинные вычислительно-тяжёлые пайплайны: ML-инженерам, backend-разработчикам, инженерам по инфраструктуре, DevOps/SRE, тимлидам и продакт-менеджерам AI-продуктов. Доклад особенно актуален для тех, кто работает с обработкой аудио и видео, TTS, ASR, LLM, генеративными медиа и хочет снизить стоимость инференса, повысить контролируемость качества и масштабировать решения без усложнения инфраструктуры. Начинающим специалистам доклад может быть полезен как обзор архитектурных подходов и практических компромиссов, но максимальную пользу получат слушатели с базовым пониманием ML-инференса, очередей задач и контейнеризации.

Тезисы

Мы покажем, как уйти от монолитного инференса на A100/H100 при задачах обработки видео/аудио к гибридной архитектуре, совместимой даже с домашним компьютером, вплоть до CPU-only режима. Обработка видео традиционно ресурсоёмка, а с приходом LLM и генеративных моделей требования к железу только растут. Наш подход — сочетать проверенные классические методы с современными моделями так, чтобы пайплайн оставался управляемым, а инфраструктура — доступной.

Мы разберём приёмы, которые позволяют не перебирать варианты генераций вручную и автоматически контролировать качество: генетический алгоритм и предиктор длительности подбирают отрезки и перевод для озвучки до запуска TTS, значительно сокращая смещения по времени и улучшая попадание в оригинальный видеоряд; старый добрый VTLN работает как лёгкий CPU-постпроцессор без дообучения и GPU доводит качество до целевых метрик; плавающее позиционирование, вместо принудительного выравнивания и percentile-метрики превращают синхронизацию в измеряемый инженерный показатель с целевым 95% отклонением около 150–180 мс. Вместо субъективного MOS предложим свои автоматически измеряемые метрики: round-trip WER, speaker similarity, audio integrity.

Отдельно расскажем, как масштабировать длинные ML-задачи без сложной оркестрации: очередь, Docker-агенты, чекпойны, контроль исполнения - позволяют добавлять GPU- или CPU-воркеры без Kubernetes. Честно разведём trade-offs: GPU — быстрее и качественнее, CPU — дешевле но дольше, сравним насколько.

Более чем 20-летним опыта в IT: от системного программирования и компиляторов до AI-продуктов и управления R&D. Работал над GCC и LLVM/Clang, инструментами для ARM и ESP32, AI-видеоаналитикой, игровыми R&D-задачами, распределёнными вычислениями и стартапами в IoT/NLP. Сейчас развиваю проект RevovoxAI, получаю второе высшее и занимаюсь птицеводством.

Видео

Другие доклады секции

Архитектура и масштабируемость