AI-дубляж видео без обязательного дата-центра: гибридный пайплайн
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
Мы покажем, как уйти от монолитного инференса на A100/H100 при задачах обработки видео/аудио к гибридной архитектуре, совместимой даже с домашним компьютером, вплоть до CPU-only режима. Обработка видео традиционно ресурсоёмка, а с приходом LLM и генеративных моделей требования к железу только растут. Наш подход — сочетать проверенные классические методы с современными моделями так, чтобы пайплайн оставался управляемым, а инфраструктура — доступной.
Мы разберём приёмы, которые позволяют не перебирать варианты генераций вручную и автоматически контролировать качество: генетический алгоритм и предиктор длительности подбирают отрезки и перевод для озвучки до запуска TTS, значительно сокращая смещения по времени и улучшая попадание в оригинальный видеоряд; старый добрый VTLN работает как лёгкий CPU-постпроцессор без дообучения и GPU доводит качество до целевых метрик; плавающее позиционирование, вместо принудительного выравнивания и percentile-метрики превращают синхронизацию в измеряемый инженерный показатель с целевым 95% отклонением около 150–180 мс. Вместо субъективного MOS предложим свои автоматически измеряемые метрики: round-trip WER, speaker similarity, audio integrity.
Отдельно расскажем, как масштабировать длинные ML-задачи без сложной оркестрации: очередь, Docker-агенты, чекпойны, контроль исполнения - позволяют добавлять GPU- или CPU-воркеры без Kubernetes. Честно разведём trade-offs: GPU — быстрее и качественнее, CPU — дешевле но дольше, сравним насколько.
Более чем 20-летним опыта в IT: от системного программирования и компиляторов до AI-продуктов и управления R&D. Работал над GCC и LLVM/Clang, инструментами для ARM и ESP32, AI-видеоаналитикой, игровыми R&D-задачами, распределёнными вычислениями и стартапами в IoT/NLP. Сейчас развиваю проект RevovoxAI, получаю второе высшее и занимаюсь птицеводством.
Видео
Другие доклады секции
Архитектура и масштабируемость