Tencent выпустила модель для генерации звука к видео

Лаборатория Hunyuan компании Tencent анонсировала HunyuanVideo-Foley - модель искусственного интеллекта, создающую звуковые эффекты по видеоряду и текстовому описанию. Это решение позволяет автоматически синхронизировать звук с картинкой, делая ролики более живыми и профессиональными.
Как это работает
Модель анализирует видео и учитывает описание. Например, если на экране человек идёт по траве, а в тексте сказано «шаги во время дождя», алгоритм синхронизирует шаги, шелест и капли. Звук формируется в студийном качестве (48 кГц) и может включать эффекты, музыку и даже вокал.
Разработчики собрали датасет объёмом более 100 тысяч часов видео с чистым аудио и текстовыми подписями, что позволило избежать фонового шума и искажений. Архитектура модели гибридная: отдельные модули отвечают за видео и текст, а трансформеры обеспечивают точную временную синхронизацию.
Результаты тестов
По итогам независимых бенчмарков HunyuanVideo-Foley обогнала все открытые аналоги и даже некоторые закрытые системы. В динамичных сценах, таких как бег или взрывы, задержки сведены к минимуму, а звук воспринимается максимально естественным. В слепых тестах люди чаще выбирали её результат, чем конкурентов.
Доступность
Tencent сделала модель полностью открытой: код и веса уже доступны на GitHub и Hugging Face. Для запуска потребуется GPU и настройка окружения, после чего достаточно указать путь к видео и описание - система выдаст до шести звуковых дорожек. Модель интегрирована в популярные фреймворки и может быть дообучена под конкретные задачи. Ознакомиться можно на сайте.
Таким образом, HunyuanVideo-Foley - это инструмент профессионального уровня, который может изменить стандарты работы с видео в индустрии кино, игр и рекламы.