ByteDance выпустила Seed Audio 1.0 для генерации целых аудиосцен

ByteDance Seed 20 июля 2026 года представила Seed Audio 1.0 - модель для генерации полной аудиосцены по текстовому описанию. Она создаёт речь персонажей, атмосферу и звуковые эффекты в одном процессе, с управлением таймингом реплик и доступом через BytePlus.
ByteDance выпустила Seed Audio 1.0 для генерации целых аудиосцен

ByteDance Seed представила Seed Audio 1.0 - аудиомодель, которая работает со сценой как с единым объектом. Пользователь описывает персонажей, интонацию, окружение, звуковые события и порядок действия, а система собирает речь, фон и эффекты в согласованный звуковой фрагмент.

Для рынка генеративного аудио это заметный релиз. Большая часть инструментов в категории до сих пор делит работу на отдельные задачи: озвучка, музыка, шумы, эффекты, монтаж. Seed Audio 1.0 переносит акцент на готовую звуковую сцену, где реплика должна звучать в нужном месте, эффект попадать в момент действия, а окружение не мешать голосу.

Реплики можно ставить с точностью до 100 миллисекунд

Seed Audio 1.0 поддерживает управление временем вступления диалогов на уровне промпта. ByteDance заявляет точность до 100 миллисекунд: автор может указать, когда персонаж начинает говорить, и использовать модель для дубляжа, рекламных роликов, коротких видео или сценарной озвучки.

Сильный сценарий здесь - не разовая генерация красивого голоса, а быстрая сборка черновика для сцены. Режиссёр, монтажёр или команда локализации получает вариант с репликами, фоном и эффектами сразу в одной акустике. Дальше его можно править вручную или продолжать генерацию.

Голос задаётся описанием или разрешённым референсом

Модель умеет создавать голос по текстовому описанию, по разрешённому аудиореференсу или по сочетанию этих двух способов. ByteDance подчёркивает, что голос должен сохранять узнаваемость при смене эмоции, темпа и манеры подачи.

За один проход Seed Audio 1.0 генерирует до двух минут аудио и поддерживает продолжение. Это полезно для подкастов, аудиодрам, игровых сцен, брендированных роликов и мультиязычных кампаний, где один персонаж или диктор должен оставаться стабильным на протяжении нескольких фрагментов.

Поддержка 20+ языков делает релиз ближе к локализации

ByteDance заявляет поддержку более 20 языков, включая китайский, английский, японский, корейский, испанский, индонезийский, немецкий, французский, тайский и вьетнамский. В мультиязычном сценарии модель должна переносить голосовой образ между языками с сохранением тембра и манеры исполнения.

Здесь компания явно целится в международный контент: игры, рекламу, короткие видео, подкасты и дубляж. Локализация обычно распадается на перевод, озвучку, монтаж и сведение. Если модель справится с синхронизацией и стабильностью голоса, часть этого процесса можно будет ускорить на этапе черновиков и тестовых версий.

Архитектура совмещает язык и акустику

По описанию ByteDance, Seed Audio 1.0 соединяет языковую модель и диффузионный акустический генератор. Первая помогает разобрать замысел сцены: кто говорит, с какой эмоцией, когда вступает звук и как развивается действие. Второй создаёт финальное аудио в скрытом акустическом пространстве, где сохраняются тембр, ритм, фон и пространственное ощущение.

Такая схема выглядит логичной для задач, где звук зависит от контекста. Голос в пустой комнате, на улице или рядом с тревожной сиреной должен вести себя по-разному. Простая озвучка текста этого не решает; сценовая модель хотя бы пытается учитывать окружение как часть генерации.

Ограничения первой версии остаются заметными

ByteDance сама называет релиз ранним этапом. Точное управление временем сейчас в основном относится к диалогам. Более детальный контроль звуковых эффектов, атмосферы и музыки компания планирует развивать дальше.

В планах также названы видеореференсы, длинные форматы, многодорожечная генерация и более управляемая мультиязычная локализация. Это важная оговорка: для профессионального производства одного смешанного файла часто мало. Командам нужны отдельные дорожки, контроль уровней, правки по слоям и предсказуемое поведение между сценами.

Seed Audio 1.0 уже доступна через BytePlus. Региональная доступность и условия доступа за пределами платформы в анонсе подробно не раскрыты. Документация BytePlus выделяет Audio 1.0 в отдельный API-раздел и отдельный раздел биллинга, но главная проверка будет практической: смогут ли создатели контента получать стабильные сцены, которые не разваливаются при правках и продолжении.

17:35
128
Нет комментариев. Ваш будет первым!