Сбер выпустил Kandinsky 6.0 Video с генерацией видео со звуком

Сбер выпустил Kandinsky 6.0 Video, линейку моделей, которые создают видео сразу со звуком — речью с движением губ, музыкой и шумами окружения. Генерация уже работает в ГигаЧате бесплатно, а веса обеих моделей, Lite и Pro, открыты под лицензией MIT.
Сбер выпустил Kandinsky 6.0 Video с генерацией видео со звуком

Kandinsky 6.0 Video стал первым поколением видеомоделей от Сбер , которое озвучивает ролик само. Компания называет его первой российской моделью генерации видео с синхронным звуком. Пользователи получили новинку в ГигаЧат , а разработчики в открытом репозитории с весами.

Пять секунд со звуком в Kandinsky 6.0

Kandinsky 6.0 Video собирает ролик длиной до пяти секунд вместе со звуковой дорожкой в 44 кГц, это обычное качество стриминговых сервисов. Звук бывает трёх видов:

  • Речь — с синхронизацией губ говорящего персонажа;
  • Музыка — фоновое сопровождение под настроение сцены;
  • Шумы — шаги, ветер, дождь, проезжающие машины.

Сцену можно описать текстом с нуля или загрузить первый кадр, например фотографию или рисунок, и попросить модель его оживить. Звук задаётся в том же запросе, что и картинка. Если он не нужен, ролик выйдет беззвучным. Разрешение выбирается из трёх вариантов: SD, HD или Full HD.

Для первого теста подойдёт короткая сцена с одним действием и понятным звуком, например:

Бариста в маленькой утренней кофейне взбивает молоко в металлическом кувшине и наливает его в чашку, рисуя сердце на пенке. Слышно шипение пара, звон посуды, а из колонки у стойки тихо играет джаз

Что получается, видео ниже

Модель обучали на 20 с лишним миллионах роликов со звуком. Под синхронизацию речи отдельно отбирали видео с чистой дорожкой и крупными планами говорящих людей. По словам разработчиков, Kandinsky 6.0 Video заметно лучше передаёт физику движения людей, животных и машин в динамичных сценах.

Lite на 3 млрд и Pro на 29 млрд параметров

Линейка Kandinsky 6.0 Video состоит из двух моделей. Lite весит 3 млрд параметров и рассчитана на скорость, Pro на 29 млрд параметров отвечает за качество. У каждой есть дистиллированная версия, то есть ускоренная копия, которая генерирует за меньшее число шагов ценой небольшой потери деталей. Full HD обе модели выдают через отдельный модуль повышения разрешения.

Код и веса лежат на GitHub и Hugging Face под лицензией MIT, одной из самых свободных. Её условия разрешают встраивать Kandinsky 6.0 в коммерческие продукты без отчислений. Поддержка популярных инструментов появилась в день релиза — библиотеки Diffusers, сборки ComfyUI с готовыми узлами и движка vLLM-Omni.

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаем разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».

Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка

Kandinsky 6.0 Video на домашней видеокарте

Запустить Kandinsky 6.0 Video у себя можно только на картах NVIDIA. Разработчики опубликовали замеры для полной, недистиллированной версии, время указано на один пятисекундный ролик без загрузки весов:

  • Lite на RTX 4090 — около 7 минут в SD и 10 минут в Full HD;
  • Lite на RTX 5090 — около 5 минут в SD и 7 минут в Full HD;
  • Pro на RTX 4090 — от 16 до 21 минуты;
  • Pro на H100 — от 5 до 7 минут.

На бюджетной RTX 5060 Ti ролик от Pro в Full HD считается почти час. Дистиллированные версии работают быстрее, но точных цифр для них в репозитории нет. Для домашнего компьютера реалистичный выбор — Lite, а Pro остаётся моделью для серверов и студий с профессиональными картами.

Против Kandinsky 5.0 и LTX 2.5

Сбер сравнивает Kandinsky 6.0 Video с двумя моделями. Новинка лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям и, по данным компании, уверенно обходит открытую LTX 2.5 от Lightricks. Обе оценки внутренние, независимых замеров пока нет.

Здесь нужно оговориться. Со звуком видео генерируют и закрытые модели, Veo от Google и Kling от Kuaishou, с ними Сбер Kandinsky 6.0 не сравнивает. Козырь Kandinsky в другом месте. Открытая модель на 29 млрд параметров со звуком и свободной лицензией встречается редко, а доступ из России без VPN для облачных конкурентов остаётся проблемой.

Три пути к Kandinsky 6.0 Video

Проще всего попробовать модель в ГигаЧате. Генерация видео со звуком там бесплатная и работает без VPN, достаточно войти в аккаунт на сайте или в приложении. Лимиты на число роликов Сбер не раскрывает.

Второй путь — демо Kandinsky 6.0 Pro Distill на Hugging Face. Оно открыто всем, но в часы нагрузки возможна очередь. Третий путь — локальный запуск через ComfyUI или скрипты из репозитория, если есть видеокарта NVIDIA и готовность ждать по нескольку минут на ролик.

Пять секунд — короткий формат, поэтому запрос лучше строить вокруг одного действия и одного звукового плана. Сцена «человек идёт под дождём» получится чище, чем сюжет с диалогом, музыкой и сменой места. Звук имеет смысл описывать отдельной фразой после картинки, как в примере с бариста выше.

Пять секунд как главный предел

Kandinsky 6.0 Video закрывает главный пробел прошлого поколения, у которого звука не было вовсе. Слабое место тоже очевидно. Пяти секунд хватает на сторис или заставку, но для рекламного ролика или клипа их мало, и монтировать придётся из нескольких кусков. Сбер обещает увеличить длительность, и следующая версия Kandinsky покажет, сможет ли открытая российская модель держать сцену хотя бы десять секунд.

Источник:
16:54
44
Нет комментариев. Ваш будет первым!