Сбер выпустил Kandinsky 6.0 Video с генерацией видео со звуком
Kandinsky 6.0 Video стал первым поколением видеомоделей от Сбер , которое озвучивает ролик само. Компания называет его первой российской моделью генерации видео с синхронным звуком. Пользователи получили новинку в ГигаЧат , а разработчики в открытом репозитории с весами.
Пять секунд со звуком в Kandinsky 6.0
Kandinsky 6.0 Video собирает ролик длиной до пяти секунд вместе со звуковой дорожкой в 44 кГц, это обычное качество стриминговых сервисов. Звук бывает трёх видов:
- Речь — с синхронизацией губ говорящего персонажа;
- Музыка — фоновое сопровождение под настроение сцены;
- Шумы — шаги, ветер, дождь, проезжающие машины.
Сцену можно описать текстом с нуля или загрузить первый кадр, например фотографию или рисунок, и попросить модель его оживить. Звук задаётся в том же запросе, что и картинка. Если он не нужен, ролик выйдет беззвучным. Разрешение выбирается из трёх вариантов: SD, HD или Full HD.
Для первого теста подойдёт короткая сцена с одним действием и понятным звуком, например:
Бариста в маленькой утренней кофейне взбивает молоко в металлическом кувшине и наливает его в чашку, рисуя сердце на пенке. Слышно шипение пара, звон посуды, а из колонки у стойки тихо играет джаз
Что получается, видео ниже
Модель обучали на 20 с лишним миллионах роликов со звуком. Под синхронизацию речи отдельно отбирали видео с чистой дорожкой и крупными планами говорящих людей. По словам разработчиков, Kandinsky 6.0 Video заметно лучше передаёт физику движения людей, животных и машин в динамичных сценах.
Lite на 3 млрд и Pro на 29 млрд параметров
Линейка Kandinsky 6.0 Video состоит из двух моделей. Lite весит 3 млрд параметров и рассчитана на скорость, Pro на 29 млрд параметров отвечает за качество. У каждой есть дистиллированная версия, то есть ускоренная копия, которая генерирует за меньшее число шагов ценой небольшой потери деталей. Full HD обе модели выдают через отдельный модуль повышения разрешения.
Код и веса лежат на GitHub и Hugging Face под лицензией MIT, одной из самых свободных. Её условия разрешают встраивать Kandinsky 6.0 в коммерческие продукты без отчислений. Поддержка популярных инструментов появилась в день релиза — библиотеки Diffusers, сборки ComfyUI с готовыми узлами и движка vLLM-Omni.
«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаем разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».
Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка
Kandinsky 6.0 Video на домашней видеокарте
Запустить Kandinsky 6.0 Video у себя можно только на картах NVIDIA. Разработчики опубликовали замеры для полной, недистиллированной версии, время указано на один пятисекундный ролик без загрузки весов:
- Lite на RTX 4090 — около 7 минут в SD и 10 минут в Full HD;
- Lite на RTX 5090 — около 5 минут в SD и 7 минут в Full HD;
- Pro на RTX 4090 — от 16 до 21 минуты;
- Pro на H100 — от 5 до 7 минут.
На бюджетной RTX 5060 Ti ролик от Pro в Full HD считается почти час. Дистиллированные версии работают быстрее, но точных цифр для них в репозитории нет. Для домашнего компьютера реалистичный выбор — Lite, а Pro остаётся моделью для серверов и студий с профессиональными картами.
Против Kandinsky 5.0 и LTX 2.5
Сбер сравнивает Kandinsky 6.0 Video с двумя моделями. Новинка лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям и, по данным компании, уверенно обходит открытую LTX 2.5 от Lightricks. Обе оценки внутренние, независимых замеров пока нет.
Здесь нужно оговориться. Со звуком видео генерируют и закрытые модели, Veo от Google и Kling от Kuaishou, с ними Сбер Kandinsky 6.0 не сравнивает. Козырь Kandinsky в другом месте. Открытая модель на 29 млрд параметров со звуком и свободной лицензией встречается редко, а доступ из России без VPN для облачных конкурентов остаётся проблемой.
Три пути к Kandinsky 6.0 Video
Проще всего попробовать модель в ГигаЧате. Генерация видео со звуком там бесплатная и работает без VPN, достаточно войти в аккаунт на сайте или в приложении. Лимиты на число роликов Сбер не раскрывает.
Второй путь — демо Kandinsky 6.0 Pro Distill на Hugging Face. Оно открыто всем, но в часы нагрузки возможна очередь. Третий путь — локальный запуск через ComfyUI или скрипты из репозитория, если есть видеокарта NVIDIA и готовность ждать по нескольку минут на ролик.
Пять секунд — короткий формат, поэтому запрос лучше строить вокруг одного действия и одного звукового плана. Сцена «человек идёт под дождём» получится чище, чем сюжет с диалогом, музыкой и сменой места. Звук имеет смысл описывать отдельной фразой после картинки, как в примере с бариста выше.
Пять секунд как главный предел
Kandinsky 6.0 Video закрывает главный пробел прошлого поколения, у которого звука не было вовсе. Слабое место тоже очевидно. Пяти секунд хватает на сторис или заставку, но для рекламного ролика или клипа их мало, и монтировать придётся из нескольких кусков. Сбер обещает увеличить длительность, и следующая версия Kandinsky покажет, сможет ли открытая российская модель держать сцену хотя бы десять секунд.