Сбер выложил Kandinsky WM 1.0 - видеомодели для обучения роботов и беспилотников

WM в названии расшифровывается как World Model, «модель мира». Kandinsky WM 1.0 получает на вход первый кадр сцены и подробное описание на английском, а дальше строит пятисекундное продолжение. Внешнего сходства для таких задач мало: предметы должны сохранять форму и двигаться по законам физики. Основой послужила Kandinsky 5.0 Video Lite на 2 млрд параметров; поверх неё Сбер обучил три отдельные модели под три области.
Данных с дорог физически мало
Обучать беспилотник нужно на редких ситуациях: внезапное перестроение соседа, пешеход в неположенном месте, авария на перекрёстке. Именно их почти нет в реальных записях. Автомобиль, который снимает дорогу круглый год без остановки, соберёт меньше 10 тысяч часов синхронных сцен, и почти всё это будет движением в потоке и стоянием на светофорах. Для сравнения: NVIDIA обучала свою Cosmos на 20 млн часов видео.
В робототехнике та же история. Каждый эпизод требует живого робота, оператора, набора датчиков и последующей проверки, а часть нужных ситуаций небезопасно воспроизводить вживую. Отсюда идея закрыть пробел синтетикой - при условии, что сгенерированное видео не тащит в датасет собственные ошибки модели.
Три модели под три домена
Сбер собрал три непересекающиеся выборки и обучил на них отдельные версии Kandinsky:
- K5-AV - автомобильные сцены, 1,5 млн роликов на основе открытого датасета NVIDIA;
- K5-RO - робототехника, 2,2 млн роликов, самая большая выборка из трёх;
- K5-PH - сложная физика: жидкости, разрушения, деформации, движение людей, 1,6 млн роликов.
Данные для K5-RO взяли из открытых наборов с реальными бытовыми сценами - складывание одежды, работа с крышками и молниями, кухонные задачи. Для сложной физики 300 тысяч роликов отбирали вручную асессоры Сбера, остальное отфильтровали автоматикой по качеству и динамике.
Награда за правдоподобную физику
Дообучение на профильных данных само по себе физику не чинит, поэтому Сбер добавил второй этап. Для дорожных и робототехнических сцен взяли обучение с подкреплением: отдельная модель-оценщик учится отличать настоящее видео от сгенерированного, опираясь на форму объектов, глубину сцены и характер движения, а генератор подстраивается так, чтобы получать от неё высокую оценку.
Со сложной физикой этот подход дал слабый результат. Там, где ткань мнётся, а человек двигается, естественная деформация легко читается оценщиком как ошибка. Для K5-PH применили другой метод: модель во время обучения намеренно уводят с правильной траектории и учат возвращаться обратно, без внешнего судьи.
Топ-10 при 2 млрд параметров
Kandinsky WM 1.0 проверяли на трёх бенчмарках для Physical AI: 4-е место на PAI-Bench-G, 5-е на Physics-IQ Verified и 6-е на RBench. Модели, стоящие выше, крупнее на один-два порядка. В целевых доменах Kandinsky обошла NVIDIA Cosmos-Predict2.5-2B, ближайшую к себе по размеру: примерно на 5 процентных пунктов в автомобильных и робототехнических сценариях, на 2–3 пункта в индустрии и сценах с людьми.
Здесь Сбер честно оговаривается, и оговорку легко пропустить: все места и метрики получены в собственной валидации команды по опубликованным процедурам бенчмарков, а не через официальную подачу в лидерборд. Цифры от этого не перестают быть цифрами, но проверить их придётся сообществу - благо веса выложены.
Что даёт лицензия MIT
MIT - самая свободная из ходовых лицензий: модель можно брать в коммерческие проекты, дообучать и встраивать в свои продукты, сохранив упоминание авторства. Веса Kandinsky WM 1.0 лежат на GitHub, GitVerse и Hugging Face, размер в 2 млрд параметров позволяет запускать модель без серверной фермы. Работает она в режиме «кадр плюс описание», причём промпт нужен английский и подробный - с описанием объектов, действия и ожидаемой динамики. Сбер сообщает, что модели уже используют его Центр робототехники и институт AIRI.
Следующий шаг - интерактивная среда
По функциональной классификации моделей мира Kandinsky WM 1.0 пока остаётся рендерером: она рисует наблюдение, но не держит состояние мира и не отвечает на действия. Дальше по этой лестнице стоят Genie 3 у Google DeepMind, Cosmos 3 у NVIDIA и GWM-1 у Runway - среды, которые реагируют на команду и позволяют проверить несколько вариантов будущего. Туда же собирается двигаться и команда Сбера. Пока же в открытом доступе появилась рабочая заготовка мирового уровня по метрикам и российская по происхождению - редкое сочетание для этой части рынка.