Сбер выложил Kandinsky WM 1.0 - видеомодели для обучения роботов и беспилотников

Сбер выложил в открытый доступ Kandinsky WM 1.0 - три модели, которые достраивают видео по первому кадру и удерживают физику сцены. Код и веса опубликованы под лицензией MIT. Ролики нужны, чтобы обучать роботов и беспилотные автомобили редким ситуациям.
Сбер выложил Kandinsky WM 1.0 - видеомодели для обучения роботов и беспилотников

WM в названии расшифровывается как World Model, «модель мира». Kandinsky WM 1.0 получает на вход первый кадр сцены и подробное описание на английском, а дальше строит пятисекундное продолжение. Внешнего сходства для таких задач мало: предметы должны сохранять форму и двигаться по законам физики. Основой послужила Kandinsky 5.0 Video Lite на 2 млрд параметров; поверх неё Сбер обучил три отдельные модели под три области.

Данных с дорог физически мало

Обучать беспилотник нужно на редких ситуациях: внезапное перестроение соседа, пешеход в неположенном месте, авария на перекрёстке. Именно их почти нет в реальных записях. Автомобиль, который снимает дорогу круглый год без остановки, соберёт меньше 10 тысяч часов синхронных сцен, и почти всё это будет движением в потоке и стоянием на светофорах. Для сравнения: NVIDIA обучала свою Cosmos на 20 млн часов видео.

В робототехнике та же история. Каждый эпизод требует живого робота, оператора, набора датчиков и последующей проверки, а часть нужных ситуаций небезопасно воспроизводить вживую. Отсюда идея закрыть пробел синтетикой - при условии, что сгенерированное видео не тащит в датасет собственные ошибки модели.

Три модели под три домена

Сбер собрал три непересекающиеся выборки и обучил на них отдельные версии Kandinsky:

  • K5-AV - автомобильные сцены, 1,5 млн роликов на основе открытого датасета NVIDIA;
  • K5-RO - робототехника, 2,2 млн роликов, самая большая выборка из трёх;
  • K5-PH - сложная физика: жидкости, разрушения, деформации, движение людей, 1,6 млн роликов.

Данные для K5-RO взяли из открытых наборов с реальными бытовыми сценами - складывание одежды, работа с крышками и молниями, кухонные задачи. Для сложной физики 300 тысяч роликов отбирали вручную асессоры Сбера, остальное отфильтровали автоматикой по качеству и динамике.

Награда за правдоподобную физику

Дообучение на профильных данных само по себе физику не чинит, поэтому Сбер добавил второй этап. Для дорожных и робототехнических сцен взяли обучение с подкреплением: отдельная модель-оценщик учится отличать настоящее видео от сгенерированного, опираясь на форму объектов, глубину сцены и характер движения, а генератор подстраивается так, чтобы получать от неё высокую оценку.

Со сложной физикой этот подход дал слабый результат. Там, где ткань мнётся, а человек двигается, естественная деформация легко читается оценщиком как ошибка. Для K5-PH применили другой метод: модель во время обучения намеренно уводят с правильной траектории и учат возвращаться обратно, без внешнего судьи.

Топ-10 при 2 млрд параметров

Kandinsky WM 1.0 проверяли на трёх бенчмарках для Physical AI: 4-е место на PAI-Bench-G, 5-е на Physics-IQ Verified и 6-е на RBench. Модели, стоящие выше, крупнее на один-два порядка. В целевых доменах Kandinsky обошла NVIDIA Cosmos-Predict2.5-2B, ближайшую к себе по размеру: примерно на 5 процентных пунктов в автомобильных и робототехнических сценариях, на 2–3 пункта в индустрии и сценах с людьми.

Здесь Сбер честно оговаривается, и оговорку легко пропустить: все места и метрики получены в собственной валидации команды по опубликованным процедурам бенчмарков, а не через официальную подачу в лидерборд. Цифры от этого не перестают быть цифрами, но проверить их придётся сообществу - благо веса выложены.

Что даёт лицензия MIT

MIT - самая свободная из ходовых лицензий: модель можно брать в коммерческие проекты, дообучать и встраивать в свои продукты, сохранив упоминание авторства. Веса Kandinsky WM 1.0 лежат на GitHub, GitVerse и Hugging Face, размер в 2 млрд параметров позволяет запускать модель без серверной фермы. Работает она в режиме «кадр плюс описание», причём промпт нужен английский и подробный - с описанием объектов, действия и ожидаемой динамики. Сбер сообщает, что модели уже используют его Центр робототехники и институт AIRI.

Следующий шаг - интерактивная среда

По функциональной классификации моделей мира Kandinsky WM 1.0 пока остаётся рендерером: она рисует наблюдение, но не держит состояние мира и не отвечает на действия. Дальше по этой лестнице стоят Genie 3 у Google DeepMind, Cosmos 3 у NVIDIA и GWM-1 у Runway - среды, которые реагируют на команду и позволяют проверить несколько вариантов будущего. Туда же собирается двигаться и команда Сбера. Пока же в открытом доступе появилась рабочая заготовка мирового уровня по метрикам и российская по происхождению - редкое сочетание для этой части рынка.

10:40
36
Нет комментариев. Ваш будет первым!