Runway показала GWM Worlds 2 - интерактивный мир вместо видеоролика

Runway 3 сентября показала GWM Worlds 2 - мировую модель, которая выдаёт живое интерактивное пространство вместо готового ролика. Картинка идёт непрерывным потоком в 720p при 24 кадрах в секунду, звук генерируется вместе с ней, а происходящим управляют текстом и движением камеры прямо во время генерации.
Runway показала GWM Worlds 2 - интерактивный мир вместо видеоролика

Мировые модели — отдельная ветка генеративного видео. Вместо готового клипа они держат сцену, по которой можно перемещаться, и достраивают её под действия зрителя. Runway описывает свой релиз как переход от генерации видео к симуляции и называет четыре области применения: интерактивные развлечения, виртуальные персонажи, робототехника с симуляцией агентов и генеративный дизайн. Пока это research preview, исследовательская демонстрация без публичного доступа.

Джетпак, зонт и затопленная комната

У сессии в GWM Worlds 2 нет заранее заданной длины. Модель не проигрывает заготовленный клип и не следует сценарию — каждый новый ввод продолжает мир с того состояния, в котором он находится. Пользователь задаёт окружение, действующих персонажей, визуальный стиль, физические правила и атмосферу, а дальше управляет происходящим командами и непрерывным движением камеры.

Заявленный набор действий заметно шире перемещения по локации:

  • навигация от первого и от третьего лица — ходьба, бег, полёт, езда, осмотр по сторонам, причём камера и персонаж управляются независимо;
  • произвольные действия субъектов, от лазания и рывка на джетпаке до выстрела из лазерного пистолета, включения лампы и раскрытия зонта;
  • события всей сцены целиком, например затопление комнаты или смена погоды;
  • диалоги персонажей с контролем голоса, интонации и языка речи, причём артикуляция генерируется синхронно с озвучкой.

WorldPrompt делит мир на два слоя

Для описания мира Runway предложила собственный формат ввода — WorldPrompt. Он разделяет состояние сцены на то, что сохраняется постоянно, и то, что меняется во времени.

Постоянный слой включает genesis prompt, описание сцены с её геометрией, материалами, освещением и фоновым звуком. Туда же идут список субъектов с их свойствами и «законы» мира — гравитация, столкновения, способности персонажей, ракурс камеры. Дополнительно задаётся первый кадр, который визуально заземляет генерацию.

Второй слой — поток событий с временными метками. Каждое действие представляет собой свободный текст с началом и концом, адресованный конкретному субъекту или сцене целиком. Действия могут накладываться друг на друга, а отдельным потоком идёт покадровое положение и поворот камеры.

От киносценария до реального времени

Runway описывает три режима работы с моделью:

  • заранее — весь поток событий пишется до старта, при желании с помощью языковой модели, после чего система генерирует итоговое видео со звуком целиком; это ближе к режиссуре;
  • пошагово — генерация останавливается в точках выбора, подходит для визуальных новелл;
  • в реальном времени — действия влияют на поток немедленно, и именно этот режим нужен играм и интерактивным проектам.

Здесь же обозначено главное техническое ограничение подхода. Набирать текст на ходу слишком медленно, а внешние мультимодальные модели не успевают реагировать за десятки миллисекунд. В демонстрации проблему обходят привязкой готовых промптов к клавишам и мыши: клавиша движения вперёд соответствует фразе «персонаж идёт вперёд», клик — броску мяча. Разработчики признают, что качество в таком режиме ниже, чем при заранее написанном сценарии, потому что развёрнутый текст успевает описать гораздо больше деталей сцены. Свободный текст как интерфейс управления пока остаётся на бумаге — в живом демо это обычная игровая раскладка.

Мультиплеер и мир одной фразой

Поскольку GWM Worlds 2 оперирует понятием субъекта, разные пользователи могут управлять разными персонажами одновременно. В демоверсии это сделано через роли — «игрок 1», «игрок 2», «режиссёр», — у каждой свой набор доступных действий. Трансляция видео и звука всем участникам организована на базе LiveKit, а клиент выбирает роль при подключении.

Отдельно показан сценарий авторинга. Вместо ручного написания genesis prompt и списка действий пользователь вводит короткую фразу вроде «кроссовый мотоцикл от третьего лица в заснеженном ландшафте», а языковая модель сама собирает первый кадр, описание мира и раскладку действий по клавишам. Всё это можно отредактировать до запуска, и путь от идеи до готового мира занимает секунды.

Почему картинку уводит при быстрых движениях

GWM Worlds 2 устроена как авторегрессионная диффузионная модель, генерирующая видео и аудио разом. На каждом шаге она опирается на три типа контекста — глобальный (genesis prompt и первый кадр), текущий кадр (положение камеры и активные текстовые действия) и уже сгенерированные кадры, которые хранятся в скользящем окне кэша. Старые кадры из этого окна вытесняются, декодеры видео и звука работают с кэшем ради скорости.

Отсюда и слабые места, которые Runway перечисляет открыто. Генерация в реальном времени меняет качество на скорость, и при быстрых движениях камеры детали, текстуры и геометрия начинают плыть. Долговременная согласованность мира несовершенна, а референсные изображения, кроме первого кадра, не поддерживаются. Полноценное управление свободным текстом требует внешней обвязки, которая отслеживала бы состояние мира и генерировала действия на лету, например реплики неигровых персонажей.

Компания сравнивает нынешний этап с ранней историей офлайновой генерации видео. Та прошла путь от коротких грубых клипов до материала продакшен-качества. В реальном времени, по мнению разработчиков, повторится та же кривая, а GWM Worlds 2 они называют очень ранней точкой на ней.

Google и World Labs идут иначе

GWM Worlds 2 продолжает линейку GWM-1, представленную в декабре 2025 года вместе с вариантами для миров, роботов и аватаров. С тех пор Runway закрыла раунд Series E на 315 млн долларов при оценке в 5,3 млрд, пообещав направить деньги на предобучение следующего поколения мировых моделей.

Конкуренция в сегменте плотная. Google раздаёт доступ к экспериментальному Project Genie на базе Genie 3 подписчикам старших тарифов, World Labs вывела на рынок Marble для генерации трёхмерных пространств, а профильные стартапы за 2026 год привлекли сотни миллионов долларов каждый. Ставка Runway на этом фоне выглядит специфично. Компания строит непрерывный аудиовизуальный поток, которым управляют текстом, без трёхмерной сцены и игрового движка под ним, с расчётом на то, что тот же интерфейс пригодится и для развлечений, и для обучения роботов.

Граница между роликом, игрой и агентом

Публичного доступа, ценника или листа ожидания Runway пока не объявляла, анонс ограничен исследовательской страницей и демонстрационным роликом. Судить об успехе можно будет по первому показу вне демо — когда мир придётся держать дольше пары минут и на чужом сценарии.

Практический смысл релиза для отрасли скорее концептуальный. Если управление симуляцией сводится к тексту с временными метками, граница между «снять видео», «сделать игру» и «обучить агента» становится куда менее чёткой, чем сейчас.

01:30
25
Нет комментариев. Ваш будет первым!