Runway показала GWM Worlds 2 - интерактивный мир вместо видеоролика
Мировые модели — отдельная ветка генеративного видео. Вместо готового клипа они держат сцену, по которой можно перемещаться, и достраивают её под действия зрителя. Runway описывает свой релиз как переход от генерации видео к симуляции и называет четыре области применения: интерактивные развлечения, виртуальные персонажи, робототехника с симуляцией агентов и генеративный дизайн. Пока это research preview, исследовательская демонстрация без публичного доступа.
Джетпак, зонт и затопленная комната
У сессии в GWM Worlds 2 нет заранее заданной длины. Модель не проигрывает заготовленный клип и не следует сценарию — каждый новый ввод продолжает мир с того состояния, в котором он находится. Пользователь задаёт окружение, действующих персонажей, визуальный стиль, физические правила и атмосферу, а дальше управляет происходящим командами и непрерывным движением камеры.
Заявленный набор действий заметно шире перемещения по локации:
- навигация от первого и от третьего лица — ходьба, бег, полёт, езда, осмотр по сторонам, причём камера и персонаж управляются независимо;
- произвольные действия субъектов, от лазания и рывка на джетпаке до выстрела из лазерного пистолета, включения лампы и раскрытия зонта;
- события всей сцены целиком, например затопление комнаты или смена погоды;
- диалоги персонажей с контролем голоса, интонации и языка речи, причём артикуляция генерируется синхронно с озвучкой.
WorldPrompt делит мир на два слоя
Для описания мира Runway предложила собственный формат ввода — WorldPrompt. Он разделяет состояние сцены на то, что сохраняется постоянно, и то, что меняется во времени.
Постоянный слой включает genesis prompt, описание сцены с её геометрией, материалами, освещением и фоновым звуком. Туда же идут список субъектов с их свойствами и «законы» мира — гравитация, столкновения, способности персонажей, ракурс камеры. Дополнительно задаётся первый кадр, который визуально заземляет генерацию.
Второй слой — поток событий с временными метками. Каждое действие представляет собой свободный текст с началом и концом, адресованный конкретному субъекту или сцене целиком. Действия могут накладываться друг на друга, а отдельным потоком идёт покадровое положение и поворот камеры.
От киносценария до реального времени
Runway описывает три режима работы с моделью:
- заранее — весь поток событий пишется до старта, при желании с помощью языковой модели, после чего система генерирует итоговое видео со звуком целиком; это ближе к режиссуре;
- пошагово — генерация останавливается в точках выбора, подходит для визуальных новелл;
- в реальном времени — действия влияют на поток немедленно, и именно этот режим нужен играм и интерактивным проектам.
Здесь же обозначено главное техническое ограничение подхода. Набирать текст на ходу слишком медленно, а внешние мультимодальные модели не успевают реагировать за десятки миллисекунд. В демонстрации проблему обходят привязкой готовых промптов к клавишам и мыши: клавиша движения вперёд соответствует фразе «персонаж идёт вперёд», клик — броску мяча. Разработчики признают, что качество в таком режиме ниже, чем при заранее написанном сценарии, потому что развёрнутый текст успевает описать гораздо больше деталей сцены. Свободный текст как интерфейс управления пока остаётся на бумаге — в живом демо это обычная игровая раскладка.
Мультиплеер и мир одной фразой
Поскольку GWM Worlds 2 оперирует понятием субъекта, разные пользователи могут управлять разными персонажами одновременно. В демоверсии это сделано через роли — «игрок 1», «игрок 2», «режиссёр», — у каждой свой набор доступных действий. Трансляция видео и звука всем участникам организована на базе LiveKit, а клиент выбирает роль при подключении.
Отдельно показан сценарий авторинга. Вместо ручного написания genesis prompt и списка действий пользователь вводит короткую фразу вроде «кроссовый мотоцикл от третьего лица в заснеженном ландшафте», а языковая модель сама собирает первый кадр, описание мира и раскладку действий по клавишам. Всё это можно отредактировать до запуска, и путь от идеи до готового мира занимает секунды.
Почему картинку уводит при быстрых движениях
GWM Worlds 2 устроена как авторегрессионная диффузионная модель, генерирующая видео и аудио разом. На каждом шаге она опирается на три типа контекста — глобальный (genesis prompt и первый кадр), текущий кадр (положение камеры и активные текстовые действия) и уже сгенерированные кадры, которые хранятся в скользящем окне кэша. Старые кадры из этого окна вытесняются, декодеры видео и звука работают с кэшем ради скорости.
Отсюда и слабые места, которые Runway перечисляет открыто. Генерация в реальном времени меняет качество на скорость, и при быстрых движениях камеры детали, текстуры и геометрия начинают плыть. Долговременная согласованность мира несовершенна, а референсные изображения, кроме первого кадра, не поддерживаются. Полноценное управление свободным текстом требует внешней обвязки, которая отслеживала бы состояние мира и генерировала действия на лету, например реплики неигровых персонажей.
Компания сравнивает нынешний этап с ранней историей офлайновой генерации видео. Та прошла путь от коротких грубых клипов до материала продакшен-качества. В реальном времени, по мнению разработчиков, повторится та же кривая, а GWM Worlds 2 они называют очень ранней точкой на ней.
Google и World Labs идут иначе
GWM Worlds 2 продолжает линейку GWM-1, представленную в декабре 2025 года вместе с вариантами для миров, роботов и аватаров. С тех пор Runway закрыла раунд Series E на 315 млн долларов при оценке в 5,3 млрд, пообещав направить деньги на предобучение следующего поколения мировых моделей.
Конкуренция в сегменте плотная. Google раздаёт доступ к экспериментальному Project Genie на базе Genie 3 подписчикам старших тарифов, World Labs вывела на рынок Marble для генерации трёхмерных пространств, а профильные стартапы за 2026 год привлекли сотни миллионов долларов каждый. Ставка Runway на этом фоне выглядит специфично. Компания строит непрерывный аудиовизуальный поток, которым управляют текстом, без трёхмерной сцены и игрового движка под ним, с расчётом на то, что тот же интерфейс пригодится и для развлечений, и для обучения роботов.
Граница между роликом, игрой и агентом
Публичного доступа, ценника или листа ожидания Runway пока не объявляла, анонс ограничен исследовательской страницей и демонстрационным роликом. Судить об успехе можно будет по первому показу вне демо — когда мир придётся держать дольше пары минут и на чужом сценарии.
Практический смысл релиза для отрасли скорее концептуальный. Если управление симуляцией сводится к тексту с временными метками, граница между «снять видео», «сделать игру» и «обучить агента» становится куда менее чёткой, чем сейчас.