Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию, а голосовой референс переносит в новую сцену ещё и тембр героя. Заодно появились генерация видео из текстового описания и нативное разрешение 1080p.
Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

Grok Imagine - генератор изображений и видео от xAI, встроенный в Grok (Грок) и вынесенный отдельным разделом на grok.com. Обновление 31 июля компания подаёт как переход от разовых красивых роликов к съёмке сериями, где персонаж и обстановка не меняются от кадра к кадру. Функции включаются постепенно, и часть из них пока заперта на верхних подписках.

Семь референсов на одну генерацию

Каждое изображение-референс в Grok Imagine закрепляет один элемент сцены - лицо, товар или локацию. Остальное меняется по промпту. Можно оставить героя и переставить его в другой интерьер, оставить интерьер и поменять героя, либо зафиксировать оба слоя и менять только действие. Предел - семь референсов на одну генерацию.

Ролик теперь собирается из повторяющихся элементов. Раньше похожего результата добивались десятком попыток с одним и тем же промптом, и совпадение получалось случайным.

Голос держится вместе с лицом

Вторая новинка релиза - голосовой референс. В Grok Imagine загружаются два файла, фотография персонажа и образец его голоса, после чего в новых сценах сохраняются и внешность, и звучание. Повторяемость голоса оставалась слабым местом генеративного видео дольше, чем повторяемость картинки: лицо ещё как-то удавалось удержать, а тембр героя плавал от ролика к ролику.

Видео из текста и 1080p

Grok Imagine научился делать видео из одного текстового описания, стартовое изображение больше не нужно. Технически xAI связала собственную генерацию картинок с режимом image-to-video: модель сначала рисует кадр, потом его оживляет.

Второе изменение - нативные 1080p для обоих режимов, и текстового, и картиночного. Текст-в-видео и высокое разрешение уже открыты всем на grok.com/imagine, в приложениях для iOS и Android.

Пока США и старшие подписки

Референсы изображений и голоса стартовали 31 июля только в США и только для SuperGrok Heavy и SuperGrok Plus, двух верхних тарифов. xAI обещает раскатить их на остальные уровни в течение нескольких дней. Разработчикам изображения-референсы, генерация из текста и 1080p доступны в API под моделью grok-imagine-video-1.5; голосовой референс там выдают по отдельному запросу через отдел продаж.

Последняя деталь говорит сама за себя. Перенос голоса xAI пока не готова отдавать в самообслуживание.

Реклама, ведущие, товарные ролики

Набор референсов переводит Grok Imagine в разряд рабочих инструментов для задач, где картинка обязана повторяться. Первыми открываются несколько сценариев:

  • рекламная серия, где товар выглядит одинаково во всех кадрах;
  • виртуальный ведущий с закреплённым лицом и голосом;
  • короткие скетчи и сериалы с постоянными персонажами;
  • демонстрация одного продукта в разных обстановках и ракурсах.

Veo и Runway пришли раньше

Сама идея опорных изображений на рынке не первый год. У Google в Veo работает режим Ingredients to Video, Runway с четвёртого поколения строит консистентность персонажей на референсах, Kling держит лицо через отдельную модель головы. Аргумент Grok Imagine - объём: семь опорных изображений против трёх у Veo, плюс голос, которого в связке «лицо и сцена» у конкурентов нет. Насколько уверенно это держится на длинных сценах, покажут ролики пользователей, а не демо на сайте xAI.

Лицо и голос без согласия

Связка «портрет плюс образец голоса» - ровно та функциональность, из которой делают дипфейки, и у Grok Imagine уже есть репутационный шлейф после историй с генерацией изображений реальных людей. Придержать голосовые референсы за формой обращения к продажам выглядит осознанной страховкой. Публичная часть продукта при этом принимает загруженные фотографии без такой оговорки. Проверочная точка близко: когда референсы раскатят на все тарифы и за пределы США, станет видно, справляются ли фильтры xAI с потоком портретов живых людей.

08:20
65
Нет комментариев. Ваш будет первым!