MiniMax выпустила видеомодель H3 - ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики до 15 секунд в 2K с нативным стереозвуком. Модель уже работает через API, а веса компания обещает открыть в ближайшие дни.
MiniMax выпустила видеомодель H3 - ролики в 2K со звуком

MiniMax - китайская компания, известная по линейке видеомоделей Hailuo (Хайлуо) и текстовым моделям серии M. H3 продолжает эту линию: в документации API модель проходит под рабочим именем Hailuo-03, но в публичном анонсе название сменили. Компания подаёт релиз как попытку убрать границы между отдельными режимами генерации и заодно вернуть видеомодели в открытый доступ.

Один запрос вместо четырёх режимов

До сих пор видеогенерация была разбита на отдельные задачи: текст в видео, картинка в видео, первый и последний кадр, перенос движения, референс по персонажу, редактирование. Под каждую обычно шла своя модель или свой режим. H3 принимает всё это в одном запросе - текст, изображения, ролики и аудио складываются в общий контекст, а связь между ними описывается обычными словами.

Пример из анонса MiniMax выглядит так: «Возьми движение камеры из видео 1, пусть персонаж с изображения 2 поёт, а голос совпадает с аудио 3». Модель сама разбирается, что здесь референс движения, что источник внешности, а что образец голоса. Отдельных переключателей режима нет.

2K по умолчанию, от 4 до 15 секунд

В API H3 доступна асинхронно: запрос возвращает идентификатор задачи, готовый ролик забирается отдельным вызовом. Разрешение сейчас одно - 2K. Длительность задаётся целым числом секунд в диапазоне от 4 до 15. Пропорции кадра выбираются из набора 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 либо подбираются автоматически под входной материал.

Ограничения на вход у MiniMax довольно щедрые:

  • до 9 референсных изображений, до 3 референсных видео и до 3 аудиодорожек в одном запросе;
  • каждый референсный клип от 2 до 15 секунд, суммарно не больше 15;
  • изображение до 30 МБ, видео до 50 МБ, аудио до 15 МБ, всё тело запроса до 64 МБ.

Текстовый промпт обязателен всегда, даже когда основную работу делают референсы. Аудио отдельно, без картинки или видео, модель не примет.

Цена как главный аргумент MiniMax

Экономику MiniMax описывает в относительных величинах: секунда в 2K обходится меньше трети от цены основных конкурентов, а в 768p - меньше половины от их же 720p. Абсолютных цифр в анонсе нет, конкретные модели для сравнения не названы.

Здесь нужно оговориться. Режим 768p упомянут в тексте про цены, но в самой документации API разрешение пока предлагается только одно, 2K. Либо более дешёвый режим появится позже, либо сравнение приведено для внутренних расчётов. Проверить утверждение о цене на своей задаче получится не раньше, чем откроется второй режим или появится публичный прайс-лист.

H3-VAE и регенерация вместо апскейла

Техническая часть у MiniMax держится на нескольких решениях. Новый токенизатор H3-VAE даёт четырёхкратный выигрыш по эффективной длине последовательности, и именно он позволяет считать 2K нативно, а не догонять разрешение постобработкой. Архитектура H3-Omni Transformer разводит вычисления на понимание и на генерацию по разным контурам, что подняло пропускную способность обучения почти на 30%.

Самое любопытное решение - отказ от отдельного модуля апскейла. Вместо него H3 заново генерирует собственный черновик низкого разрешения, снова опираясь на исходный контекст. По замыслу MiniMax это возвращает мелкие детали и текст на вывесках, которые обычный увеличитель разрешения способен только додумать. Полный технический отчёт компания обещает опубликовать позже.

Открытые веса обещаны «в ближайшие дни»

Видеогенерация до сих пор остаётся вотчиной закрытых моделей - открытых релизов сопоставимого уровня почти нет, и экосистема вокруг них развивается медленнее, чем вокруг языковых моделей. MiniMax собирается выложить веса H3 «в ближайшие дни, с учётом применимого законодательства». Формулировка осторожная, срок мягкий, но совместимость с разным железом компания закладывала в архитектуру с самого начала.

Если обещание выполнят, H3 станет одной из первых крупных открытых моделей для мультимодальной генерации видео. Развернуть её у себя и дообучить под конкретную нишу - сценарий, которого рынку сейчас не хватает больше, чем очередного роста качества.

Реклама, товарные карточки и заставки

Целевые сценарии MiniMax называет прямо: реклама, брендинг, электронная коммерция, промышленный дизайн, интерфейсы, игры. В демонстрациях - киношные титры, промо-ролик для сайта продукта, оживший постер и рекламные вставки для магазина. Отдельно компания подчёркивает аккуратную отрисовку текста и логотипов, что для товарной съёмки важнее эффектных планов.

Подбор примеров говорит о приоритетах. H3 продают не как инструмент для авторского кино, а как рабочую лошадь для контента, который производят пачками и по техзаданию.

Всё упирается в дату публикации весов

Заявленные MiniMax цифры пока опираются только на собственные тесты компании: независимых замеров качества и сравнений с конкурентами нет, абсолютных цен тоже. Ближайшая проверочная точка - выкладка весов. Появятся они в течение недели-двух, и у сообщества будет чем мерить; затянется срок или изменится формулировка про «применимое законодательство» - и H3 останется ещё одним API среди прочих, с хорошим прайсом и обычной для отрасли закрытостью.

12:05
52
Нет комментариев. Ваш будет первым!