HappyHorse

Анонимный лидер рейтинга, за которым стояла Alibaba
HappyHorse появилась на видеоарене Artificial Analysis без указания авторства. За пару дней модель забрала первое место в категориях «текст в видео» и «картинка в видео», обойдя прежнего лидера Seedance примерно на 60 пунктов Elo. Индустрия гадала, кто за этим стоит, пока авторство не подтвердила Alibaba.
Разработку ведёт Future Life Lab внутри Taotian Group - подразделения Alibaba, отвечающего за электронную коммерцию. Команду возглавляет Чжан Ди, бывший вице-президент Kuaishou и технический руководитель Kling. То есть за HappyHorse стоят люди, уже сделавшие одну из сильнейших китайских видеомоделей. Это многое объясняет в стартовом уровне продукта.
Четыре режима генерации
Модель закрывает основные сценарии работы с видео. Из текстового описания она собирает ролик с нуля. Из стартового кадра оживляет статичную картинку, сохраняя персонажа и обстановку. Режим с референсами (до девяти изображений) удерживает героев, окружение, палитру и даже конкретные товары на протяжении всего проекта. Есть и редактирование готового видео.
Каждый режим работает в двух вариантах: с нативным звуком и без него. Длина клипа - от 3 до 15 секунд, по умолчанию пять. Разрешение на выбор: 720p или 1080p.
Звук и видео из одной модели
Главная техническая особенность HappyHorse - единая архитектура, которая генерирует звук и картинку в одном проходе. Текстовые, графические, видео- и аудиотокены идут одной последовательностью, и одни и те же слои внимания обрабатывают всё сразу. Поэтому звуковые события совпадают с экранным действием без отдельной стадии озвучки.
На практике это даёт синхронные реплики, шумовое окружение и липсинк. Движение губ подгоняется под несколько языков - от английского и путунхуа до японского, корейского и французского. Для роликов с говорящими персонажами это снимает самую заметную проблему ИИ-видео: рассинхрон рта и речи.
Режиссура нескольких сцен по одному описанию
Отдельная сильная сторона - разбор сложного описания на последовательность сцен. Одна большая подсказка раскладывается на несколько кадров подряд с расстановкой персонажей и операторской раскадровкой. Раньше для такого пришлось бы собирать ролик из отдельных кусков вручную.
Вместе с референсными изображениями это переводит модель из разряда «генератор коротких гифок» в инструмент для связных мини-историй: герой и обстановка держатся от сцены к сцене, а не плывут при каждой новой генерации.
Где модель сильна, а где проседает
Сильная сторона очевидна по рейтингам: качество картинки и движения у HappyHorse на уровне топовых закрытых моделей, а нативный звук пока есть далеко не у всех конкурентов. Липсинк и многосценность выводят её за рамки рядового генератора клипов.
Ограничения тоже есть. Потолок в 15 секунд держит модель в формате коротких роликов - полноценное видео придётся собирать из нескольких генераций. Качество звука в редких языках уступает английскому и китайскому. И как у любой генеративной видеомодели, сложная физика, мелкий текст в кадре и руки остаются зоной риска: с первого раза выходит не всегда.
Доступность: своя платформа, партнёры и API
У HappyHorse есть собственный веб-сервис на happyhorse.com с разделами генерации и редактирования видео. В интерфейсе выбираются режим работы (по референсам или по первому кадру), загрузка до девяти изображений, модель, соотношение сторон, разрешение и длительность ролика. Это полноценная рабочая среда, а не только витрина модели.
Помимо официального сайта, модель раздаётся через партнёрские платформы и API: fal, Atlas Cloud, WaveSpeed, PixVerse, Picsart, ImagineArt и другие. У каждого свой интерфейс и условия, а для разработчиков есть API с эндпоинтами под все четыре режима.
Отдельно стоит сказать про «открытость». HappyHorse часто называют открытой моделью, и формально API действительно открыт. Но полные веса в свободный доступ так и не выложены: страница на Hugging Face закрыта авторизацией, а независимые репозитории официального статуса не имеют. Так что к ярлыку «open-source» стоит относиться осторожно: открыт доступ, но не сама модель.
Тарифы: оплата по факту
Цена зависит от площадки. Ориентиры на 25 июня 2026 года такие:
- Официальный сайт happyhorse.com - кредитная модель: около 180 кредитов за обычный ролик и 240 за HD при курсе $1 = 100 кредитов. На старте дают 10 бесплатных кредитов без подписки. Дальше - месячная или годовая подписка (годовая со скидкой до 50%, фактически пара месяцев в подарок) либо разовые пакеты кредитов. Подписчики получают постоянное хранилище и коммерческие права; на бесплатном и поштучном тарифах файлы хранятся 15 дней.
- API на fal, Atlas Cloud, WaveSpeed - $0,14 за секунду видео в 720p и $0,28 за секунду в 1080p. Оплата по факту, без минимального платежа.
- API на EvoLink - от $0,179 за секунду в 720p и $0,318 в 1080p.
В пересчёте пятисекундный ролик в 1080p через API обходится примерно в $1,4. Для коротких форматов и тестов это посекундная модель без подписки, что удобно при нерегулярной нагрузке.
Кому это пригодится
Маркетологам и SMM-специалистам HappyHorse закрывает короткие рекламные ролики и анимацию товаров: режим с референсами держит конкретный продукт в кадре. Креаторам и блогерам пригодятся говорящие персонажи с липсинком на нескольких языках - без отдельной озвучки. Студиям и режиссёрам многосценность даёт быстрый способ собрать раскадровку или превизуализацию. А разработчики могут встроить генерацию в свои продукты через API, не поднимая инфраструктуру.
Плюсы и минусы
Плюсы:
- нативный звук и липсинк на нескольких языках в одном проходе;
- первые места в независимом рейтинге Artificial Analysis по text-to-video и image-to-video;
- режиссура нескольких сцен по одному описанию и до девяти референсных изображений;
- посекундная оплата без подписки, бесплатный вход у многих площадок.
Минусы:
- потолок ролика в 15 секунд;
- на бесплатном и поштучном тарифах файлы хранятся всего 15 дней;
- полные веса не опубликованы, «открытость» условна;
- качество звука и липсинка в редких языках ниже, чем в английском и китайском.
Как получить результат с первого раза
Описывайте сцену по слоям: кто в кадре, что делает, какая камера, какой звук. Модель хорошо разбирает структуру, поэтому раскадровка из нескольких предложений работает лучше одной общей фразы. Для проектов с повторяющимся героем или товаром сразу загружайте референсы - это заметно стабильнее, чем описывать внешность словами.
Если нужен ролик длиннее 15 секунд, планируйте его как набор сцен под многосценный режим, а не как одну длинную генерацию. И сравните пару площадок перед регулярной работой: модель одна, но цены и лимиты у партнёров отличаются.
Разработчик
HappyHorse создаёт Future Life Lab - исследовательское подразделение Taotian Group, входящей в Alibaba (Китай, основана в 1999 году, штаб-квартира в Ханчжоу). Лабораторию возглавляет Чжан Ди, прежде вице-президент Kuaishou и технический руководитель видеомодели Kling. Для Alibaba это часть большой ставки на генеративный ИИ наряду с языковыми моделями Qwen.
Стоит ли пробовать
HappyHorse подойдёт тем, кому нужно короткое видео со звуком и говорящими персонажами без отдельной стадии озвучки - от рекламных роликов до превизуализации. Сильные стороны реальны и подтверждены независимым рейтингом, а посекундная оплата позволяет протестировать модель почти без затрат. Если ваши задачи укладываются в формат до 15 секунд, начать проще всего с бесплатных кредитов на официальном сайте happyhorse.com и пары пробных генераций.
| Возможности сервиса | |
|---|---|
| Нужен VPN | Да |
| Русский язык | Да |
| Русский интерфейс | Нет |
| Платформа | |