Видео из текста — со звуком
Опишите сцену словами — модель вернёт ролик длительностью до 15 секунд с синхронным аудио и реалистичной физикой движения. Никакой отдельной озвучки, никакого монтажа.
Видео-модель Alibaba — единый Transformer на 15 млрд параметров. Нативное аудио в одном проходе, lip-sync на 7 языках, до 15 секунд в 1080p. Четыре режима: T2V, I2V, Reference-to-Video и редактирование готового ролика.
Четыре режима в одной модели — без переключения инструментов
Опишите сцену словами — модель вернёт ролик длительностью до 15 секунд с синхронным аудио и реалистичной физикой движения. Никакой отдельной озвучки, никакого монтажа.
Загрузите изображение — модель добавит движение, плавную камеру, ветер, изменения освещения и синхронный звук. Стиль исходника сохраняется.
Передайте 1–9 референсных изображений героя — модель удержит его внешность, одежду и черты лица в каждом кадре всех 15 секунд. Уникальный режим, которого нет в других моделях.
Загрузите MP4 (до 100 МБ, 3–60 сек) и опишите изменение: смена фона, времени суток, добавление объектов, рестайл сцены. Модель сохраняет монтажный ритм.
Единый Transformer без cross-attention выдаёт видеопоток и аудиодорожку синхронно. Это убирает рассинхрон, типичный для двухстадийных пайплайнов с TTS.
Полная синхронизация губ с речью на английском, мандарине, кантонском, японском, корейском, немецком и французском. Промпт можно писать на любом из них — до 2 500 символов.
Никакой настройки API — Clipia уже подключила HappyHorse 1.0
Четыре режима в одной модели: T2V для текста, I2V для оживления фото, R2V для сохранения персонажа, Edit для рестайла готового ролика.
Пишите промпт текстом до 2 500 символов на любом из 7 поддерживаемых языков. Звуковое окружение тоже описывается прямо в промпте.
Выберите длительность от 3 до 15 секунд, разрешение 720p или 1080p, нужное соотношение сторон (16:9, 9:16, 1:1, 4:3, 3:4).
~38 секунд для 5-секундного ролика 1080p. Аудио уже встроено в файл — никакого дополнительного монтажа.
Где HappyHorse 1.0 даёт максимум ценности
Reels, Shorts и TikTok с готовой музыкой и эффектами. 9:16, 15 секунд, без отдельного монтажа звука.
Динамичные ролики для performance-кампаний. Через Reference-to-Video бренд-герой держит идентичность во всей серии.
Статичные портреты, иллюстрации и продуктовые шоты оживают: модель добавляет движение, сохраняя облик и стиль.
Каталог-шоты превращаются в кинематографичные ролики с плавной камерой, светом и текстурами материала.
Короткие сцены с диалогами, музыкой и атмосферным звуком — основа для авторских веб-сериалов и подкаст-роликов.
Один сценарий — несколько языковых дорожек. Lip-sync на 7 языках без отдельной озвучки и пересъёмки.
Что нужно знать о HappyHorse 1.0
HappyHorse 1.0 — видео-модель Alibaba ATH под руководством Чжана Ди (бывшего технического архитектора Kling AI). Это единый 40-слойный Transformer на 15 млрд параметров, который генерирует видео и звук в одном проходе. На 7 апреля 2026 модель появилась анонимно на лидерборде Artificial Analysis и за сутки взяла #1, 10 апреля Bloomberg и CNBC раскрыли авторство Alibaba.
На блайнд-тесте AA Arena HappyHorse впереди Seedance 2.0 в обеих категориях без аудио: T2V 1366 vs 1273, I2V 1391 vs 1356. С аудио ситуация обратная — Seedance 2.0 #1 (T2V 1219, I2V 1162), HappyHorse #2 (1204 / 1159). Если важны физика движения, оптика и идентичность персонажа без озвучки — HappyHorse сильнее. Если приоритет — нативная аудиодорожка, Seedance 2.0 пока впереди на доли процента.
Три причины. Архитектурно — единый Transformer без cross-attention, который выдаёт видео и аудио в одном проходе (раньше так умели только закрытые флагманские модели). По бенчмаркам — взял #1 на AA Arena анонимно за 24 часа после релиза, обойдя Seedance, Kling, PixVerse, SkyReels. По линейке возможностей — четыре режима в одной модели (T2V/I2V/R2V/Edit), а не четыре отдельных продукта.
На независимом блайнд-тесте Artificial Analysis Video Arena HappyHorse держит первое место в обеих категориях без аудио: Text-to-Video (ELO 1366) и Image-to-Video (ELO 1391). По физике движения, оптике и стабильности персонажа модель — сильнейшая на рынке среди публично доступных. С учётом аудио — топ-2.
Четыре режима в одной модели: Text-to-Video (T2V) — из текста, Image-to-Video (I2V) — оживление картинки, Reference-to-Video (R2V) — сохранение идентичности персонажа сквозь всё видео, Video Editing — редактирование готового ролика по текстовой команде. Каждый режим поддерживает аудио и lip-sync.
Архитектура HappyHorse — единый Transformer без cross-attention: видеопоток и аудиодорожка генерируются совместно за один forward pass. Это устраняет рассинхрон, который встречается у моделей с раздельным TTS-этапом. На вход можно описать звуковое окружение прямо в промпте — модель учтёт его при создании дорожки.
Семь языков с полной синхронизацией губ: английский, мандарин, кантонский, японский, корейский, немецкий и французский. Промпт можно писать на любом из них, до 2 500 символов.
720p и 1080p. Пять соотношений сторон: 16:9, 9:16, 1:1, 4:3, 3:4. На входе I2V принимаются JPEG, PNG, WEBP до 10 МБ; для Video Editing — MP4 или MOV до 100 МБ длительностью 3–60 секунд.
От 3 до 15 секунд, шаг — 1 секунда (любое целое число). Среднее время генерации — около 38 секунд для 5-секундного ролика 1080p. Для длительных историй можно склеивать несколько роликов с одним персонажем через R2V.
Стоимость начинается от 30 кредитов и зависит от длительности и разрешения. Точная сумма отображается перед запуском генерации. Аудио и lip-sync уже включены, отдельная плата за озвучку не взимается.