Видеомодель нового поколения от MiniMax: изображение и звук генерируются одновременно, поэтому отдельная озвучка не нужна. В промпте описывают не только сцену и движение камеры, но и саундтрек — музыку, шумы, атмосферу. Текст в видео и оживление изображения, 5–15 секунд, 480p и 768p, 7 форматов кадра.
Кинематографичный облёт штормового океана на закате, огромные волны разбиваются о тёмные скалы, вспышки молний на горизонте, раскаты грома и глубокая оркестровая партитура
В независимом рейтинге Artificial Analysis MiniMax H3 занимает первое место в категории «редактирование видео» (Elo 1132) и второе — в «текст в видео» (Elo 1238), уступая там только Gemini Omni Flash. Среди моделей с открытыми весами H3 первая в обеих категориях. Отрыв в монтаже небольшой — девять пунктов Elo при доверительном интервале около десяти, то есть с ближайшим преследователем это фактически ничья, а сам рейтинг ещё молодой: голосов у H3 меньше, чем у соседей по таблице.
Artificial Analysis Video Arena, замер 06.08.2026 · релиз модели 31.07.2026, веса опубликованы 03.08.2026
Три шага до первого ролика со звуком
Текст в видео — если начинаете с нуля. Изображение в видео — если есть готовый кадр, который нужно оживить.
Кроме действия и движения камеры добавьте в промпт желаемый саундтрек: жанр музыки, шумы, атмосферу. Русский входит в число официально поддерживаемых языков, длина промпта — до 7000 символов.
Выберите разрешение и длительность — стоимость в кредитах пересчитается сразу. Готовый ролик появится в личном кабинете со звуком внутри.
Четыре сценария, ради которых модель берут в работу
Стереодорожка генерируется в том же проходе, что и картинка. Достаточно описать в промпте желаемый саундтрек — «раскаты грома и оркестровая партитура», «тихий джаз и гул кофейни» — и он появится в готовом ролике синхронно с движением.
Уличный саксофонист играет в переходе метро, тёплый свет сверху, прохожие размыты в движении, мелодия саксофона отражается от кафельных стен, вдалеке грохочет поезд
Сцена, движение камеры и звук — одним описанием, без исходных материалов. Доступны семь форматов кадра, включая вертикальный 9:16 для соцсетей и широкий 21:9 для кинематографичных планов.
Кинематографичный облёт дроном рынка специй в Марракеше на закатном свету, яркие горки шафрана и паприки, зазывания торговцев, шипение уличной еды и ритмичная перкуссия
Загруженный кадр становится первым кадром ролика, а соотношение сторон наследуется от него — подгонять формат не нужно. Промпт задаёт движение внутри сцены и звук.
Рыбак моргает и слегка поворачивает голову к морю, ветер шевелит волосы, над головой кричат чайки, волны бьются о деревянный пирс за спиной
Можно задать второе изображение как финальный кадр — модель построит переход от первого ко второму. Удобно для смены сцены, превращений и зацикленных роликов.
На той же террасе кафе идёт время: утренняя дымка рассеивается, один за другим загораются фонари и окна, стулья расставляют вокруг столов, гости рассаживаются, тихая утренняя улица наполняется вечерним гулом и мягким аккордеоном
Что модель принимает на вход и что отдаёт на выходе
768p — родное разрешение модели, 480p работает быстрее и стоит вдвое дешевле. Кадр 16:9 в 768p выходит размером 1344×768 пикселей.
Длительность задаётся целым числом секунд. Ролик 480p на пять секунд обычно готов меньше чем за полторы минуты.
16:9, 9:16, 1:1, 4:3, 3:4, 21:9 и 9:21. В режиме оживления изображения формат берётся из исходного кадра.
Звук приходит внутри готового MP4 отдельной дорожкой — двухканальный AAC. Отдельного переключателя нет: звук генерируется всегда.
Текст в видео и изображение в видео, кадровая частота 24 fps. Во втором режиме можно добавить финальный кадр и получить управляемый переход.
На выходе — готовый MP4 с видеорядом и звуковой дорожкой, без дополнительной сборки и сведения.
Задачи, в которых встроенный звук экономит отдельный этап работы
Вертикальный формат 9:16 и готовая звуковая дорожка — клип не нужно отдельно озвучивать перед публикацией.
Продуктовые сцены с атмосферным звуком: всплеск жидкости, шум города, музыкальная подложка под нужное настроение.
Статичный кадр превращается в короткую сцену с движением и окружающим звуком, соотношение сторон сохраняется.
Природа, погода, городские виды — там, где половину впечатления создаёт именно звук: дождь, гром, ветер, прибой.
Запуск модели без зарубежной карты и настройки окружения
Ничего не нужно устанавливать и настраивать: открыли страницу, выбрали режим и запустили генерацию.
Стоимость видна до запуска и пересчитывается при смене разрешения и длительности. Оплата в рублях, без зарубежной карты.
Готовые ролики можно использовать в коммерческих проектах — в рекламе, соцсетях и клиентских работах.
Коротко о том, что чаще всего спрашивают про модель
MiniMax H3 — видеомодель компании MiniMax, вышедшая 31 июля 2026 года. Её главное отличие от предыдущего поколения в том, что изображение и звук генерируются одновременно, в одном проходе: готовый MP4 сразу содержит стереодорожку. Модель работает в двух режимах — из текстового описания и из загруженного изображения, выдаёт ролики длительностью от 5 до 15 секунд в разрешении 480p или 768p.
Модель разработала компания MiniMax. Официальное название — именно MiniMax H3, без слова Hailuo: линейка Hailuo осталась на версии 2.3, а H3 — третье поколение и отдельное семейство. Модель вышла 31 июля 2026 года, а 3 августа её веса опубликовали открыто — для видеомодели такого уровня это пока редкость.
Звуковая дорожка создаётся тем же проходом, что и видеоряд, и приходит внутри готового MP4 — стереозвук 32 kHz. Отдельной кнопки «добавить звук» нет: он генерируется всегда. Разработчик отдельно подчёркивает, что речь, шумы и музыка моделируются совместно, без разделения на отдельные домены — поэтому звук совпадает с движением в кадре: гром звучит на вспышке молнии, всплеск слышен в момент удара жидкости.
Два. «Текст в видео» строит сцену с нуля по описанию и позволяет выбрать формат кадра. «Изображение в видео» берёт ваш кадр за первый и оживляет его, наследуя соотношение сторон от исходника. Во втором режиме дополнительно можно указать финальный кадр и получить переход между двумя изображениями.
Доступны 480p и 768p. 768p — родное разрешение модели, в формате 16:9 это кадр 1344×768 пикселей. Режим 480p работает заметно быстрее и стоит вдвое дешевле, поэтому его удобно использовать для черновых прогонов и подбора промпта, а финальный вариант снимать в 768p.
От 5 до 15 секунд, длительность задаётся целым числом. Время генерации зависит от разрешения: ролик 480p на пять секунд обычно готов меньше чем за полторы минуты, 768p считается дольше.
Семь: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 и 9:21. Вертикальные подходят для соцсетей, широкий 21:9 — для кинематографичных планов. В режиме оживления изображения формат не выбирают: он наследуется от загруженного кадра.
Да. В режиме «изображение в видео» кроме первого кадра можно загрузить второй — модель построит переход от одного к другому. Это удобно для превращений, смены сцены и зацикленных роликов, где начало и конец должны совпасть.
Звук описывают в том же тексте, что и картинку — отдельного поля для него нет. Работают формулировки уровня «раскаты грома и глубокая оркестровая партитура», «тихий джаз и приглушённый гул кофейни», «шум прибоя и крики чаек». Если звук не описан, модель подберёт его сама, исходя из содержания сцены. Русский язык модель поддерживает официально, промпт — до 7000 символов.
Максимум 15 секунд в одном ролике и потолок разрешения 768p — для 4K потребуется отдельный апскейл. Как и другие видеомодели, H3 плохо удерживает мелкий текст в кадре: надписи на объектах при оживлении изображения обычно искажаются, поэтому текст лучше накладывать после генерации. Разработчик отдельно отмечает, что детализация и мультимодальное понимание ещё будут улучшаться.