Нейросеть MiniMax — на самом деле целая линейка моделей китайской компании MiniMax, которая с 2021 года работает в Шанхае. На сайте их семь: видео H3 и две версии Hailuo, три версии озвучки Speech и Music 3.0 для песен. Задания для роликов, текст озвучки и слова песни мы писали по-русски, и переводить ничего не пришлось.
Для сравнения мы сделали в Nano Banana 2 кадр с выдуманной героиней: вечерняя улица, жёлтый дождевик, закрытый прозрачный зонт в руке. Этот кадр получили все четыре нейросети с одним заданием.
Женщина раскрывает прозрачный зонт над головой, улыбается и идёт по мокрому тротуару навстречу камере. Камера плавно отъезжает назад. Дождь усиливается, капли стучат по зонту, неон отражается в лужах.
MiniMax H3 · 2K, 5 с, со звуком · от 6 ₽/сек.
Hailuo 2.3 · модель «Про», 1080p, 6 с · от 30 ₽
Hailuo 2.3 · модель «Стандарт», 768p, 6 с · от 30 ₽
Hailuo 02 · модель «Pro», 1080p, 6 с · от 12 ₽
У H3 мы поставили самую короткую длительность, 5 секунд: она берёт плату за каждую секунду, а для сравнения движения секунды разницы хватает. 2K у неё единственное разрешение. Лучше всех справилась она: зонт раскрылся без искажений, дождевик остался тем же, с капюшоном, и в ролике слышен шум дождя, который нейросеть сделала сама. Обе модели Hailuo 2.3 на секунду закрыли лицо зонтом, а в «Про» под дождевиком вместо светлой кофты появилось чёрное платье. Hailuo 02 справилась хуже всех: зонт при раскрытии «поплыл», дождевик превратился в пальто на пуговицах. Вывеску «Кафе у Светы» с исходника сохранили все четыре. Быстрее всех ответила Hailuo 2.3 в модели «Стандарт», чуть больше чем за минуту, а H3 думала шесть с половиной минут.
MiniMax H3 вышла 31 июля 2026 года и стала самой новой видеомоделью MiniMax. Она всегда снимает в 2K: при кадре 16:9 это 2560×1440 точек, больше 1080p, но меньше 4K. Ролик длится от 5 до 15 секунд, и платите вы за каждую секунду. В поле Тип генерации три режима: видео из текста, видео из изображения и видео по референсам. В первом и третьем можно выбрать одну из шести пропорций, от 21:9 до 9:16, в режиме из изображения пропорции берутся из кадра, и галочкой Конечный кадр можно задать ещё и последний кадр. Референсами называют образцы, на которые нейросеть опирается: до 8 картинок, 4 видео и 4 аудио. Секунды референс-видео оплачиваются так же, как секунды ролика, а одно аудио без картинки или видео не сработает.
Разработчик отдельно хвалит, как H3 пишет текст в кадре. Мы проверили это на русских надписях:
Раннее утро, маленькая кофейня на углу. Бариста в зелёном фартуке переворачивает табличку на стеклянной двери стороной с надписью «ОТКРЫТО» и улыбается. Над дверью звенит колокольчик, за окном проезжает трамвай. Над входом вывеска «КОФЕ У МОСТА». Тёплый свет, камера медленно приближается.
MiniMax H3 · Видео из текста, 16:9, 2K, 5 с · от 6 ₽/сек.
Обе надписи вышли без единой ошибки с первой попытки, трамвай проехал, а колокольчик слышен в самом начале. Ролик делался почти четыре минуты.
До H3 компания выпускала видеонейросети Hailuo. Hailuo 2.3 (октябрь 2025 года) делает только видео из изображений, в моделях «Стандарт» и «Про». Обе снимают 6 или 10 секунд в 768p либо 6 секунд в 1080p. Hailuo 02 умеет и видео из текста, и видео из картинки, в том числе с конечным кадром, то есть переход между двумя кадрами. В модели «Standard» она снимает 6 или 10 секунд в 512p или 768p, в модели «Pro» — 6 секунд в 1080p. Самый дешёвый ролик из фото во всей линейке получается у Hailuo 02 в модели «Standard» и 512p.
Голоса, эмоции и языки у трёх версий общие. Как Speech 2.8 звучит рядом с другими нейросетями, слышно в разделе «Озвучка текста», а здесь сравним версии между собой: мы дали всем трём одну фразу с числами и именем, голос Марина, модель «HD»:
Автобус номер сорок два опять ушёл без меня. Ну вот скажите, Андрей Петрович, как можно приезжать на остановку в 7:15, если по расписанию он в 7:20? Ладно. Пойду пешком, тут всего три километра. Зато успею купить кофе.
MiniMax Speech 2.8 · голос Марина, HD · от 10 ₽ за 1000 символов
MiniMax Speech 2.6 · голос Марина, HD · от 10 ₽ за 1000 символов
MiniMax Speech 2.5 · голос Марина, HD · от 8 ₽ за 1000 символов
Записи мы прогнали через распознавание речи. Время «7:15» и «7:20», а ещё «три километра» все три версии прочитали правильно, только у 2.5 распознавание услышало «но» вместо «ну». Разница в подаче небольшая: 2.6 читает быстрее (15 секунд против 16,6 у 2.8), а у 2.8 голос звучит чуть ниже. Каждая запись была готова меньше чем за 20 секунд.
Главное отличие MiniMax Speech 2.8 в тегах звуков. Тег — это слово в скобках прямо в тексте: (laughs) смех, (chuckle) смешок, (sighs) вздох, (breath) вдох, (coughs) кашель, (gasps) ахнуть. Паузу пишут так: <#0.8#>, это 0,8 секунды. У 2.6 и 2.5 тегов звуков нет. Вот 2.8 с эмоцией «Радость»:
(laughs) Слушай, ты не поверишь! Я вчера перепутала сахар с солью и испекла самый солёный торт в мире. (chuckle) И что ты думаешь? Гости ели и хвалили. <#0.8#> А потом Лёша попросил рецепт. (sighs) Пришлось признаться.
MiniMax Speech 2.8 · голос Марина, HD, эмоция «Радость» · от 10 ₽ за 1000 символов
Теги не прозвучали словами: распознавание записало смех в начале как «ха-ха». Цены MiniMax Speech 2.6 и MiniMax Speech 2.5 — в таблице ниже. Во всех трёх есть режим Клонировать голос (подробно — в вопросах ниже).
MiniMax Music 3.0 поёт ваш текст с аранжировкой. В поле Задание пишут стиль (жанр, голос, инструменты, темп), в поле Текст песни — слова, без текста песню не запустить. Пустая строка в тексте даёт паузу, а в ##…## описывают аккомпанемент, например проигрыш без слов. Длину песни задать нельзя: в наших пробах нейросеть пела написанное один раз, без повторов, поэтому припев мы вписали в текст дважды.
[Intro]
##синтезаторы, шум дождя##
[Verse]
Жёлтый плащ и мокрый тротуар,
Город светит в лужах, как бульвар.
Ты раскрыла зонт над головой,
И трамвай уходит на восьмой.
[Chorus]
Дождь, дождь, не спеши домой,
Мы с тобой танцуем под водой.
Неон горит, и ночь длинна,
Нам этот дождь, как музыка, нужна.
[Verse]
Кафе закрыто, свет погас в окне,
Но это всё неважно мне.
Ты смеёшься, капли на щеке,
И город тонет в этой реке.
[Chorus]
Дождь, дождь, не спеши домой,
Мы с тобой танцуем под водой.
Неон горит, и ночь длинна,
Нам этот дождь, как музыка, нужна.
Задание: synth-pop, male vocal singing in Russian, 80s drum machine, warm analog bass, bright synth lead, 112 BPM, nostalgic night city mood, catchy chorus
MiniMax Music 3.0 · 256 кбит/с, 44,1 кГц · 25 ₽
Песня вышла на 1 минуту 57 секунд, меньше чем через две минуты после запуска, и распознавание речи нашло в ней оба куплета и оба припева. Битрейт и Частоту дискретизации оставьте максимальными: цена от них не зависит. Как Music 3.0 поёт рядом с Suno и другими, слышно в сравнении раздела «Музыка», а как написать текст песни, рассказано в инструкции как создать песню нейросетью.
Цены обновляются сами. На все примеры этой статьи у нас ушло около 385 ₽.
| Нейросеть | Цена | Что делает | Чем выделяется |
|---|---|---|---|
| MiniMax H3 | от 6 ₽/сек. | видео из текста, картинки и референсов | 2K, 5–15 с, звук |
| Hailuo 2.3 | от 30 ₽ | видео из картинки | 1080p уже в модели «Стандарт» |
| Hailuo 02 | от 12 ₽ | видео из текста и картинки | самый дешёвый ролик, от 512p |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | озвучка и клон голоса | теги смеха и вздохов |
| MiniMax Speech 2.6 | от 10 ₽ за 1000 символов | озвучка и клон голоса | читает быстрее, без тегов |
| MiniMax Speech 2.5 | от 8 ₽ за 1000 символов | озвучка и клон голоса | самая дешёвая в модели «Turbo» |
| MiniMax Music 3.0 | 25 ₽ | песня со словами | поёт по-русски, 44,1 кГц |
Статья обновлена 25 сентября 2026 г.