MiniMax-H3 делает из текстового описания видеоролик до 15 секунд — со звуком. На вход принимает не только текст, но и картинки, аудио и видео. Главное в этой истории то, что модель удалось запустить не в облаке, а на обычном MacBook Pro. Разбираем, что для этого понадобилось, что получилось и стоит ли повторять.
Мультимодальность: что это значит на практике
Обычный видеогенератор работает по схеме «текст на входе — видео на выходе». MiniMax-H3 принимает несколько типов данных сразу: описание словами, изображение-образец, звуковую подсказку, фрагмент видео.
Разница в управляемости. Одним текстом трудно объяснить, как должен выглядеть персонаж или в каком стиле снят кадр, — а картинкой это показывается сразу. Комбинация «описание плюс образец» даёт результат ближе к задуманному, чем самый подробный текст.
Цена запуска на своей машине
Здесь начинается честная часть. Автор запустил модель на MacBook Pro с процессором M5 Max, и вот что для этого потребовалось:
- 115 ГБ на скачивание файлов модели;
- около 45 минут на генерацию одного ролика длиной несколько секунд;
- MLX — среда для запуска моделей на процессорах Apple, плюс версия модели, портированная под неё.
Сорок пять минут на несколько секунд видео — это не «попробовал и посмотрел», а «поставил и ушёл». Экспериментировать с формулировками в таком режиме тяжело: цикл обратной связи растягивается на часы.
Картинка получилась, звук — не очень
Визуальный результат впечатляет: в примере сгенерирован ролик с радужным скунсом, прыгающим через мохнатое бревно в супермаркете. Абсурдная сцена, которой заведомо нет в обучающих данных, — и модель её собрала.
Со звуком вышло хуже. Без специально продуманной подсказки система выдала невнятные шумы и речь без смысла. Это типичная картина для нынешнего поколения: изображение модели даётся заметно лучше, чем осмысленный звук.
Лечится это формулировками — для MiniMax-H3 есть отдельное руководство по составлению запросов, особенно для аудиочасти. Без него результат почти наверняка разочарует.
Кому стоит это повторять
Если вам нужны видео для дела — быстрее и дешевле воспользоваться онлайн-сервисом. Локальный запуск сейчас проигрывает по всем практическим параметрам, кроме двух: ваши материалы никуда не отправляются и за генерацию не нужно платить за каждый ролик.
Смысл в локальном запуске есть, если у вас Mac на Apple Silicon, свободны 115 ГБ и вам интересен сам процесс. Тогда закладывайте вечер: скачивание, установка, первая генерация, чтение руководства по запросам, вторая генерация.
Что тут важнее самой модели
Показательна не модель, а факт: генерация видео со звуком уехала с серверных стоек на пользовательский ноутбук. Год назад это требовало дата-центра. Сейчас — 115 ГБ на диске и терпения.
Тот же путь прошли текстовые модели: сначала только в облаке, потом медленно на своей машине, потом быстро и буднично. Про то, как локальные модели встраиваются в агентов, разобрано в полном гиде по OpenClaw; из свежего по теме — модель Ling-3.0-flash и новые функции OpenClaw 2026.7.2.
Практический вывод простой: если приватность материалов для вас существенна, следите за локальными версиями — они догоняют облачные по качеству, оставаясь у вас на диске. Смежная тема — как не допустить утечки данных через агента.
Источник: PipeNetwork/minimax-h3-mlx, Simon Willison, 4 августа 2026.
Соседние разборы про локальные модели: NVIDIA Magpie TTS и Muse Glimmer от Meta.