Содержание
Что умеет локальный MiniMax H3 на Mac
Разработчик Сальваторе Санфилиппо открыл проект h3-metal — нативный движок для запуска видеомодели MiniMax H3 на компьютерах с Apple Silicon. Он написан на C и использует Metal, поэтому генерация выполняется локально: исходные изображения, видео, аудио и промпты не нужно отправлять в облачный сервис.
Видео, звук и референсы в одном локальном пайплайне
Проект уже поддерживает генерацию видео со звуком по тексту, управление первым и последним кадрами, а также упорядоченные референсы в виде изображений, роликов и аудиоклипов. Максимальный заявленный холст — 1344×768 или 768×1344, частота — 24 кадра в секунду, а основной рабочий диапазон роликов составляет примерно от 4 до 15 секунд.
Для быстрых проб можно снизить число шагов, отключить часть блоков модели или рендерить на меньшем внутреннем разрешении с последующим масштабированием. В тесте автора на M5 Max четыре шага денойзинга для 22 кадров 512×512 заняли около 3,5 секунды против 26,4 секунды у более медленного референсного режима. Это время только основного этапа генерации, а не всего процесса подготовки и декодирования ролика.
Пока это инструмент для мощных Mac, а не готовое приложение
Главное ограничение — память. Файл модели занимает около 37 ГБ, а полный прогон с визуальным и аудиореференсом в тестах достигал примерно 40 ГБ физической памяти на Mac с 128 ГБ. Проект оптимизируется прежде всего под M3 Max и M5 Max; на обычных конфигурациях без большого объёма объединённой памяти запуск может оказаться непрактичным.
У h3-metal пока нет привычного графического интерфейса: нужно скачать модель с Hugging Face, собрать движок, установить FFmpeg и работать через командную строку или интерактивную терминальную сессию. Код распространяется по лицензии MIT, а репозиторий активно обновляется.
Почему это важно креаторам
Локальный запуск даёт три практических преимущества: конфиденциальные материалы остаются на компьютере, нет оплаты за каждую генерацию и можно глубже настраивать скорость и качество. Пока решение рассчитано на технических пользователей с дорогим железом, но оно показывает, как генерация AI-видео со звуком постепенно переходит из облачных платформ в персональные рабочие станции.