都说天下没有免费午餐,大模型第一个不服。

今天带大家免费用的是——MiniMax H3,一个开源、能本地跑、生成视频还带原声音频的 AI 视频模型。

一、H3 到底牛在哪

2026 年 8 月 3 日,MiniMax 把 H3 的权重放到了 HuggingFace 上。

这玩意儿是什么概念?它是目前开源视频模型里,最全能的一个。

  • 一个模型同时处理四种模态:文本、图片、视频、音频
  • 输出规格吓人:最高 2K 分辨率、最长 15 秒、24 FPS、32kHz 原生立体声音频
  • 玩法多:文生视频、首尾帧生视频、参考图/参考视频/参考音频生成视频
  • 榜单成绩:Artificial Analysis 视频编辑能力项 全球第一

MiniMax H3 系统总览:Context-IR → H3-Base → H3-Regenerate-2K

图片来源:MiniMax H3 GitHub 官方仓库

传统做法里,视频归视频模型管,声音归 TTS 模型管,最后还得人工对齐。

H3 的狠活在于:**它在同一个模型里,把视频和音频一起「画」出来。**不是后期配音,是生成阶段就同步好的。

你可以理解为:以前的 AI 视频是「默片 + 后配字幕」,H3 直接能出「带原声的电影片段」。

这对谁最有用?

  • 做自媒体的:不用到处找无版权 BGM,一条 prompt 出片
  • 做电商的:产品图 → 15 秒种草视频,连配音一起生成
  • 做游戏的:角色立绘 → 动作演示视频,省掉买动作捕捉的钱
  • 做广告的:品牌 logo + 文案 → 完整广告片

一句话:只要你能写 prompt,H3 就把「拍视频」变成「写视频」。

当然,开源不等于全部公开。H3 这次放出来的是 H3-Base 两个 checkpoint(FL2VA 和 Ref2VA),它们负责生成 768p 的音视频。而负责理解复杂多模态指令的 H3-Context-IR 仍是官方托管的 API,负责 2K 超分的 H3-Regenerate-2K 也没在开源包里。

所以本地跑的其实是「导演 + 摄影机」,剧本翻译和后期精修还是得靠官方接口。但对大多数想白嫖的人来说,这套摄影机已经足够拍短片了。

二、小白也能本地跑:4 步出片

别被「33B 参数」吓到。MiniMax 官方把 H3 原生接进了 ComfyUI,而且有专门的量化包。只要你的电脑不是特别老,都能试试。

第 1 步:确认你的电脑能不能跑

最低门槛比想象中低:

  • 显存:12GB 起步(RTX 3060 就能跑)
  • 内存:32GB 起步,推荐 64GB
  • 硬盘:模型文件约 40-60GB,推荐 NVMe 固态
  • 系统:Windows / Linux 均可

第 2 步:安装或升级 ComfyUI

ComfyUI 从 0.30.0 版本开始原生支持 H3。

1
2
3
4
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
git pull
pip install -r requirements.txt

老用户直接 git pull 升到最新版就行。

第 3 步:从模板库拖工作流

打开 ComfyUI,进入 Workflow → Browse Templates → Video,你会看到三个官方模板:

  • MiniMax H3 Text to Video(文生视频)
  • MiniMax H3 Image to Video(图生视频)
  • MiniMax H3 Reference to Video(参考生视频)

选一个拖进来,点运行,模型会自动从 HuggingFace 下载。

第 4 步:等它跑完

第一次需要下载约 40-60GB 模型文件。下载完成后,输入 prompt 就能出片。

你的显卡显存能跑多快
RTX 3060 / 40608-12GB5 秒 480p 约 5-10 分钟
RTX 4070 Ti / 408012-16GB5 秒 720p 约 1-2 分钟
RTX 409024GB12 秒 HD 约 10 分钟
RTX 509032GB10 秒 864×480 约 175 秒

数据来源:社区实测(ComfyUI + INT8/FP8/NVFP4 量化版)。

如果你在国内,HuggingFace 下载慢,可以直接用魔搭 ModelScope 的镜像仓库:

1
2
# ModelScope 下载命令示例(需安装 modelscope 工具)
modelscope download --model Comfy-Org/MiniMax-H3 --local_dir ./MiniMax-H3

下载完成后,把 .safetensors 文件放到 ComfyUI 对应的 models/ 子目录里即可。

MiniMax H3 两个官方 checkpoint 对比:FL2VA 与 Ref2VA

图片来源:MiniMax 官方新闻页

FL2VA 适合文生视频、首尾帧控制;Ref2VA 适合角色一致性、风格迁移、动作迁移。新手建议先用 FL2VA 的文生视频模板上手。

第一次跑通后,有两个参数最值得调:

  • Steps(步数):默认 20 步画质最好;想快就选 8 步 Turbo 模式
  • Resolution(分辨率):768p 最稳,2K 需要更多显存和耐心

建议先用 480p 批量抽卡,挑中喜欢的再拉高分辨率精修。跟打游戏抽 SSR 一个逻辑。

三、为什么 33B 的模型,单卡就能跑

H3 虽然是 33B 参数,但它用了几个关键技巧把显存压下来:

  1. AdaLN 参数缓存:约 13B 参数只在训练时需要,推理时不加载
  2. INT8 / FP8 / NVFP4 量化:把权重从 BF16 压到 4-8 bit
  3. 动态卸载:显存不够时,把部分权重临时搬到内存
  4. Turbo LoRA:把生成步数从 20 步降到 4-8 步

这几个手段叠加,让原本需要数据中心集群的模型,现在消费级显卡也能跑。

用生活类比一下:

  • 量化 就像把高清电影压成 720p,画质差一点点,但文件小一半
  • 动态卸载 就像书桌太小,先把不常用的书放回书架,要用再拿
  • Turbo LoRA 就像速写,20 步是素描,8 步是速写,都能看出是啥,但速写更快

还有一个加速神器:SageAttention。官方说开了之后生成速度大概翻倍,质量损失很小。如果你的显卡支持,强烈建议打开。

你可能会问:同样是 MiniMax 开源的模型,为什么之前说的 M3(文本模型)动不动就要 8 张 H100,H3 反而单卡就能跑?

因为它们是两类东西。M3 是 4280 亿参数的 MoE 语言模型,要的是推理速度和上下文长度;H3 虽然是视频模型,但主网络是 33B 稠密 Transformer,加上官方做了大量量化压缩。类比一下:M3 像一台满载 40 吨的重卡,H3 像一辆被拆掉后排座椅的小轿车——后者当然更容易塞进普通车库。

不过要注意:**能跑≠跑得快。**RTX 3060 能出片,但体验更接近「抽卡」;想要舒服地迭代,RTX 4070 Ti 以上更合适。


未来做视频,可能不是先写脚本、再拍素材、再剪辑,而是直接写一段 prompt,等 AI 给你「想」出来。

MiniMax H3 把这个未来提前了一年。

你手里是哪张显卡?跑过 H3 吗?评论区晒配置,咱们比比谁更快。

关注公众号「程序员晚枫」,AI 工具不踩坑。

参考链接

相关阅读

AI 实战课