都说天下没有免费午餐,大模型第一个不服。
今天带大家免费用的是——MiniMax H3,一个开源、能本地跑、生成视频还带原声音频的 AI 视频模型。
一、H3 到底牛在哪
2026 年 8 月 3 日,MiniMax 把 H3 的权重放到了 HuggingFace 上。
这玩意儿是什么概念?它是目前开源视频模型里,最全能的一个。
- 一个模型同时处理四种模态:文本、图片、视频、音频
- 输出规格吓人:最高 2K 分辨率、最长 15 秒、24 FPS、32kHz 原生立体声音频
- 玩法多:文生视频、首尾帧生视频、参考图/参考视频/参考音频生成视频
- 榜单成绩:Artificial Analysis 视频编辑能力项 全球第一

图片来源:MiniMax H3 GitHub 官方仓库
传统做法里,视频归视频模型管,声音归 TTS 模型管,最后还得人工对齐。
H3 的狠活在于:**它在同一个模型里,把视频和音频一起「画」出来。**不是后期配音,是生成阶段就同步好的。
你可以理解为:以前的 AI 视频是「默片 + 后配字幕」,H3 直接能出「带原声的电影片段」。
这对谁最有用?
- 做自媒体的:不用到处找无版权 BGM,一条 prompt 出片
- 做电商的:产品图 → 15 秒种草视频,连配音一起生成
- 做游戏的:角色立绘 → 动作演示视频,省掉买动作捕捉的钱
- 做广告的:品牌 logo + 文案 → 完整广告片
一句话:只要你能写 prompt,H3 就把「拍视频」变成「写视频」。
当然,开源不等于全部公开。H3 这次放出来的是 H3-Base 两个 checkpoint(FL2VA 和 Ref2VA),它们负责生成 768p 的音视频。而负责理解复杂多模态指令的 H3-Context-IR 仍是官方托管的 API,负责 2K 超分的 H3-Regenerate-2K 也没在开源包里。
所以本地跑的其实是「导演 + 摄影机」,剧本翻译和后期精修还是得靠官方接口。但对大多数想白嫖的人来说,这套摄影机已经足够拍短片了。
二、小白也能本地跑:4 步出片
别被「33B 参数」吓到。MiniMax 官方把 H3 原生接进了 ComfyUI,而且有专门的量化包。只要你的电脑不是特别老,都能试试。
第 1 步:确认你的电脑能不能跑
最低门槛比想象中低:
- 显存:12GB 起步(RTX 3060 就能跑)
- 内存:32GB 起步,推荐 64GB
- 硬盘:模型文件约 40-60GB,推荐 NVMe 固态
- 系统:Windows / Linux 均可
第 2 步:安装或升级 ComfyUI
ComfyUI 从 0.30.0 版本开始原生支持 H3。
1 | git clone https://github.com/comfyanonymous/ComfyUI.git |
老用户直接 git pull 升到最新版就行。
第 3 步:从模板库拖工作流
打开 ComfyUI,进入 Workflow → Browse Templates → Video,你会看到三个官方模板:
- MiniMax H3 Text to Video(文生视频)
- MiniMax H3 Image to Video(图生视频)
- MiniMax H3 Reference to Video(参考生视频)
选一个拖进来,点运行,模型会自动从 HuggingFace 下载。
第 4 步:等它跑完
第一次需要下载约 40-60GB 模型文件。下载完成后,输入 prompt 就能出片。
| 你的显卡 | 显存 | 能跑多快 |
|---|---|---|
| RTX 3060 / 4060 | 8-12GB | 5 秒 480p 约 5-10 分钟 |
| RTX 4070 Ti / 4080 | 12-16GB | 5 秒 720p 约 1-2 分钟 |
| RTX 4090 | 24GB | 12 秒 HD 约 10 分钟 |
| RTX 5090 | 32GB | 10 秒 864×480 约 175 秒 |
数据来源:社区实测(ComfyUI + INT8/FP8/NVFP4 量化版)。
如果你在国内,HuggingFace 下载慢,可以直接用魔搭 ModelScope 的镜像仓库:
1 | # ModelScope 下载命令示例(需安装 modelscope 工具) |
下载完成后,把 .safetensors 文件放到 ComfyUI 对应的 models/ 子目录里即可。

图片来源:MiniMax 官方新闻页
FL2VA 适合文生视频、首尾帧控制;Ref2VA 适合角色一致性、风格迁移、动作迁移。新手建议先用 FL2VA 的文生视频模板上手。
第一次跑通后,有两个参数最值得调:
- Steps(步数):默认 20 步画质最好;想快就选 8 步 Turbo 模式
- Resolution(分辨率):768p 最稳,2K 需要更多显存和耐心
建议先用 480p 批量抽卡,挑中喜欢的再拉高分辨率精修。跟打游戏抽 SSR 一个逻辑。
三、为什么 33B 的模型,单卡就能跑
H3 虽然是 33B 参数,但它用了几个关键技巧把显存压下来:
- AdaLN 参数缓存:约 13B 参数只在训练时需要,推理时不加载
- INT8 / FP8 / NVFP4 量化:把权重从 BF16 压到 4-8 bit
- 动态卸载:显存不够时,把部分权重临时搬到内存
- Turbo LoRA:把生成步数从 20 步降到 4-8 步
这几个手段叠加,让原本需要数据中心集群的模型,现在消费级显卡也能跑。
用生活类比一下:
- 量化 就像把高清电影压成 720p,画质差一点点,但文件小一半
- 动态卸载 就像书桌太小,先把不常用的书放回书架,要用再拿
- Turbo LoRA 就像速写,20 步是素描,8 步是速写,都能看出是啥,但速写更快
还有一个加速神器:SageAttention。官方说开了之后生成速度大概翻倍,质量损失很小。如果你的显卡支持,强烈建议打开。
你可能会问:同样是 MiniMax 开源的模型,为什么之前说的 M3(文本模型)动不动就要 8 张 H100,H3 反而单卡就能跑?
因为它们是两类东西。M3 是 4280 亿参数的 MoE 语言模型,要的是推理速度和上下文长度;H3 虽然是视频模型,但主网络是 33B 稠密 Transformer,加上官方做了大量量化压缩。类比一下:M3 像一台满载 40 吨的重卡,H3 像一辆被拆掉后排座椅的小轿车——后者当然更容易塞进普通车库。
不过要注意:**能跑≠跑得快。**RTX 3060 能出片,但体验更接近「抽卡」;想要舒服地迭代,RTX 4070 Ti 以上更合适。
未来做视频,可能不是先写脚本、再拍素材、再剪辑,而是直接写一段 prompt,等 AI 给你「想」出来。
MiniMax H3 把这个未来提前了一年。
你手里是哪张显卡?跑过 H3 吗?评论区晒配置,咱们比比谁更快。
关注公众号「程序员晚枫」,AI 工具不踩坑。
参考链接
- MiniMax H3 官方博客(英文):https://www.minimax.io/news/minimax-h3-open-source
- MiniMax H3 GitHub 仓库:https://github.com/MiniMax-AI/MiniMax-H3
- ComfyUI MiniMax H3 官方教程:https://docs.comfy.org/tutorials/video/minimax/minimax-h3
相关阅读
- AI 圈公开的秘密:DeepSeek V4 Flash 可以免费用
- 英伟达"掀桌子"了:国产大模型免费用,智谱、MiniMax、LLaMA...
- 用上 OpenCode 的5 个免费大模型,省了我 200 刀 ChatGPT 年费






