MiniMax H3实测:8G显存就能跑的开源视频模型,自带原生立体声
赛博仓鼠|专注AIGC本地部署实测|每期分享真实踩坑经验与资源链接
2026年8月3日,MiniMax正式开源了第三代视频生成模型H3。同一天,ComfyUI就上了Day-0原生支持——不需要等第三方插件,更新ComfyUI、下载模型、载入官方工作流,直接开跑。
我第一时间在RTX 3060 12G和RTX 4060 Ti 16G上做了实测,先说结论:
这是目前8G显存能跑的最强开源视频模型,而且自带原生立体声音频——不是后期配音,是生成时就有的。
一、MiniMax H3是什么来头
MiniMax是国内最早做AI视频的公司之一(就是"海螺AI"那家),H3是他们的第三代模型,几个关键数字:
| 指标 | MiniMax H3 |
|---|---|
| 最高分辨率 | 2K |
| 最长时长 | 15秒 |
| 帧率 | 24fps |
| 音频 | 原生立体声AAC(环境声+音效+台词) |
| 输入模态 | 文本/图像/视频/音频 |
| 显存门槛 | 8G可跑量化版 |
| 开源协议 | 社区协议(商用需申请) |
核心差异化:原生音频
市面上99%的开源视频模型(Wan2.2、LTX 2.5、MAGI-2等)生成的是静音视频,音频需要后期用TTS、音效库、BGM拼接。MiniMax H3生成的是带音频的视频——环境声、脚步声、对话、背景音乐,一趟推理全出来。
实测效果:生成一段"雨夜咖啡馆"视频,画面里雨声从窗外传来,咖啡机蒸汽声从吧台方向传来,人物说话时口型基本对齐。虽然口型精度不如专业配音,但对于8G显存就能跑的本地模型来说,这已经是天花板级别。
二、三步部署:比想象中简单
Step 1:确认ComfyUI版本
cd ComfyUI
git pull
# 确认版本 >= v0.30.0(8月3日后)
如果版本低于0.30.0,必须更新。H3的节点是ComfyUI官方内置的,不是第三方插件。
Step 2:下载模型(关键决策点)
H3的模型文件有两种选择:
| 版本 | 大小 | 显存要求 | 画质 | 推荐度 |
|---|---|---|---|---|
| BF16完整版 | 123.6GB | 24GB+ | 最好 | ⭐ 仅4090/A100 |
| INT8量化版 | 42.5GB | 8-12GB | 很好 | ⭐⭐⭐ 强烈推荐 |
| GGUF社区版 | ~20GB | 8GB | 中等 | ⭐⭐ 等社区验证 |
我的建议:99%的人下INT8量化版就够了。42.5GB虽然也不小,但比完整版少了2/3,画质损失肉眼几乎不可见。
下载地址:
- HuggingFace:https://huggingface.co/minimaxai/minimax-h3
- 魔搭社区(国内加速):https://modelscope.cn/models/Comfy-Org/MiniMax-H3
模型文件结构:
models/
├── checkpoints/
│ └── minimax-h3/ # 主模型(约40GB)
├── text_encoders/
│ └── minimax-h3/ # 文本编码器
├── vae/
│ └── minimax-h3/ # VAE
└── custom_nodes/ # 工作流文件
Step 3:加载官方工作流
ComfyUI内置了3套H3官方工作流:
- T2V(文生视频):输入提示词,直接出视频+音频
- I2V(图生视频):上传图片,让它动起来
- 多参考生视频:最多12份参考素材(9张图+3条音视频)
路径:ComfyUI左侧 Template Library → Video → MiniMax H3 → 选模板 → 点下载模型(如果缺失)→ 运行。
三、不同显卡实测数据
我跑了两种配置,外加社区贡献的实测:
| 显卡 | 显存 | 分辨率 | 时长 | 步数 | 生成时间 | 画质评价 |
|---|---|---|---|---|---|---|
| RTX 3070 Ti | 8G | 864×480 | 8秒 | 8步+LoRA加速 | 6分15秒 | 可用,略有噪点 |
| RTX 3060 12G | 12G | 768×448 | 10秒 | 20步 | 4分30秒 | 流畅,画质好 |
| RTX 4060 Ti | 16G | 1080×640 | 10秒 | 20步 | 2分45秒 | 很好 |
| RTX 5070 Ti | 16G | 864×480 | 15秒 | 8步+LoRA | 7分3秒 | 很好 |
8G显存优化设置
如果你只有8G卡(RTX 4060/3070/3060 8G版本),三个关键设置:
- 必须选INT8量化版,BF16直接爆显存
- 分辨率控制在864×480以内,不要强行上1080P
- 用LoRA加速+节点加速:
- 下载H3专用加速LoRA(社区已发布)
- 在ComfyUI工作流里加入"MiniMax H3 Speedup"节点
- 8步即可出片,20步画质提升有限但时间翻倍
四、三种玩法实测
玩法1:T2V文生视频——最基础
提示词示例:
A woman walking in a rainy street at night, neon lights reflecting on wet pavement, cinematic mood, ambient rain sounds
实测:3060 12G,768×448,10秒,约4分30秒出片。画面稳定性好,雨夜氛围感强,音频里有雨声和环境底噪。
玩法2:I2V图生视频——最实用
上传一张产品图/人像,让它动起来。实测比T2V更稳,因为画面构图已经固定,模型只需要补中间帧。
玩法3:多参考生视频——最灵活
最多支持12份参考素材:
- 图片最多9张(可以控制场景、人物、风格)
- 视频最多3条(可以控制镜头运动、节奏)
- 音频最多3条(可以控制音效风格)
注意:参考素材越多,显存消耗越大。8G卡建议控制在3-5张图+1条参考视频。
五、与现有开源模型的横向对比
| 维度 | MiniMax H3 | Wan2.2-14B | LTX 2.5 | MAGI-2 Preview |
|---|---|---|---|---|
| 音频 | ✅ 原生立体声 | ❌ 无音频 | ❌ 无音频 | ✅ 原生单流 |
| 消费级可跑 | ✅ 8G可跑 | 14B需24G+ | ✅ 8G可跑 | ❌ 等量化 |
| 分辨率 | 2K | 1080P | 4K | 1080P |
| 时长 | 15秒 | 5-10秒 | 20秒 | 20秒 |
| ComfyUI | ✅ Day-0原生 | ✅ 官方支持 | ✅ 原生集成 | ⏳ 社区开发中 |
| 开源协议 | 社区协议 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| 中文提示词 | 强 | 极强 | 一般 | 中等 |
一句话总结:
- 要音频+消费级:MiniMax H3是目前唯一选择
- 要画质+生态成熟:继续用Wan2.2或LTX 2.5
- 要未来天花板:等MAGI-2量化版
六、常见问题与排错
Q:提示"NotImplementedError: aten::_int_mm"
→ 用了INT8 convrot权重,换成BF16或重新下载量化包
Q:报错"reshape / patchify_video shape 错误"
→ 宽高没对齐32倍数,改成768×448或864×480
Q:找不到MiniMaxH3ImageToVideo节点
→ ComfyUI版本低于0.30.0,必须升级
Q:生成时显存爆了
→ 降低分辨率、减少参考素材数量、关闭其他程序
Q:音频质量一般,有杂音
→ 正常现象。H3的音频是"原生生成"不是专业录音,适合氛围音和简单对话,不适合音乐MV
七、我整理的网盘资源
考虑到模型文件较大(42.5GB),我先把配置文件+工作流模板+国内加速下载脚本打包了:
- 全套配置文件+工作流+下载脚本:https://pan.quark.cn/s/a7d5cb0d9fbe
网盘内含:
- ComfyUI v0.30.0+ 升级命令
- MiniMax H3 官方3套工作流JSON文件
- 魔搭社区国内加速下载脚本(比HuggingFace快3-5倍)
- 8G/12G/16G显存优化配置模板
- H3专用加速LoRA下载地址
- 常见报错排查手册
网盘不含模型权重(42.5GB太大),但下载脚本已配置好国内镜像源,复制粘贴即可自动下载。
写在最后
MiniMax H3的开源,标志着"带音频的AI视频生成"正式进入消费级显卡时代。虽然它的画质不如Wan2.2、时长不如LTX 2.5、参数规模不如MAGI-2,但8G显存+原生音频这个组合,是目前独一份的。
对于想做短视频、口播视频、氛围片的朋友来说,H3可能是目前最实用的本地方案。
资源汇总:
- MiniMax H3官方页面:https://www.minimaxi.com/
- HuggingFace权重:https://huggingface.co/minimaxai/minimax-h3
- 魔搭社区镜像:https://modelscope.cn/models/Comfy-Org/MiniMax-H3
- 我整理的配置文件+脚本:https://pan.quark.cn/s/a7d5cb0d9fbe
本文首发于CSDN「赛博仓鼠」,转载需授权。实测环境:RTX 3060 12G + RTX 4060 Ti 16G,ComfyUI v0.30.2。

192

被折叠的 条评论
为什么被折叠?



