Minimax H3的本地部署经验
stablediffusion吧
全部回复
仅看楼主
level 8
海螺开源以来,折腾了好几宿,也算有了些经验,分享出来希望能让大家少走弯路。
1、部署硬件条件:64G内存是必须的。现在网络上有int4版,质量太差,而比int8容量小的GGUF只能是Q2,都无法使用。int8剪枝版平均占用内存50G左右,所以64G内存是必须,不然就需要硬盘做缓存,对硬盘寿命伤害太大,不推荐。
2、软件条件:最好升级到cuda13.X,这个版本速度块很多。50系的更是必要条件,因为它的硬件原生加速只有cuda13.X才支持。sage也是必要的,github上有现成编译好的轮子,不用看它对应的cuda版本,只要python版本对上了,都可以用。
3、关于加速的选择:在加速lora出来后,除了sage注意力,其他加速节点或插件都可以不用。其他加速节点或插件是通过跳过采样步骤或者层数来加速的,和加速lora混用会造成质量损失太大,基本没了用武之地。
4、普通不加加速lora的情况下,480p,20step还非常模糊,用了加速lora,6步就很清晰了,但还有些错误出现,最好是12步采样,基本就很好了。480p我的4070tis不到2分钟一个5秒,4分多一点一个10秒的。
5、模型对中文提示词理解能力非常优秀,但是必须按照官方要求,把那几个块都填充满,尽量写详细动作,方位,那么遵循度会非常的高。
6、采样器个人测试中,觉得欧拉比官方推荐的那个要好。
2026年08月07日 00点08分 1
level 1
64G,3080 20G,推荐用哪个版本呀
2026年08月07日 02点08分 2
基本上都是int8的剪枝版,int8完整版好像是34个G
2026年08月07日 03点08分
@奥茨玛西亚 那我这卡肯定跑不动,我去研究下吧,谢啦
2026年08月07日 03点08分
@w211691 能跑,升级到cuda13.X,都支持int8加速。comfyui升级到3.0以上,它会分块加载模型解码,不会爆显存。
2026年08月07日 03点08分
@奥茨玛西亚 恩,我是说原版的我肯定跑不动,我看看挑一个合适的剪枝,我已经升级过了[太开心]
2026年08月07日 03点08分
level 2
5080-16g+32g内存,有办法跑吗?
2026年08月07日 02点08分 3
有办法跑,我的配置是5070ti加32g内存,虚拟内存96g,别听楼主吹牛逼,int8,4秒,官方流,多参142秒就跑出来了
2026年08月07日 04点08分
4060laptop 8+16都能跑,用的int8好像,不过有点伤硬盘(其实还好?),昨天看到一个up跑出来了个视频参考480p 10s还是15s没记清,且社区一直在出优化,第二天同一个视频参考快了几十倍,现在无非是速度和质量的问题[滑稽]
2026年08月07日 03点08分
可以,我5060ti 16g 32g内存能跑通h3官方的工作流
2026年08月07日 04点08分
@贴吧用户_QZXNGXa 肯定能跑,但这是牺牲固态寿命换来的。能接受就行。
2026年08月07日 04点08分
level 6
你是卖硬件的?
2026年08月07日 02点08分 4
我是在劝内存小的别强行上,普通硬盘速度会慢得你受不了,固态硬盘读写量太大了,甚至几分钟就会读写几百G,你觉得你能接受也行。
2026年08月07日 03点08分
主模型21G,CLIP15+G,视频VAE 5+G,音频VAE 2+G,如果只有16G或32G内存,你算算,每跑一个视频要跟硬盘交换多少次数据。
2026年08月07日 03点08分
这模型确实是显存还好很吃内存,ComfyUI现在的优化策略基本给多少吃多少
2026年08月07日 03点08分
小内存虽然也不是不能玩,但也只是能玩,这模型想要好效果,多参考图甚至喂参考视频和拉高分辨率拉高秒数不可能不多吃内存的啊,反正我64G内存,32G显存,跑视频真就吃满,想开点别的应用都感觉比较卡,更别提我想生成质量更好的视频了[滑稽]
2026年08月07日 07点08分
level 1
加速lora这些去哪里下载啊
2026年08月07日 03点08分 5
level 8
24显存48内存玩起来压力大吗
2026年08月07日 03点08分 6
level 9
1.楼主的经验是比较客观中肯的,从模型大小就可以估算出理想运行状态需要的硬件配置。
2.另外不得不说comfyui自更新支持int8之后,对内存管理做了相当好的优化,实际在使用中会发现,模型是分片加载的,所以大家会发现H3这种体量的模型竟能在相对低的配置下跑起来。
3.硬盘读写的情况也没有那么恶劣,需要注意的是散热(尤其是笔电)
4.目前实测对质量影响最小的加速方式只有sage注意力,其它都是明显有损。加速lora目前已有支持剪枝版模型的,使用加速lora时,采样方式推荐euler,步数最好8-12步。
2026年08月07日 03点08分 7
level 1
内存屯了多少?
2026年08月07日 03点08分 8
玩不动就不能不玩?一定非得加东西?那咋不整个pro 6000来玩呢。[喷]
2026年08月07日 04点08分
@A675051045 确实16g随便跑了,几分钟一个视频
2026年08月07日 04点08分
level 4
内存不够的话,系统里虚拟内存开到64g也可以,现在内存价格太高了没动力升级内存[滑稽]
2026年08月07日 03点08分 9
level 6
32g内存把sage和ComfyUI-MiniMaxH3-Cache挂上,736p能做到180秒出视频,比跑图也就多一倍时间吧,对硬盘损耗比较小,所以显卡才是最重要的
2026年08月07日 04点08分 10
什么显卡
2026年08月07日 04点08分
4080,5秒
2026年08月07日 06点08分
level 1
没毛病 , 现在内存占用基本在65-75G
2026年08月07日 04点08分 11
level 1
没毛病,以前都是必须显存,现在只要大内存3060和5090一个品质就是速度差的比较多而已。觉得内存贵的可以不买,去年搞了2tb d4的epyc,和512gb的d5 线程撕裂者,只能说从moe模型和ktransformers出来,就可以遇见内存只会越来越重要,后进多花钱没有一点办法。
2026年08月07日 04点08分 12
哎,内存最便宜的时候,我花了不到400买了2条64G的,后来感觉用不上,退掉了。现在想想就心塞。
2026年08月07日 04点08分
@奥茨玛西亚 什么内存到64G一条了?
2026年08月08日 07点08分
@胸文文虫 ecc啊,我用的服务器板子,双路u
2026年08月08日 14点08分
level 1
服务器上 80G A100 推荐怎么玩,以前没接触过这一块
2026年08月07日 04点08分 13
这还不是随便玩了。。直接上完整版,完整版好像是60多G。
2026年08月07日 04点08分
@奥茨玛西亚 我问 ai 好像 A100 很多优化用不了,现在部署的 int8 一个小时才跑了 15 秒[喷],好像缺很多优化措施,实在不行用 5090 了
2026年08月07日 06点08分
level 1
[滑稽]我用int8的20G那个模型,vae也用kij新出的实验int8来降低需求,32内存的先老老实实玩个0.2,0.3分辨率的,这样读写可以接受,注意读写的时候固态温度别太高了。过高了就要降低一下时长,让读写别那么厉害。
刚实际开diskinfo测试:T2V,8+32配置,使用20g那个int8 pruned模型,fp4的clip,加速lora,实验性int8的vae。
0.3分辨率是480X640,0.2就是384X544
分辨率是0.3,时长8秒,在不改提示词的情况下,跑一次要写入1到2G。分辨率0.2,8秒也是写入1到2G左右。
分辨率0.3,时长5秒,在不改提示词的情况下,跑一次写入不到1G。分辨率0.2,5秒,几乎没什么写入。
最后测了一个0.3分辨率10秒,写入也是1到2G左右。
每次改变提示词会多增加一些写入。
对低配置电脑,选择自己合适的分辨率和时长很重要,看自己能接受的情况改。
2026年08月07日 04点08分 14
[滑稽]比1年前wan2.2出来的时候,跑的轻松多了。之前wan2.2刚出的时候comfy优化差我用q4模型2个9.6G,只要换提示词跑一次都要写入6,7个G,甚至超过10个G。现在的h3效果更好,视频时长还多了一倍,硬盘写入少多了。
2026年08月07日 04点08分
level 1
但是我这边为什么生出来的人脸非常模糊啊?720p也救不了
2026年08月07日 04点08分 15
用了加速Lora没有?刚作者又更新了一个850步的,但我使用中,觉得最初那个适用性最强,中间500步那个画面很清晰。没用加速lora,得上到1536*1024才能清晰起来。1920*1080效果最好。
2026年08月07日 04点08分
@奥茨玛西亚 我不管哪个版本,用了加速lora,生出来的视频非常差
2026年08月08日 01点08分
@奥茨玛西亚 只有原版加速节点和20步的才好 只不过非常慢 720 10s 要10.30分
2026年08月08日 01点08分
@洛的类—😄 用550步训练那个,采样12步,欧拉。480p都挺清晰。放大分辨率更是强。
2026年08月08日 04点08分
1 2 3 尾页