minimax h3 32b clip可被4b代替
stablediffusion吧
全部回复
仅看楼主
level 6
-eziohx 楼主
网页链接
Reddit上有人用qwen3 vl 4b或8b代替了原来的32b,输出的视频质量也还不错
2026年08月10日 01点08分 1
level 7
clip应该只是影响要画什么的理解能力,对画质影响不大,是这样吧?
2026年08月10日 02点08分 2
对的。刚看了下作者说多参模型不支持。文生视频、文生图、首尾帧可以。
2026年08月10日 02点08分
level 9
这对我们本地部署的个人电脑用户是好消息,牛逼的消息。我要试下看
2026年08月10日 02点08分 3
@94松果果 这玩意只能减少文本编码时显存/内存的占用,对生成速度关系不大。不过减少占用总归是好的
2026年08月10日 02点08分
@-eziohx [滑稽]可以省点硬盘啊,但是clip文本编码器对理解有不少影响的。我用了fp4,fp4 heretic,int4这3个同样16G的clip,同样提示词跑起来是comfy原版fp4动作感觉最自然,fp4heretic比较生硬,像硬做那个动作的样子,int4类似fp4有点小区别。
2026年08月10日 02点08分
level 1
4b和32b,这两个东西,最后一层输出的隐元数据完全不同,怎么能直接用?就算强行修改维度适配,数据差太多了,还能用?
2026年08月10日 03点08分 4
@-eziohx 他压根就没有那个数据量来做这些事情,说实话minimax也挺神奇的,从哪里搞得数据,来训练这个h3模型的,字节本身做短视频,这么多年通过多模态模型审核视频积累下来的数据,竟然没做成门槛,谷歌在gemini3.1pro预训练投入这么大的多模态模型,视频生成上都不如字节,
2026年08月10日 03点08分
开源社区邪修多
2026年08月10日 03点08分
@94松果果 扯淡骗人的也多
2026年08月10日 03点08分
@94松果果 老美现在和这边一样,都是自媒体水军泛滥,假消息满天飞
2026年08月10日 03点08分
level 9
实测跑通了,先说结论:除了文件小一点,实战应用价值低。
1.内存占用稍低,显存占用没多少变化(我生成8秒视频),作者的工作流是12步采样,速度并不快。
2.qwen3vl(any Qwen3-VL-4B works)。
画质未受影响。可以叠加lightxv的turbo-lora,但6步采样声音会出问题。
3.作者提供了3个clip修补分别针对三种场景,使用时要仔细看作者的介绍。
h3_qwen3vl_4b_tap24.pt
h3_control_identity.pt
h3_control_zero.pt
2026年08月10日 04点08分 5
声音出问题?clip一般不会影响声音吧
2026年08月10日 04点08分
@-eziohx 叠加turbo-lora之后,6步采样出问题,注意看我的表述。默认12步采样,不加速没问题
2026年08月10日 04点08分
@94松果果 多测试了一轮,叠加turbo-lora之后,8步即可修复声音问题。
2026年08月10日 04点08分
level 2
这玩意我如果直接用闭源大模型skill写好提示词是不是直接可以不用?
2026年08月12日 01点08分 6
无论如何都需要clip,除非你一句提示词都不写。因为视频生成模型本身读不懂文本。clip模型是将文本提示词转换为视频生成模型读的懂的数据。
2026年08月12日 02点08分
1