奥茨玛西亚 奥茨玛西亚
关注数: 4 粉丝数: 6 发帖数: 672 关注贴吧数: 24
Minimax H3本地部署经验(二)——提示词的写法篇 在阅读正文之前,请先理解两个事实: 1、我们写的提示词,并不是直接交给H3的扩散模型理解,而是通过QwenVL转译成潜空间,让H3知道怎么画。 2、官方并没有在训练扩散模型的时候针对VL一并训练,所以,它生成的结果都是基于VL的翻译。 综上所述:官方的提示词模板可用且好用,但不一定适合中文,或者说,不一定适合你。你的提示词只要VL能够理解,就能画好,不一定必须遵循官方模板。 正文: 1、如何写好视频类提示词: 1.1、Qwen是我见过最有空间的模型之一,所以,你必须用时间线、上下左右等具体词汇描述各个物体什么时候出现在画面的什么地方。 1.2、提示词切记不能冲突,你想要什么效果,就必须详细且不能发生冲突: 1.2.1、例一,你想要在繁华的城市,充满霓虹灯的街道,你就必须写明,只写城市街道,就可能没灯,也没高楼大厦。 1.2.2、例二,不能冲突,宁可少些,不写冲突词汇,如:你描写了正面上半身特写镜头,白色球鞋,发现镜头怎么都无法直接从上半身特写开始,这是因为球鞋冲突了。它只能先生成包含你提示词里的画面,再把你的要求作为结尾。 1.2.3、宁可啰嗦,不要神略,如:他挥剑砍向对方脖子,画面却始终是两个人一起行动,同时挥剑。 所以,当模型如何也画不出你想要的画面的时候,请仔细检查你的提示词,是否有冲突的地方。 1.3、用中文提示词如何精确表达动作?这在我们版,这似乎是个很简单的问题,你实在不知道有些动作该怎么说,就去把SD的TAG翻译成中文,看他的中文词汇是什么。例,形容肉颤抖的感觉,你可能写了很多还写不出那种感觉,请用”弹跳“这个词,再例,你怎么都写不好某个行为时反复的动作,请用”晃动“这个词。 1.4、最容易被VL理解的写法:代码式写法。所有的大模型,基本都训练过编程类的语料,所以,对编程哪怕不精,也都能够理解得很好,特别式变成得结构式写法,能够精确地表达某个行为和动作。 1.4.1、例: 视频首帧:{ 男人站在荒野,右手握着剑,指着他前面的女人。 从男人背后,侧方向拍摄,聚焦女人,男人背影虚化 } 剧情推进:{ 镜头切换成双人侧面角度拍摄静态广角镜头,锁定,不推进,不旋转。男人挥手把剑举高,然后朝着女人砍去。女人站在原地,含情脉脉地看着男人,一动也不动。 镜头切换成男人面部特写广角镜头,锁定,不推进,不旋转。男人面带哀伤的表情,问道:”你为什么不躲“ …… } 音乐就用官方模板那俩个词,同样用这样写。基本中文识别跟随性VERY GOOD。 一点小经验,分享出来让大伙爽玩,也希望有经验的大佬批评指正!
Minimax H3的本地部署经验 海螺开源以来,折腾了好几宿,也算有了些经验,分享出来希望能让大家少走弯路。 1、部署硬件条件:64G内存是必须的。现在网络上有int4版,质量太差,而比int8容量小的GGUF只能是Q2,都无法使用。int8剪枝版平均占用内存50G左右,所以64G内存是必须,不然就需要硬盘做缓存,对硬盘寿命伤害太大,不推荐。 2、软件条件:最好升级到cuda13.X,这个版本速度块很多。50系的更是必要条件,因为它的硬件原生加速只有cuda13.X才支持。sage也是必要的,github上有现成编译好的轮子,不用看它对应的cuda版本,只要python版本对上了,都可以用。 3、关于加速的选择:在加速lora出来后,除了sage注意力,其他加速节点或插件都可以不用。其他加速节点或插件是通过跳过采样步骤或者层数来加速的,和加速lora混用会造成质量损失太大,基本没了用武之地。 4、普通不加加速lora的情况下,480p,20step还非常模糊,用了加速lora,6步就很清晰了,但还有些错误出现,最好是12步采样,基本就很好了。480p我的4070tis不到2分钟一个5秒,4分多一点一个10秒的。 5、模型对中文提示词理解能力非常优秀,但是必须按照官方要求,把那几个块都填充满,尽量写详细动作,方位,那么遵循度会非常的高。 6、采样器个人测试中,觉得欧拉比官方推荐的那个要好。
1 下一页