奥茨玛西亚
奥茨玛西亚
关注数: 4
粉丝数: 6
发帖数: 672
关注贴吧数: 24
Minimax H3本地部署经验(二)——提示词的写法篇 在阅读正文之前,请先理解两个事实: 1、我们写的提示词,并不是直接交给H3的扩散模型理解,而是通过QwenVL转译成潜空间,让H3知道怎么画。 2、官方并没有在训练扩散模型的时候针对VL一并训练,所以,它生成的结果都是基于VL的翻译。 综上所述:官方的提示词模板可用且好用,但不一定适合中文,或者说,不一定适合你。你的提示词只要VL能够理解,就能画好,不一定必须遵循官方模板。 正文: 1、如何写好视频类提示词: 1.1、Qwen是我见过最有空间的模型之一,所以,你必须用时间线、上下左右等具体词汇描述各个物体什么时候出现在画面的什么地方。 1.2、提示词切记不能冲突,你想要什么效果,就必须详细且不能发生冲突: 1.2.1、例一,你想要在繁华的城市,充满霓虹灯的街道,你就必须写明,只写城市街道,就可能没灯,也没高楼大厦。 1.2.2、例二,不能冲突,宁可少些,不写冲突词汇,如:你描写了正面上半身特写镜头,白色球鞋,发现镜头怎么都无法直接从上半身特写开始,这是因为球鞋冲突了。它只能先生成包含你提示词里的画面,再把你的要求作为结尾。 1.2.3、宁可啰嗦,不要神略,如:他挥剑砍向对方脖子,画面却始终是两个人一起行动,同时挥剑。 所以,当模型如何也画不出你想要的画面的时候,请仔细检查你的提示词,是否有冲突的地方。 1.3、用中文提示词如何精确表达动作?这在我们版,这似乎是个很简单的问题,你实在不知道有些动作该怎么说,就去把SD的TAG翻译成中文,看他的中文词汇是什么。例,形容肉颤抖的感觉,你可能写了很多还写不出那种感觉,请用”弹跳“这个词,再例,你怎么都写不好某个行为时反复的动作,请用”晃动“这个词。 1.4、最容易被VL理解的写法:代码式写法。所有的大模型,基本都训练过编程类的语料,所以,对编程哪怕不精,也都能够理解得很好,特别式变成得结构式写法,能够精确地表达某个行为和动作。 1.4.1、例: 视频首帧:{ 男人站在荒野,右手握着剑,指着他前面的女人。 从男人背后,侧方向拍摄,聚焦女人,男人背影虚化 } 剧情推进:{ 镜头切换成双人侧面角度拍摄静态广角镜头,锁定,不推进,不旋转。男人挥手把剑举高,然后朝着女人砍去。女人站在原地,含情脉脉地看着男人,一动也不动。 镜头切换成男人面部特写广角镜头,锁定,不推进,不旋转。男人面带哀伤的表情,问道:”你为什么不躲“ …… } 音乐就用官方模板那俩个词,同样用这样写。基本中文识别跟随性VERY GOOD。 一点小经验,分享出来让大伙爽玩,也希望有经验的大佬批评指正!
Minimax H3的本地部署经验 海螺开源以来,折腾了好几宿,也算有了些经验,分享出来希望能让大家少走弯路。 1、部署硬件条件:64G内存是必须的。现在网络上有int4版,质量太差,而比int8容量小的GGUF只能是Q2,都无法使用。int8剪枝版平均占用内存50G左右,所以64G内存是必须,不然就需要硬盘做缓存,对硬盘寿命伤害太大,不推荐。 2、软件条件:最好升级到cuda13.X,这个版本速度块很多。50系的更是必要条件,因为它的硬件原生加速只有cuda13.X才支持。sage也是必要的,github上有现成编译好的轮子,不用看它对应的cuda版本,只要python版本对上了,都可以用。 3、关于加速的选择:在加速lora出来后,除了sage注意力,其他加速节点或插件都可以不用。其他加速节点或插件是通过跳过采样步骤或者层数来加速的,和加速lora混用会造成质量损失太大,基本没了用武之地。 4、普通不加加速lora的情况下,480p,20step还非常模糊,用了加速lora,6步就很清晰了,但还有些错误出现,最好是12步采样,基本就很好了。480p我的4070tis不到2分钟一个5秒,4分多一点一个10秒的。 5、模型对中文提示词理解能力非常优秀,但是必须按照官方要求,把那几个块都填充满,尽量写详细动作,方位,那么遵循度会非常的高。 6、采样器个人测试中,觉得欧拉比官方推荐的那个要好。
Krea好像也不是不能玩啊。 之前觉得提示词很难写,发现,中文也不是不行啊。兄弟们,冲啊。
来玩qwen吧,把千问的环境搞起来。 qwen14b的参数,比光辉强太多了,配置要求也不是那么高,8g显存可以跑。 最最最主要的是,16g显存可以练lora!!!我昨天用nf4模型做基础模型,40张图跑了3个回合,耗时不到一小时,lora就能用了,比我想象中容易多了。
wan的图生视频新玩法。 之前,有吧友们提到wan2.2不动,或者lora不敏感的问题,这其实是高噪模型参数设置问题。细心调节下还是可以解决的。 加上之前也关注过一个wan all in one的融合模型,就在想,wan2.1+wan2.2能不能同时一起玩? 尝试了一下,用wan2.1降噪前两步,wan2.2低噪降噪后4步,发现竟然可行! 但是因为没有细调参数,从2.2重回2.1,觉得2.1的动作控制实在是惨不忍睹,没继续实验下去。 实在玩不动2.2,而对2.1又非常有经验的吧友们,可以尝试一下这样融合解码试试。
画动漫时,发抖时或者极速运动的重影有固定提示词吗? 如题。
美国登月造假了么? 1、科学,应该是可以重复论证的。老美既然连登六次,必然能够再次载人登月。不然,为假。或者说,不科学。那么,信任美国登月成功者,是神学鼓吹者? 2、义务教育完成,都能明白一个道理。要完成一个事实的证明,要么就是完全证实,要么就是证伪。 国际上无法证实老美登月,各期刊杂志却是不断有各种证伪老美登月的证据和论文的发表。 无法证明,却不断被证伪,这是一个事实?
没了美化,瞬间就想删档了。 正式版更新了,美化mod也挂了,看了下一家子的歪瓜裂枣,还全部特么的天人,瞬间没了玩下去的动力。
1
下一页