level 8
奥茨玛西亚
楼主
海螺开源以来,折腾了好几宿,也算有了些经验,分享出来希望能让大家少走弯路。
1、部署硬件条件:64G内存是必须的。现在网络上有int4版,质量太差,而比int8容量小的GGUF只能是Q2,都无法使用。int8剪枝版平均占用内存50G左右,所以64G内存是必须,不然就需要硬盘做缓存,对硬盘寿命伤害太大,不推荐。
2、软件条件:最好升级到cuda13.X,这个版本速度块很多。50系的更是必要条件,因为它的硬件原生加速只有cuda13.X才支持。sage也是必要的,github上有现成编译好的轮子,不用看它对应的cuda版本,只要python版本对上了,都可以用。
3、关于加速的选择:在加速lora出来后,除了sage注意力,其他加速节点或插件都可以不用。其他加速节点或插件是通过跳过采样步骤或者层数来加速的,和加速lora混用会造成质量损失太大,基本没了用武之地。
4、普通不加加速lora的情况下,480p,20step还非常模糊,用了加速lora,6步就很清晰了,但还有些错误出现,最好是12步采样,基本就很好了。480p我的4070tis不到2分钟一个5秒,4分多一点一个10秒的。
5、模型对中文提示词理解能力非常优秀,但是必须按照官方要求,把那几个块都填充满,尽量写详细动作,方位,那么遵循度会非常的高。
6、采样器个人测试中,觉得欧拉比官方推荐的那个要好。
2026年08月07日 00点08分
1
1、部署硬件条件:64G内存是必须的。现在网络上有int4版,质量太差,而比int8容量小的GGUF只能是Q2,都无法使用。int8剪枝版平均占用内存50G左右,所以64G内存是必须,不然就需要硬盘做缓存,对硬盘寿命伤害太大,不推荐。
2、软件条件:最好升级到cuda13.X,这个版本速度块很多。50系的更是必要条件,因为它的硬件原生加速只有cuda13.X才支持。sage也是必要的,github上有现成编译好的轮子,不用看它对应的cuda版本,只要python版本对上了,都可以用。
3、关于加速的选择:在加速lora出来后,除了sage注意力,其他加速节点或插件都可以不用。其他加速节点或插件是通过跳过采样步骤或者层数来加速的,和加速lora混用会造成质量损失太大,基本没了用武之地。
4、普通不加加速lora的情况下,480p,20step还非常模糊,用了加速lora,6步就很清晰了,但还有些错误出现,最好是12步采样,基本就很好了。480p我的4070tis不到2分钟一个5秒,4分多一点一个10秒的。
5、模型对中文提示词理解能力非常优秀,但是必须按照官方要求,把那几个块都填充满,尽量写详细动作,方位,那么遵循度会非常的高。
6、采样器个人测试中,觉得欧拉比官方推荐的那个要好。