求助大佬:5090这个速度是不是太慢了,如何优化
comfyui吧
全部回复
仅看楼主
level 5
Lueie7 楼主
一个720*960的视频十分钟了都做不好,我看别人都是几分钟完事,内存占用不满但是显存永远都是满的,这是为何
2026年01月02日 10点01分 1
level 9
加四步加速
2026年01月02日 11点01分 2
按理来说我5090就算不四部加速也应该只要几分钟,不知道为何
2026年01月02日 11点01分
@Lueie7 20步太多了,没必要,步数多总的提升也不大,搭配对应的lora效果更好,cfg感觉也有点高了,如果你要整跳舞的,可以用那个steadydancer或者sakil
2026年01月02日 13点01分
@jakNPT 只是试出图,我这就把步数调小试试
2026年01月02日 13点01分
@Lueie7 你主要是做nsfw还是sfw?
2026年01月02日 13点01分
level 1
20步cfg大于1等于别人40步cfg1的加速流。
2026年01月02日 13点01分 3
调整成10步还是爆显存
2026年01月03日 06点01分
reserved-vram节点加上
2026年01月03日 12点01分
@_冰華 我去试试
2026年01月03日 13点01分
level 1
你一步多少分钟?
2026年01月05日 07点01分 4
3分钟,还炸内存、显存[泪]目前还在找原因
2026年01月05日 08点01分
@Lueie7 3分钟还行,就是分辨率和时长,你改下就不炸了。就整个4步的就行了20步没必要。浪费时间。wan好像本身就是分块执行的,内存肯定要炸,你这个应该会用到80g左右的内存吧。所以现在内存暴涨。
2026年01月05日 09点01分
level 7
内存小了,临时用的话加虚拟内存,买内存条加上去吧,不然白瞎了5090,妥妥的吕布骑狗
2026年01月05日 13点01分 5
别骂了别骂了,现在内存条太贵了,晚点再换
2026年01月05日 15点01分
@Lueie7 那我内存跟你换显卡我160g[滑稽]
2026年01月06日 07点01分
@hklingluan 我96G内存,我也可以拿出48G换显卡的[开心]
2026年01月07日 05点01分
level 1
我5080虽然是笔记本,4步,5秒,单图3分钟,首尾6分钟,你20步,10秒,直接拉爆我10倍[笑尿],你这十分钟的,我怕是要半个多小时[笑尿]
2026年01月05日 19点01分 6
我看别人uurf模型,5090 +32g内存才3分钟就可以走完4步一百多帧[泪]
2026年01月05日 23点01分
level 1
第一,你得看用的什么启动器,启动器选项是怎么设置的,你的优化方案都是咋选的,这个很大可能就是你内显存占用问题的根本原因。第二你先搞个标准的81帧5秒的视频测一下看看,你上来就干到161帧,采样还是20步,你这个估计全吧也没几个你这么出的,所以你这个情况正不正常谁能知道啊!你要是想对比,起码得和别人设置差不多才能比。你看别人出就分分钟的事儿,你得看他的参数,用的啥模型,加速方案是啥,工作流是咋设计的,都用了什么优化节点,出多大分辨率,多少帧,采样多少步,用的啥调度器等等。
2026年01月06日 07点01分 7
试了一下4步160针,视频出是能出了,但是明显鬼图了,还是有问题
2026年01月07日 13点01分
@Lueie7 你要不先学学wan的基础知识,我怎么感觉不是机器的问题呢...而且为啥你老执着160帧呢,wan这个模型就不适合单视频出太长的,不要感觉你5090你就能比别人出的视频长,大家基本都是单视频81左右不是说显卡不行,而是模型就不适合再多出了。至于你4步鬼图问题,首先你是不是挂了相应的4步加速lora,另外还是参数问题,还有你跑的啥模型都有关系。
2026年01月08日 02点01分
@BD_xiaoboy 确实对长点的视频有执念[泪]
2026年01月08日 02点01分
@Lueie7 关键是别人的长视频那都不是单视频生成的,那都是5s一段一段拼在一起的,至于为啥都是5s一段你出多了就明白了,劝你还是先学学基础吧,先把官方基本工作流跑明白了,知道基本参数都咋调,节点都是干啥用的,再研究别的吧。
2026年01月08日 08点01分
level 3
官方不是还有个加速lora的,那个快多嘞
2026年01月07日 06点01分 8
还有这玩意?那个gguf吗?
2026年01月07日 13点01分
level 1
你这是默认流程啥优化没有当然慢,部署Sage attention提速,部署WanVideo Enhanced BlockSwap有这个节点才能和内存交换有多少用多少,部署”图层工具:清除VRAM V2“可以缓存生成的遮罩一堆巴拉巴拉的东西,模型和lora节点给WanVideo Torch Compile节点加速,wan采样器给TeaCache节点可以抽步数,模型用fp16_fast,最外面启动器加参数--use-sage-attention --fast fp16_accumulation --lowvram,我5060ti做720p视频5秒20多分钟12步,我说的够明白了基本就这些
2026年02月19日 02点02分 9
感谢大佬
2026年02月20日 03点02分
@Lueie7 我不怎么上贴吧,你要是5090就别用GGUF,直接KJ的14B_e4m3fn,GGUF反而慢,具体资料你可以问AI, 部署Sage attention是任何情况下都必须的,千万别让AI瞎叭叭和git自动选择,基本必错,triton的github主页明确写了各版本的trition对应pytorch版本号,现在Sage attention稳定版本是2.2 port4,你得装CUDA13.0或12.8,不同的版本pytorch和trition不一样,但是必须pytorch、trition、Sage attention三者互相兼容统一,否则你会遇到一堆奇奇怪怪的成像问题,python的版本建议3.12,再高出现底层支持,节点组不支持
2026年03月24日 10点03分
@Lueie7 然后接上一条你要开启Torch Compile才能实现最大速度,但肯定会遇到tcc报错,说无法编译,问ai尤其是deepseek他肯定瞎叭叭,你装好VC++ 2020工具包之后把环境指定好,在启动其中强行让它用VC++编译才能用
2026年03月24日 11点03分
level 7
5090跑这个分辨率,5秒视频!最多几分钟
2026年03月25日 12点03分 10
level 1
咋调的。。我这GPU 根本不跑啊。。。
2026年03月25日 15点03分 11
吧里找了个大佬有偿帮我把全部环境之类的修了个遍
2026年03月26日 03点03分
1