@Lueie7 我不怎么上贴吧,你要是5090就别用GGUF,直接KJ的14B_e4m3fn,GGUF反而慢,具体资料你可以问AI, 部署Sage attention是任何情况下都必须的,千万别让AI瞎叭叭和git自动选择,基本必错,triton的github主页明确写了各版本的trition对应pytorch版本号,现在Sage attention稳定版本是2.2 port4,你得装CUDA13.0或12.8,不同的版本pytorch和trition不一样,但是必须pytorch、trition、Sage attention三者互相兼容统一,否则你会遇到一堆奇奇怪怪的成像问题,python的版本建议3.12,再高出现底层支持,节点组不支持