level 13
yfy1990610
楼主
实测在RTX5090D+9950X+192GB DDR5 6800CL32降5600+傲腾P4800X下,使用llama部署DeepSeek V4 flash输出API到本地酒馆能跑20tokens/s-22tokens/s,酒馆记忆长度152K tokens的时候输入等待约8秒,首tokens差不多14秒。
而RTX Spark在跑DeepSeek V3.2 70B的时候,输出也就16tokens/s,要说论能装也远没有5090D+192GB内存能装,反正满血DeepSeek V4 flash是梦里啥都有。
当然最冤种的还是我富豪朋友的M3ultra+768GB部署DeepSeek V3.2 685B Q4量化,10Ktokens输入要等16分钟左右才能输出首token,GPU拉完了![[笑眼]](/static/emoticons/u7b11u773c.png)

2026年09月01日 08点09分
1
而RTX Spark在跑DeepSeek V3.2 70B的时候,输出也就16tokens/s,要说论能装也远没有5090D+192GB内存能装,反正满血DeepSeek V4 flash是梦里啥都有。
当然最冤种的还是我富豪朋友的M3ultra+768GB部署DeepSeek V3.2 685B Q4量化,10Ktokens输入要等16分钟左右才能输出首token,GPU拉完了


