RTX Spark真心有点冤种。
高通吧
全部回复
仅看楼主
level 13
yfy1990610 楼主
实测在RTX5090D+9950X+192GB DDR5 6800CL32降5600+傲腾P4800X下,使用llama部署DeepSeek V4 flash输出API到本地酒馆能跑20tokens/s-22tokens/s,酒馆记忆长度152K tokens的时候输入等待约8秒,首tokens差不多14秒。
而RTX Spark在跑DeepSeek V3.2 70B的时候,输出也就16tokens/s,要说论能装也远没有5090D+192GB内存能装,反正满血DeepSeek V4 flash是梦里啥都有。
当然最冤种的还是我富豪朋友的M3ultra+768GB部署DeepSeek V3.2 685B Q4量化,10Ktokens输入要等16分钟左右才能输出首token,GPU拉完了[笑眼]
2026年09月01日 08点09分 1
level 13
yfy1990610 楼主
解释一下为什么降5600,9950X要192GB内存容量,就只能插4条,内存控制器的高频是为双通道服务的,我插两条跑6800一点问题都没有,插4条5800都蓝屏[阴险]
2026年09月01日 08点09分 2
amd和英特尔为了高利润,不愿意给民用cpu开放四通道,如果给民用cpu开放了四通道乃至八通道,服务器cpu销量就会暴跌了
2026年09月01日 08点09分
@guo土无双 唯一开放四通道的是strix halo,ai max系列大型apu,可惜amd为了恰烂钱只做移动端,不上桌面。而且最近涨飞了
2026年09月01日 10点09分
那不是“四通道”,是2DPC,2 DIMM per channel,每通道两内存条。因为消费级主板布线的限制,内侧外侧两根条子到CPU的长度不一样
2026年09月03日 11点09分
level 14
跟gpu没啥关系吧,主要是苹果m3系列没有tensor算矩阵的单元,如果按5090的fp4 tensor算力对比m3u的fp32算力,那大约是60倍了吧
2026年09月01日 09点09分 3
不止,CUDA算力也高,5090处理152K输入只要8秒,M3ultra处理10K就要960秒,换算下来5090都是M3Ultra的1824倍性能了,当然FP4居功至伟[笑眼]
2026年09月01日 09点09分
@yfy1990610 要对比也得控制好变量,各种条件差别这么大有什么可比性,别的不说你这连模型都不同
2026年09月01日 12点09分
level 1
不开 mtp 和 dspark 的吗?
2026年09月01日 09点09分 4
M3ultra不是我的我不太清楚,但是这俩又不影响处理输入时间,本身M3ultra输入差就是算力低。5090D和RTX spark开了影响不大,大概是我技术不行。
2026年09月01日 09点09分
@yfy1990610 pp 取决于算力,m3u 抢救不了。tg 阶段 dgx spark 和 m5m 这类带宽瓶颈的可以投机解码改善一下速度
2026年09月01日 09点09分
@yfy1990610 你要只是 code agent 场景的话可以用 qwen3.8 27b,不然确实没啥更好的选择了,现在的新模型普遍写代码特化,不咋说人话
2026年09月01日 09点09分
@qianption 确实,涩涩的话DeepSeek V3.2就是肥鱼娘的巅峰了
2026年09月01日 09点09分
level 14
不过我觉得你朋友数据可能有点问题?有不少关于m3u对比两个spark的测试,pp阶段到512K差距也没那么大,两位不同人测试,在256K下,双spark大约pp是m3u的6倍多速度
2026年09月01日 10点09分 5
这个对比数据比较合理
2026年09月01日 14点09分
小模型应该没差那么远,但是Spark实际可用模型才70B,极限110B没什么可用性,但是我说的是685B的模型M3ultra输入跑不动[滑稽]
2026年09月01日 11点09分
@Jht5132 卡了吧
2026年09月01日 11点09分
@yfy1990610 稠密模型和moe也不能直接比
2026年09月01日 12点09分
level 13
24g+192g放得下 v4 flash吗,一部分模型分配到硬盘里,傲腾速度快延迟低,哪怕分配进去也不影响的吗?
2026年09月01日 10点09分 6
能,但是tokens打骨折,50系占了pcie 5.0的便宜
2026年09月01日 11点09分
还有32GB+148GB就能把V4f完整放入内存还能支持128K上下文(Kv Cache扔显存约2GB大小),不过我还是建议装个酒馆,把记忆扔酒馆里作为输入tokens处理,慢不了多少还能无限记忆[滑稽]
2026年09月01日 11点09分
level 12
苹果的 gpu 算力本来就很低,首 Token 更是 M5 出来才好了一点点
2026年09月01日 11点09分 7
不是好一点,是好了很多倍
2026年09月01日 14点09分
level 14
确实苹果的算力太低吃亏了
2026年09月01日 11点09分 8
level 1
苹果主要还是认准了小公司这条路线,个人使用和大公司使用都不是很舒服,这样苹果的生态其实和老中开源小模型的生态有一定的耦合度
2026年09月01日 12点09分 9
小公司直接 API 不行嘛
2026年09月01日 14点09分
@蒸蒸日上d API钱都让API商或者数据托管赚了
2026年09月01日 14点09分
level 12
你这个多大量化?我m5max 128g跑q2.4mix量化的deepseek v4flash单路能跑到40tokens/s,8并发能到80-90tokens/s,你是不是没用mlx的gguf的会慢很多。
2026年09月01日 12点09分 10
原生啊,没量化
2026年09月01日 13点09分
level 14
今明年苹果矩阵单元也支持fp4和fp8了,同时metal4.1也率先支持fp4/8,而且GPU每核心面积比m5更小不少,可以看看继续堆核心的效果。
2026年09月01日 14点09分 11
我现在都印象深刻的是M5MAX和M3ultra渲染蛋白质旋转那个图只有30fps不到,笔记本的RTX5070能转198fps,是因为那个软件上限只有198fps[笑眼]
2026年09月01日 15点09分
@yfy1990610 渲染蛋白质旋转是啥东西?如果差距这么大那就是图形API问题了,怕是OpenGL转metal
2026年09月01日 15点09分
@旅行走失的猫- 就是那个折叠蛋白质的“游戏”,人工设计折叠蛋白质。名字忘了叫啥了。
2026年09月01日 15点09分
@旅行走失的猫- 那个“游戏”本质是个科研工具,所以原生支持Direct,OpenGL,metal等全部渲染API
2026年09月01日 15点09分
level 8
如果把傲腾改为旗舰pcle5.0硬盘的话,速度会有多大变化呢[阴险]
2026年09月01日 16点09分 12
不会有变化,模型都在内存里[滑稽],用傲腾纯粹是我顺手[笑眼]
2026年09月01日 16点09分
当然启动往内存载入专家的时候是有区别的,全是小4K
2026年09月01日 16点09分
@yfy1990610 那就是在启动时有点差别,不过差别应该也不大吧
2026年09月01日 16点09分
@披露兰芝 那就不清楚了[笑眼]
2026年09月01日 16点09分
1