那天Stable Diffusion和llm喝醉了
stablediffusion吧
全部回复
仅看楼主
level 3
王八hhhhh 楼主
Diffusion居然也能被用于文字生成,这个模型是DiffusionGemma的量化版本,我本地跑的,用的是一个社区的2bit非对称量化版本,性能不咋地但是感觉这种模式未来可期。因为不是那种传统大语言模型一个一个字蹦所以再发展几年应该挺适合搞文学创作的,毕竟它有一个很好的总观能力。
因为传统大语言模型(如GPT、Llama)采用的是自回归(Autoregressive)范式,即从左到右、一个字接一个字地预测下一个token。这种方式天然串行,生成第N个字时必须依赖前N-1个字,无法回头修改,也无法预知后文。这就像写小说不列大纲,写到哪算哪,容易出现前后矛盾、逻辑崩坏或遗忘设定的问题。
而DiffusionGemma采用的是离散文本扩散机制,它在生成文本时,会先铺开一块256个token的“画布”,从随机噪声开始,通过多轮并行去噪,一次性“印”出整段文字。在这个过程中,每个token都能同时关注块内所有其他token,相当于在生成时就具备了“全局视野”,想必这个各位玩sd的朋友也不陌生。
感觉应该挺适合文学创作的,周末有时间我拿它和APEXmini量化版的qwen3.6 35B A3B比一比
2026年08月05日 11点08分 1
level 1
这个有意思[太开心]
2026年08月05日 14点08分 2
我这个显存12g的速度有点感人,你们有好显卡或者爆改显存的可以玩玩
2026年08月05日 15点08分
level 12
[滑稽]之前试过Mercury2,拿来帮我做点翻译,速度还行,效果也够用
2026年08月05日 14点08分 3
level 1
拿扩散来做llm吗,只能说确实很有想法了,感觉理论上成段文章的效果能更好,只能说是个神奇的想法,不过我总感觉是不是什么地方非常亏啊。说直白了256个token约等于256个像素点吗,但迭代再往上面一码,感觉生成的计算效率是不是还是差很多啊。(也不懂技术细节,瞎扯中)
2026年08月05日 15点08分 4
256个token是可以并行的,扩散模型走十到二十步就行了传统串行要老老实实走256步,实际速率要快四倍左右
2026年08月05日 17点08分
level 3
王八hhhhh 楼主
这个llamacpp是一个特殊分支版本,编译挺麻烦的,我也没咋搞明白所以是交给Codex帮我弄的
2026年08月05日 17点08分 5
level 3
diffusion llm目前请一律视为狗屎,以及,如果你说自回归模型有“前后矛盾,逻辑崩坏,遗忘设定”问题,那么毫无疑问的扩散模型的这种问题会更加严重,因为diffusion没有“因果性”,自回归模型又称为“因果语言模型”,即每一个新token的生成依赖于以前的token,而扩散模型显然不因果,这也就导致,所有扩散模型在除了生成速度之外的部分一无是处。
目前扩散语言模型最好的应用是作为自回归模型的投机解码模型,如DFlash
2026年08月05日 23点08分 6
不懂就问,diffusion llm为什么不用单向注意力呢?就像decoder-only的自回归模型一样,让每个token只能往前看,会改善逻辑性吗?
2026年08月06日 03点08分
level 6
看了一下,感觉更像是分块的自回归,块内可以双向修改重写,但是块之间是不行的。底层还是串行的,比如说上一个块的结尾写到“存在三点问题:”,后一个块发现实际应该是五个,他不能回头改之前的内容。而且块与块之间要做到连贯也比普通的自回归模型困难。所以这玩意对逻辑的提升是感觉有限,主要是对速度的提升。逻辑这种还是堆砌思维链靠谱,相当于打草稿了。
2026年08月06日 03点08分 7
level 1
扩散模型也是有的,蚂蚁百灵的ling3.0貌似就是扩散模型
2026年08月07日 02点08分 9
level 1
我觉得不靠谱的原因一直是这样
无论是现在llm预测下一个token还是diffusion 本质都是想对给出一个prompt 回答的分布
问题在于预测联合分布是很困难的 llm是运用了信息学里x y的熵等于x的熵加y given x的熵
diffusion把问题拆解成从一个杂乱分布里 预测噪声过程
本质都没法解决核心问题 而llm现在的处理方式更合理
2026年08月08日 15点08分 10
1