level 3
王八hhhhh
楼主
Diffusion居然也能被用于文字生成,这个模型是DiffusionGemma的量化版本,我本地跑的,用的是一个社区的2bit非对称量化版本,性能不咋地但是感觉这种模式未来可期。因为不是那种传统大语言模型一个一个字蹦所以再发展几年应该挺适合搞文学创作的,毕竟它有一个很好的总观能力。
因为传统大语言模型(如GPT、Llama)采用的是自回归(Autoregressive)范式,即从左到右、一个字接一个字地预测下一个token。这种方式天然串行,生成第N个字时必须依赖前N-1个字,无法回头修改,也无法预知后文。这就像写小说不列大纲,写到哪算哪,容易出现前后矛盾、逻辑崩坏或遗忘设定的问题。
而DiffusionGemma采用的是离散文本扩散机制,它在生成文本时,会先铺开一块256个token的“画布”,从随机噪声开始,通过多轮并行去噪,一次性“印”出整段文字。在这个过程中,每个token都能同时关注块内所有其他token,相当于在生成时就具备了“全局视野”,想必这个各位玩sd的朋友也不陌生。
感觉应该挺适合文学创作的,周末有时间我拿它和APEXmini量化版的qwen3.6 35B A3B比一比



2026年08月05日 11点08分
1
因为传统大语言模型(如GPT、Llama)采用的是自回归(Autoregressive)范式,即从左到右、一个字接一个字地预测下一个token。这种方式天然串行,生成第N个字时必须依赖前N-1个字,无法回头修改,也无法预知后文。这就像写小说不列大纲,写到哪算哪,容易出现前后矛盾、逻辑崩坏或遗忘设定的问题。
而DiffusionGemma采用的是离散文本扩散机制,它在生成文本时,会先铺开一块256个token的“画布”,从随机噪声开始,通过多轮并行去噪,一次性“印”出整段文字。在这个过程中,每个token都能同时关注块内所有其他token,相当于在生成时就具备了“全局视野”,想必这个各位玩sd的朋友也不陌生。
感觉应该挺适合文学创作的,周末有时间我拿它和APEXmini量化版的qwen3.6 35B A3B比一比


