返回文章列表

扩散语言模型:让大模型从"逐字打字"变成"整段雕刻"

自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。

17 分钟阅读

打字机与雕刻师

当前几乎所有主流大语言模型都采用自回归生成:先敲出第一个词,才能决定第二个词。这种机制严谨,却有一个物理瓶颈——每生成一个 token,都要把整个模型的权重从内存搬运一遍,GPU 大部分时间在等内存传数据,而不是在真正计算。芯片厂商把这种困境概括为"内存墙"。

扩散语言模型(Diffusion Language Model,dLLM)换了一条路:不再一个词一个词地吐,而是像雕刻师一样,先在一块"石料"上一次性规划整段文字,再反复打磨修改。2026 年 8 月,这条路线迎来两个标志性节点:

  • DiffusionGemma(谷歌 DeepMind,2026-08-04):把自回归的 Gemma 4 通过两阶段微调改造成文字扩散模型,单张 NVIDIA H100 实测约 1456 词/秒,比同规模自回归模型快 7 倍有余。
  • LLaDA MoE v2(人大高瓴人工智能学院与蚂蚁集团,2026-08-11):首次系统刻画混合专家(MoE)扩散语言模型的扩展定律,并据此从头训练 30B-A3B 模型,用 Qwen3 同规模约 65% 的预训练词元逼近其水准。

来源:DiffusionGemma 技术报告(arXiv:2608.00146)LLaDA MoE v2 论文(arXiv:2608.03457)

扩散语言模型的基本机制

训练:从损坏中学会还原

扩散语言模型的训练目标是"去噪":给定一句完整文本,随机把一部分词替换成噪声(乱码或掩码),让模型猜原来是什么词,替换比例从 0% 到 100% 不等。模型在不同程度的损坏下重建原始信息。

这带来一个与自回归截然不同的性质:双向上下文。自回归模型只能用因果注意力,每个词只能看到它前面的词;扩散模型用双向注意力,一个词可以同时参考左右两侧。代价是训练时监督信号只落在被掩码的位置——平均约一半词元参与学习,信号密度比自回归低,这直接影响了后续扩展定律的结论。

推理:迭代精修一整段文本

推理时,模型从一段完全随机的序列出发,多轮修改:哪些词已经确定就"锁定",哪些不确定就继续接受修改。每一轮对所有位置同时判断,这是并行加速的根源。

谷歌 DeepMind 在 DiffusionGemma 中选择多项式扩散而非掩码扩散:掩码扩散把不确定位置变成特殊占位符,而多项式扩散把该位置换成词汇表里的任意一个词。后者的好处是即使已被"锁定"的词,后续轮次依然可以被修改——模型拥有真正的自我纠错能力。

DiffusionGemma:改造一条成熟路线

站在巨人肩膀上的架构改造

DiffusionGemma 的起点是 Gemma 4,一个 252 亿总参数、每次激活约 38.5 亿参数的 MoE 模型(128 组专家、每次激活 8 组)。从自回归改造为扩散,核心冲突是注意力模式:原模型只有因果注意力,扩散需要双向注意力。谷歌 DeepMind 的解法是保留全部原始权重,通过微调让模型同时掌握两种模式:编码上下文时用因果注意力,生成 256 词"画布"时用双向注意力。训练数据量不到原始预训练的 10%。

模型还继承了 Gemma 4 的自我条件化组件:每一轮修改时,除了当前的噪点草稿,还能参考上一轮自己的预测结果,相当于雕刻师一边看石头、一边参考自己上一刀的设计草图。为此额外增加了约 780 万参数。

两阶段训练:先学会雕刻,再学会快速雕刻

第一阶段是监督微调(SFT):从语料中抽取文本、随机做词汇替换,训练模型修复。实验显示非思考模式性能提升很快,而思考模式(内部推理)学习曲线慢得多,起步时会频繁陷入循环重复。坚持完成完整 SFT 后,两种模式都呈近似对数线性提升。

第二阶段是采样器蒸馏与强化学习(SD·RL),这是拉开差距的关键。仅完成 SFT 的模型需要 192 轮修改才能保证质量,压缩到 48 轮以内质量急剧下降,还会因陷入重复循环触发提前停止、输出空白答案。SD·RL 用高轮次生成的高质量草稿当"在线教师",同时引入外部奖励信号(数学题答对、代码通过测试)引导正确性,两个目标整合进同一个训练目标。

训练中出现了一个自动加速的正向飞轮:模型越有把握,预测熵越低;熵越低,自适应停止触发越早;停止越早,训练数据中短轨迹样本越多;短轨迹反过来训练模型快速完成任务。SD·RL 完成后,GPQA-Diamond 与 LiveCodeBench-v6 综合得分比 SFT 完成时提升 10 个百分点,每次前向产出 token 数从 5 提升到近 20,速度翻四倍;输出长度还缩短了约一半——减少总词数等于减少修改轮次的工作量,简洁即速度。

采样器:决定哪些词可以"毕业"

256 个词同时修改,但不同位置的处理力度不同。采样器按排序:熵衡量模型对某位置的不确定程度。每轮从最有把握的词开始逐个锁定,直到累计熵超过阈值 0.1;超出阈值的词被重新随机化,在下一轮重新接受修改——相当于考试时先答最确定的题,把难题留到后面反复斟酌。

采样器还配合温度退火:早期温度 0.8 鼓励探索,随轮次线性降到 0.4 让模型收敛。自适应停止机制在连续两轮预测几乎无变化(平均熵低于 0.005 且最可能序列完全相同)时提前结束,实际平均轮次降至 12 轮左右,只有 48 轮上限的四分之一。任务越难轮次越多:GSM8K 约 8 到 9 轮、HumanEval 9 到 10 轮、GPQA-Diamond 14 到 15 轮、Codeforces 17 到 18 轮。

速度从哪来:每轮慢 3.2 倍,但产出 20 个词

每次修改要同时处理 256 个词,直觉上应该比自回归慢 256 倍,实测却只慢 3.2 倍:

  • MoE 专家散射:256 个词平均激活约 84 个不同专家(传统模型只激活 8 个),该层耗时增加 4.3 倍;换成密集架构可降到不足 2 倍。
  • 采样计算:256 个词的概率分布、自我条件化矩阵乘法、26.2 万词汇表上的 softmax 合计约 3.06 毫秒,是传统模型的 5.5 倍。
  • 注意力:256 词完整双向注意力只能用 FlashAttention-4,慢约 4 倍。
  • KV 缓存传输显著减少:这是最大的节省项——传统模型每生成一个词都要读一遍全部历史上下文,扩散模型每生成 256 词才读一遍,大幅缓解内存带宽压力。

综合下来,每次修改慢 3.2 倍,但每次产出约 20 个 token,净效率提升约 6 倍;加上 GPU 内核调优与 CPU-GPU 通信异步化,最终实测 1456 词/秒。在低并发(1 到 16 用户)下,它对单用户速度和总吞吐都优于配多词预测加速的 Gemma 4,只有并发超过约 32 用户时才被传统模型反超。

能"反悔"的模型:双向注意力的实际价值

扩散机制带来一个自回归模型天然缺失的能力:根据后面的内容修改前面的词。报告中的例子很典型:面对"先给答案再推导"的数学题,Gemma 4 传统版本第一个词就输出了错误答案,推导到正确答案后只能在末尾尴尬地"等等,重新计算";DiffusionGemma 则在第一轮对错误答案赋了较高概率,后续轮次中随着推导词逐渐确定,位置靠前的答案被同步修正为正确答案,输出前后完全一致。

结构化输出任务上这种能力尤其突出:格式确定时大部分词内容几乎确定,第一轮就能以 83% 以上平均置信度完成大部分填写,第二轮全部锁定,整个任务只需两轮。

评测与代价

在覆盖二十个标准评测集的体系上,DiffusionGemma 思考模式下 AIME 2026 得 69.1、GPQA-Diamond 73.2、LiveCodeBench-v6 69.1、GSM8K 96.3、HumanEval 94.5、IFEval 97.4。代价是相对起点模型低约 5 到 15 个百分点(Gemma 4 自回归版 AIME 2026 为 84.2)。与同类开源扩散模型相比优势明显:LLaDA 2.1 Flash 100B 需要 8 张 B200、每秒仅 375 词,DiffusionGemma 单卡即可达到其近 4 倍速度;与闭源 Mercury 2 相比综合成绩相当,速度约 2.5 倍(1479 对 489 到 600 词/秒)。

一个关键特性是保留自回归能力:架构与 Gemma 4 完全相同,同一套权重可直接以自回归模式加载,性能几乎回到原版水平。同一份权重可以根据任务切换:速度优先用扩散模式,质量优先用自回归模式。

模型以 Apache 2.0 开源,配套 LoRA 微调工具包(2 块 A100 即可完成)。数独任务经 rank=8 微调(仅 800 万可训练参数)达到 84.4% 准确率,平均轮次从 40.65 压缩到 10.72;PubMedQA 的解释文段 BLEU 从 10.76 提升到 20.67。

来源:DiffusionGemma:速度革命的技术拆解(科技行者,2026-08-11)

LLaDA MoE v2:为扩散模型立"扩展定律"

如果说 DiffusionGemma 回答"怎么把已有模型改造得更快",LLaDA MoE v2 回答的是另一个问题:扩散模型和 MoE 结合后,如何科学地扩大规模

三个层次的扩展规律

研究团队用 158M、1B、3.6B 三个规模的模型,在 10^18 到 3×10^20 FLOPs 的预算范围做了系统实验,得到三组规律:

调参规律:最佳批量大小约等于 0.374 × 预算^0.3481,最佳学习率约等于 64.8 × 预算^−0.2447。与自回归模型(如 DeepSeek LLM)有系统性差异——同等预算下扩散模型需要的批量大得多。以 10^20 FLOPs 为例,自回归模型最优批量约 102 万词元,扩散模型约需 343 万,相差三倍多。原因是扩散训练的信号密度低:只有被掩码的位置参与学习,需要更大批量维持稳定性。

资源分配规律:用等算力曲线(IsoFLOP)分析,最优模型算力 M* ≈ 0.5152 × C^0.475,最优训练词元数 D* ≈ 1.9411 × C^0.525。数据侧的指数(0.525)快于模型侧(0.475),意味着预算增大时,应把相对更多新增资源投入数据。横向对比更有意思:自回归密集→自回归 MoE,数据指数略微上升;自回归密集→扩散密集,也略微上升;而 MoE 与扩散同时叠加时数据指数达到 0.525,是所有对比研究中最偏向数据的一个——因为路由器面对的是被随机遮盖、噪声水平各异的输入,比自回归的因果前缀更多样,额外数据能覆盖这种多样性。

专家架构规律:围绕三个维度实验。激活比例在小预算下略高更好,预算增大时越来越稀疏的激活(更大专家池)占优;专家粒度没有随预算单调变化,取中等范围(G=8 到 16)最稳健;共享专家比例呈 U 形曲线,33.3% 在所有预算档位都取得最低损失——这与自回归惯例不同(DeepSeekMoE 用 25%,Qwen3 不用共享专家),扩散模型应维持"每两份路由专家算力配一份公共专家"。

按定律训练 30B-A3B

依据上述规律,团队从零训练 LLaDA MoE v2:总参 300 亿、激活约 30 亿,激活比例约 9.09%,粒度 G=8,每层 128 个路由专家(激活 8 个)加一个宽度为路由专家四倍的共享专家。预训练分五阶段共 23.5 万亿词元:前两阶段各 10 万亿做基础积累,第三阶段 2 万亿精选数据退火,第四阶段把上下文从 4 千扩展到 3.2 万词元(位置编码基础频率从 10000 调到 500000),第五阶段 1 万亿长文档收尾。总消耗约 46 万 NVIDIA B200 GPU 小时。

结果:用 65% 的词元逼近 Qwen3

在 15 个基准上与同规模模型对比:LLaDA MoE v2 平均得分 58.60,是所有对比扩散模型中最高,比同样 30B-A3B 的 SDAR Sci 高 3.78 分;代码类尤其突出,HumanEval 比 SDAR Sci 高 16.46 个百分点——且它是从零训练,SDAR Sci 是在 Qwen3 基础上继续训练的。

与自回归顶尖的 Qwen3 30B-A3B(36 万亿词元)相比,LLaDA MoE v2 用约 65% 的词元,在数学推理(OlympiadBench 仅落后 2.22 分)、代码生成(HumanEval 仅落后 2.44 分)上保持较近差距,中文知识类测试差距较明显。扩展定律的价值也有直接证据:在相同训练计算量下,新模型用约 50% 的计算量就超越上一代 LLaDA MoE 7B-A1B,HellaSwag 上甚至不到 10%。

指令微调:无 RL 的追赶

监督微调用 700 万条指令-回答样本训练三轮(问题部分不变,只遮盖回答部分),峰值学习率 5×10^-6,训练后未做强化学习。即便如此,在八项推理和代码测试中七项超过 SDAR Chat(含全部四项推理测试);与经过 RL 的 Qwen3 相比,AIME 2024 得 30 对 32.8、MultiPL-E 以 67.52 反超 Qwen3 的 66.60。

来源:LLaDA MoE v2:扩散模型扩展定律详解(搜狐科技,2026-08-12)扩散语言模型扩展定律与 LLaDA MoE v2(腾讯网,2026-08-11)

两条路线的对比

维度DiffusionGemmaLLaDA MoE v2
团队谷歌 DeepMind人大高瓴 + 蚂蚁集团
规模26B-A4B(改造自 Gemma 4)30B-A3B(从零训练)
路线保留预训练权重,两阶段微调改造扩展定律指导的从头预训练
训练成本不到原始预训练的 10%23.5 万亿词元、约 46 万 B200 GPU 小时
关键机制多项式扩散 + 自我条件化 + SD·RL掩码去噪 + MoE + 三组扩展定律
速度单张 H100 约 1456 词/秒以扩展效率为目标,未主打单卡速度
相对自回归低 5 到 15 个百分点,但保留自回归模式用 65% 词元逼近 Qwen3 30B-A3B
开源Apache 2.0,权重 + LoRA 工具包论文已公开,推理代码与权重待开源

两条路线并不冲突,反而互补:DiffusionGemma 证明了"改造"路径的价值——扩散能力不必从零预训练,已有强模型加精心设计的微调就能获得数量级的速度提升;LLaDA MoE v2 证明了"定律"路径的价值——扩散 + MoE 的规模化不能照搬自回归经验,需要专属的调参、资源分配和专家设计原则。

已知局限

谷歌 DeepMind 在报告中坦率列出了 DiffusionGemma 的问题:整体能力低于起点模型(跳过扩散预训练、SFT 偏短、SD·RL 为低延迟牺牲峰值性能);输出"过于简洁",深度长论述任务表现不如预期;极端压缩轮次下偶发词汇循环(如"the the the");思考模式在多模态任务中有时丢失闭合标签(MMMU-Pro 上思考模式 54.3 分反而低于关闭思考的 66.0 分);高并发(32 用户以上)总吞吐逊于传统模型,高批次优化尚未完成。

LLaDA MoE v2 的扩展定律也有边界:三个架构维度是独立实验的,相互作用尚未研究;极端大规模下规律是否成立需要未来验证。

趋势:扩散范式会重估自回归优化栈吗

当扩散模型能同时做到并行生成、自我纠错和接近自回归的质量,整个自回归优化栈——投机解码、KV Cache 压缩、量化推理——的价值都需要重新评估。DiffusionGemma 已经示范了一个务实的中间态:同一套权重在空闲时用扩散模式高速生成草稿,关键任务切换回自回归模式精细推理,两种范式协同工作。

在 2026 年 8 月这个时间点,扩散语言模型已经从学术前沿走到了工程验证的阶段。它未必会取代自回归,但"整段雕刻"相对于"逐字打字"的效率优势,已经让这条路线值得每个做推理优化的工程师认真对待。

(内容由AI生成,仅供参考)