#推理优化

收录标记为「推理优化」的文章。

当前筛选已生效清除筛选
找到 3 篇文章 · 第 1 / 1 页
  1. 扩散语言模型:让大模型从"逐字打字"变成"整段雕刻"

    自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。