#技术原理

收录标记为「技术原理」的文章。

当前筛选已生效清除筛选
找到 4 篇文章 · 第 1 / 1 页
  1. 大模型的"多线程大脑":混合专家(MoE)稀疏架构原理

    为什么 DeepSeek-V3 有 671B 参数却只激活 37B?混合专家(MoE)如何用"高参数、低计算"打破参数量与推理成本的正比关系?从 1991 年的分治思想、Noisy Top-K 门控、Switch Transformer 的 Top-1 极简,到 DeepSeek 的细粒度专家与无辅助损失路由,本文拆解 MoE 的路由机制、负载均衡挑战与部署代价。

  2. 扩散语言模型:让大模型从"逐字打字"变成"整段雕刻"

    自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。