#MoE

收录标记为「MoE」的文章。

当前筛选已生效清除筛选
找到 1 篇文章 · 第 1 / 1 页
  1. 大模型的"多线程大脑":混合专家(MoE)稀疏架构原理

    为什么 DeepSeek-V3 有 671B 参数却只激活 37B?混合专家(MoE)如何用"高参数、低计算"打破参数量与推理成本的正比关系?从 1991 年的分治思想、Noisy Top-K 门控、Switch Transformer 的 Top-1 极简,到 DeepSeek 的细粒度专家与无辅助损失路由,本文拆解 MoE 的路由机制、负载均衡挑战与部署代价。