#昇腾

收录标记为「昇腾」的文章。

当前筛选已生效清除筛选
找到 1 篇文章 · 第 1 / 1 页
  1. 96% 的含义:一颗 29B 全栈国产训练模型拆开看

    中国电信开源星辰 Xing4.0-29B-A4B——29B 总参数、每 token 激活 4B、原生 256K 上下文,全程在昇腾 910C 与 MindSpore 上训练。为什么"训练吞吐提升约 96%"这个内部对比数字,比九项跑分更值得拆解?本文从规格、架构、训练栈、基准口径和边界五个角度,拆开这颗国产训练样本。