96% 的含义:一颗 29B 全栈国产训练模型拆开看中国电信开源星辰 Xing4.0-29B-A4B——29B 总参数、每 token 激活 4B、原生 256K 上下文,全程在昇腾 910C 与 MindSpore 上训练。为什么"训练吞吐提升约 96%"这个内部对比数字,比九项跑分更值得拆解?本文从规格、架构、训练栈、基准口径和边界五个角度,拆开这颗国产训练样本。18 分钟阅读AI / 大模型前沿笔记#大模型#国产算力#昇腾#MoE#智能体#AIGC
96% 的含义:一颗 29B 全栈国产训练模型拆开看中国电信开源星辰 Xing4.0-29B-A4B——29B 总参数、每 token 激活 4B、原生 256K 上下文,全程在昇腾 910C 与 MindSpore 上训练。为什么"训练吞吐提升约 96%"这个内部对比数字,比九项跑分更值得拆解?本文从规格、架构、训练栈、基准口径和边界五个角度,拆开这颗国产训练样本。18 分钟阅读AI / 大模型前沿笔记#大模型#国产算力#昇腾#MoE#智能体#AIGC