返回文章列表

Qwen 3.8-Max 开源落地:2.4 万亿参数的"长程自主"走进开发者手里

8 月 12 日,阿里云按预告开放 Qwen 3.8-Max 权重,2.4 万亿参数、激活 95B,采用 Apache 2.0 许可,同步上线 Hugging Face 与 ModelScope。一周前它在无人干预下连跑 16 天完成开源项目的纪录,如今变成任何人都能下载的权重文件。本文梳理这次开源的技术规格与生态影响,以及它如何改写开源模型的能力天花板。

8 分钟阅读

预告如约兑现

8 月 3 日那篇行业观察里,我记录过一个关键预告:阿里云千问在发布 Qwen 3.8-Max 时承诺"下周开源权重"。一周后,承诺如期兑现——8 月 12 日,Qwen 3.8-Max 的权重文件正式在 Hugging FaceModelScope 同步上线,采用 Apache 2.0 许可,允许商用、修改与二次分发(Qwen 官方博客)。

这是 Qwen-Max 级别模型历史上第一次向社会开放权重。过去两年,Max 系列一直以 API 形态存在,属于"只可远观"的旗舰产品;这一次,它把完整的 2.4 万亿参数交到了开发者手里。如果说 8 月 3 日发布时大家还在讨论"长程自主"是不是营销话术,那么现在,这套能力已经变成可以被任何团队下载、部署和复现的开源资产。

规格回顾:2.4 万亿参数意味着什么

先回放一下核心规格。Qwen 3.8-Max 是混合专家(MoE)架构,总参数 2.4 万亿、激活参数约 95B,主打编程、办公与科研场景的长程端到端交付。它此前披露的一组长程任务数据,是这次开源最值得复现的看点:

  • 无人工干预独立运行 16 天,完成 oh-my-cli 项目的自动建构与自进化 harness,在 GitHub 上产出 265 次代码提交;
  • 连续自主工作约 125 小时,复现 AI Reasoning 相关论文并做四轮自我进化,AIME24 得分提升 2.7 分;
  • 在天池 WWW2025 多模态对话意图识别赛中,24 小时内击败 458 支人类参赛队伍;
  • 在芯片设计沙箱里历经约 500 轮交互,把硬件门数从 8298 个精简到 678 个。

以上数据来自 8 月 3 日的发布报道,开源之前它们更像"官方演示",开源之后它们变成了可复现基准:任何团队都能拿同一份权重,在自己的任务集上验证"16 天无人值守"到底能跑多远。这在开源模型历史上并不多见——多数开源模型的卖点是单次任务的精度,而 Qwen 3.8-Max 的卖点是连续数天不崩的自主性

与同代开源模型的对比:两条路线

把 Qwen 3.8-Max 放回本周的开源坐标系,会看到两条明显不同的路线:

模型参数许可证定位
Qwen 3.8-Max2.4T / 激活 95B(MoE)Apache 2.0长程端到端交付,企业级部署
Meta Muse Glimmer30B(dense)Apache 2.0本地常驻 Agent,单卡可跑
DeepSeek-V4-Flash开源开源高性价比通用推理

Meta 在 8 月 10 日发布的 Muse Glimmer 走的是"小而全"路线:30B 稠密模型、4-bit 量化后约 17GB,单张消费级显卡就能运行本地智能体。Qwen 3.8-Max 则是"大而深":2.4 万亿参数的 MoE,推理需要企业级多卡或云端资源,换取的是更长、更复杂任务的端到端完成能力。两者并不冲突,但指向了开源模型的两个不同出口——端侧个人助理企业自主工作流

值得注意的是,8 月 3 日的 OpenRouter 周榜 显示,全球调用量前五名已全部是中国模型,其中 DeepSeek-V4-Flash 以 7.22 万亿 Token 登顶。在这个背景下,Qwen 3.8-Max 的开源把国产模型的开源阵营进一步拉高到万亿参数量级,也让"开源=小模型"的旧印象被正式打破。

开源对生态的三层影响

第一层,长程自主从演示变成可复现。16 天无人值守、265 次提交、125 小时论文复现——这些数字以前只出现在官方通稿里,现在任何有 GPU 资源的团队都能自己跑一遍。可复现意味着可信,也意味着竞争:谁都能拿着同一份权重做评测、做微调、做二次开发,能力的天花板不再被 API 提供方垄断。

第二层,企业私有化部署路线被打开。对于数据敏感、有数据驻留要求的组织,旗舰模型一直有个尴尬:能力最强的模型往往只以 API 形态存在,数据要出域。Qwen 3.8-Max 开源后,这类组织可以基于同一份权重搭建私有推理环境,把"长程自主"放进自己的数据边界里。Apache 2.0 许可也降低了法务审核成本——没有月度活跃用户上限、没有归属条款,商用门槛明显低于当年 Llama 家族的自研许可。

第三层,开源模型的能力天花板被抬升。此前开源阵营的主流是 30B-400B 量级,万亿参数模型基本是闭源专属。Qwen 3.8-Max 把"万亿参数 + 长程自主"同时带进开源世界,意味着开源与闭源之间的能力差距,正在从"参数规模"维度被压缩。Meta 用 Muse Glimmer 圈端侧,阿里用 Qwen 3.8-Max 抢企业,两家不约而同地把最强能力放进开源——这是 2026 年 8 月值得记录的结构性变化。

观察与反思

把这一周的开源动态串起来看,几个判断值得记录:

第一,开源正在成为旗舰模型的"第二战场"。8 月 10 日 Meta 开源 Muse Glimmer,8 月 12 日阿里开源 Qwen 3.8-Max,一周之内两个巨头把各自的最强阵容放进开源。闭源 API 负责商业化,开源权重负责生态和心智——这条在 8 月 11 日 Muse Glimmer 分析里提出的判断,被 Qwen 用更重的棋子再次验证。

第二,"长程自主"正在成为新的开源评价维度。过去比开源模型,大家看基准分、看上下文长度、看推理价格;Qwen 3.8-Max 把"连续工作多少天不崩"摆上了台面。这个维度对工程和运维的考验是全新的——它不仅是模型能力问题,更是任务设计、沙箱隔离、失败恢复的系统工程问题。

第三,也要保持清醒。2.4 万亿参数的开源权重,部署成本和安全要求都远超普通开源模型:需要企业级推理集群、需要专门的治理流程,能力越强,被滥用的风险面也越大。开源永远是一把双刃剑——8 月 3 日那篇文章里记录的诈骗团伙案例提醒我们,更强的自主能力一旦落入错误的人手里,杀伤力也会同步放大。

这一周,开源模型的地图被重新画了两笔:一笔画在端侧,一笔画在企业。而 Qwen 3.8-Max 的落地,把第二笔落到了实处。


笔记

  • Qwen 3.8-Max 权重 8 月 12 日上线 Hugging Face / ModelScope,Apache 2.0,来源:Qwen 官方博客(qwenlm.github.io)。
  • 技术规格与长程数据(16 天、265 commits、125 小时、AIME24 +2.7、458 支队伍、8298→678 门数)沿用 8 月 3 日发布信息,同一来源。
  • Muse Glimmer 对比数据(30B、Apache 2.0、约 17GB 4-bit)来自 8 月 11 日文章与 Hugging Face 模型卡。
  • OpenRouter 榜单数据(DeepSeek-V4-Flash 7.22 万亿 Token)来自 8 月 3 日文章。

(内容由AI生成,仅供参考)