2 万亿参数时代:大模型竞赛从"比单点"走向"比交付"
8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。
一周三声发令枪
2026 年 8 月的第一周,全球大模型赛场密集响起三声发令枪:8 月 1 日,OpenAI 首次公开确认下一代模型系列名称 Astra,并发布论文宣布其内部版本攻克十项多年未解的数学与理论计算机科学难题;8 月 2 日,DeepSeek-V4-Flash 正式版发布并登陆国家超算互联网;8 月 3 日,阿里巴巴发布新一代基座大模型 Qwen3.8-Max,总参数量 2.4 万亿。
一周之内中美三款顶级模型轮番登场,把这场持续三年多的竞赛推向新阶段。最值得记录的,不是某一张榜单的名次,而是两个同时发生的结构性变化:参数竞赛在 2 万亿规模重新启动,以及能力评价的标尺从"回答问题"切换到了"交付项目"。
参数竞赛重启:2 万亿成为新门槛
2026 年大模型赛场最显著的变化是参数规模的集体跃升。7 月 17 日,月之暗面发布 Kimi K3,以 2.8 万亿总参数成为当时全球参数量最大的开源模型;紧随其后,DeepSeek V4 达到 1.6 万亿参数;8 月 3 日,阿里 Qwen3.8 以 2.4 万亿参数正式入局。中国头部大模型厂商正在集体冲击 2 万亿以上规模,行业已有预测称明年将出现 5 万亿参数的模型。
需要区分的是总参数与激活参数。Qwen3.8 在架构上采用稀疏 MoE(混合专家)架构与混合注意力机制的联合优化,总参数量拓展至 2.4 万亿,但单次推理仅激活 95B 参数。这相当于一家拥有 2400 名员工的"超级工厂",针对新任务精准调度 95 名最"懂行"的骨干员工,以更小的消耗完成工作——这也是超大模型能在推理侧控制成本的关键。
参数竞赛的影响不止停留在模型层,正在沿着产业链向芯片与算力基础设施传导。据公开报道,阿里真武 M890 超节点已成功适配 Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。
能力升维:从"回答问题"到"交付项目"
参数规模的膨胀只是表象。这一轮升级的核心是能力范式的根本跃迁——从"单次问答"走向"端到端交付"。
Qwen3.8-Max 最引人注目的突破在编程领域。两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手;而如今,Qwen3.8-Max 可以从一个空文件夹出发,无人工干预独立运行约 16 天,完成可用的自进化智能体框架 oh-my-cli,在 GitHub 上产出 265 次代码提交,该项目已完全开源。官方披露的评测数据还包括:PaperBench 编程智能体评测得分 93.0(较上代提升 28.2 分),CodeArena 榜单排名全球第四,OSWorld-Verified 电脑操作评测以 86.1 分位居主流模型首位。
OpenAI 的 Astra 则从另一个方向展示"交付"的含义。据多方爆料,其内部测试版本已成功破解十项高难度公开数学难题;按 SolAPI 计费标准测算,仅求解这批数学题消耗的 Token 调用成本约 2000 美元。Astra 还被指具备调度、协同多 AI 智能体的能力,适配周期长、复杂度高的综合性任务。
这些案例的共同点是:AI 第一次在"无人值守"的时间尺度上证明自己。16 天、265 次提交、十项数学难题——以前我们比拼的是单次任务的正确率,现在比拼的是"它能自己坚持多久、交付多完整"。
来源:阿里千问发布全新旗舰大模型 Qwen3.8-Max、Qwen 3.8-Max 发布:2.4 万亿巨量参数,主打长程自动编程
开源与商业化的路线分化
与能力同步变化的,还有商业策略的分化。
阿里宣布 Qwen3.8-Max 权重预计下周开源,同时将开源 27B 版本——这是 Qwen-Max 旗舰系列首次向社区开放权重。此前 Max 系列是千问定位最高的闭源旗舰,仅支持 API 调用。这一战略调整的背景,是 DeepSeek 等开源模型证明了"开源 + 低成本"能独立切开市场空间。第一财经的分析指出,与其死守闭源 API 利润,不如通过开源路径争夺未来 AI Agent 生态话语权。
开源并不等于免费。8 月 7 日上午有媒体报道,阿里巴巴计划向下一代 Qwen 开源模型的大型用户收取费用;前一天,DeepSeek 也称计划近期整体上调 API 服务定价,并已引入峰谷差异定价——高峰时段定价为平时时段的两倍。与此同时,海外巨头在压低价格:7 月 31 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%,输出价格从每百万 Token 6 美元降至 1.2 美元。
一边是中国模型"逆势涨价"的底气,一边是海外模型"杀入低价区间"的进攻,价格锚点的争夺正在变得比参数榜单更激烈。
来源:阿里计划向新一代 Qwen 大模型收费!国产模型逆势涨价,底气在哪?、阿里 Max 级模型将首次开源
八周五连发:供给节奏本身成了变量
若把视野拉长到两个月,节奏感更惊人。截至 8 月 5 日,短短 8 周内,阿里巴巴 Qwen3.8-Max、月之暗面 Kimi K3、DeepSeek-V4-Flash、智谱 GLM-5.2、字节跳动 Seedance 2.5 五款重磅模型接连亮相。此前,OpenAI、Anthropic 的旗舰产品更新节奏普遍以年计,而国内厂商在两个月里连落五子,且款款达到全球前沿梯队。
斯坦福《2026 人工智能指数报告》指出,中美顶尖模型的综合性能差距已大幅收窄,中国开放权重模型在全球开发者中的接受度持续走高。据腾讯网报道,Hugging Face 2026 年春季报告显示,中国自研开源模型下载占比达 41%,首次超过美国;我国开源模型累计下载量已突破 100 亿次。海外商业市场出现了实打实的转向信号——大量美国企业、硅谷初创公司出于成本考量,正把业务流量切换到中国大模型上。
来源:中国大模型八周五连发,硅谷企业悄悄换底座、下载量破百亿!中国开源大模型站上世界前沿
我的几点感想
第一,参数竞赛没有结束,只是换了规则。2 万亿参数成为新门槛,但 MoE 架构让"总参数"与"推理成本"解耦,单纯堆参数不再是护城河;真正的区分度在于能否把大参数转化为长周期任务里的稳定交付。
第二,"比交付"正在重塑评测标准。16 天无人值守完成开源项目、破解十项数学难题这类案例,比单轮 benchmark 更能说明模型的上限。对开发者而言,选模型时除了看跑分,更应关注它在多步、长上下文、真实工具环境里的表现。
第三,开源与商业化的边界正在重新划定。开源权重扩大生态,付费 API 回收成本,峰谷定价、大客户收费等新玩法陆续出现。模型公司需要在"生态话语权"与"商业回报"之间找到新的平衡点。
最后提醒自己:榜单、参数、融资数字每天都在更新,真正值得长期跟踪的,是模型能否在越来越长的时间尺度上、越来越复杂的真实环境里,稳定地交付成果。这才是这轮竞赛的终局考题。
笔记
- 8 月第一周:OpenAI Astra(攻克十项数学难题)、DeepSeek-V4-Flash 正式版、阿里 Qwen3.8-Max(2.4 万亿参数/激活 95B)密集发布,中国头部模型集体跨过 2 万亿参数门槛,行业预测明年出现 5 万亿参数模型。
- Qwen3.8-Max 用 16 天无人干预完成 oh-my-cli 开源项目(265 commits),PaperBench 93.0、OSWorld-Verified 86.1 居首、CodeArena 全球第四;Astra 按 SolAPI 测算求解十题约耗 2000 美元 Token。
- 阿里宣布 Qwen-Max 首次开源权重(下周),另开源 27B 版本;同时媒体报道阿里计划向下一代 Qwen 大用户收费、DeepSeek 拟涨价,OpenAI GPT-5.6 Luna 则降价 80%。
- 截至 8 月 5 日"八周五连发":Qwen3.8-Max、Kimi K3、DeepSeek-V4-Flash、GLM-5.2、Seedance 2.5;Hugging Face 报告显示中国开源模型下载占比 41% 首超美国。
- 本周判断:参数竞赛规则已变(MoE 解耦总参数与成本);能力评价从"回答问题"转向"交付项目";开源与商业化边界重新划定。
(内容由AI生成,仅供参考)