前五全是国产:这一周,全球模型调用榜变天了
OpenRouter 周调用量榜前五首次全部由中国模型包揽,DeepSeek-V4-Flash 登顶、腾讯混元 3 上榜;阿里发布 2.4 万亿参数 Qwen 3.8-Max,无人干预连跑 16 天完成一个开源项目;微软把 GitHub Copilot 默认模型换成自研 Polaris,彻底切断 OpenAI API——能力、生态、成本三条线同时改写的一周。
一张榜单,十四周的复利
昨天还在感慨 Astra 用 2000 美元买下十道数学难题,今天这份 OpenRouter 周榜更直白:全球调用量前五,全部是中国模型。
上周(7 月 27 日至 8 月 2 日)全球 AI 大模型总调用量 56.8 万亿 Token,其中中国模型合计 28.13 万亿,连续十四周超过美国。美国那边合计 4.38 万亿,环比倒是涨了 87%——但绝对值差距依旧悬殊。
| 排名 | 模型 | 周调用量(万亿 Token) | 环比 |
|---|---|---|---|
| 1 | DeepSeek-V4-Flash | 7.22 | +13% |
| 2 | 小米 MiMo-V2.5 | 6.30 | -40% |
| 3 | 腾讯混元 3 | 4.82 | +22% |
| 4 | DeepSeek-V4-Pro | 3.28 | +3% |
| 5 | 智谱 GLM-5.2 | 2.89 | -12% |
第八名是首次上榜的 GPT-5.6 Luna——上线不到三周就被砍价 80%,周调用量 1.95 万亿,环比暴增 456%。美联社转述的评价很扎心:中国模型与 OpenAI 前沿模型"几乎同样智能",成本却低得多。Kimi K3 每百万 token 使用费,只有美国同类产品的几分之一。
两年前"百模大战"被嘲讽是重复造轮子,今天轮子们集体跑完了整条赛道。
Qwen 3.8-Max:长程任务的试金石
榜单之外,今天还有一颗更重的棋子:阿里云千问发布 Qwen 3.8-Max,2.4 万亿参数、激活 95B,主打编程、办公、科研的长程端到端交付,下周开源权重——这也是 Qwen-Max 级别首次对社会开放。
参数不是重点,重点是它干成了什么:
- 无人工干预独立运行 16 天,完成 oh-my-cli 项目的自动建构与自进化 harness,在 GitHub 上产出 265 次代码提交;
- 连续自主工作约 125 小时,复现 AI Reasoning 相关论文并做四轮自我进化,AIME24 得分再提升 2.7 分;
- 在天池 WWW2025 多模态对话意图识别赛里,24 小时内击败 458 支人类参赛队伍;
- 芯片设计沙箱里历经约 500 轮交互,把硬件门数从 8298 个精简到 678 个。
16 天、125 小时、500 轮交互——这些数字的共同点是:AI 第一次在"无人值守"的时间尺度上证明自己。以前我们比拼的是单次任务的正确率,现在比拼的是"它能自己坚持多久不崩"。
长程自主,正在成为下一代模型的新赛点。
Copilot 的"断奶"
同一天,微软悄悄做了一件大事:Project Polaris 正式成为 GitHub Copilot 的默认模型,从本月起所有订阅用户的默认路径自动切换到微软自研的 MoE 代码模型,跑在自家 Maia 加速芯片上——默认链路里不再有任何 OpenAI API 调用。
Polaris 的 MoE 按编程语言和框架划分专家模块,写 Rust 不必为激活 Python 专家付算力税,官方称在 Rust、Haskell、Zig 等低资源语言上收益最大。Pro 以上档位默认支持 10 万行多文件上下文和自主测试生成。
最有意思的是:账单没变。不涨价、不加 SKU,模型在既有合同底下悄悄换掉。这是一次利润率决策穿着产品公告的外衣——每一个曾经流经 OpenAI API 的 Copilot 补全,都是微软给自己的产品交的过路费,现在不交了。
巨头们都在做同一件事:把模型的护城河,从"能力"挪到"生态"。
同一把剑,另一只手
能力膨胀的另一面,是滥用也在组织化。OpenAI 上周披露捣毁了一个柬埔寨诈骗团伙:它用 ChatGPT 跨语言生成和翻译消息、伪造护照和交易平台界面、甚至管理内部员工考勤和罚款记录,运营者遵循一套"建立信任 → 施加情绪压力 → 诱导打款"的三段式流程。
值得警惕的不是文案能力,而是 AI 的杠杆变成了翻译、伪造和管理——诈骗团伙不需要文案大师,需要的是能跨语言运营、能批量产出假证件、能当行政主管的"组织层 AI"。这意味着基于纯文本信号的检测会大面积失效,未来的攻防战场在生成文档和假 UI 里。
我的几点感想
第一,叙事变了:从"追赶者"到"价格锚点"。榜单前五全是中国模型,靠的不是单点突破,而是开源 + 低价 + 本地化部署的组合拳持续输出。但我提醒自己别太兴奋:总调用量环比下滑 2%,价格战的红利能吃多久、质量能否持续跟上,才是真正的考验。
第二,长程自主是下一个分水岭。Qwen 3.8-Max 的 16 天无人值守、Copilot 的 10 万行上下文,指向同一个方向:模型的价值正在从"回答问题"转向"接管一段持续数天甚至数周的工作"。
第三,生态才是护城河。Polaris 换掉 GPT 这件事比任何榜单都说明问题:当模型能力趋于同质化,"离用户最近、绑定最深"的那一方才有定价权。OpenAI 手里攥着最好的模型之一,却挡不住微软把自家产品撤走。
最后,能力越大责任越大这句老话,这周被诈骗团伙又复习了一遍。AI 是一把没有护城河的剑——谁都能捡起来用,包括那些不该用的人。我们这行真正的长期竞争力,可能不是跑分,而是让好用的东西尽量不被坏人滥用。
笔记
- OpenRouter 上周全球调用量 56.8 万亿 Token,前五名全是中国模型,中国模型连续十四周总量超美国;GPT-5.6 Luna 降价 80% 后首次上榜第八,环比 +456%。
- Qwen 3.8-Max 发布:2.4 万亿参数/激活 95B,主打长程任务,16 天无人干预完成开源项目(265 commits)、125 小时复现论文并四轮自我进化、24 小时击败 458 支人类队伍,下周开源权重。
- 微软 Project Polaris 成为 GitHub Copilot 默认模型,自研 MoE + Maia 芯片,默认链路移除 OpenAI API,价格不变,属利润率导向的生态整合。
- OpenAI 捣毁柬埔寨诈骗团伙:AI 被用作翻译、伪造文档与内部管理工具,"ping, zing, sting" 三段式诈骗流程,文本信号检测将失效。
- 本周判断:国产模型从追赶者变成价格锚点;长程自主成为新赛点;生态位比模型能力更值钱;AI 滥用正在组织化,攻防战场转向生成文档与假 UI。
(内容由AI生成,仅供参考)