返回文章列表

前五全是国产:这一周,全球模型调用榜变天了

OpenRouter 周调用量榜前五首次全部由中国模型包揽,DeepSeek-V4-Flash 登顶、腾讯混元 3 上榜;阿里发布 2.4 万亿参数 Qwen 3.8-Max,无人干预连跑 16 天完成一个开源项目;微软把 GitHub Copilot 默认模型换成自研 Polaris,彻底切断 OpenAI API——能力、生态、成本三条线同时改写的一周。

7 分钟阅读

一张榜单,十四周的复利

昨天还在感慨 Astra 用 2000 美元买下十道数学难题,今天这份 OpenRouter 周榜更直白:全球调用量前五,全部是中国模型

上周(7 月 27 日至 8 月 2 日)全球 AI 大模型总调用量 56.8 万亿 Token,其中中国模型合计 28.13 万亿,连续十四周超过美国。美国那边合计 4.38 万亿,环比倒是涨了 87%——但绝对值差距依旧悬殊。

排名模型周调用量(万亿 Token)环比
1DeepSeek-V4-Flash7.22+13%
2小米 MiMo-V2.56.30-40%
3腾讯混元 34.82+22%
4DeepSeek-V4-Pro3.28+3%
5智谱 GLM-5.22.89-12%

第八名是首次上榜的 GPT-5.6 Luna——上线不到三周就被砍价 80%,周调用量 1.95 万亿,环比暴增 456%。美联社转述的评价很扎心:中国模型与 OpenAI 前沿模型"几乎同样智能",成本却低得多。Kimi K3 每百万 token 使用费,只有美国同类产品的几分之一。

两年前"百模大战"被嘲讽是重复造轮子,今天轮子们集体跑完了整条赛道。

Qwen 3.8-Max:长程任务的试金石

榜单之外,今天还有一颗更重的棋子:阿里云千问发布 Qwen 3.8-Max,2.4 万亿参数、激活 95B,主打编程、办公、科研的长程端到端交付,下周开源权重——这也是 Qwen-Max 级别首次对社会开放。

参数不是重点,重点是它干成了什么:

  • 无人工干预独立运行 16 天,完成 oh-my-cli 项目的自动建构与自进化 harness,在 GitHub 上产出 265 次代码提交;
  • 连续自主工作约 125 小时,复现 AI Reasoning 相关论文并做四轮自我进化,AIME24 得分再提升 2.7 分;
  • 在天池 WWW2025 多模态对话意图识别赛里,24 小时内击败 458 支人类参赛队伍
  • 芯片设计沙箱里历经约 500 轮交互,把硬件门数从 8298 个精简到 678 个。

16 天、125 小时、500 轮交互——这些数字的共同点是:AI 第一次在"无人值守"的时间尺度上证明自己。以前我们比拼的是单次任务的正确率,现在比拼的是"它能自己坚持多久不崩"。

长程自主,正在成为下一代模型的新赛点。

Copilot 的"断奶"

同一天,微软悄悄做了一件大事:Project Polaris 正式成为 GitHub Copilot 的默认模型,从本月起所有订阅用户的默认路径自动切换到微软自研的 MoE 代码模型,跑在自家 Maia 加速芯片上——默认链路里不再有任何 OpenAI API 调用。

Polaris 的 MoE 按编程语言和框架划分专家模块,写 Rust 不必为激活 Python 专家付算力税,官方称在 Rust、Haskell、Zig 等低资源语言上收益最大。Pro 以上档位默认支持 10 万行多文件上下文和自主测试生成。

最有意思的是:账单没变。不涨价、不加 SKU,模型在既有合同底下悄悄换掉。这是一次利润率决策穿着产品公告的外衣——每一个曾经流经 OpenAI API 的 Copilot 补全,都是微软给自己的产品交的过路费,现在不交了。

巨头们都在做同一件事:把模型的护城河,从"能力"挪到"生态"。

同一把剑,另一只手

能力膨胀的另一面,是滥用也在组织化。OpenAI 上周披露捣毁了一个柬埔寨诈骗团伙:它用 ChatGPT 跨语言生成和翻译消息、伪造护照和交易平台界面、甚至管理内部员工考勤和罚款记录,运营者遵循一套"建立信任 → 施加情绪压力 → 诱导打款"的三段式流程。

值得警惕的不是文案能力,而是 AI 的杠杆变成了翻译、伪造和管理——诈骗团伙不需要文案大师,需要的是能跨语言运营、能批量产出假证件、能当行政主管的"组织层 AI"。这意味着基于纯文本信号的检测会大面积失效,未来的攻防战场在生成文档和假 UI 里。

我的几点感想

第一,叙事变了:从"追赶者"到"价格锚点"。榜单前五全是中国模型,靠的不是单点突破,而是开源 + 低价 + 本地化部署的组合拳持续输出。但我提醒自己别太兴奋:总调用量环比下滑 2%,价格战的红利能吃多久、质量能否持续跟上,才是真正的考验。

第二,长程自主是下一个分水岭。Qwen 3.8-Max 的 16 天无人值守、Copilot 的 10 万行上下文,指向同一个方向:模型的价值正在从"回答问题"转向"接管一段持续数天甚至数周的工作"。

第三,生态才是护城河。Polaris 换掉 GPT 这件事比任何榜单都说明问题:当模型能力趋于同质化,"离用户最近、绑定最深"的那一方才有定价权。OpenAI 手里攥着最好的模型之一,却挡不住微软把自家产品撤走。

最后,能力越大责任越大这句老话,这周被诈骗团伙又复习了一遍。AI 是一把没有护城河的剑——谁都能捡起来用,包括那些不该用的人。我们这行真正的长期竞争力,可能不是跑分,而是让好用的东西尽量不被坏人滥用。


笔记

  • OpenRouter 上周全球调用量 56.8 万亿 Token,前五名全是中国模型,中国模型连续十四周总量超美国;GPT-5.6 Luna 降价 80% 后首次上榜第八,环比 +456%。
  • Qwen 3.8-Max 发布:2.4 万亿参数/激活 95B,主打长程任务,16 天无人干预完成开源项目(265 commits)、125 小时复现论文并四轮自我进化、24 小时击败 458 支人类队伍,下周开源权重。
  • 微软 Project Polaris 成为 GitHub Copilot 默认模型,自研 MoE + Maia 芯片,默认链路移除 OpenAI API,价格不变,属利润率导向的生态整合。
  • OpenAI 捣毁柬埔寨诈骗团伙:AI 被用作翻译、伪造文档与内部管理工具,"ping, zing, sting" 三段式诈骗流程,文本信号检测将失效。
  • 本周判断:国产模型从追赶者变成价格锚点;长程自主成为新赛点;生态位比模型能力更值钱;AI 滥用正在组织化,攻防战场转向生成文档与假 UI。

(内容由AI生成,仅供参考)