Ox Alpha 揭面:智谱 GLM-5.3-Flash 如何用一周匿名登顶 OpenRouter
8月20日,一个代号 Ox Alpha 的匿名模型悄然上线 OpenRouter,一周内处理约 23.2 万亿 token 登顶使用量榜首,社区戏称它"牛来";8月26日晚智谱揭晓谜底——这是 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash(320B-A18B),并当晚开源权重。本文还原这场"模型侦探战",拆解混合注意力架构、1/10 定价与全栈国产芯片的算力故事。
一头来历不明的"牛"
8 月 26 日晚间,智谱向彭博社确认:过去一周匿名登顶 OpenRouter 使用量榜首的神秘模型 Ox Alpha,正是其 GLM 系列的新版本。腾讯新闻还原了这场持续近一周的"模型侦探战"——而官方代号背后的巧合也让中文社区会心一笑:Ox 英文意为"牛",恰逢电影《牛来》走红,"牛来大模型"的昵称就此出圈。
更关键的是,谜底揭晓当晚,智谱兑现了对开源社区的承诺,正式公开发布该模型权重。它的大名是 GLM-5.3-Flash(320B-A18B),GLM-5 系列的第一个原生多模态模型。官方博客在发布文章中毫不讳言:发布前,团队就是以 Ox Alpha 的匿名身份在 OpenCode 和 OpenRouter 上做用户反馈测试的。
一周吃掉 23.2 万亿 token
故事要从 8 月 20 日说起。OpenRouter 上线了一个标注为 "stealth model"(匿名模型)的推理服务,页面上没有任何开发者信息。规格却先声夺人:约 104.86 万 token 上下文窗口、单次最大输出 13.1 万 token,文本、图片、视频输入全支持,工具调用和结构化输出齐备——一次吞下整个代码仓库、完整项目文档和超长 Agent 运行记录都不成问题,恰好命中智能体工作流最刚需的三样东西。
真正引爆使用量的是免费。据腾讯新闻报道,上线当天,开源编程工具 OpenCode 宣布 Ox Alpha 一周内免费开放,额度"接近不限量",背后服务容量号称每天 100 万亿 token。敢把服务器成本押上桌赌口碑,结果就是六天内全球开发者用掉了数十万亿 token,模型冲上 OpenRouter 使用量榜首。
潮新闻给出的数据更具体:截至 8 月 25 日,Ox Alpha 在短短数天内处理了约 23.2 万亿 token,排名升至第一,是同期排在第二位的 DeepSeek 模型的两倍以上,直接刷新了该平台的单日模型用量纪录。全球数以万计的开发者,在零官方宣传的情况下成了它的"自来水"。
社区侦探:Tokenizer 指纹破案
在智谱认领之前,社区已经把答案挖得八九不离十。有人对 25 个提示词做了分词器(Tokenizer)指纹分析:把同样的文本喂给各家模型,统计 token 的切分方式,结果 Ox Alpha 的 token 数量与 GLM-5.3 几乎完全吻合;另有人通过底层报错码等线索,同样把指向锁定在智谱 GLM 系列。
这种"指纹破案"在模型圈并不新鲜——分词器训练数据、特殊 token 编号、报错文案都带有厂商烙印,几乎无法伪装。真正让这次事件与众不同的,是匿名发布的规模和速度:一个没有名字的模型,仅凭规格和免费策略,在没有任何品牌背书的情况下完成了一次全球范围的冷启动。
真身:GLM-5.3-Flash 的效率革命
GLM-5.3-Flash 不是小模型蒸馏的产物,而是一个全新训练的基座模型。据Hugging Face 模型页与官方博客披露,其核心变化有三:
- 稀疏与线性混合注意力:GLM 系列首次引入混合架构,关键信息用稀疏注意力保证精度,非关键上下文用线性注意力压低长上下文服务成本,同时保持精确的长上下文能力。
- 流形约束超连接(mHC):一种新的连接设计,进一步提升扩展效率。
- 30T token 多模态预训练语料:配合新架构与训练配方,用更少的算力换取更高的智能密度。
原生多模态是另一个定位变化:GLM-5.3-Flash 直接支持文本、图像与视频输入,是 GLM-5 系列中第一个把多模态能力内置到基座模型的版本,而不是靠外部视觉模块拼接。
性能与价格:逼近 Opus 4.8 的 1/40 成本
官方博客给出了可核验的性能锚点:在 Artificial Analysis Intelligence Index v4.1.1 上,GLM-5.3-Flash 得分 57,折扣后每任务成本约 0.045 美元——此前达到相近智能水平通常要付出约 10 倍成本。多家媒体报道(极客早知道)指出其综合指数与 Claude Opus 4.8 持平,编程表现亦与 Opus 4.8 相当。
编码与 Agent 基准上与上一代旗舰 GLM-5.2 的对比更为直观:
| 基准 | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
价格方面,GLM-5.3-Flash 定价约为 GLM-5.3 的 1/10,上线前两周执行半价优惠,限时折扣内约为 Opus 4.8 的 1/40,定位直接对标 DeepSeek V4 Flash 所在的轻量旗舰档位(凤凰网科技)。模型以 MIT 许可证开源,权重已上线 Hugging Face,允许二次开发与商业化落地。
全栈国产芯片的公开验证
这次发布最硬核的信息藏在官方博客的一句话里:匿名测试期间的全部流量,都由中国 AI 芯片承载。据凤凰网科技报道,GLM-5.3-Flash 线上推理服务依托超过 10 万张国产芯片的集群,兼容华为昇腾、海光、摩尔线程等多家国产算力硬件(智谱未公布具体型号,行业信息显示集群主要来自上述厂商)。
如果属实,这意味着 Ox Alpha 一周 23.2 万亿 token 的调用量,是在国产芯片集群上跑出来的——这是"国产大模型 + 国产算力"规模化落地的一次公开压力测试,也侧面回应了此前"国产芯片只能跑小模型"的质疑。其意义甚至超出模型本身:推理侧对海外 GPU 的依赖,正在被国产集群逐步替换。
匿名发布会成为新常态吗
把 Ox Alpha 事件放回更大的坐标里,它其实踩中了两个正在发生的趋势。
一是匿名发布(stealth launch)成为营销新玩法。过去厂商发布模型总是开发布会、发通稿,这次智谱选择先匿名上架、让开发者自己用脚投票,再用真实使用量反哺正式发布。相比 PR 造势,这种方式的信任成本更高,但一旦跑通,传播效果也更强——23.2 万亿 token 就是最好的发布会。
二是中国开源模型在全球调用量中的权重持续上升。OpenRouter 数据(潮新闻引用)显示,上周全球大模型总调用量达 93.3 万亿 token,中国大模型周调用量连续十七周超越美国;Ox Alpha 登顶榜首、智谱确认身份并当晚开源权重,让"中国厂商正在把最强模型直接交给全球开发者"的叙事又多了一个样本。
当然,也有一些问题值得冷静观察:23.2 万亿 token 的峰值流量包含大量免费额度,转化为付费留存的比例尚不可知;57 分的 Artificial Analysis 指数与"逼近 Opus 4.8"的描述之间仍有营销口径的弹性;国产芯片集群的具体型号、能耗与长期稳定性,也需要更长周期的第三方验证。匿名发布的喧嚣过后,真正要看的还是开发者愿不愿意为它持续付费。
(内容由AI生成,仅供参考)