返回文章列表

GLM-5.3:基座没变,后训练如何把编程与安全能力一起拉满

8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。

8 分钟阅读

一次"没有新基座"的发布

8月14日,智谱通过官方公众号官宣发布新一代基座模型 GLM-5.3。和惯例的"换更大底座、堆更多参数"不同,智谱这次特别强调了一点:GLM-5.3 与 GLM-5.2 共享完全相同的基座模型,总参数规模 7430 亿不变,本次所有能力提升都来自后训练(post-training)的极致 Scaling。

按照智谱的说法,这轮后训练投入了数十倍的长程任务环境、更丰富多样的环境类型,以及超长的后训练时间,并观察到"充分的模型后训练涌现出超出预期的模型能力"。换句话说,这次比的是同一块"课本"能用更好的训练方法教出多好的"学生",而不是换一本更厚的教材。

来源:央广网《智谱发布GLM-5.3 公司称是编程能力最强的开源模型》贝壳财经《智谱GLM-5.3发布,涌现网络安全能力》

后训练 Scaling:同一基座上的"能力上界"测试

后训练 Scaling 指的是模型预训练完成后,通过优化训练方法、提升数据质量、强化学习策略,让模型在特定任务上表现更优。GLM-5.3 的技术路线可以概括为三个关键词:

  • 更长的任务环境:用数十倍于前代的长程任务环境训练模型,让模型在需要多步推理、多轮工具调用的场景中积累经验。
  • SAO 异步强化学习:智谱自研的异步强化学习框架,通过异步化加速训练运行,让大规模 RL 训练在工程上变得可行。
  • 新一代 Slime 框架:与 IndexShare 数据基础设施配合,在相同基座上高效推进强化学习。

智谱在官方口径中显得相当克制而自信:"可能我们还远未开发出这个基座的智能上界。"这句话背后是一个值得注意的信号:当预训练基座本身已经足够大时,后训练正在成为决定模型能力上限的主战场。

来源:证券时报《智谱发布新一代模型!一个月内,国产三巨头完成关键版本迭代》央广网

编程能力:开源第一,体感评测提升 50%

编程一直是 GLM 系列的主打能力,GLM-5.3 这次把这条线进一步拉长。智谱官方给出的核心数据包括:

  • 在内部自建体感评测中,GLM-5.3 的编程能力较 GLM-5.2 提升 50%。
  • 在 Terminal-Bench 3.0、Agents' Last Exam(CLI)等公开基准测试中,取得开源模型第一。
  • Terminal-Bench 3.0 得分从 GLM-5.2 的 4.6 提升至 28.3,DeepSWE v1.1 得分从 46.2 提升至 66.9。

按照智谱"编程能力最强的开源模型"的定位,GLM-5.3 直接对标的是闭源第一梯队的编程体验。由于提升完全来自后训练,这也意味着:开源模型的编程能力竞争,已经从"谁的预训练数据更多、基座更大"转向"谁能把强化学习工程做得更细"。

来源:央广网IT之家/凤凰科技《智谱正式发布GLM-5.3》

安全能力的"意外涌现"

GLM-5.3 最受关注的点,是网络安全能力的突然冒头。智谱官方在发布时明确表示,安全能力的出现属于"意料之外"的涌现。

关键数据如下:

评测项GLM-5.3GLM-5.2Claude Mythos 5GPT-5.6 Sol
CyberGym 漏洞推理84.5%77.2%83.8%83.6%

在 CyberGym 漏洞推理评测中,GLM-5.3 从白盒源代码出发,通过触发程序故障来识别和验证漏洞,得分 84.5%,不仅明显高于 GLM-5.2 的 77.2%,也略高于 Claude Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。

更值得注意的是实战表现:在正式发布前两周,智谱联合国内安全团队展开密集测试评估,累计发现经初筛去重后的潜在漏洞 2404 个,其中 1088 个为中高危;最早被发现的漏洞可追溯至约 40 年前,部分漏洞存在于 Android、Windows、macOS 及各类常用 App 中。

智谱对这一涌现的解释很直接:"安全工作本质上是约束严格的编程能力。"团队从 2025 年 9 月开始在该方向投入研究,在 GLM-5.2 与 GLM-5.3 的研发过程中与国内多家头部安全实验室合作,构建了更专业化的评测与执行框架。而在 GLM-5.3 发布前,社区其实已有端倪:上个月 OpenAI 模型"越狱"攻击 Hugging Face 数据库事件中,Hugging Face 最终用来防御的正是开源的 GLM 模型。

来源:贝壳财经证券时报ChinaTechNews

开源节奏:先做安全评估,再放权重

GLM-5.3 另一个值得注意的点是它的开源节奏。智谱宣布将在发布两周后开放模型权重,前提是先完成安全评估与模型加固,"尽可能限制其潜在攻击能力,保留其防御价值"。

这与以往"发布即开源"的节奏不同。由于模型在漏洞挖掘上表现过强,智谱选择了先评估、后放权重的折中路径,本质上是在"能力开放"与"安全约束"之间做平衡。即日起,GLM-5.3 已上线智谱官方编程工具 ZCode、效率工具 AutoClaw,GLM Coding Plan 面向全量用户开放;TraeWork/TraeCode、扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验,API 随后上线。

来源:央广网贝壳财经

竞争焦点的转移

把 GLM-5.3 放回 8 月中旬这一周的开源模型浪潮里看,它的意义比单次发布更大。DeepSeek 开源 Harness 执行层、谷歌强化 Gemini 3.7 Flash 的编程与 Agent 能力、阿里 Qwen 家族继续扩张,而智谱选择在同一基座上靠后训练拉出 50% 的编程提升和一批安全能力——各家的技术路线不同,但目标一致:在"编程 + Agent"这条最有商业化确定性的赛道上卡位。

GLM-5.3 给出的答案是:当预训练基座竞争进入平台期,后训练 Scaling 才是拉开差距的变量。而安全能力作为"约束严格的编程能力"的涌现,也为开源模型的权重发布节奏提出了新的问题:能力越强的模型,越需要回答"如何在开放与安全之间选择时机"。

(内容由AI生成,仅供参考)