GLM-5.3:基座没变,后训练如何把编程与安全能力一起拉满
8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。
收录标记为「大模型」的文章。
8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。
自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。
8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。
8 月 12 日,阿里云按预告开放 Qwen 3.8-Max 权重,2.4 万亿参数、激活 95B,采用 Apache 2.0 许可,同步上线 Hugging Face 与 ModelScope。一周前它在无人干预下连跑 16 天完成开源项目的纪录,如今变成任何人都能下载的权重文件。本文梳理这次开源的技术规格与生态影响,以及它如何改写开源模型的能力天花板。
自回归解码为什么慢?投机解码如何用"草稿-验证"把一次前向从产出 1 个 token 变成 3 到 6 个?从经典小模型草稿、Medusa 多头、EAGLE 特征级自回归,到 MoE 时代的专家散射问题与 2026 年的半自回归新方向,本文按技术代际拆解投机解码的底层机制与收益边界。
8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。
为什么 100 万 token 上下文的推理常常"显存先于算力告急"?从 MQA/GQA 的注意力头共享,到 DeepSeek MLA 的潜空间压缩,再到 PagedAttention 的分页管理与 KIVI 的低比特量化,本文按四条技术路线拆解 KV Cache 这一长上下文时代最硬的瓶颈。
MiniMax H3 全模态视频模型开源,DeepSeek V4-Flash 正式公测把单次推理成本压到 3 美分,OpenAI Astra 内部版本用 2000 美元算力破解十项数学难题——同一天,开源与闭源的路线之争迎来新的注脚。
OpenRouter 周调用量榜前五首次全部由中国模型包揽,DeepSeek-V4-Flash 登顶、腾讯混元 3 上榜;阿里发布 2.4 万亿参数 Qwen 3.8-Max,无人干预连跑 16 天完成一个开源项目;微软把 GitHub Copilot 默认模型换成自研 Polaris,彻底切断 OpenAI API——能力、生态、成本三条线同时改写的一周。
OpenAI 的下一代模型 Astra 用约 2000 美元推理成本攻克十项悬而未决至少十年的数学难题;Kimi K3 以 2.8 万亿参数开源重构产业链逻辑;慕尼黑法院裁定 Suno 侵权、欧盟 AI 透明度义务正式生效——能力、成本、规则三条线同时改写的周末。
收录标记为「大模型」的文章。
8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。
自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。
8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。
8 月 12 日,阿里云按预告开放 Qwen 3.8-Max 权重,2.4 万亿参数、激活 95B,采用 Apache 2.0 许可,同步上线 Hugging Face 与 ModelScope。一周前它在无人干预下连跑 16 天完成开源项目的纪录,如今变成任何人都能下载的权重文件。本文梳理这次开源的技术规格与生态影响,以及它如何改写开源模型的能力天花板。
自回归解码为什么慢?投机解码如何用"草稿-验证"把一次前向从产出 1 个 token 变成 3 到 6 个?从经典小模型草稿、Medusa 多头、EAGLE 特征级自回归,到 MoE 时代的专家散射问题与 2026 年的半自回归新方向,本文按技术代际拆解投机解码的底层机制与收益边界。
8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。
为什么 100 万 token 上下文的推理常常"显存先于算力告急"?从 MQA/GQA 的注意力头共享,到 DeepSeek MLA 的潜空间压缩,再到 PagedAttention 的分页管理与 KIVI 的低比特量化,本文按四条技术路线拆解 KV Cache 这一长上下文时代最硬的瓶颈。
MiniMax H3 全模态视频模型开源,DeepSeek V4-Flash 正式公测把单次推理成本压到 3 美分,OpenAI Astra 内部版本用 2000 美元算力破解十项数学难题——同一天,开源与闭源的路线之争迎来新的注脚。
OpenRouter 周调用量榜前五首次全部由中国模型包揽,DeepSeek-V4-Flash 登顶、腾讯混元 3 上榜;阿里发布 2.4 万亿参数 Qwen 3.8-Max,无人干预连跑 16 天完成一个开源项目;微软把 GitHub Copilot 默认模型换成自研 Polaris,彻底切断 OpenAI API——能力、生态、成本三条线同时改写的一周。
OpenAI 的下一代模型 Astra 用约 2000 美元推理成本攻克十项悬而未决至少十年的数学难题;Kimi K3 以 2.8 万亿参数开源重构产业链逻辑;慕尼黑法院裁定 Suno 侵权、欧盟 AI 透明度义务正式生效——能力、成本、规则三条线同时改写的周末。