#大模型

收录标记为「大模型」的文章。

当前筛选已生效清除筛选
找到 24 篇文章 · 第 2 / 3 页
  1. GLM-5.3:基座没变,后训练如何把编程与安全能力一起拉满

    8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。

  2. 扩散语言模型:让大模型从"逐字打字"变成"整段雕刻"

    自回归模型为什么慢?扩散语言模型如何把生成从"逐字串行"改成"整段并行"?2026 年 8 月,谷歌 DeepMind 的 DiffusionGemma 用两阶段微调把 Gemma 4 改造成扩散模型,单张 H100 每秒生成约 1500 词;人大高瓴与蚂蚁集团的 LLaDA MoE v2 则首次系统刻画了扩散模型的扩展定律。本文拆解掩码去噪、多项式扩散、双向注意力与两阶段训练的底层机制,并对比两条规模化路线的取舍。

  3. DeepSeek 的"执行层"一跃:V4-Pro 正式版与 Harness 开源

    8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。

  4. Qwen 3.8-Max 开源落地:2.4 万亿参数的"长程自主"走进开发者手里

    8 月 12 日,阿里云按预告开放 Qwen 3.8-Max 权重,2.4 万亿参数、激活 95B,采用 Apache 2.0 许可,同步上线 Hugging Face 与 ModelScope。一周前它在无人干预下连跑 16 天完成开源项目的纪录,如今变成任何人都能下载的权重文件。本文梳理这次开源的技术规格与生态影响,以及它如何改写开源模型的能力天花板。

  5. 2 万亿参数时代:大模型竞赛从"比单点"走向"比交付"

    8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。