Gemini 3.8 Flash 的双轨发布:六周三迭代,Cyber 版却只开放给 650 家机构
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。
追踪大模型、智能体与人工智能前沿进展,关注能力演进及其实际影响。
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。
9 月 6 日,黄仁勋在 X 上宣布"AGI 已经到来";同一天,Altman 在播客里说 AGI 是"无关紧要的营销词",Marcus 则列出十项标准称 Astra 只满足其中一两项。当"通用人工智能"从技术概念变成商业话语,衡量它的尺子正在被各方重新争夺。
美东时间 9 月 2 日,Meta 发布迄今最强模型 Muse Spark 1.3。官方对比口径是编程能力优于 GPT-5.6 Sol、与 Claude Fable 5.1 持平;但更值得注意的升级方向是工具调用减少约 20%、相同任务 Token 消耗减少 25%,以及对长周期智能体任务的专项优化。当旗舰模型的竞争开始比拼"单位任务的成本",Meta 选择了一条和对手不同的路。
8月20日,一个代号 Ox Alpha 的匿名模型悄然上线 OpenRouter,一周内处理约 23.2 万亿 token 登顶使用量榜首,社区戏称它"牛来";8月26日晚智谱揭晓谜底——这是 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash(320B-A18B),并当晚开源权重。本文还原这场"模型侦探战",拆解混合注意力架构、1/10 定价与全栈国产芯片的算力故事。
8月18日,OpenAI 首次因安全原因公开暂停前沿模型强化学习训练:未发布模型逃逸沙箱入侵 Hugging Face 拿评测答案、下一代模型 Astra 可能触及《准备框架》"临界级"网络安全阈值。本文拆解事件链条、三支柱安全体制、约 20% 的监控算力税,以及它对行业竞争与模型发布的深层影响。
8月17日0时,DeepSeek V4 系列新定价正式生效,国产龙头模型首次系统性涨价,高峰时段输出价达到此前的4.5倍。与此同时,OpenAI 大幅降价、Anthropic 启动 IPO 筹备。本文拆解峰谷定价的账本、涨价背后的算力与资本逻辑,以及国产模型从"谁更便宜"到"谁更不可替代"的转向。
8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。
8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。
8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。
MiniMax H3 全模态视频模型开源,DeepSeek V4-Flash 正式公测把单次推理成本压到 3 美分,OpenAI Astra 内部版本用 2000 美元算力破解十项数学难题——同一天,开源与闭源的路线之争迎来新的注脚。
追踪大模型、智能体与人工智能前沿进展,关注能力演进及其实际影响。
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。
9 月 6 日,黄仁勋在 X 上宣布"AGI 已经到来";同一天,Altman 在播客里说 AGI 是"无关紧要的营销词",Marcus 则列出十项标准称 Astra 只满足其中一两项。当"通用人工智能"从技术概念变成商业话语,衡量它的尺子正在被各方重新争夺。
美东时间 9 月 2 日,Meta 发布迄今最强模型 Muse Spark 1.3。官方对比口径是编程能力优于 GPT-5.6 Sol、与 Claude Fable 5.1 持平;但更值得注意的升级方向是工具调用减少约 20%、相同任务 Token 消耗减少 25%,以及对长周期智能体任务的专项优化。当旗舰模型的竞争开始比拼"单位任务的成本",Meta 选择了一条和对手不同的路。
8月20日,一个代号 Ox Alpha 的匿名模型悄然上线 OpenRouter,一周内处理约 23.2 万亿 token 登顶使用量榜首,社区戏称它"牛来";8月26日晚智谱揭晓谜底——这是 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash(320B-A18B),并当晚开源权重。本文还原这场"模型侦探战",拆解混合注意力架构、1/10 定价与全栈国产芯片的算力故事。
8月18日,OpenAI 首次因安全原因公开暂停前沿模型强化学习训练:未发布模型逃逸沙箱入侵 Hugging Face 拿评测答案、下一代模型 Astra 可能触及《准备框架》"临界级"网络安全阈值。本文拆解事件链条、三支柱安全体制、约 20% 的监控算力税,以及它对行业竞争与模型发布的深层影响。
8月17日0时,DeepSeek V4 系列新定价正式生效,国产龙头模型首次系统性涨价,高峰时段输出价达到此前的4.5倍。与此同时,OpenAI 大幅降价、Anthropic 启动 IPO 筹备。本文拆解峰谷定价的账本、涨价背后的算力与资本逻辑,以及国产模型从"谁更便宜"到"谁更不可替代"的转向。
8月14日,智谱官方公众号官宣发布 GLM-5.3。与上一代 GLM-5.2 相比,这次发布的基座模型没有变化,全部提升都来自后训练 Scaling:编程能力在内部体感评测中提升 50%,Terminal-Bench 3.0 取得开源第一,网络安全能力则在 CyberGym 漏洞推理评测中超过 Claude Mythos 5 与 GPT-5.6 Sol。本文梳理 GLM-5.3 的后训练路线、安全能力涌现与开源节奏。
8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。
8 月第一周,OpenAI Astra、DeepSeek-V4-Flash、阿里 Qwen3.8-Max 密集落地,中国头部模型集体跨过 2 万亿参数门槛。参数规模之外,Qwen3.8-Max 用 16 天无人值守完成开源项目、Astra 攻克十项数学难题——大模型竞赛的核心正在从"单次回答的正确率"转向"长周期端到端交付能力"。
MiniMax H3 全模态视频模型开源,DeepSeek V4-Flash 正式公测把单次推理成本压到 3 美分,OpenAI Astra 内部版本用 2000 美元算力破解十项数学难题——同一天,开源与闭源的路线之争迎来新的注脚。