模型洪流的一个月
七月四家顶级 AI 实验室密集发模,性能差距收窄,竞争从「最强」转向「最值」。Claude Opus 5 以一半价格逼近 Fable 5,Gemini 3.6 Flash 把 Agent 效率当卖点——这个月没有颠覆,却比颠覆更有意思。
四家实验室,三周,一堆新模型
昨天那篇讲 Agent 协作,今天想回头看一个更基本的事实:这个七月,模型本身的更新密度是空前的。
从 7 月初到 7 月 25 日,xAI 发了 Grok 4.5,OpenAI 发了 GPT-5.6 系列,月之暗面如约开源了 Kimi K3,Google 一口气发了三款 Flash 模型,Anthropic 在 25 日压轴推出 Claude Opus 5。五家顶级实验室,密集到几乎可以按天排表。
这个节奏在 AI 历史上没有先例。不是某一个模型特别惊艳,而是一整批模型同时刷新了行业基线。当一个月的发布量抵得上过去半年的积累时,值得停下来想一想:这意味着什么。
模型的性能差距正在收窄
先把各家官方 benchmark 放一边——每个实验室都挑对自己有利的评测。用第三方评测机构 Artificial Analysis 的 Intelligence Index 看更客观:Claude Fable 5 排在最前,但 Kimi K3、GPT-5.6 Sol、Grok 4.5、Claude Opus 5 的分差已经远小于上一代产品之间的差距。GLM-5.2 和 Muse Spark 1.1 也在紧追。
这不是谁超过谁的问题,而是整体基线在抬升。以前是「一超多强」,现在是「群雄并起」。对用户来说,这是好事——选模型不再是非此即彼的单选题,而是可以根据场景、预算、延迟要求做选择题。
Claude Opus 5:一个新策略的成型
7 月 25 日 Anthropic 发布 Claude Opus 5,是这轮密集发布中最值得细看的。
先说冷冰冰的数字:输入 5 美元/百万 token,输出 25 美元/百万 token。和上代 Opus 4.8 持平。但性能呢?Frontier-Bench v0.1 登顶,ARC-AGI 3 得分是第二名模型的三倍,OSWorld 2.0 计算机使用评测中,用不到 Fable 5 三分之一的价格跑出了比 Fable 5 更好的成绩。
更有意思的是做法,不是参数。Anthropic 这次没有把 Opus 定位成「追赶 Fable」的产品,而是明确说:Opus 5 接近 Fable 5 的前沿智能,但价格只有一半。这不是谦虚,是一种新的产品哲学——不是造最强的模型,而是造「足够强且足够便宜」的模型。
这个策略在商业逻辑上非常聪明。Fable 5 再强,按 token 计费的模式决定了绝大多数日常任务不需要调用它。写代码、做分析、处理文档、跑 Agent 工作流——Opus 5 完全够用。而且 Opus 5 的非对齐行为得分仅 2.3,是近期主流模型中最低的。等于说:便宜、够强、还安全。
再看 Effort 调节机制。用户可以在 low / medium / high / xhigh / max 五档之间选择,用 token 量换智能深度。这和以前「一刀切」的推理模式完全不同——同一个模型,简单任务用 low 档快速出结果,复杂任务切到 max 仔细推敲。把推理成本的主动权交给用户,而不是让模型自行判断。
这条路线如果跑通,对行业格局的影响可能比 Fable 5 本身更大。因为大部分 AI 产品的付费逻辑,压舱石不是最贵的那一层,是中间层。
Google 的三箭齐发:Agent 效率当卖点
7 月 22 日 Google 发了三款 Flash 模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。
Gemini 3.6 Flash 的核心卖点是 Token 效率——完成同样任务,比 3.5 Flash 少花约 17% 的 output token。这在 Agent 工作流中价值很大。Agent 跑一次任务可能产生几十次 API 调用,每次省一点,累加起来就是真金白银。在 DeepSWE 测试中,输出 token 消耗最多减少了 65%。
Gemini 3.5 Flash-Lite 主打低延迟,生成速度每秒 350 个 output token。适合分类、抽取、文档处理这类高吞吐场景。
Gemini 3.5 Flash Cyber 是安全特化版,配合 CodeMender 做漏洞发现和修复,性能对标 Mythos 5 和 GPT-5.6 Sol。不过目前只对政府和信任伙伴开放。
Google 这三款模型的共同点很明显:不跟你拼 benchmark 最高分,跟你拼「跑得稳、跑得快、跑得便宜」。这和 Anthropic 的 Opus 5 策略是一个方向的两种打法。市场在说同一句话:前沿智能已经够用了,接下来比的是工程化和性价比。
再看 Google Q2 财报:云业务同比增 82%,Gemini Enterprise 渗透了接近 90% 的财富 100 强。单季资本开支 449 亿美元,同比翻倍,全年指引上调到 1950-2050 亿美元。Gemini 4 的预训练已经启动。不要被三款 Flash 模型的低调迷惑——Google 在 AI 上的投入规模是碾压级的。
CuspAI:AI 的另一条路
夹杂一条不在大模型主赛道上的消息:英国材料发现公司 CuspAI 完成 4.5 亿美元 B 轮融资,估值 26 亿美元。
它的核心产品 MIRA 平台,用 Meta UMA 系列模型做 AI 驱动的材料研发,把传统需要数年的周期压缩到六个月以内。同时发布了「AI Materials Foundry」全球网络计划,已吸引超过 45 家企业加盟。
这条新闻放在一堆大模型发布里,反而更显眼。它提示了一件事:大模型不是 AI 的全部。在生命科学、材料、药物发现这些领域,专用 AI 正在静悄悄地产生比通用模型更直接的经济价值。Anthropic 也在 Opus 5 的发布里特别强调了生命科学评测的进步——有机化学任务提升 10.2 个百分点,蛋白质功能预测提升 7.7 个百分点。
通用智能和专用智能不是对立关系,是互补关系。通用模型提供底座能力,专用模型在垂直场景里深耕。CuspAI 的 4.5 亿美元融资只是冰山一角。
这个月的主题不是「颠覆」
七月没有出现一个让所有人惊呼的颠覆性突破。没有 Sora 式的炸场,没有 GPT-4 式的代际跨越。
但这个月比任何单点突破都更有信号意义。当四家实验室在同一个窗口期内密集发模,当性能差距缩小到不再是核心话题,当竞争焦点从「跑分最高」转向「性价比最优」和「工程稳定性」,说明行业进入了新阶段。
这个阶段的特点是:AI 不再是一个需要证明自己「能不能」的话题,而是一个需要回答「怎么用、用在哪、花多少钱」的话题。这比「能不能」更难,但也更接近真实的产业落地。
从技术突破到工程落地,从跑分竞赛到成本优化,从「谁最强」到「谁最值」——七月没有颠覆,但七月标定了一条分水岭。
(内容由AI生成,仅供参考)