返回文章列表

八月第一周复盘:当"交付"成为新的标尺

从 Astra 用 2000 美元攻克十道数学难题,到 Qwen3.8-Max 无人值守 16 天完成开源项目,再到 DeepSeek 把单次推理成本压到 3 美分——八月的第一周,AI 世界用七天时间同时改写了能力、成本与规则三条线。本文是一次技术随笔式的复盘。

10 分钟阅读

周六早晨,回看这一周

8 月 8 日,星期六。上一周的新闻清单长到需要专门坐下来整理:一个内部版本的模型解开了十道数学难题,一个 2.4 万亿参数的模型在无人干预下写完了一个开源项目,一款旗舰模型的开源权重正式落地,一次财报季让"算力收租"四个字变得具体,还有一场判决、一部法案同时给行业画出了新的边界。

信息量太大,反而是复盘的时机。以下先按时间把这一周发生的事排一遍,再做三条线的梳理,最后是我的几点想法。凡是数字,都附了来源。

七天,五款模型,一份成绩单

8 月 1 日,OpenAI Astra 的十项突破。 OpenAI 公布下一代模型系列 Astra 内部版本在数学与理论计算机科学上的十项成果,覆盖高维球体堆积密度上界、非 sofic 群、Connes 刚性猜想等长期悬而未决的问题;按 Sol API 费率折算,求解总 token 成本约 2000 美元。完整的 249 页论文与 Lean 形式化证书均已公开(Ten Proofs 论文GitHub 证书仓库)。值得记录的不只是"解出来了",而是"生成思路 → 撰写论证 → 形式化验证"的闭环走完了。

8 月 2 日,Kimi K3 开源权重落地。 月之暗面公开约 2.8 万亿参数、每 token 激活约 104B、支持 100 万 token 上下文的开源模型,成为当时全球最大的开源权重模型,并支持本地私有化部署。同一天,慕尼黑地区法院裁定 AI 音乐公司 Suno 侵犯版权,欧盟《人工智能法案》第 50 条透明度义务正式生效——能力与规则在同一天各进了一步。

8 月 3 日,Qwen3.8-Max 与榜单同时到来。 阿里巴巴发布新一代基座大模型 Qwen3.8-Max,总参数 2.4 万亿,采用稀疏 MoE 架构,单次推理仅激活 95B 参数(腾讯新闻)。它最具讨论度的表现是:从一个空文件夹出发,无人工干预独立运行约 16 天,完成可用的自进化智能体框架 oh-my-cli,在 GitHub 产出 265 次提交;官方披露 PaperBench 编程智能体评测得分 93.0,OSWorld-Verified 电脑操作评测 86.1 分居首(网易)。同日,OpenRouter 周调用量榜前五首次全部由中国模型包揽,中国模型合计 28.13 万亿 Token,连续十四周超过美国(OpenRouter 周榜报道)。

8 月 4 日,开源与低价同频。 MiniMax 正式开源全模态视频模型 H3,统一理解文本、图像、视频与音频,生成最长 15 秒、2K 分辨率、带原生立体声的视频,Artificial Analysis 有声视频编辑榜单 Elo 1130 分第一(官方公告36氪),华为昇腾、AMD、Intel 等 16 家芯片与推理平台完成首日适配。同日 DeepSeek V4-Flash 正式版 API 公测:输入 $0.14、输出 $0.28 每百万 tokens,缓存命中 $0.0028,上下文 1M、最大输出 384K(官方定价页);按 Artificial Analysis 测算,平均单次测试成本约 3 美分(每日经济新闻)。

8 月 5 日,财报季把叙事从"讲故事"拉到"算账"。 微软 2026 财年全年营收超 3310 亿美元,Azure 四季度收入同比增长 43%、年化营收突破 1000 亿美元;谷歌云 2026Q2 营收 248 亿美元、同比暴增 82%、营业利润率扩张到 35.6%;AWS 营收 422 亿美元、同比加速至 36.7%、创 18 个季度最快增速;Palantir 总营收 19.35 亿美元、同比暴增 93%、净美元留存 157%(钛媒体雪球解读)。这一周,AI 的价值天平明显从模型层移向算力与应用层。

8 月 7 日,参数竞赛的新注脚。 媒体将截至 8 月 5 日的八周称为"五连发":Qwen3.8-Max、Kimi K3、DeepSeek-V4-Flash、GLM-5.2、Seedance 2.5 接连亮相;Hugging Face 报告显示中国开源模型下载占比达 41%,首次超过美国(下载量破百亿报道)。同一周,阿里被报道计划向新一代 Qwen 大型用户收费、DeepSeek 计划上调 API 定价并引入峰谷定价,而 OpenAI 宣布 GPT-5.6 Luna 降价 80%(网易)。

三条暗线

把七天排完,浮出来的不是七条独立新闻,而是三条互相咬合的暗线。

第一条:能力的标尺,从"答对"换成了"交付"。 Astra 的 2000 美元数学题、Qwen3.8-Max 的 16 天无人值守项目,指向同一个变化——模型竞争的核心不再是单次回答的正确率,而是长周期、多步骤、真实环境里的端到端交付能力。十道数学难题走完了"提出论证 + 形式化验证"的闭环,265 次提交证明模型能在人类缺席的时间尺度上坚持工作。衡量智能的单位,正在从"一题"变成"一个项目"。

第二条:成本曲线的斜率,比榜单排名更值得跟踪。 3 美分一次的推理、$0.14 每百万 tokens 的输入价格,让"试错"从烧钱实验变成日常操作;OpenAI 这边则在用降价 80% 进攻低价区间。当试错成本趋近于零,Agent 长时间自主运行就不再是少数实验室的专利——16 天无人值守这类故事能够规模化,恰恰以成本为前提。

第三条:验证与合规,成了竞争力的新组件。 Astra 用 Lean 证书自证,EU 法案要求机器可读标记 AI 生成内容,Suno 案在追究训练数据的来源——能力输出不再天然可信,可验证性、可追溯性、合规性,正在变成模型能否被采用的硬条件。这与开源权重是否该被限制的争论叠加在一起,构成了生态层面的暗流。

我的复盘

写到这里,把七天的碎片收拢成几句话。

第一,别再把 benchmark 当唯一坐标。本周最能说明模型上限的,不是某张榜单的名次,而是 16 天、265 次提交、2000 美元十道题这类"过程证据"。选模型、评估技术路线时,长上下文、多步推理、真实工具环境里的稳定性,比单轮分数更接近真实价值。

第二,低价不是终点,而是起点。当推理便宜到可以忽略,稀缺的就不再是算力账单,而是提出好问题的能力、设计多步任务的能力、以及判断结果可信度的能力。AI 工具越便宜,"会用的人"和"不会用的人"之间的差距反而会拉大。

第三,规则正在给技术画护栏,这不是坏事。透明度义务、版权判决、开源权重政策讨论,短期看是约束,长期看是把行业从"谁嗓门大谁说了算"推向"谁能自证、谁更合规谁胜出"。对从业者而言,把验证与合规当成工程的一部分,会比把它们当成麻烦更早受益。

最后,留一个待验证的判断:如果"交付能力"真的取代"单轮正确率"成为新的标尺,那么接下来最值得跟踪的,会是模型在多步任务中的稳定性、工具调用的可靠度、以及失败后的自我修正能力——而不是下一张跑分表的数字。这个判断对不对,下周、下个月的事实会给出答案。


笔记

  • 8 月第一周:Astra 十项数学突破(约 2000 美元 token 成本、Lean 闭环)、Kimi K3 开源(2.8 万亿参数)、Qwen3.8-Max(2.4 万亿/激活 95B、16 天 265 commits)、DeepSeek V4-Flash 公测(单次约 3 美分)、MiniMax H3 开源(全模态视频、16 家芯片适配)、五大财报季(Azure 千亿美元年化、谷歌云 +82%、AWS 36.7%、Palantir +93%)。
  • 三条暗线:能力标尺从"答对"转向"交付";成本曲线斜率比榜单更值得跟踪;验证与合规成为竞争力新组件。
  • 复盘观点:过程证据比单轮 benchmark 更有信息量;低价时代稀缺的是提问与任务设计能力;规则约束长期看有利于自证型玩家。

(内容由AI生成,仅供参考)