边想边做的时代来了
七月最后一天,DeepSeek V3.2 打通思考与工具调用,Thinking Machines 用四分之一体量反超万亿大哥,国产算力规模翻三倍——模型正从「想得好」跨入「做得到」。
七月的最后一天,两件事撞在一起
今天是 7 月 31 日。早上打开新闻,两条消息并列出现在时间线上。
左边:DeepSeek V3.2 正式版发布,首个将思考融入工具调用的模型,Agent 评测开源最强。右边:Thinking Machines 发布 Inkling-Small,276B 总参数、12B 激活,四分之一体量反超 975B 的初代 Inkling。
两件事本质上在说同一句话,只是口音不同。
DeepSeek V3.2:思考不再是调工具的障碍
DeepSeek 这次更新的核心,不是 benchmark 分数——虽然 V3.2 在推理上达到了 GPT-5 水平——而是一个架构层面的突破:思考模式与工具调用不再互斥。
过往版本的限制很明确:开了思考模式,就不能调工具;关了思考,推理深度就降。开发者被迫在"想得深"和"做得快"之间二选一。这很像一个剑客——要么专心悟剑,要么拔剑出招,没法边打边悟。
V3.2 把这个限制拆掉了。技术实现上,团队提出了一套大规模 Agent 训练数据合成方法,构造了 1800+ 环境、85000+ 条复杂指令作为强化学习任务。核心思路很巧妙:只挑"难解答但易验证"的任务——模型可以反复尝试,系统能自动判定对错,不需要人工标注每一步。
在 Agent 评测中,V3.2 达到了开源模型的最高水平。而且值得注意的细节是:V3.2 没有针对这些评测集的工具做特殊训练。这意味着它在真实应用场景中的泛化能力,理论上比 benchmark 数字更强。
另外,Speciale 版本的成绩也值得记一笔:同时拿下 IMO 2025、CMO 2025、ICPC World Finals 2025、IOI 2025 四块金牌。ICPC 成绩达到人类第二名水平,IOI 达到第十名。不过这个版本仅供研究使用,不支持工具调用——它是纯粹的思维机器。
Inkling-Small:团队散了,模型快了
Thinking Machines 的剧情,任何一个编剧都不敢这么写。
去年 2 月,六位 OpenAI 出走的顶级研究者组建了这个梦之队——Mira Murati、John Schulman、Barret Zoph、翁荔、Andrew Tulloch、Luke Metz。20 亿美元种子轮,120 亿美元估值。
今年 1 月,500 亿美元估值的融资流产。转折开始了。
到现在,六位联创走了四个。Zoph、Metz、翁荔先后回归 OpenAI。更戏剧性的是——7 月 15 日沉默 17 个月后交出首个模型 Inkling,两周后翁荔官宣离职,三天后第二个模型上线。
人才在加速流失,模型在加速狂飙。这两条背道而驰的曲线,把 AI 行业的某种本质撕开了给人看。
再说模型本身。Inkling-Small 是 MoE 架构,总参数 2760 亿,单次推理只激活 120 亿。相比初代 Inkling(975B),体量缩到四分之一,性能反而超越了老大哥。
怎么做到的?官方把方法全公开了:
- 用初代 Inkling 做 on-policy 蒸馏,出一个 preview 检查点
- 从这个检查点跑了整整两周的智能体编码强化学习
两周。学生超过了老师。
这意味着 Thinking Machines 已经跑通了一条可复用的模型产线。第一个模型是作品,第二个模型是产能证明。
对开发者来说,真正的分水岭在 12B 激活参数。原版 Inkling 跑 BF16 需要 2TB 聚合显存——8 张 B300 或 16 张 H200。Inkling-Small 在 8 张 B200 上用 NVFP4 量化,开 DSpark 能到 648 tok/s。以前只有大厂能玩的模型定制,现在一个中等规模团队也够得着了。
两条曲线的交汇处
把 DeepSeek V3.2 和 Inkling-Small 放在一起看,能看出两条正在汇合的曲线。
| 曲线 | DeepSeek V3.2 | Inkling-Small |
|---|---|---|
| 核心突破 | 思考 + 工具调用一体化 | 小模型反超大模型 |
| 实现路径 | 大规模 Agent RL 数据合成 | On-policy 蒸馏 + Agent RL |
| 关键数字 | 1800+ 环境,85000+ 指令 | 276B 总参 / 12B 激活 |
| 对开发者的意义 | 模型能边想边做 | 小团队也用得起前沿模型 |
| 开源 | 全量权重 + 技术报告 | 全量权重 + 训练方法全公开 |
两条曲线的交汇点很明确:模型不再只是一个"想"的系统,它正在变成一个"想 + 做"的统一体。
大背景:国产算力也在加速
同一天,国家发改委在发布会上披露了几个数字:
- 首个全国产 10 万卡 AI 超集群正式投用
- 全国智能算力规模达到去年同期的 2.8 倍
- 国产大模型全球总下载量突破 100 亿次
- AI 相关行业保持 30% 以上 高增长
- 高质量数据集超过 12 万个
这些数字本身不出人意料——AI 行业的高增长已经持续了两年多。但"算力规模 2.8 倍"和"下载量 100 亿次"放在一起,说明国产 AI 的底座正在从"能用"走向"好用"。DeepSeek V3.2 在 Agent 评测上达到开源最强,不是凭空出来的——它站在一个正在快速扩张的算力和数据基础设施上。
关于"思考 + 工具调用"的几点感想
我个人觉得,DeepSeek V3.2 打通思考与工具调用这件事,意义比 benchmark 分数大得多。
过去两年,大模型的进化路径大致是这样的:先比参数规模,再比推理分数,再比多模态,再比 Agent。每一步都是在给模型加一个新能力模块。但 V3.2 的不同之处在于——它不是加了一个新模块,而是拆掉了一堵墙。
思考模式和工具调用不再互斥,意味着模型可以在执行任务的过程中随时停下来想,想清楚了再继续做。这和人解决问题的方式更接近了。
而 Inkling-Small 从另一个方向验证了同一件事:Agent 能力不是靠堆参数堆出来的。276B 比 975B 更强,靠的是两周的 Agent 强化学习。这说明 Agent 能力的瓶颈不在模型大小,在训练方法和数据质量。
两条消息一起看,结论很清晰:2026 年下半年的主旋律,不是"谁造出更强的模型",而是"谁的模型能真的把事情做成"。想得好是前提,做得到才是终局。
笔记
- DeepSeek V3.2 的思考 + 工具调用路线值得持续跟踪。这是 Agent 从"预规划"走向"实时推理 + 执行"的关键一步。
- Thinking Machines 的团队流失 vs 模型加速,是一个值得观察的反直觉现象。也许 AI 研发正在从"人海战术"走向"系统驱动"。
- 国产算力 2.8 倍增长 + 10 万卡超集群投用,意味着国产大模型的训练底座在质变。2027 年的格局会很有意思。
- Inkling-Small 的 12B 激活参数是一个信号:前沿模型的门槛在下沉。明年的 AI 创业,可能不需要 B 轮融资才能跑得动了。
(内容由AI生成,仅供参考)