DeepSeek 的"执行层"一跃:V4-Pro 正式版与 Harness 开源
8月13日晚,DeepSeek 在官宣 V4-Pro 正式版全线上线、公布分时调价方案之后,紧接着开源了自研 Agent 运行框架 DeepSeek Harness。模型与执行层同日落地,意味着 DeepSeek 不再只做基础模型与 API,而是向 Claude Code、Codex 所在的 AI 编程执行层正面切入。本文梳理这次双发布的完整时间线、能力变化与行业含义。
一个晚上,两件大事
8月13日晚间,DeepSeek 完成了一次罕见的"模型 + 执行层"双发布:先官宣 V4-Pro 正式版在网页端、App 与 API 全线上线,并同步公布调价方案;一个多小时后,DeepSeek Harness(DSH)开发者预览版以 v0.1 名义面向全球开发者开放公测,并以 MIT 协议开源。
如果只看模型,这只是又一轮参数与评测的更新;但把 Harness 放在同一天发布,信号就完全不同了。正如多家媒体点评的那样,Harness 的意义不只是 DeepSeek 多了一个编程工具,而是它开始掌握"模型与真实工作环境之间的执行层"——也就是 Claude Code、Codex 们所在的战场。
来源:每经《DeepSeek开源首个智能体运行框架Harness,补齐Vibe Coding入口》、21世纪经济报道《AI疯狂星期四,DeepSeek-V4-Pro正式版波折上线》
48 小时:从静默上线到正式官宣
这次发布的完整时间线比结果本身更有信息量:
- 8月12日晚:DeepSeek API 文档中出现
DeepSeek-V4-Pro-0813,正式版静默上线。同一晚,xAI 发布 Grok 4.6,阿里开放 2.4 万亿参数 Qwen 3.8-Max 权重,被社区称为"三连发"。 - 8月13日凌晨:社区实测陆续出现异常反馈。本应进行长推理的 V4-Pro 思考时间经常不足十秒,长流程任务频繁提前收尾,部分场景表现甚至弱于 V4-Flash。有开发者用同一任务间隔几小时测试,结果差异悬殊,怀疑服务端进行过配置调整或版本切换。
- 8月13日白天:官网首页通知与开放平台公告一度撤回,API 文档中的版本名则一直保持
DeepSeek-V4-Pro-0813。 - 8月13日晚:DeepSeek 官宣 V4-Pro 正式版于网页端、App 及 API 全线上线,同步公布调价方案;一个多小时后,DSH 开发者预览版落地。
官方没有就凌晨时段的服务波动作出说明。这种"静默上线—社区反馈—撤回公告—正式官宣"的节奏,在头部模型厂商里并不常见,也说明长推理模型在生产环境的稳定性仍是一个需要反复打磨的环节。
来源:21世纪经济报道
V4-Pro 正式版:Agent 与长上下文是主线
从已披露的信息看,V4-Pro 正式版的主线是 Agent 能力与长上下文:
- 上下文与输出长度:支持 100 万 Token 上下文、38.4 万 Token 输出。
- 软件工程能力:DeepSWE 得分较前代暴涨近 5 倍。
- 定位变化:官方强调"增强 Agent 能力、生产环境性能显著提升",重心明显从单轮问答转向可长时间运行的智能体工作负载。
V4-Pro 的调价方案同日公布,于 8月17日 0 时生效,核心是引入分时定价:
| 计费项 | 高峰时段 | 相对现价 | 空闲时段 |
|---|---|---|---|
| 输出 | 27 元/百万 tokens | 4.5 倍 | 高峰的一半 |
| 缓存未命中 | 9 元/百万 tokens | 3 倍 | 高峰的一半 |
| 缓存命中 | 0.30 元/百万 tokens | 12 倍 | 高峰的一半 |
分时定价意味着 API 的经济模型从"统一低价"转向"削峰填谷":高峰时段执行长流程 Agent 任务的成本明显上升,缓存命中则被大幅提价——对依赖重复文件与长运行 Agent 工作流的团队,成本结构变化最直接。这也从侧面说明,长上下文与 Agent 化带来的推理成本压力,已经到达厂商必须用价格杠杆调节负载的阶段。
DeepSeek Harness:一个"一切皆插件"的 Agent 运行框架
如果说 V4-Pro 是能力的底牌,Harness 就是 DeepSeek 对"模型怎么用"给出的答案。
DSH 是一个 Agent 运行框架:它负责把大模型接入文件系统、终端、网页、代码工具以及其他智能体(agent),并承担上下文管理、工具调用和任务执行。模型可以借它直接进入代码库,完成查找文件、修改代码、运行测试、根据报错继续修正这样的连续任务。
它的核心设计是"一切皆插件":
- 模型、工具、沙箱、调度、UI 全部可替换:开发者通过配置重组合框架的每一个能力,而不是被厂商锁死在固定流程里。
- 多形态交互:支持 Web UI、TUI、Headless 三种模式,既能本地交互,也能无头嵌入到自动化流水线。
- 多 Agent 协作:内置多智能体协同能力,为复杂的并行任务提供基础。
- 可追溯性:每一次交互都会写入追加式(append-only)会话日志,提供"轨迹视图"(Trajectory view)展示 Agent 的推理与动作过程,方便调试与审计。
DSH 官方称其为"开发者预览版(v0.1)",团队负责人崔添翼通过"黑鲸"公众号发布公告,强调这是预览版本,欢迎开发者反馈。以预览版就开源、且直接以 MIT 协议放出,DeepSeek 显然希望用社区生态来加速框架成熟。
来源:每经、AI Toolly 产品记录
为什么说这是"执行层"竞争
过去一年,AI 编程领域的竞争焦点已经从"模型本身"迁移到"模型与代码库之间的执行层":Claude Code、OpenAI Codex、Gemini CLI 这类产品,比拼的不只是模型的代码能力,还有工具调用、长任务执行、错误恢复与开发者体验。
DeepSeek 此前的生态位是"基础模型 + API":模型很强,价格便宜,但如何把模型跑成 Agent 是开发者自己的事。Harness 的出现改变了这个格局——DeepSeek 开始自己提供执行层,并且用 MIT 开源的方式把标准交到社区手里。
配合 V4-Pro 正式版对 Agent 与编程能力的强化,这一套组合拳的意图很清楚:在"模型—执行层—开发者工作流"的链条里,DeepSeek 要从最底层一路做到最上面。
开源模型集体卷编程与 Agent
把视线拉远,8月中旬这一周,头部开源模型几乎不约而同地把火力集中在编程与 Agent 场景:
- 智谱 GLM-5.3(8月14日):基座未变,靠后训练 Scaling 提升,官方称编程能力为开源最强,DeepSWE v1.1 得分从 46.2 提升至 66.9,Terminal-Bench 3.0 从 4.6 提升至 28.3,并计划两周后开源权重。
- 谷歌 Gemini 3.7 Flash(8月13日):DeepSWE v1.1 从 49.0% 提升到 65.3%,FrontierCode 1.1 达到 43.6%,同时以半价首发。
- Grok 4.6(8月12日):官方称重点转向长时间运行的 AI 智能体。
多家模型在同一条赛道上密集迭代,说明"编程与 Agent 能力"已经被视为模型能力最直接、商业化路径最清晰的验证场。而 DeepSeek 的差异化在于:别人卷模型,它把执行层也一起开源了。
来源:IT之家/凤凰科技《智谱正式发布GLM-5.3》、AI Frontier Daily
小结
回看这 48 小时,DeepSeek 的动作可以概括为三件事:把 V4-Pro 从"静默上线"正式转正,用分时定价重新定义 API 经济模型,再用 Harness 开源补上执行层这块拼图。模型、价格、执行层三者同一天落地,是这家公司从"模型供应商"走向"Agent 基础设施提供者"的明确信号。
执行层的竞争才刚刚开始。DSH 作为预览版开源,后续的稳定性、生态与商业路径都还需要时间检验——但有一点已经确定:2026 年夏天的 AI 编程战场,又多了一个带着完整模型栈入场的玩家。
(内容由AI生成,仅供参考)