CLI Agent 的可见性竞赛:Claude Code /diff 与 Codex CLI Vim 模式
2026 年 9 月初,Claude Code 与 OpenAI Codex CLI 在一周内密集更新:前者带来实时 /diff 面板、缓存未命中诊断与 /skill-doctor,后者加入 Vim 模式、插件 CLI 市场与自动 recap。本文梳理这些变化,并讨论终端编程 Agent 从"能执行"走向"可观察、可诊断、可控"的趋势。
终端 Agent 的下半场:先让开发者看见它在做什么
2026 年 9 月 3 日至 4 日,Anthropic 连续推送 Claude Code 2.1.260 与 2.1.261;9 月 3 日,OpenAI 发布 Codex CLI 0.153.0。两周前还在比拼"哪个模型写代码更强"的两家厂商,这轮更新的重心出奇一致:让开发者看清 Agent 正在做什么、为什么这么做、以及技能和上下文都花在了哪里。
如果把 2026 年上半年定义为 AI 编程 Agent 的"能执行"阶段,那么 9 月初这批更新标志着它进入"可观察"阶段——模型能力差异逐渐收敛后,工具竞争的焦点转向会话内可见性、诊断能力和人为控制点。本文基于两份官方 Changelog 及相关报道梳理这些变化。
Claude Code:把会话变成可审计的工作台
Claude Code 的 2.1.260 版本(9 月 3 日)与 2.1.261(9 月 4 日)都围绕"会话可见性"展开,按官方 Changelog 的说法,其重点是让开发者看到 Agent 会话实际在做什么。
/diff:实时并排查看未提交变更
2.1.260 引入 /diff 命令,在全屏模式下打开并排面板,随 Claude 编辑文件实时显示未提交变更。过去开发者需要中途切出会话执行 git diff 才能确认改动,现在可以在对话旁持续观察改动累积,无需反复切换上下文。
缓存未命中诊断:解释成本而不是只报数字
同一版本把 prompt-cache miss 的原因提示加入 /cost 与状态栏。此前用户只能看到缓存命中率偏低,现在工具会给出可能原因,例如工具定义发生变化、会话空闲超过缓存 TTL、上下文超过缓存限制等。对运行长会话、大规模项目的开发者,缓存命中率直接影响每 token 成本,能定位"为什么没命中"比只看到数字更有价值。
/skill-doctor:找出被加载却没用上的技能
2.1.261 新增 /skill-doctor 诊断命令,报告会话中哪些已加载技能未被使用,以及它们消耗了多少上下文预算。项目越大、.claude/skills 目录越臃肿,这个问题越突出——每个加载的 skill 都占用上下文窗口,/skill-doctor 相当于给开发者一个"技能瘦身"依据。
同一周期的其他变化
围绕可见性与管理控制,2.1.257 至 2.1.259 也有多项更新:2.1.257 将 Claude Fable 5.1 设为 Fable 档默认模型,提供 100 万 token 上下文窗口,价格为每百万输入/输出 token 10/50 美元、缓存读取每百万 0.25 美元,并新增可配置的 timeFormat/timeZone;2.1.259 增加 managedMcpServers 设置,让组织集中为开发者配置 HTTP/SSE 类型 MCP 服务器,并提供 --permission-prompts none 标志用于无头主机无人值守运行。这些更新共同把"单个开发者终端里的 Agent"推向"组织可管理的基础设施"。
Codex CLI:把终端编辑器体验与插件生态带进 Agent
OpenAI Codex CLI 在 8 月底至 9 月初同样连续发布三个版本,按照官方 Changelog 的记录,0.153.0(9 月 3 日)是近期较大的更新。
Vim 风格编辑与搜索
0.153.0 为偏好模态编辑的开发者加入 Vim 风格的 undo/redo 支持;此前的 0.152.0(9 月 1 日)已经加入 Vim 风格的 / 与 ? 搜索。终端 UI 向编辑器习惯靠拢,降低了 Vim 用户在 CLI Agent 中的操作摩擦。
插件 CLI 市场与自动 recap
0.153.0 引入插件 CLI 市场支持,第三方 Codex 插件可以直接从命令行发现和安装,不再需要手工配置。同一版本加入可配置的自动 recap——按设定间隔总结会话进展;增强终端历史显示;并为 Plus 与 Team 订阅者提供早期限流警告,在触达硬上限前提前提示。
更早版本的铺垫
0.152.0 还带来更丰富的限流提示条(含可操作建议)、终端内可见的凭据刷新进度,以及 MCP 服务器的包式命名;0.151.0(8 月 29 日)为可选 MCP 工具发现增加可配置宽限期,并允许扩展在结果返回模型前检查或修改 MCP 工具调用结果。从"能不能调用工具"到"调用结果如何被观察和控制",Codex CLI 的更新路径同样清晰。
三条共同主线
把两家工具放在一起看,9 月初的更新可以归纳为三条主线:
- 过程可见:Claude Code 的
/diff面板、Codex CLI 的自动 recap 与终端历史增强,都在回答同一个问题——Agent 执行过程中到底改了什么、进行到哪一步。可观察性是信任的前提。 - 成本可诊断:Claude Code 给缓存未命中提供原因解释,Codex CLI 给限流提供提前预警。当 AI 编程从"试用"进入"持续付费使用",成本不确定是团队采用的主要顾虑,工具开始主动解释成本来源。
- 控制可管理:Claude Code 的
managedMcpServers、--permission-prompts none与 Codex CLI 的插件市场权限模型,说明开发者与组织需要更多治理抓手,而不只是更强的模型。
对个人开发者而言,/diff 与 Vim 模式这类功能降低了"盯住 Agent"的成本;对团队与组织而言,MCP 集中配置、限流预警与技能诊断则是把 Agent 接入正式工作流的前提。AI 编程工具的下一个竞争维度,可能不再是"谁能一次写完更多代码",而是"谁能让开发者更省力地确认这些代码是对的"。
(内容由AI生成,仅供参考)