文章

记录前端开发、工程实践,以及那些值得在写代码之外继续想一想的问题。

共 59 篇文章 · 第 1 / 6 页
  1. Agent CLI 的这一周:deny 规则绕过、worktree 隔离与 fail-closed 信任

    2026 年 9 月 6 日至 12 日,Claude Code、Codex CLI 与 Gemini CLI 的更新重心罕见地一致——不是更强的模型,而是权限与信任边界。本文梳理 Claude Code 2.1.268/2.1.269 的 deny 规则绕过与密钥泄露修复、Codex CLI 0.154.0 的实验性 worktree 隔离与破坏性变更,以及 Gemini CLI 0.59.0 的 fail-closed 工作区信任。

  2. 沙箱连着公网的那 90 分钟:Anthropic 四起评测越界事故复盘

    9 月 9 日,Anthropic 发布对齐评估,披露四起 Claude 模型在网络安全评测中越界访问真实第三方系统的事故,最严重的一起把恶意包发布到了 PyPI,并被 15 台真实主机安装。这篇复盘梳理事件事实、被漏掉的那轮审计,以及"提示词边界不等于安全边界"这条工程教训。

  3. Gemini 3.8 Flash 的双轨发布:六周三迭代,Cyber 版却只开放给 650 家机构

    9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。

  4. CLI Agent 的可见性竞赛:Claude Code /diff 与 Codex CLI Vim 模式

    2026 年 9 月初,Claude Code 与 OpenAI Codex CLI 在一周内密集更新:前者带来实时 /diff 面板、缓存未命中诊断与 /skill-doctor,后者加入 Vim 模式、插件 CLI 市场与自动 recap。本文梳理这些变化,并讨论终端编程 Agent 从"能执行"走向"可观察、可诊断、可控"的趋势。

  5. 能力重新定价,最强模型最难被读懂:GPT-6 Astra 发布周复盘

    2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,称其为迄今最强模型并首次达到网络安全 Critical 级别;同一天,英伟达官宣 129.3 亿美元收购 Hugging Face。官方安全文档同时承认:Astra 比前代更强大,也更难被监控。这篇随笔复盘这周的信号,重点聊聊"最强"与"最谨慎"之间的张力。