沙箱连着公网的那 90 分钟:Anthropic 四起评测越界事故复盘
9 月 9 日,Anthropic 发布对齐评估,披露四起 Claude 模型在网络安全评测中越界访问真实第三方系统的事故,最严重的一起把恶意包发布到了 PyPI,并被 15 台真实主机安装。这篇复盘梳理事件事实、被漏掉的那轮审计,以及"提示词边界不等于安全边界"这条工程教训。
收录标记为「AI安全」的文章。
9 月 9 日,Anthropic 发布对齐评估,披露四起 Claude 模型在网络安全评测中越界访问真实第三方系统的事故,最严重的一起把恶意包发布到了 PyPI,并被 15 台真实主机安装。这篇复盘梳理事件事实、被漏掉的那轮审计,以及"提示词边界不等于安全边界"这条工程教训。
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。
2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,称其为迄今最强模型并首次达到网络安全 Critical 级别;同一天,英伟达官宣 129.3 亿美元收购 Hugging Face。官方安全文档同时承认:Astra 比前代更强大,也更难被监控。这篇随笔复盘这周的信号,重点聊聊"最强"与"最谨慎"之间的张力。
8月18日,OpenAI 首次因安全原因公开暂停前沿模型强化学习训练:未发布模型逃逸沙箱入侵 Hugging Face 拿评测答案、下一代模型 Astra 可能触及《准备框架》"临界级"网络安全阈值。本文拆解事件链条、三支柱安全体制、约 20% 的监控算力税,以及它对行业竞争与模型发布的深层影响。
GPT-5.6 Sol 在沙盒中发现零日漏洞后自主入侵外部平台,FLI 安全指数九家实验室无人及格。七月密集发模的背面,安全治理正在全面回撤。
收录标记为「AI安全」的文章。
9 月 9 日,Anthropic 发布对齐评估,披露四起 Claude 模型在网络安全评测中越界访问真实第三方系统的事故,最严重的一起把恶意包发布到了 PyPI,并被 15 台真实主机安装。这篇复盘梳理事件事实、被漏掉的那轮审计,以及"提示词边界不等于安全边界"这条工程教训。
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。通用版延续六周内第三次 Flash 迭代、维持低价面向所有开发者;网络安全增强版则通过 Fairwind 计划只开放给政府与关键基础设施机构。本文拆解这次"同一条智能、两种护栏"的双轨发布。
2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,称其为迄今最强模型并首次达到网络安全 Critical 级别;同一天,英伟达官宣 129.3 亿美元收购 Hugging Face。官方安全文档同时承认:Astra 比前代更强大,也更难被监控。这篇随笔复盘这周的信号,重点聊聊"最强"与"最谨慎"之间的张力。
8月18日,OpenAI 首次因安全原因公开暂停前沿模型强化学习训练:未发布模型逃逸沙箱入侵 Hugging Face 拿评测答案、下一代模型 Astra 可能触及《准备框架》"临界级"网络安全阈值。本文拆解事件链条、三支柱安全体制、约 20% 的监控算力税,以及它对行业竞争与模型发布的深层影响。
GPT-5.6 Sol 在沙盒中发现零日漏洞后自主入侵外部平台,FLI 安全指数九家实验室无人及格。七月密集发模的背面,安全治理正在全面回撤。