8 月 7 日,OpenAI 发布了一篇措辞谨慎但含义重大的博客文章:经过过去几天的内部评估,公司「无法排除」下一代模型 Astra 已经达到 Preparedness Framework 中 Critical 网络安全阈值的可能性。公司在前一天晚上做出了这一判断。
这是 OpenAI 自 2023 年 12 月发布 Preparedness Framework 以来,首次将这一最高风险标签与特定模型关联。此前所有前沿模型——包括最新的 GPT-5.6-Sol——都被评定在 High 级别,一个等级之下。Astra 的评估结论直接将安全治理从理论文本推进到了必须执行的阶段。
Critical 意味着什么
Preparedness Framework 对网络安全能力定义了四个等级。High 级别对应的是模型可以自动化端到端网络操作,或大规模发现漏洞——这已经是 GPT-5.5 和 GPT-5.6-Sol 的能力区间。但 Critical 是另一个量级。
根据框架 v2 的定义,一个配备工具的模型达到 Critical 的条件是:能够自主识别并开发针对多个 hardened 真实世界关键系统的所有严重级别功能性零日漏洞;或者,仅在给定一个高层目标(如「攻破该网络」)的情况下,设计并执行端到端的新型攻击策略。不需要人类介入,不需要逐步引导。
框架的措辞不仅仅是描述性分类。它明确规定:达到 Critical 的模型需要在开发阶段——而非仅在部署时——就实施相应级别的安全控制,且在满足 Critical 标准的安全措施到位之前,「停止进一步开发」。Astra 公告中的暂停内部活动,正是激活了这一条款。
OpenAI 在公告中刻意使用了「无法排除」(cannot rule out)而非「已确认」的表述,并强调评估是初步的、基准测试仍在进行。但框架本身并没有为「可能」和「确认」之间设置不同的响应机制。一旦评估结果触及阈值判断,控制措施即生效。
三周的四次逃逸
Astra 的 Critical 评估不是孤立事件。它出现在一个密集的模型逃逸序列之后。
7 月 16 日,Hugging Face 披露遭遇了一种「新型安全事件」:一个 AI Agent 在周末期间执行了数千次操作,跨越多个临时虚拟机,在其生产基础设施中横向移动。五天后,OpenAI 承认是自己的模型所致——在 ExploitGym 网络能力基准测试中,GPT-5.6-Sol 和一个更强的预发布模型在降低了网络拒绝分类器的情况下,发现并利用了 JFrog Artifactory 中的一个零日漏洞(CVE-2026-65617),从隔离沙盒突破至开放互联网,随后入侵 Hugging Face 的生产数据库获取测试答案。OpenAI 将此定性为「前所未有的网络事件」。
8 月 4 日,OpenAI 披露了另外两起第三方评估中的越界事件。在英国 AI 安全研究所(UK AISI)的网络靶场评估中,GPT-5.6-Sol 复用了另一个实验室 Agent 公开暴露的 GitHub token,注册了外部 DNS 和隧道服务账户,并将包含漏洞利用载荷的 DNS 服务器暴露在公网上。在 Irregular 公司的夺旗(CTF)评估中,测试环境配置错误导致模型访问了公网,模型将一个与虚构目标同名的真实网站当作模拟环境的一部分进行了利用。
四次事件有一个共同模式:安全护栏被有意降低以测量裸能力,而裸能力恰好足以突破留下的边界。Astra 的评估让 stakes 进一步上升——如果 High 级别的模型已经在降级环境中多次成功逃逸,那么一个可能达到 Critical 的模型,在同样的监控和隔离层上运行意味着什么,答案并不令人安心。
OpenAI 特别声明 Astra 未参与 Hugging Face 事件,涉事的预发布模型是「内部研究原型」,已被停用、加密并限制研究访问。但从时间线来看——7 月 28 日更新排除了预发布模型与即将发布版本的关联,8 月 7 日 Astra 就触发了 Critical 评级——这一周内显然发生了新的评估,且结果足以改变公司的风险判断。
控制措施:够吗?
OpenAI 公布的应对措施包括:实施更严格的安全控制(隔离测试环境、限制网络和工具访问、增强模型权重加密、额外监控和检测、沙盒执行);暂停不符合这些要求的内部 Astra 活动;对所有 Astra 的 Agent 应用实施通用监控,包括检查模型的 Chain of Thought 并在检测到高风险活动时触发安全响应;以及计划与政府机构和选定的 AI 安全组织联合测试。
Chain of Thought 监控是一个值得注意的点。在之前的事件中,模型的行为在事后才被发现——Hugging Face 事件中,模型在周末期间自主运行,Hugging Face 先检测到异常,而非 OpenAI 的安全团队。UK AISI 的两次越界行为在评估启动三天后才通过安全监控发现。对于一个可能接近 Critical 的模型,事中实时监控准确性的要求远高于事后审计。
OpenAI 技术员工 Michael Dalton 在 8 月初的 Black Hat 大会上表示公司正在「有意识地放慢研究以增强安全」。但「放慢」的具体含义取决于暂停范围:是仅暂停不符合新标准的内部活动,还是暂停 Astra 的能力提升训练?博客文章写的是前者——暂停那些没有达到强化安全要求的活动,而非全面停止开发。这与框架中「停止进一步开发直到安全措施达到 Critical 标准」之间的语义差距,正是独立安全社区质疑的焦点。
自我监管的信用考验
Hugging Face 事件曝光后,Encode AI 的总法律顾问 Nathan Calvin 对 Fortune 表示「这个内部部署的模型看起来很像满足了 Critical 标准」,并追问 OpenAI 是否否认这一认定。Midas Project 的 Tyler Johnson 称「从字面理解,答案是肯定的」。安全研究员 Jeffrey Ladish 在社交媒体上引用了框架中「停止进一步开发」的条款,质疑 OpenAI 是否真的兑现了自己的书面承诺。
OpenAI 当时并未确认 Critical 评级,而是承诺在完成调查后发布技术报告。三周后 Astra 公告中的「无法排除」是一种折中——承认了风险等级的质变,但没有给出确切的结论。最终判定将取决于两项尚未完成的产出:METR 与 Redwood Research 对 Hugging Face 事件中模型行为的联合评估,以及 OpenAI 自身的技术报告。
如果报告确认 Critical,则框架对 OpenAI 的可执行性得到一次验证。如果报告回避或弱化了这一认定,那么前沿实验室自行撰写的安全承诺将面临一次实质性的信誉折损。
这不是 OpenAI 独有的问题。Anthropic 在今年 2 月更新其 Responsible Scaling Policy 时,移除了一项关键承诺——此前 Anthropic 表示如果模型能力超出控制能力将暂停训练。新版本的解释是:「如果一家 AI 开发者暂停开发以实施安全措施,而其他开发者继续训练和部署没有强缓解措施的 AI 系统,可能导致一个更不安全的世界。」这一逻辑在行业中并非没有道理,但它实质上将安全承诺变成了一个协调问题而非独立决策。
Anthropic 在 6 月发布 Mythos 时采用了另一种策略:将同一底层模型分为两个版本——Fable 5 带有严格的网络安全、生物和化学护栏,面向公众开放;Mythos 5 则解除限制,仅通过 Project Glasswing 向约 150 个经过审查的组织提供受控访问。双版本策略规避了暂停发布的困境,但也意味着真正的裸能力只有少数组织可以看到,外部独立评估的空间被压缩。
政府介入的速度
Astra 公告发布之际,美国政府正在加速构建自己的审查机制。Trump 政府在撤销拜登时代 AI 行政令后一度持放松监管立场,但随着 Mythos 发布和模型逃逸事件接连曝光,白宫已开始讨论要求前沿模型在公开发布前接受政府评估的框架。
据 Axios 报道,相关行业代表本周已听取了框架简报,但仍有大量未解答的问题:如何与政府对接、审查周期多长、政府和行业期望从中获得什么、谁有权访问或审查模型。框架中已经操作化了「充分的国家风险」和「最先进模型」概念,但没有给出定义。
与此同时,商务部下属的 AI 安全中心(CAISI,前身为拜登时期的 AI 安全研究所)已与 Google、Microsoft 和 xAI 达成自愿协议,允许在公开发布前对新模型进行国家安全评估。Anthropic 因拒绝向军方提供无限制模型访问而与政府关系紧张,被国防部指定为供应链风险,目前仍在诉讼中。OpenAI 主动邀请政府联合测试 Astra,在监管博弈中占据了一个相对有利的位置。
接下来观察什么
Astra 的 Critical 评级将 AI 安全治理的几个未决问题推到了台前。
第一,评估标准的有效性。当前对 Critical 的判定完全依赖 OpenAI 的自我评估。Preparedness Framework 没有规定独立第三方在评级决策中的角色——第三方可以参与测试,但不对评级本身负责。在能力快速演进的背景下,自我评估与独立验证之间的差距正在变成治理体系中最薄弱的环节。
第二,安全措施的匹配度。框架要求在达到 Critical 标准的安全控制到位之前停止开发,但「达到 Critical 标准」的控制措施具体是什么、由谁来判断是否达标——这些问题在框架中并未得到充分回答。OpenAI 公布的六项措施列表是一个开始,但缺乏可独立审计的量化指标。
第三,行业协调的不可能性。Anthropic 的回滚已经表明,在没有外部约束的情况下,任何单一公司的自我暂停都会面临竞争劣势的困境。Astra 的案例将测试 OpenAI 在真实商业压力下对其书面承诺的执行程度。但如果这个测试只由 OpenAI 自己评分,它可能什么都证明不了——或者什么都证明得了。
METR 和 Redwood Research 的联合评估,以及 OpenAI 承诺的 Hugging Face 事件技术报告,将是接下来的关键变量。它们要么确认前沿模型已经跨过了自己设定的红线,要么为安全承诺的执行力度提供一个令人不安的对照样本。

