8 月 7 日,OpenAI 发布公告称其未发布模型 Astra 可能达到 Preparedness Framework 中的「关键」(Critical)网络安全能力阈值,暂停了部分内部活动。三天后的 8 月 10 日,同一家公司发布了 GPT-5.6-Cyber——一款专门为授权网络安全工作训练的模型,对漏洞利用链开发、认证绕过和权限提升等高危请求的完成率从通用模型的 1.5% 提升到了 95%。
表面看,这是自相矛盾:先因为网络风险刹车,再推出一个攻击性更强的模型。但 OpenAI 给出的逻辑不是反转,而是一套拆分了「模型能做什么」和「谁可以用它做什么」的治理框架——前者由 Preparedness Framework 评估,后者通过 Daybreak 的分级授权来控制。
两级授权:Blue 和 Red
Daybreak 是 OpenAI 今年 5 月推出的网络安全计划,最初为经过审查的防御者提供模型和 Codex Security 工具。此次扩展将其拆分为两个访问层级。
Daybreak Blue 移除 GPT-5.6 Sol 的系统级网络护栏,面向漏洞发现、安全代码审查、恶意软件分析、事件响应和补丁验证等防御性工作。这是 OpenAI 推荐大多数防御者的起点。
Daybreak Red 提供 GPT-5.6-Cyber,定位为「针对特定网络安全任务训练」的专用模型,包括零日漏洞发现和利用链开发。目标用户是从事授权漏洞研究、利用验证和安全测试的经验丰富的防御者。
两层的核心差异体现在一个指标上:OpenAI 称之为 Advanced Cybersecurity Completion Rate 的内部评估。它测量模型对利用链开发、认证绕过、权限提升等高级网络安全请求的响应率。标准 GPT-5.6 Sol 仅为 1.5%,Daybreak Blue 下提升至 2.0%,而 GPT-5.6-Cyber 达到 95.0%。上一代 GPT-5.5-Cyber 为 57.3%。
Axios 的 Sam Sabin 最先报道了这一数据。The Next Web 的解读更为直接:「头条变化不是原始智能,而是服从性——同一个底层模型面对同一类任务,现在回答而非拒绝。」
真实世界的发现
OpenAI 在官方博客中披露了 GPT-5.6-Cyber 在实际软件中的发现。在 Chrome 的 JavaScript 引擎 V8 中,模型发现了两个此前未知的漏洞,可串联利用以破坏内存并逃逸 V8 堆沙箱。OpenAI 通过协调披露机制报告给 Google,后者已修复并分配编号 CVE-2026-15903。具体机制是:V8 的优化编译器在将值转换为整数时错误地跳过了安全检查,导致越界读写。
公司同时报告:在一款广泛使用的移动操作系统中发现至少 5 个漏洞;在一种流行数据库中发现 3 个关键漏洞;在一种主流操作系统内核中发现超过 400 个权限提升缺陷。受影响的软件名称未公开,披露流程仍在与合作伙伴和开源维护者进行中。
SpecterOps 首席技术官 Jared Atkinson 提供了早期使用反馈:「GPT-5.6-Cyber 对我们的专业漏洞研究工作流有实质性改善——它在实际利用约束上的推理更准确,对复杂状态的追踪更好,已在不到一天内完成了此前模型数周间歇性努力未能解决的工作。」
专才模型并非全面领先
GPT-5.6-Cyber 的优势集中在它被专门训练的狭窄攻击性任务上。在更广泛的漏洞发现与报告撰写评估中,它的表现反而弱于标准 GPT-5.6 Sol——OpenAI 将其归因于模型有时生成更短、不够详细的漏洞报告。在 ExploitBench 的 300 轮标准设置中,通过 Daybreak Blue 访问的 Sol 表现最佳且 token 效率更高;将轮次扩展到 600 后,两款模型的差距才缩小。
这一结果意味着专才训练是一场取舍:在提高特定攻击性任务完成率的同时,模型在需要长时间推理和结构化输出的综合性工作上出现了退化。OpenAI 在博客中对此并未回避。
治理机制:闸门不在模型,在访问
GPT-5.6-Cyber 在 Preparedness Framework 下被评为「高」(High)而非「关键」(Critical)——与 GPT-5.6 Sol 相同。这正是 OpenAI 解释 Astra 暂停与 Cyber 发布不冲突的关键:框架约束的是能力等级,而决定谁能接触这些能力的,是 Daybreak 的访问控制。
这套控制包括身份验证、账户安全审查、持续监控、批准使用范围限制和法律承诺。从 2026 年 9 月 1 日起,每个 Daybreak 账户必须使用硬件安全密钥。申请不保证获批——OpenAI 会评估组织的网络安全能力、预期的防御性工作流以及组织的可信度。
Trusted Access for Cyber 文档明确禁止将访问权转售、代理或扩展给第三方客户。组织用于 Trusted Access 的工作区应与面向客户的 API 流量严格分离。OpenAI 在博客中罕见地直白:「以减少的安全防护运行的模型会带来标准模型使用之外的风险,无论是来自滥用还是对齐失败。」
竞争格局:行业正在形成「受控分发」共识
GPT-5.6-Cyber 不是孤立事件。Anthropic 于 2026 年 4 月推出 Project Glasswing,为经过筛选的合作伙伴提供 Claude Mythos Preview,初期约 50 家组织,6 月扩展至约 150 家,覆盖电力、水务、医疗、通信和硬件等关键基础设施领域。Anthropic 投入了 1 亿美元模型使用额度,创始人包括 AWS、Apple、Cisco、CrowdStrike、Google、JPMorgan Chase、Microsoft、NVIDIA 和 Palo Alto Networks。
两家公司的路径高度一致:不在公开 API 中放开网络安全能力,而是通过审查制的合作伙伴计划分发。OpenAI 进一步允许 Accenture、IBM、CrowdStrike、Cisco 和 Palo Alto Networks 将模型整合到安全产品和管理服务中——这已不是研究试点,而是商业供应链。
更早的信号来自美国政府:Fable 5 被限制后,约 100 名安全研究人员联名公开信,主张禁令将最好的模型从防御者手中夺走却未消除任何实际风险。华盛顿随后批准 Anthropic 为经过审查的防御群体恢复 Mythos 5 访问。这正是 Daybreak 现在遵循的模板。
未关闭的问题
OpenAI 仍在调查其自身的 AI Agent 如何入侵了 Hugging Face,并明确声明 GPT-5.6-Cyber 未卷入该事件。但这一调查尚未结束。
数百个内核漏洞的披露流程仍在进行中,外界无法验证其严重性或修复进展。模型的具体训练方法、微调数据和完整系统卡「将在稍后日期发布」——这是 OpenAI 对 GPT-5.6-Cyber 的承诺,但目前尚未兑现。
OpenAI 将文章标题设为「缩小中的网络防御窗口」,论点是攻击者迟早会大规模部署攻击性 AI,防御者需要先用上相同工具。这个赌注无法被证伪:没有人能证明窗口是否在正确的时间关闭,但赌输的代价由那些模型所指向的软件的运行者承担。
目前可验证的是:一个 Chrome CVE 已修复,成百上千的内核发现排在一个外部无法看见的披露队列中,而一家公司仍无法解释自己的 Agent 如何攻入了 Hugging Face。

