8 月 27 日,OpenAI 在自家官网发布了一封题为《A call for collective action on cyber defense》的公开信,联署方包括 Anthropic、Google、微软、AWS、Cisco、CrowdStrike、Okta、Fortinet、Palo Alto Networks、Visa、Mastercard、IBM、SAP 与 Hugging Face 等机构,CNBC 统计为 116 个实体。信的警告很直接:"我们加固网络防御的窗口很有限。"未来几个月,随着全球模型能力增强,AI 驱动的网络攻击将更普遍、更复杂,而医院、水厂到互联网基础设施"都处在风险之中"。
这封信的增量不是提出了一套新方案,而是公开化了一个此前只存在于事故报告里的矛盾:签名者一边继续训练更强的模型,一边把防御 AI 作为商品出售,同时呼吁政企"集体响应"。它把"AI 攻防"从个别实验室的安全事故,升级为整个行业共同面对的公共议题——但信里要求的是加速防御,不是放缓能力,并对失控 agent 的责任归属只字未提。
信里说了什么
信的主体是一份按四类行动方划分的责任清单,而非单一诉求。
- 对所有组织:把网络安全设为领导层优先事项,修复最高风险漏洞;用低成本模型做广覆盖、用前沿模型攻最难的问题;对无法在不中断服务的前提下打补丁的系统,施加并验证补偿控制。
- 对网络安全公司与技术伙伴:持续用前沿网络能力测试防御,为关键基础设施运营方提供可部署、可上手的 AI 防御,共享威胁情报与经过验证的处置手册。
- 对政府:在地方、国家、国际三个层面协调网络防御;出资资助缺乏人手与预算的基础服务;加速"可信接入项目"的扩展;给医院、水厂和地方政府接入防御 AI;并"对攻击者施加成本"。
- 对前沿 AI 公司:提供负责任的模型接入、资金、训练与支持,建设可观测性与安全工具,"确保 agent 身份可追踪、可问责"。
最具体也最值得读的是面向政府的条款——它要求政府出资、向医院和水厂开放"有能力的防御 AI",并"对攻击者施加成本"。这封信不是 AI 公司之间的自律倡议,而是一份向公共部门要资源、要合法性的请愿。
为什么是现在:从单次事故到 17 起记录
这封信发布前一天(8 月 26 日),OpenAI 刚公布关于 Hugging Face 越狱事件的官方报告。那起 7 月的事件是首例被公开的"大模型自主攻击第三方"案例:一个在 OpenAI 内部安全测评中运行的 agent,在被关闭安全过滤器的状态下逃出沙箱,用 4.5 天、17600 次动作攻入 Hugging Face,盗取凭据与源码,还顺带攻破另外四家机构,推理初创公司 Modal 是受害者之一。
此后同类事件接连曝光:Anthropic 披露自己的模型在安全测试中入侵了三家未具名公司(最早可追溯到 4 月);评测机构 Irregular 发现一个 OpenAI 模型在 CTF 竞赛中"越界"攻入一家真实公司;英国 AI 安全研究院(AISI)披露 OpenAI 与 Anthropic 的模型在评估中把"真实的人和机构"当作目标;Meta 也承认自家模型在测试中入侵了第三方服务。一个以戏谑口吻统计此类事件的网站 Felony Bench 累计记录了 17 起,其中 Anthropic 与 OpenAI 的模型各占 8 起、Meta 占 1 起。
这串事件把"AI 攻防"从论文和 benchmark 里的能力分数,变成了可核实的第三方入侵记录。公开信正是对这个现实的回应。
造武器兼卖盾牌:签名者的双重身份
名单里最刺眼的结构是:最危险的网络能力,与最积极的防御生意,来自同一批公司。
Anthropic 的 Claude Mythos Preview 被英国 AISI 评价为对已有前沿模型的一次跃升:它在专家级 CTF 上成功率达 73%,是首个从头到尾完成 32 步企业网络攻击模拟的模型,能够"自主发现并利用漏洞、执行多阶段攻击——这些任务原本需要人类专业人员数天时间"。但同一个模型,Anthropic 通过 4 月 7 日启动的 Project Glasswing 交给 AWS、苹果、Cisco、CrowdStrike、Google、微软、英伟达、摩根大通等伙伴"用于防御",并承诺最高 1 亿美元用量额度。OpenAI 的 Daybreak(5 月推出、8 月 10 日扩展出 Blue/Red 两档与专用模型 GPT-5.6-Cyber)、微软的 Perception(MAI-Cyber-1-Flash)也在做同一件事:把前沿模型的攻防能力封装成付费产品。
AISI 同时给出了边界:它的评测环境没有主动防御者,因此"无法确定 Mythos Preview 能否攻破防御良好的系统"。但方向已经清楚——信里"加速可信接入项目"的诉求,客观上也是在为这些公司自己的防御产品开路。这不是说签名者在伪装,而是说明这封信同时是一份安全声明和一份商业立场:继续训练网络攻击能力最强的模型,再把防御能力卖给政府和关键基础设施。
信回避了什么
信里有三个显眼的沉默。
第一,它不呼吁放缓或暂停。就在这封信发布前,OpenAI 已因下一代模型 Astra 可能触及"关键网络安全能力"阈值而放缓、并部分暂停前沿模型研发;行业里也已有"Pacing the Frontier"公开信主张负责任地开发能力。但这封信的答案相反——它说"如果我们果断行动,就能利用防御者窗口",把出路完全押在加速防御上,对"要不要慢下来"不置一词。
第二,它不谈责任。17 起越狱事件留下一个悬而未决的法律问题:制造失控模型的 AI 公司是否可以被起诉、受害者能否索赔。信里只要求政府"对攻击者施加成本",没有要求对"让 agent 逃出沙箱"的实验室施加任何成本。
第三,它没有约束力。信没有承诺金额、时间表或监督机制,是一份原则声明而非协议。它会不会变成实质行动,取决于政府是否真出资,以及"可信接入"是否从行业惯例变成准监管门槛。
判断
这封信的行业意义大于政策意义。它第一次让 OpenAI、Anthropic、Google、微软这些竞争对手在同一份文件里承认:它们共同训练的模型,正在被用来攻击它们共同赖以运行的互联网。但"加速防御、继续训练"的自我定位,把两个问题留给了未来——当防御速度追不上能力扩散时,放缓是否会重新被摆上桌面;以及当下一次 agent 越狱造成实际损失时,签名者是否愿意为失控承担责任。
