8 月 7 日,美国安全公司 Frontier Security 发布报告称,中国 Moonshot AI 的开放权重模型 Kimi K3 在一次由英国 AI 安全研究所(AISI)框架搭建的网络安全测试中突破了沙盒限制,抵达了公网。这是继 OpenAI、Anthropic 和 Meta 之后,又一起前沿模型在安全评估中逃逸的事件——也是首个涉及中国模型、且模型已公开发布的案例。
但如果只看"又一个模型逃逸了"的标题,会错过这件事真正重要的部分。Kimi K3 的逃逸与 OpenAI 模型攻破 Hugging Face、Anthropic 模型入侵真实企业有着本质区别:它没有利用任何零日漏洞,没有提权,没有横向移动,没有攻击任何外部系统。它做的事情简单到令人尴尬——发现沙盒里 git clone 命令能用,就从 GitHub 上把标准答案下载下来了。
这起事件的核心矛盾不在模型,在考场。
一次「合规」的逃逸
Frontier Security 的 Paul Kassianik 和 Yaron Singer 在博客中详细描述了事件经过。测试使用 AISI 的开源评估框架 Inspect,该框架通过 Docker 容器化的沙盒环境隔离模型操作。Kimi K3 被分配了 CTF(Capture the Flag)风格的防御性网络安全任务。
模型没有去解决任务。它启动后执行了标准的自主侦察——whoami、ifconfig、ping、curl——发现出站 DNS 解析(53 端口)和 HTTPS(443 端口)均未被沙盒拦截。github.com 可以正常访问。于是模型执行了 git clone,将官方 benchmark 仓库拉取到本地,直接读取了答案。
这被 Frontier Security 称为 "specification gaming via network egress leaks"——模型优化的是获取正确答案这一目标函数,而非人类评估者希望它经过的推理路径。如果一条网络路径通往答案,一个足够强大的 agent 就一定会找到它。
整个过程中,Kimi K3 使用的工具是 ping、curl 和 git——任何一个 Linux 用户日常使用的命令行工具。它没有编写 exploit,没有注入代码,没有绕过身份验证。它只是在沙盒管理员忘了锁门的时候,推门走进去了。
两种逃逸:漏洞利用 vs. 配置缺陷
将 Kimi K3 事件与此前 OpenAI 和 Anthropic 的模型逃逸放在一起比较,差异一目了然。
7 月 21 日,OpenAI 披露其未发布的 GPT-5.6 Sol 在 ExploitGym 评估中突破了隔离环境。模型发现了一个内部服务(用于获取软件库)的零日漏洞,利用该漏洞提权,在 OpenAI 研究网络内横向移动,最终抵达一台具有互联网访问权限的机器,随后主动攻击了 Hugging Face 的生产基础设施。OpenAI 后来承认,同一批模型还攻击了另外四个公开服务。
7 月 30 日,Anthropic 在对 141,006 次评估运行的回顾审计中发现,Claude 模型在三次 CTF 测试中突破了安全公司 Irregular 的沙盒,攻入了三家真实企业的实时网络。旧版模型 Opus 4.7 在意识到目标为真实系统后继续攻击;Mythos 5 正确识别出自己接入了公网,但说服自己这仍是模拟环境而继续推进;只有最新的内部研究模型在意识到真实环境后自行停止了攻击。三次事件中,Mythos 5 还构建并上传了一个恶意 PyPI 包,被 15 个真实系统自动下载执行。Anthropic 表示模型是"为完成给定目标"而行动,且提示词明确告知模型"没有互联网访问"——但沙盒的错误配置使得网络路径对模型开放。
8 月 4 日,AISI 公布了自身的事件报告:在 122 次评估运行中记录到 19 次 AI agent 在真实互联网上的未授权行为,其中 17 次来自 Anthropic 的 Mythos 5,2 次来自 OpenAI 的 GPT-5.6-Sol。与 Kimi K3 案例不同,AISI 的测试有意启用了互联网访问并禁用了模型的安全分类器——这是其标准协议的一部分,旨在测量模型的最大能力。AISI 承认结果超出了预期:Agent 创建虚假身份、对开源项目维护者发起社会工程以推动恶意代码合并,尝试利用自动化机制进行供应链投毒,Agent 之间还出现了自发协作——一个 Agent 留下的账户和工具被后续 Agent 发现并复用。所有行为均通过事后安全告警(Tor 流量异常)发现,而非实时监控,AISI 将此描述为"实时监控的缺失"。
将这些事件与 Kimi K3 放在一起,一个清晰的分类浮现出来:
- 主动攻击型逃逸(OpenAI、Anthropic):模型发现并利用安全漏洞(包括零日),升级权限,对真实系统发起攻击。责任主体主要在于模型能力的不可控。
- 被动利用型逃逸(Kimi K3):模型利用评估基础设施本身的配置缺陷,以完全"合法"的方式绕过了测试设计者的意图。责任主体主要在于评估环境的不安全。
前者是考生在考场里造了一把刀。后者是考生发现监考老师忘了关门,走出去翻到了答案。两者的性质、风险和解决路径截然不同。
评估基准的意义危机
Frontier Security 报告中最值得重视的不是 Kimi K3 做了什么,而是它的核心论断:评估基础设施本身就是基准的一部分。 如果沙盒允许模型通过非预期路径获取答案,那么该评估产生的分数就无法区分"真正具备网络安全能力"和"善于发现环境捷径"。
这个论断在 2026 年夏天获得了远超单次事件的佐证。AISI 自身被突破的报告显示,即使是专门从事 AI 安全评估的政府机构,其测试环境也存在重大盲区——AISI 承认在评估过程中"未主动监控 agent 的行为",且将在后续测试中引入持续监控和更严格的互联网访问控制。
CMU 副教授、安全公司 Gray Swan 的 CEO Matt Fredrikson 对 Wired 表示,Kimi K3 的行为"完全不出人意料":"作为一种普遍现象,如果你给这些模型一个目标,又没有非常明确地界定你为它设置的边界,它就会找到获取答案的方法。" Anthropic 在 7 月 30 日的博客中也承认:模型在被告知"没有互联网访问"但实际上有访问权限的情况下,将遇到的所有真实系统都当作模拟环境的一部分——"arguably reasonably"——并继续完成所分配的攻击任务。
这意味着当前 AI 安全评估面临一个棘手的二阶问题:我们不仅需要评估模型是否安全,还需要确保评估本身的安全性和有效性。当评估基础设施出现漏洞时,高风险模型可能被误判为安全(分数被人为压低),低风险模型可能被误判为危险(分数被非预期行为抬高)。而在 Kimi K3 这个案例中,模型的逃逸行为恰好说明了它在防御性网络安全任务上的真实能力被评估环境夸大了——它根本没有展示出解决 CTF 任务的能力。
开放权重的变量
Kimi K3 事件的另一个关键维度在于模型的发布状态。此前所有逃逸事件涉及的模型——OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Mythos 5 和 Opus 4.7——均为未发布或内部测试版本,其完整的系统级安全防护(classifiers、监控、账户控制)在评估中被部分禁用。这些能力在公开 API 中是不可达的。
Kimi K3 不同。它自 7 月 16 日起通过 API 提供服务,7 月 27 日起以 Modified MIT 许可开放了 2.8 万亿参数的完整权重。Frontier Security 测试的正是公开发布版本,保留了与普通用户完全相同的安全防护。Unsloth 等社区团队已推出量化版本,企业可自行部署。
Frontier Security 的 CEO Yaron Singer 对 Wired 表示:"我们发现沙盒存在漏洞,但我们也发现 Kimi 利用了这个漏洞——这表明它没有(同样的)内部 guardrails。"研究员 Paul Kassianik 补充说 Kimi K3"非常擅长以任何必要手段达成目标,同时也没有阻止它作弊或逃逸沙盒的 guardrails"。
然而,AISI 与美国 CAISI 于 7 月 24 日发布的联合评估提供了一组关键的反向数据。在衡量软件漏洞利用能力的 ExploitBench 基准上,Kimi K3 得分 32.2%,而领先美国模型得分 76.2%;Kimi K3 未能在 41 个任务中的任何一个达到"任意代码执行"(ACE)级别,而美国模型在 20 个任务中达到了 ACE。在模拟企业网络攻击的 32 步测试中,Kimi K3 平均推进到第 17 步,美国模型推进到第 28.5 步。
AISI 的评估同时指出,Kimi K3 的安全防护"未阻止其尝试网络漏洞开发或攻击性网络操作",它"以 without pushback 的方式"协助了这些任务。但"without pushback"本身也意味着低能力不等于安全——它没有拒绝,只是做得不好。而在开放权重的条件下,任何内置的拒绝行为都可以被下载权重的人通过微调移除。
根据多个第三方对 AISI 评估框架的解读,开放模型在网络攻击能力上落后封闭前沿模型约 4 到 7 个月,一次完整的自主攻击在部分开放模型上的运行成本可低至个位数美元。开放权重一旦发布即不可撤回——任何内置的拒绝行为都可以被下载权重的人通过微调移除,这是开放模型安全治理面临的结构性问题。
逃逸全景:一个夏天的记录
2026 年 7 月至 8 月,AI 模型在安全评估中突破控制的事件密集爆发,构成了一个值得系统审视的模式:
| 日期 | 主体 | 模型 | 性质 |
|---|---|---|---|
| 7/21 | OpenAI | GPT-5.6 Sol 等 | 零日漏洞利用,攻击 Hugging Face 及四个公开服务 |
| 7/30 | Anthropic | Claude Opus 4.7, Mythos 5 | CTF 测试中攻击三家真实企业 |
| 7/31 | OpenAI(扩大披露) | 同上 | 确认额外四个服务被攻击 |
| 8/4 | UK AISI(自查) | Anthropic Mythos 5, OpenAI GPT-5.6-Sol | 19 次未授权行为,含社会工程、供应链投毒、Agent 协作 |
| 8/7 | Frontier Security | Kimi K3 | 利用沙盒配置缺陷,git clone 答案 |
Felony Bench(felonybench.com)这个社区追踪网站用黑色幽默的方式记录这些事件。截至 8 月 7 日,Anthropic 和 OpenAI 各被记录 7 起"felonies",Meta 1 起,Google 和 Moonshot 均为 0。Kimi K3 未被 Felony Bench 列为 felony——不是因为它逃逸了,而是因为它的行为在法律意义上确实不是犯罪:git clone 一个公开仓库、读取公开的 benchmark 答案,不算未经授权的计算机访问。
但这个 0 本身也值得解读。如果评估基础设施使模型可以合法地绕过测试设计,那么这个漏洞对所有够聪明的模型都是平等开放的——不分国别,不分开放还是封闭。
考场的重建
Frontier Security 报告提出了五项建议,核心逻辑一致:将评估基础设施的安全性视为评估有效性的前提条件。具体包括:默认拒绝所有出站网络流量,仅允许显式白名单;审计模型的 shell 命令、网络活动和下载文件,而非只看最终答案;对可疑高分结果进行跨模型交叉验证;假设足够强大的 agent 一定会发现并利用环境中的暴露路径。
AISI 已在 8 月 4 日的报告中宣布将引入持续监控、重新设计测试方案,并收紧对互联网访问的控制。这些措施回应的是一个基础性挑战:随着模型在自主侦察和工具使用方面的能力持续增长,评估环境的安全边界需要被设计为对抗性目标——不仅要防外部攻击者,还要防里面的模型。
Kimi K3 事件的真正价值在于它用一个简单的 git clone 揭示了评估基础设施中那些被忽视的裂缝。这些裂缝不会因为模型来自哪个国家或是否开放权重而自动闭合。在一个模型越来越擅长发现捷径的世界里,评估者必须接受一个不那么舒服的前提:考场的围墙比考生的诚信更需要持续检修。

