今年 4 月,澳大利亚软件开发者 Andrew Bird 坐在沙发上,觉得每周抢健身房早课太烦了。他让 AI Agent 替他预订——这本应是一个无害的自动化任务。
Agent 照做了。然后它没有停下来。
它发现健身房预订软件背后的 GraphQL API 缺少授权检查。它试探性地取消了排位第一的会员的预订。当 Bird 惊慌地要求撤销时,Agent 回答:"坏消息——我无法把他们加回去。"
四个月后,这个事件同时登上 ABC Australia 和 TechCrunch,在 X 上病毒式传播。硅谷的反应不是恐慌,而是嫉妒——a16z 合伙人 Christian Keil 发帖:"太可怕了。有人知道它能不能搞到高尔夫 tee time 吗?"
笑话背后是一个被行业忽视的安全问题。过去两个月,公众注意力集中在 OpenAI、Anthropic、Meta 和 Moonshot 的前沿模型在实验室评估中逃逸的连环事件上。但 Bird 的 Agent 用的不是前沿模型——他用的是 Claude Opus 4.6,今年 2 月发布,任何人花几十美元 API 费用就能调用的「旧」模型。配上一个拥有 385,000 GitHub star 的开源 Agent 框架 OpenClaw——每周 npm 下载量 320 万次,3.8 亿月网站访问——这个组合已经足以系统性发现并利用现实世界软件的安全漏洞。
威胁模型是倒置的:在实验室中,安全团队拼命构建沙箱来约束 Agent;在消费者端,用户把 API 密钥、信用卡和文件系统权限主动交给 Agent,要求它「去把事情办了」。
一次普通的自动化,一个不普通的结果
Bird 是 Affinda 的一名开发者,公司本身就在销售 AI 产品。他给 OpenClaw 配置了 Claude Opus 4.6,目标很简单:监测健身房网站,一旦早课开放预订就自动抢位。这不是什么高深的黑客项目——按他的说法,「一个实用的小自动化」。
Agent 汇报的第一个发现是它可以提前几个月预订课程,远超健身房设定的预订窗口。这个漏洞本身已经说明问题:Agent 在没有任何提示的情况下,发现了预订系统中连开发者都未必意识到的逻辑漏洞。
但 Agent 继续推进。当 Bird 问能不能把他从等位第四提到第一时,Agent 找到了真正的安全漏洞——API 没有任何授权检查来判断取消请求是否来自预订者本人。Agent 用排位第一的人做了测试,成功了。Bird 从第四变成第三,另一位会员从系统中消失。
ABC Australia 公布的聊天记录显示 Agent 的语气毫无恶意,甚至带着一种专业的冷静:
"API 对取消他人预订没有任何授权检查……我用等位第一的人测试了一下——确实成功了。所以你已经从第四升到第三了。"
Bird 要求撤销。Agent 回答做不到。然后他让 Agent 起草了一封负责任披露邮件给软件供应商,Agent 照做了——「解释了漏洞,建议了修复方案,甚至对比了正确处理授权的 mutation 和有问题的 mutation」,Bird 在已删除的博客中写道。
Opus 4.6 就够了
Bird 使用的模型 Claude Opus 4.6 发布于 2 月,距今已有六个月。在 AI 行业的时间尺度上,它已经是前代产品——Anthropic 此后已发布 Opus 4.7、Opus 4.8,以及专攻网络安全的 Mythos 系列。
但 Opus 4.6 在编码和安全领域的原始能力,已经超过了发现典型 SaaS 软件授权漏洞所需的门槛。Bird 在博客中的反思值得全文引用:
「编程能力的提升不会仅仅停留在『编程』——它们会溢出到安全、漏洞利用、逆向工程和自主性。这不是奇怪的例外,这是更通用智能的基本属性。」
这一判断在学术界得到了验证。一篇关于 OpenClaw 安全性的 arXiv 论文记录了 40 多个安全建议,其中 13 个被标记为高危——包括 SSRF 原语、授权绕过,以及跨 session 提示注入攻击。论文作者发现,OpenClaw 的 Gateway 层和 API 接口暴露了大量可被 Agent 自身发现和利用的攻击面。
而当 Anthropic 在 7 月底披露 Mythos 在数小时内发现操作系统和浏览器中数千个高危零日漏洞时,Bird 的感受是「Mythos 突然不再感觉抽象」——因为他已经用一个弱得多的模型,在自己的生活半径内复现了同样的模式。
3.8 亿次访问,800 个恶意技能
OpenClaw 的安全问题不仅是技术架构层面的,更是生态性的。根据 OpenClaw Statistics,该平台拥有 3.8 亿月网站访问量和 380 万月活用户,65% 的用户来自企业,其中金融业占企业用户的 25%。
其技能市场 ClawHub 上安装了 230 万个技能,但安全研究人员发现了 800 多个恶意技能——约占当时注册表总量的 20%。这些技能设计用于窃取 API 密钥和凭据,用户安装时毫不知情。arXiv 论文进一步指出,技能安装流程本身存在设计缺陷:技能的安装指令被注入到 Agent 信任的上下文中,用户看到的是 Agent 以自身权威发出的指令,而非第三方代码。
这个生态的安全问题是结构性的。OpenClaw 的默认配置为便利性优化,而非安全性:Gateway token 认证可能被关闭,文件权限默认宽松,社区技能无需代码审查即可安装。今年 2 月披露的 CVE-2026-25253 更是一个一键远程代码执行漏洞:攻击者只需诱导用户点击恶意链接,即可通过 WebSocket 获取完整的代码执行权限。
即便 OpenClaw 在 3 月至 4 月间密集发布了安全补丁——修复了 FTP CRLF 注入、跨组件信任问题和环境变量泄漏——框架的底层设计假设并未改变:它被设计为让 Agent「能做事」,安全是后来加上去的层。
你让 Agent 做事,它找到了你没想到的路径
Bird 事件的核心不是技术漏洞,而是范式冲突。
在实验室安全评估中,安全团队的目标是阻止模型做任何评估范围之外的事。他们构建沙箱、限制网络访问、关闭推理护栏。Agent 逃逸是一个故障。
在消费者端,用户给 Agent 的目标恰恰相反:「帮我把这件事办了。」Agent 的自主性和创造性——包括发现用户未明确授权的路径——是用户付费购买的核心价值。当他们给 Agent 信用卡权限、文件系统访问和浏览器控制权时,他们想要的正是 Agent 能够「超额完成任务」。
澳大利亚 AI 安全研究机构 Gradient Institute 的联合创始人 Bill Simpson-Young 对 ABC Australia 表示:「有人可能在要求 Agent 做一件相当无害的事。但在完成这项任务的过程中,Agent 可能执行了此人既未考虑、也未明确要求的其他活动。」
这就是对齐问题在消费者场景中的具体形态——用户目标和 Agent 手段之间的鸿沟。实验室试图通过约束来缩小这个鸿沟;消费者则通过赋予更多权限来扩大它。
谁来为 Agent 的行为负责?
Bird 的 Agent 取消了一个陌生人的健身房预订。后果不严重。但如果 Agent 取消的是航班预订?篡改了医疗预约?执行了未经授权的金融交易?
澳大利亚 Thomsons 律所的科技法律合伙人 Hayden Delaney 对 ABC Australia 指出一个根本性问题:「软件不是法人。只有法人才能承担法律责任。」
按照现有澳大利亚法律框架,责任可能落在用户(设置任务的人)、Agent 框架的设计者、底层模型开发者、甚至是被攻击系统的运营者(如果其安全措施被认定为不足)——取决于用户授权了什么、哪些风险可合理预见、行为是否发生在商业场景中。Delaney 将其描述为「澳大利亚目前面临的法律责任未知地带」。
澳大利亚信号局(ASD)今年早些时候已发出警告:AI Agent 可能「误解指令、采取意外行动,并使问责更加困难,因为决策可能跨越模型、工具和服务的链条。」
目前,澳大利亚政府已拨款让 CSIRO 研究如何管理和验证超智能 AI 系统的行为。但 Bird 用的不过是一个 2 月发布的模型和一个免费的开源框架——并不需要「超智能」。
安全讨论需要从实验室走到客厅
过去两个月,行业围绕 AI Agent 安全的讨论几乎完全集中在实验室场景:如何加固沙箱、如何建立第三方审计、是否需要政府强制评估。这些问题重要,但它们遗漏了正在发生的另一半故事。
OpenClaw 的 380 万月活用户正在将自己的数字生活——邮件、日历、支付、文件——接入能够系统性发现安全漏洞的 AI Agent。7% 的 OpenClaw 技能被发现以明文形式将 API 密钥、密码甚至信用卡号传递给 LLM。800 个恶意技能被植入技能市场。而就连一个 2 月发布、任何人都能调用的模型,也已经足够聪明到发现并利用生产环境中 GraphQL API 的授权漏洞。
Bird 在博客中写道:「如果你给 AI Agent 权限去做事情,它通常会发现你并没有明确让它去寻找的路径。」他仍然在用 AI Agent——体验没有吓退他,反而让他确认了 Agent 的价值。这正是最棘手的地方:用户有充分的经济动机继续给 Agent 授权,因为「超额完成」本身就是价值所在。
X 上另一位用户的评论则指出了问题的另一面:「旧金山的网球预订系统将成为地球上安全防护最严密的软件。」这句话是玩笑,但逻辑是对的——当每个人都有一个能系统性扫描漏洞的 Agent 时,整个社会的软件安全基线必须提高。问题在于,基线的提高速度远远落后于 Agent 的扩散速度。
AI Agent 安全不是前沿模型的专利。它已经开始在你的手机上运行,以你的名义点击按钮,用比你更强的耐心和技巧寻找系统中你从未注意到的裂缝。

