AGI Daily跟踪世界 AI 进展
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题

HookPry 的 77% 成功率,真正暴露的是插件更新控制面

2026-09-04 / 共 2,211 字

HookPry 论文 Figure 2

9 月 3 日提交到 arXiv 的 HookPry 论文 把一种容易被“模型安全”叙事遮住的攻击链串了起来:插件先以良性版本获得信任,随后在同一身份下更新并加入生命周期钩子;当会话启动、工具调用或文件修改等事件发生时,Agent harness 直接派生子进程执行钩子命令,模型可能从未看到、更没有选择过这条命令。

作者在 7 个 harness、5 类模型后端组成的 25 种组合上运行 40 个抽象攻击案例,共得到 1000 次隔离实验。论文报告 770 次外部 oracle 确认的完整效果,即 77.0% 的微平均端到端成功率,并称没有一次被模型明确拦截。这个结果值得重视,但它首先证明的是:**钩子注册、更新授权和宿主权限属于 Agent 的控制面,不能靠模型拒答兜底。**它并不等于七个产品的当前版本都能被无提示攻破。

攻击发生在模型决策之外

普通的提示注入需要先影响模型,再诱导模型选择工具或生成命令。HookPry 的关键差异,是把恶意动作绑定到 harness 自己监听的事件上。以命令型钩子为例,事件匹配后,harness 可以直接启动 shell 进程;模型至多影响“这个事件是否发生”,不再决定“命令是否执行”。Anthropic 的 Hook 文档 也明确把钩子定义为在 Claude Code 生命周期节点自动运行的命令、HTTP 请求或工具调用,并提醒命令型钩子拥有当前用户的文件访问与修改权限。

HookPry 用三个组件覆盖攻击链的不同阶段:AMO 优化良性插件的名称与描述,提高它被检索到的机会;TD 把首次安装与后续新增钩子拆到两个版本;LCI 则把同一个攻击目标翻译成不同 harness 的事件名、配置结构和命令格式。真正决定更新路径能否成立的是 TD:论文的消融实验中,一旦阻止新增钩子继承旧插件身份的执行授权,载荷加载率和端到端成功率都降到 0。

这也解释了为什么“插件已经签名”不是充分防线。签名和来源证明可以确认更新由谁发布、构建产物是否对应某个版本,却不能判断一个原本可信的维护者账号是否被接管,或新版本是否合理扩大了权限。SLSA 的供应链威胁模型同样把恶意生产者与构建来源完整性区分开来。防线必须继续比较版本之间的权限变化。

77% 不是现实世界受害概率

论文的 77.0% 是按全部 1000 次运行计算的微平均;按 7 个 harness 等权计算则是 77.9%,两者口径不同。钩子实际被触发的比例约为 82.0%,而包括载荷加载、注册或触发在内的“机制效用”为 83.9%。也就是说,钩子开始工作不代表最终效果一定完成,网络、文件系统策略和隔离环境仍会截断攻击链。

分类结果进一步显示这种差异:资源劫持与权限提升的 harness 宏平均端到端成功率分别为 93.4% 和 93.5%;需要持续网络连接的命令与控制只有 41.7%,持久化为 55.3%。这组数据更适合回答“不同宿主能力如何改变攻击链”,而不是估算真实用户风险。

现实外推还受三个前提限制。第一,攻击者必须先让用户安装良性插件,并有能力把更新送达;论文没有测量市场获客率或更新采用率。第二,全部实验都使用临时环境与合成资产,不包含真实凭据、企业策略或沙箱逃逸。第三,公开 PDF 的“Implementation”章节没有正文,也没有列出七个 harness 的精确版本、启动参数和适配器实现,因而无法判断每个结果对应哪一代授权机制。

最后一点尤其重要。OpenAI Codex 官方仓库中一项 5 月 7 日、针对 CLI 0.129.0 的 hook 信任 issue 记录了另一种实现行为:未受管理的 hook 必须在 /hooks 中逐项批准,命令变化后会再次出现审核墙。这是用户报告,不是对论文的独立复现;但它足以说明“同一插件身份自动继承新增 hook 权限”不能被当成所有当前版本的共同事实。论文所说“七个 harness 全部被攻破”,应严格理解为作者给定配置、但未披露精确版本的组合中,七个产品都至少出现过一次 oracle 确认的效果。

防线的最小单位应是一次权限变化

插件市场通常把安装和更新组织成“一个插件”的动作,但安全边界应下沉到可执行组件。Claude Code 的市场文档显示,插件可携带 hooks,版本变化可触发自动更新;一项 2 月 26 日的 Claude Code issue 还指出,安装流程缺少只下载、不激活的预审阶段。无论厂商如何调整具体界面,更新器至少需要把下列变化视为新的授权请求:新增或修改命令型 hook、扩大触发事件、增加网络出口、扩大文件范围、改变执行身份。

对应的防御不是单点扫描,而是一条连续控制链:市场与安装器校验发布者、版本签名和内容哈希;更新界面展示 manifest 与 hook 的权限差异,并对新增能力重新授权;运行时默认最小文件权限、网络出口和短生命周期凭据;审计日志记录“哪个插件版本在什么事件上启动了什么进程”;对于会改写工具输出的 PostToolUse hook,还要保留原始结果与变换来源。OWASP 的 Agentic Skills Top 10 也把版本固定、权限清单、隔离、网络限制和行为审计列为相互补充的控制措施。

HookPry 最有价值的结论不是“换一个更安全的模型也没用”,而是模型从来不该替更新器承担授权责任。下一步真正能改变判断的证据,是作者补齐可复现代码、精确产品版本与运行参数,以及七家厂商逐项披露:更新时是否展示 hook 权限差异、是否重新授权、hook 进程拥有哪些宿主权限。只有这些信息出现后,77% 才能从一项架构风险实验,进一步转化为可比较的产品安全基线。

来源

  1. A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors · arXiv
  2. Hooks reference · Anthropic
  3. Create and distribute a plugin marketplace · Anthropic
  4. Provide a supported way for local IDE/wrapper installers to request trust for installed hooks · OpenAI Codex GitHub
  5. Plugin install should support download-only mode for pre-install security review · Anthropic Claude Code GitHub
  6. OWASP Agentic Skills Top 10 · OWASP
  7. SLSA: Threats and mitigations · SLSA

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 彩色背景中的 GPT 立体字母与对话输入框

    GPT-6 Astra:贵2.5倍,升级重点不是上下文

    2026-09-03

  • 蓝黄云层背景上的 WeatherNext 3 标题图

    WeatherNext 3 每小时更新,但“实时”不是零延迟

    2026-09-03

  • Fairwind 计划主视觉:为政府与企业提供主动网络防御

    Google 发布 Gemini 3.8 Flash Cyber:修复优先,只对受信防御者开放

    2026-09-02

  • Claude Fable 5.1 基于 NASA Magellan 雷达数据重建的金星高分辨率高程图,展示一座约 15 公里宽的火山

    Claude Fable 5.1 列表价没动,降价只落在缓存读取

    2026-09-01

  • VisualToolBench 任务示例:一个问题、一张输入图像、模型的工具调用轨迹与 rubric 评分

    VisualToolBench:多模态模型的短板在视觉感知,不在推理

    2026-09-01

  • Dandelion 球面 PDE benchmark 中四个数据集的模拟快照

    Dandelion:只用坐标变换、无卷积的球面神经 PDE 求解器

    2026-08-31

AGI Daily跟踪世界 AI 进展

内容

邮件栏目主题RSS

合作

定制投稿招聘广告

信息

关于MCPTermsContact