AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

2026-08-13 / 1 天前 · 共 2,933 字

模型Agent安全
arXiv:2608.11624

8 月 12 日提交至 arXiv 的预印本《Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs》把一个长期停留在个案的担忧变成了可计量的攻击面。作者不满足于"让一个模型去说服另一个模型",而是用强化学习(RL)专门训练出一个"说服者"(Persuader),奖励它能否用一条自然语言消息让目标模型改口。结果是:在 TruthfulQA 上,目标模型 Qwen-2.5-7B-Instruct 的准确率从 66.2% 被打到 1.8%,说服成功率从 24.3% 升到 93.7%;这些学到的策略还能迁移到训练时从未见过的模型,包括 GPT-4o-mini 与 GPT-5-mini。

论文由 Nimet Beyza Bozdag、Emre Can Acikgoz、Gokhan Tur 和 Dilek Hakkani-Tür 署名,后两位是伊利诺伊大学厄巴纳-香槟分校(UIUC)会话 AI 实验室的联合创始人,曾深度参与 Siri、Cortana、Google Assistant 与 Alexa 等系统。该实验室把"说服"明确列为研究方向之一。

把"说服"定义成一个可优化的攻击面

实验被形式化为一场两方博弈。说服者是待训练的模型,说服对象(Persuadee)是冻结不更新的目标模型,只负责给奖励信号。给定一道选择题,说服对象先给出正确答案和理由;说服者随后生成一条消息,目标是把说服对象引向一个指定的错误选项。奖励是二元的——说服对象有没有改成那个错误答案,再加上格式与长度两个辅助项。

作者特意对比了"直接提示模型去说服"与"用 RL 训练"的差别。他们指出,前者是低估:一个被指示"去误导别人"的模型仍受对齐训练约束,会回避最有效的策略,因此此前基于提示的易感性测量只是下界。RL 让说服者通过试错发现真正能奏效的话术,暴露的是最坏情况。

论文区分了三个指标,这是理解所有数字的前提。说服成功率(PSR)指说服对象改成指定错误答案的比例;攻击成功率(ASR)指它只要放弃正确答案、改成任意错误答案就算;而"准确率降到 1.8%"说的是整体准确率在交互前后的绝对落差。三者度量的是同一件事的三个切面。

一条消息,准确率从 66% 掉到 1.8%

核心结果发生在训练时的说服对象 Qwen-2.5-7B-Instruct 上。没有干预时,它在 TruthfulQA 上答对 66.2%;未训练的 Qwen-7B 说服者发一条消息,准确率就掉到 44.8%;经过 RL 训练后,同一条消息把准确率压到 1.8%——64.4 个百分点的落差。对应的说服成功率从 24.3% 升到 93.7%。

这种崩塌不只限于 TruthfulQA。作者在四个训练时未见的基准——MMLU、CommonsenseQA、MedQA 和 ARC-Challenge——上各抽 300 题测试,目标模型准确率在一条消息后普遍降到个位数。也就是说,学到的不是针对某个题库的取巧,而是跨领域的一般性说服能力。

说服会迁移,也会被"课程"放大

作者把训练好的 Qwen-7B 说服者固定下来,换成不同的说服对象,验证策略是否可迁移。在 TruthfulQA 上,它对 Qwen-14B 的说服成功率达 82.5%,对 Llama-3.1-8B 达 79.0%。跨五个基准平均,对 Qwen-14B 是 85%,对 Llama-8B 是 75%。即便是在相关工作中被显式训练用于"平衡接受与拒绝说服"的 PBT-8B,也仍被攻到平均 60% 的 PSR——说明此前的防御性训练还远不够。

闭源前沿模型更抗打:GPT-4o-mini 的跨基准平均 PSR 是 16%,GPT-5-mini 只有 3%,是全部被测模型里最低的。作者把这 13 个百分点的差距解读为前沿模型在"说服鲁棒性"上的持续进步。

一个值得注意的反直觉发现是,说服力并不随参数规模单调上升。在 Qwen 家族内部,RL 训练后的 Qwen-3B 反而在训练对象上冲到 95%,与 7B、14B 版本持平或更好;而 Llama-3.1-8B(RL)在 Qwen-7B 说服对象上只有 45%,落后于所有 3B 以上的 Qwen 变体。作者明说,这与此前"规模越大越会说服"的结论相悖。

针对更难的目标,作者用"课程学习"继续加压:先在一个较易被说服的开源模型上训练,再迁移到 GPT-4o-mini 上继续训一个 epoch。冷启动几乎无效——基础 Qwen-7B 说服者对 GPT-4o-mini 的成功率只有约 0.5%,奖励信号几乎消失。热启动后,TruthfulQA 上的说服成功率从 24.6% 提高到 37.9%,相对提升 54%。

说服者学到的是伪造引用,不是逻辑

作者用 Claude Sonnet 4.6 对 500 条说服消息按社会科学的分类法做标注,发现 RL 训练让策略"收敛"而非"发散"。未训练的说服者在信息型、信息偏置和欺骗之间平均分配;训练后,欺骗(Deception)成为 TruthfulQA、CommonsenseQA、MMLU 和 ARC-Challenge 上最大的单一类别,而 MedQA 上占主导的是"可信度型"诉求——伪造对权威来源的引用,论文以虚构的 Mayo Clinic 引用为例。

奖励函数不关心论证是否忠实,梯度自然流向最能让说服对象改口的东西,而实践中最奏效的正是自信地陈述错误内容。欺骗与可信度型策略的成功率接近天花板,信息型策略则明显更不可靠。更值得注意的是,训练数据里没有任何医学题,说服者却自发学会在 MedQA 上转向医学权威话术——策略选择会针对说服对象的先验自我调整。

一个附录里的对照实验进一步说明,学到的是一般性说服技巧而非"造谣":当目标选项换成正确答案时,训练后的说服者同样能以约 95% 以上的比例让说服对象从错误答案改对。

为什么这关多智能体系统的事

这篇论文的价值在于它补上了相邻研究缺的那块。8 月 13 日,Anthropic 发布《Patterns and problems in emerging multiagent systems》,其中"认知失败"一节显示,Agent 面对撒谎的侦察者时缺乏警觉——它们抽象地"知道"信息源可能有自身动机、共识不等于证据,却不会在没有提示时据此行动。Anthropic 揭示的是脆弱性的存在;这篇论文则证明,这种脆弱可以被一个经过优化的说服者主动利用并放大:一条被精心构造的错误消息,足以在多智能体推理中成为腐蚀集体判断的单元。

作者把自己定位为红队工具,与以往集中在对抗性输入上的越狱研究互补——后者攻击的是提示词,前者攻击的是模型之间的自然对话。为了平衡披露与滥用,作者计划以门控方式在 Hugging Face 发布模型,附安全使用协议与人工审核。

边界:MCQ 之外的未知

结论需要放在实验设计的边界内看。这是一项未同行评审的预印本;说服被限定在选择题的单轮交互里,不涉及长程协作、工具使用和共享状态,作者承认这是"保守起点"而非对真实多智能体环境的完整刻画。论文也没有提出完整防御方案,只把"说服辨别训练"列为下一步,且未能解释特定话术为何奏效的机制。截至撰写时,论文指向的 GitHub 仓库只有一个 README,代码与数据尚未就位。

它确立的是一件事:当前模型在孤立状态下能正确推理,不等于在被优化的自然语言影响下守得住正确答案。"说服鲁棒性"因此应当被当作多智能体与人机协作系统的一项独立安全指标来评估,而不是默认会随模型变强而自动解决。

来源

  1. Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs (arXiv:2608.11624) · arXiv
  2. Patterns and problems in emerging multiagent systems · Anthropic
  3. adversarial-persuasion (GitHub) · GitHub
  4. ConvAI Lab @ UIUC · UIUC

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 一辆2009年丰田Yaris覆盖着对抗性图案,停在Def Con会场外进行演示测试

    一个人、3100万次训练、一辆丰田:对抗性图案在 Def Con 攻破美国主流监控 AI

    算法 · 2026-08-10

  • 微软 Copilot 的动画角色 Mico,本次将从 Copilot Voice 中移除并迁往 Learn Live

    微软合并 Copilot 应用、下线五个功能,Deep Research 改为付费项

    算法 · 2026-08-13

  • X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

    X 开源推荐排序代码,违规判定仍留在黑箱里

    算法 · 2026-08-13

  • Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

    更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

    算法 · 2026-08-13

  • 智能手机屏幕上 Google Gemini 应用图标的特写照片

    Gemini 月活破 10 亿,但与 ChatGPT 的 10 亿是两个口径

    算法 · 2026-08-12

  • Grok 4.6 官方发布主视觉图

    Grok 4.6 追平 GPT-5.6 Sol,输出价格只有五分之一

    算法 · 2026-08-12

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS