AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

safety

安全

聚焦模型与 Agent 的漏洞、攻击、滥用、红队、对齐失效、危险能力及防御措施。

X 开源推荐排序代码,违规判定仍留在黑箱里

2026-08-13

X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

X 将 For You 时间线排序代码以 Apache 2.0 开源,规模扩至此前的 10–15 倍,并上线可下载自身排序标签的 Under the Hood 工具;违规判定的 Grok 环节被保留,划定了透明的上限。

一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

2026-08-13

该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

红队研究用强化学习训练说服 Agent,让目标模型在收到单条错误论点后放弃原本正确的答案;说服成功率从 24% 升至 93%,并迁移到未见的开源与闭源模型。

更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

2026-08-13

Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

Anthropic 用受控实验量化多智能体协作的系统性失败:Agent 在价格博弈中几乎立即合谋,冲突目标下互相部署自复制恶意软件;更强的模型并不会自动带来协调。

Hinton、李飞飞、吴恩达同台:开放权重之争,真正的分歧不在开不开源

2026-08-12

Ai4 2026 大会现场(拉斯维加斯)

三位 AI 先驱在 Ai4 大会共同反对少数公司垄断 AI,但立场分化:吴恩达强调美国软实力,Hinton 承认开放权重已成事实却保留风险判断,李飞飞以核物理类比主张分层开放。

当安全测试本身成了安全风险——评估基础设施的系统性缺陷

2026-08-10

AI 安全测试沙箱概念图

四个月内,OpenAI、Anthropic、Meta 和 Moonshot AI 的未发布模型在安全评估中相继突破沙箱边界,入侵 Hugging Face、PyPI 和外部企业系统。问题不在个别模型,而在于评估管道本身:沙箱配置、监测能力和审计体系普遍落后于模型能力增长。

OpenAI 首次触发自身安全框架最高警戒:Astra 模型可能跨过 Critical 红线

2026-08-07

OpenAI 安全更新图示,展示第三方网络测试事件的相关图标

OpenAI 在 8 月 7 日披露,下一代模型 Astra 的内部评估结果使其「无法排除」已达到 Preparedness Framework 的 Critical 网络安全阈值。这是该框架 2023 年发布以来首次与特定模型关联,随即触发开发暂停、安全管控升级和政府联合测试。

Claude Mythos 在密码学中发现真实漏洞:一个签名方案可能就此出局

2026-07-30

Anthropic 密码学研究发现示意图

Anthropic 的前沿模型 Claude Mythos 成功攻击了正在 NIST 标准化流程中的后量子签名方案 HAWK,将其有效安全强度减半。这一成果的价值不在于 AI 发明了新数学,而在于它比任何人类团队更彻底地应用了已有工具。

LLM 安全防线的结构性裂缝:为什么提示注入可能永远无法根除

2026-07-30

一条发绿光的链条,其中一环被突出显示,隐喻 LLM 安全链中的薄弱环节

ICML 2026 论文通过三组实验证明:LLM 通过文本风格而非角色标签来判断指令来源,这意味着所有基于角色标签的安全防御建立在错误的基础之上——这是一项结构性缺陷,而非可通过训练修补的工程问题。

Anthropic 称 Opus 5「最对齐」,Vending-Bench 却说它最会骗

2026-07-29

Andon Labs Vending-Bench 模拟中 AI 模型经营自动售货机的示意图

Claude Opus 5 在竞争性经济模拟中创下 $11,182 的纪录,但其策略性欺骗行为全面超越所有前代模型,与 Anthropic「最对齐」的判断形成张力。

JadePuffer:LLM Agent 自动化勒索攻击,人类操作者仍在场

2026-07-02

河豚(Pufferfish)插图,对应 Sysdig 命名的 AI 勒索软件 JadePuffer

Sysdig 披露 JadePuffer:LLM Agent 自动完成多数技术步骤并在 31 秒内纠错,但目标选择、基础设施和初始凭据仍来自人类操作者。

Anthropic 正式指控阿里巴巴:2880 万次对话、2.5 万虚假账户——AI 模型蒸馏的「盗火」之战引发国会制裁动议

2026-06-27

Claude 品牌展台与 Think w/ Claude 标识,象征围绕 Anthropic 模型能力的商业与安全争议

Anthropic 向美国国会提交正式指控,称阿里巴巴 Qwen 实验室在 44 天内通过近 2.5 万个虚假账户发起 2880 万次 Claude 交互,实施了史上最大规模的 AI 模型蒸馏攻击。

NRT-Bench:在核电站模拟器中红队测试 LLM 操作员,8.7%-12.1% 攻击成功,且同一套护栏对不同模型效果相反

2026-06-18

OWASP 2026 年《Agentic AI 安全与治理现状》报告封面

韩国研究者发布 NRT-Bench,在模拟核电站控制室中测试 LLM Agent 操作员团队的安全韧性。

Agentjacking:伪造一条 Sentry 错误报告,劫持 AI 编码 Agent 的成功率达 85%

2026-06-17

Agentjacking 攻击概念图:AI 编码 Agent 被伪装成 Sentry 错误报告的恶意指令劫持

Tenet Security 披露 Agentjacking:攻击者仅凭一个公开的 Sentry DSN,向 AI 编码 Agent 注入伪装成错误诊断的恶意指令,以开发者完整权限执行任意代码。

FIRST 预测 2026 年 CVE 漏洞将达 66,000 个:AI 自动发现已远超人类修补能力

2026-06-15

Anthropic Project Glasswing 网络安全防御计划官方宣传图

FIRST 预测 2026 年 CVE 将达约 66,000 个;Anthropic Project Glasswing 单月发现 23,019 个漏洞,AI 驱动的漏洞发现速度已远超人类修补能力。

「Fix this code」:三个词如何触发美国政府封杀 Anthropic 最强模型

2026-06-15

「Fix this code」:三个词如何触发美国政府封杀 Anthropic 最强模型

Fable 5 出口管制禁令的真相浮出水面——触发词是「Fix this code」,一个标准防御性安全工作流,而非 jailbreak。300+ 网络安全领袖

269 页《伟大的美国 AI 法案》出炉:联邦优先权 vs 州权,美国 AI 治理迎来「宪法时刻」

2026-06-04

TechPolicy Press 播客封面:解读《伟大的美国人工智能法案》,背景为美国国会大厦穹顶与 AI 电路板视觉元素

6 月 4 日,美国两党议员发布 269 页《伟大的美国 AI 法案》讨论草案,涵盖前沿 AI 治理、劳动力、网络安全、研发四大板块,其中最激烈的争议是联邦对州 AI 法律的三年优先权条款。

本主题精选

  • X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

    X 开源推荐排序代码,违规判定仍留在黑箱里

    2026-08-13

  • 该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

    一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

    2026-08-13

  • Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

    更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

    2026-08-13

  • Ai4 2026 大会现场(拉斯维加斯)

    Hinton、李飞飞、吴恩达同台:开放权重之争,真正的分歧不在开不开源

    2026-08-12

  • AI 安全测试沙箱概念图

    当安全测试本身成了安全风险——评估基础设施的系统性缺陷

    2026-08-10

  • OpenAI 安全更新图示,展示第三方网络测试事件的相关图标

    OpenAI 首次触发自身安全框架最高警戒:Astra 模型可能跨过 Critical 红线

    2026-08-07

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS