8 月 19 日,OpenAI 预览了一项名为 Private Safety Processing 的新服务,宣称能在不保留客户数据的前提下跨会话识别滥用;次日(8 月 20 日),路透援引知情人士报道,Anthropic 计划调整其 6 月 9 日起对 Fable、Mythos 级「覆盖模型」实施的 30 天强制留存政策——仍要求留存,但允许企业把数据放在自己的云上。两天之内,两家都在冲刺 IPO 的前沿实验室,把「企业数据到底该不该、该留在谁手里 30 天」推成了正面交锋。
真正的分歧不在「要不要做安全监控」,而在监控能不能不牺牲数据主权。两家公司对这个两难给出了相反的答案。
为什么「跨会话」突然变得重要
两家公司对威胁的判断是一致的:有些攻击只在多个请求拼在一起时才现形。Anthropic 的官方说明列举了 Best-of-N 越狱(把同一提示改写数百个变体去撞开护栏)、国家支持的间谍活动、数据勒索等模式,指出这些滥用「只有当安全分类器能在许多请求之上拉远镜头时才浮出水面」。
OpenAI 产品政策负责人 Aleah Houze 在记者会上给出过一个更直白的例子:有人可能在一个对话里问某公司软件的弱点,再在另一个对话里问远程访问或「什么安全工具能检测到」——单看每一段都无害,连起来才是攻击前的踩点。
问题在于,传统的零数据留存(Zero Data Retention,下称 ZDR)只对单个请求做即时检查,处理完即删。当模型承担越来越长的 Agent 任务时,逐条检查看不见跨请求的模式。安全监控与 ZDR,就此在技术上出现了冲突。
Anthropic 的答案:让企业让出 30 天数据
Anthropic 选择了保守一侧。按官方说明,6 月 9 日起,提交给「覆盖模型」的提示与输出在所有平台上留存 30 天,覆盖模型指 Mythos 级模型及未来能力相近的模型——Fable 5 与 Mythos 5 同底座,只是多了网络与生物领域的额外护栏。
容易被误读的一点是:这条政策并不波及大多数用户。它只作用于原本签了 ZDR 的企业组织——通过 Claude Console 的 ZDR 工作区、Claude Enterprise 里的 Claude Code ZDR,或经 AWS Bedrock、Google Cloud Agent Platform、Microsoft Foundry 走 ZDR 的客户。消费者套餐本就保留数据,不受影响。也就是说,Anthropic 动的是那批最在意「零留存」承诺、且正在试用新前沿模型的企业。
对这部分客户,Anthropic 的补偿是控制措施:默认没有员工能读留存对话,人工复核只经「受控访问路径」、由少数获批审核者执行,每次访问都记入不可篡改的日志,30 天后自动删除;企业还可加装客户管理的加密密钥与访问审计日志。经 Bedrock 或 GCP 调用时,留存数据留在云厂商环境里。这是一套「留存但不乱看」的方案。
OpenAI 的答案:数据留在客户侧,只回传一个窄信号
OpenAI 走的是另一条路。官方博客描述的机制是:数据要么留在客户控制的基础设施上(即 ZDR 部署),要么存在 OpenAI 侧、但用客户持有的密钥加密——OpenAI 员工没有密钥副本。自动化系统在相关交互之间识别模式,一旦触发风险,OpenAI 只收到一个「窄信号」,标明活动的类型,而不是提示或回复本身;即便被标记,员工也拿不到内容。客户用自己的系统调查告警、申诉或补充信息,选择是否把相关内容分享给 OpenAI。
这套描述里有一个需要点破的细节:所谓「零留存」不等于「内容不被机器处理」。OpenAI 的自动化系统仍要读到明文才能发现跨会话模式,它承诺的是「不存储、员工不可见」,而不是「内容从未经手」。Anthropic 的自动化系统同样在分析内容——两者的差异不在「有没有机器在读」,而在留存时长、密钥控制与数据物理位置。
OpenAI 还保留了 CSAM 例外:疑似儿童性虐待材料的图像即便在 ZDR 部署中也会被保留供人工复核与上报,这是法律义务。目前该服务只面向合格的企业与 API 客户,不覆盖 ChatGPT 的 Free/Plus/Go/Pro 消费套餐;公司计划 9 月启动更广的推出并发布技术白皮书。
Anthropic 自己预言过的风险,正在兑现
这场竞争里最值得注意的证据,来自 Anthropic 自己的风险报告。公司写道:强制 30 天留存「将会不受那些已经习惯零留存的客户欢迎,并对我们的商业成功构成真实风险(尤其当竞争对手不跟进时),但我们认为这对检测和阻止跨多个请求的复杂攻击至关重要」。
Anthropic 准确地预言了风险本身,而 OpenAI 的确没有跟进。路透 8 月 20 日报道,Anthropic 计划仍要求企业留存 30 天,但允许他们把数据保留在自己的云基础设施上,并计划在今年晚些时候推出新的安全系统;这套改动已筹划数月,正与包括 Salesforce 在内的 100 多家客户协调(Bloomberg 最先报道)。
这一步让的不是「留存」本身,而是「数据由谁持有」——把信任边界从 Anthropic 的存储,移到客户自己的云。
差异与未决问题
把两边并排看,真正的区别有三层:留存时长(30 天 vs 处理完即删)、密钥与数据物理位置(Anthropic 让步前在自己基础设施留存,OpenAI 默认客户侧或客户持钥)、以及人员可见性(两家都声称默认无人可读、仅在触发时经受控路径复核)。
未验证的是有效性。OpenAI 的方案还只是预览,技术白皮书 9 月才发;「不保留数据的跨会话监控」能否达到「留存 30 天再分析」同等的检出能力,目前没有证据。Anthropic 的 30 天留存是更保守的路线,且有已发布的威胁模型。
对企业信息安全负责人而言,这件事的意义超出了两家公司本身:前沿模型的采购条款正在把数据治理写进竞争。TechCrunch 报道,Anthropic 年化营收运行率已达约 650 亿美元,投资者称其上市估值目标约 2 万亿美元;WSJ 则报道 OpenAI 二季度增速低于 Anthropic。双方都在 IPO 前夜,谁能同时给出「最前沿的模型」和「最克制的数据条款」,谁就多一张打动受监管行业客户的名片。
接下来的可观察变量有两个:9 月 OpenAI 的技术白皮书能否证明零留存监控的有效性;Anthropic 的新安全系统是否真正落地、以及它会不会进一步向客户让出数据控制权。若 OpenAI 的路线被证明可行,30 天留存作为「安全必需」的默认选项,将很难再站得住。