8 月 14 日,Google 在纽约南区美国破产法院的一场拍卖中,以 1000 万美元赢得已停运廉价航空 Spirit Airlines 的内部数据。Axios 援引的法院文件显示,档案包括约 1 亿封员工邮件、5 亿条 Microsoft Teams 聊天与协作记录;TechSpot 援引的法院文件补充了 1700 万个 OneDrive 文件、2000 多万个 SharePoint 条目、516 个代码仓库中约 3000 万行自研代码;Tom's Hardware 援引的法院记录还列出 72 亿条竞品航班记录、75 亿条乘客交易记录和 17.5 万余条员工记录。Google 击败了出价 750 万美元的 AI 数据公司 Mercor,后者被列为备选买家。
交易并未就此落地。8 月 18 日,代表 Spirit 空乘的空乘协会(AFA-CWA)提出异议,破产法院随即将原定 8 月 19 日的批准听证会推迟到 9 月 9 日。这场争端的焦点不是「AI 公司该不该买数据」,而是一个更具体的矛盾:这批数据之所以值钱,恰恰因为出售协议要求保留跨数据集的关联;而这些关联,可能让被「去标识」的信息重新拼回具体的人。
买下的不是乘客名单,而是一家公司的运营方式
先厘清口径。Axios 援引的法院文件显示,交易「不包括乘客画像或其常旅客信息」;Tom's Hardware 援引的法院记录进一步列出被排除的部分——9750 万个乘客画像、5020 万条 Free Spirit 忠诚计划客户记录,以及信用卡信息。Google 对 Axios 与 Forbes 的声明口径一致:「我们收购了 Spirit Airlines 企业数据集的一部分,这可能有助于改进我们的产品与 AI 模型。我们不会从这份数据集收到任何个人信息;我们收到的任何数据,都会在交付前由第三方严格清除所有个人可识别信息。」
所以 Google 花钱买的不是「人」,而是「流程」:一家经营数十年的航空公司如何定价、排班、处理客户服务、记录收支、写内部邮件。TechSpot 援引法院文件列出的类别包括定价模型、预订曲线、航班记录、机组排班、燃油单据、财务数据库、IT 支持工单与客服工作流。与从网页爬取的数据不同,这些记录展示的是人如何做决策、与同事协调、修正错误、在企业系统里完成一件具体的事——这正是训练能在职场干活的 agent 模型所缺的样本。
为什么「运营尾气」突然变成训练资产
Forbes 4 月 16 日的封面报道给出了这条线索的起点:已倒闭初创公司的 Slack 归档、Jira 工单、邮件线程正被清算为训练数据。前 OpenAI 首席科学家 Ilya Sutskever 曾断言(经 Forbes 转述),AI 实验室在 2024 年底前已经「用尽」了公开互联网。而公开文本对训练 agentic AI 尤其不适用——如果目标是让模型学会在职场完成任务,就需要大量「真正把活干成」的样子。
这催生了一个有价格体系的二手市场。帮助公司清算的 SimpleClosure 过去一年处理了近 100 笔此类交易,每笔通常在 1 万到 10 万美元之间,累计为创始人追回逾 100 万美元。价格取决于公司规模、年龄与「数据丰富度」——一条能关联到具体代码提交的 Jira 工单,比一份孤立文档更值钱。Spirit 这笔 1000 万美元的交易,是这条赛道上迄今公开可见、规模最大的一例;买家是超大规模公司 Google,备选买家 Mercor 以 750 万美元参与竞价,说明科技巨头与数据标注公司都在争抢这个新货源。
去标识的承诺,撞上「可链接性」的要求
核心冲突在这里。Forbes 报道,法院文件描述的去标识由法院任命的第三方监察员监督,要求采取「合理措施」使数据无法与个人关联;Google 承担去标识成本,并被禁止尝试重新识别。但 Reuters 披露了工会异议的实质:出售协议要求保留跨数据集的关联——而这正是让数据值钱的地方,也呼应了前述「数据丰富度」的定价逻辑。工会担心,一旦这些关联被保留,关于个人或小群体的信息就可能被重新拼凑出来。
空乘协会主席 Sara Nelson 对 Forbes 说:「这太离谱了!我们正在就 Google 购买这些本不该被出售的数据向法院提出异议。」工会的具体诉求是限制出售空乘员工数据、并给员工更多保护。值得划清的是,工会反对的不是乘客数据——那部分已被排除——而是员工数据:在破产清算中,员工多年的工作记录被当作公司资产出售,员工本人却几乎没有发言权。
从爬互联网,到买书,再到买企业数据
把这条新闻放回时间线,训练数据获取方式的演进就清晰了:先是爬公开互联网(Reddit、维基百科、电子书),到 2024 年底基本耗尽;然后是买实体书——8 月 18 日本站报道的 404 Media 追踪显示,亚马逊正在批量拆解扫描稀有书,因为 2022 年前出版的旧书几乎不可能是大模型写的,能避免「模型崩溃」;现在则延伸到企业运营数据,把一家公司多年积累的邮件、聊天、代码和交易记录直接当成训练语料。三者的共同逻辑是同一个:独特、真实、非互联网的文本正在成为稀缺资产,而 AI 公司愿意为此出价。
尚未回答的问题
交易能否落地,取决于 9 月 9 日的听证会,以及法官 Sean Lane 是否接受「去标识 + 禁止重新识别」足以消除员工数据的隐私风险。三个问题目前没有答案。其一,第三方去标识的可验证性——Forbes 采访的业内人士指出,对「一辈子的工作痕迹」做去标识没有开关,做不好就有信息泄露进模型输出的风险。其二,「保留跨数据集关联」与「无法重新识别」在技术上能否同时成立,是工会异议的实质,也是法官需要裁量的点。其三,Google 声明只承诺「改进产品与 AI 模型」,并未说明这些数据会进入哪类模型的训练语料、用于什么任务——航空是监管严格、高度保守的行业,Google 是否有把它变成面向航空业产品的计划,公司未披露。
Spirit 的清算不是孤例,而是一个正在形成、已有定价的二手市场。当训练数据的稀缺性竞赛从公开语料延伸到企业内部数据,真正的问题不再是「AI 公司买数据」本身,而是清算程序里员工的数字劳动成果在何种条件下可以被当作可出售资产——以及去标识的承诺,能否经得起「数据越丰富、越难匿名」这一内在张力的考验。

