8 月 28 日,索尼音乐出版(Sony Music Publishing)与华纳查普尔音乐(Warner Chappell Music)联合旗下多家关联出版公司,在加州北区联邦地区法院(圣何塞分院)起诉 Anthropic 及其两位联合创始人——联合创始人兼 CEO Dario Amodei 与联合创始人 Benjamin Mann(案号 5:26-cv-09217)。起诉书全文把 Anthropic 的行为定性为「历史上规模最大、最赤裸的持续性知识产权盗窃之一」,指控其用 BitTorrent 从盗版书库 Library Genesis(LibGen)与 Pirate Library Mirror(PiLiMi)下载含歌词与乐谱的书籍,再通过抓取、扫描与剥离版权信息,把索尼、华纳旗下歌曲的歌词用于训练 Claude。
值得注意的不是「AI 用版权作品训练是否侵权」这个被反复争论的问题,而是这份起诉书几乎绕开了它。它建立在 Bartz 案已经划出的一条分界线上:用合法买来的书训练是合理使用,用盗版书建「永久图书馆」不是。索尼与华纳要打的,是这条分界线靠盗版获取数据的那一侧——并且第一次把责任追到创始人个人。
一条法院已经划好的分界线
TechCrunch在报道里点明了这条线的来历。2025 年 6 月,法官 William Alsup 在 Bartz v. Anthropic 案中作出分水岭式裁决:Anthropic 用合法购得的书训练模型,「本质上是转换性的」,受合理使用保护;但下载并保存盗版副本不构成合理使用。他写下的判断成为这轮诉讼的地基:「Anthropic 无权把盗版副本用于一个中央图书馆;建立一个永久的、通用的图书馆,本身不是合理使用。」JURIST记录,该裁决确认 AI 公司可以用合法购买的书训练,但不能用盗版书。
Bartz 案随后以 15 亿美元和解收官。7 月 20 日,法官 Araceli Martínez-Olguín 批准了这项美国历史上金额最大的版权和解。Kluwer Copyright Blog测算,当时 Anthropic 面对的理论责任上限一度超过 700 亿美元——这正是它「赢下训练合理使用」仍选择和解的原因。
这条线的法律含义是:原告不必再争论「训练是否侵权」,只要证明「数据是盗来的」就够了。本案走的正是这条路。
起诉书的增量:把音乐放进盗版框架
本案的核心事实并非全新——Bartz 法院已认定,Anthropic 在 2021 年 6 月由 Mann 用 BitTorrent 从 LibGen 下载至少 500 万本盗版书,2022 年 7 月又从 PiLiMi 下载至少 200 万本,合计逾 700 万本。索尼与华纳的增量,是主张这批书里有属于他们的歌词与乐谱。
起诉书点名了具体书目:《The Beatles Complete Scores》《Best of Taylor Swift Songbook》《Bon Jovi These Days》等含合法授权乐谱与歌词的书,都在被下载的清单里。被列为涉嫌侵权的歌曲包括《Ain't No Mountain High Enough》《All I Want for Christmas is You》《Eye of the Tiger》《Livin' On a Prayer》《Hallelujah》与 Taylor Swift 的《Paper Rings》。
盗版之外,起诉书还罗列了另外三条路径:Music Business Worldwide概括为「抓取 MusixMatch、LyricFind 等授权歌词网站的歌词、对二手书进行『破坏性扫描』、使用 Common Crawl、The Pile 与 Books3 等第三方数据集」。其中 Books3 尤为关键——Bartz 法院已认定 Mann 下载了 196,640 本 Books3 盗版书,「为了省去付费的麻烦」。关于「破坏性扫描」,起诉书援引一份 2024 年规划文件里的话:「我们不希望外界知道我们在做这件事。」
把责任落到创始人个人
这份起诉书区别于此前音乐案件的地方,是把侵权责任具体到 Amodei 与 Mann 个人。它提出四项诉讼请求:torrent 直接侵权(三被告)、torrent 帮助侵权(Amodei 与 Mann)、更广泛的直接侵权(仅 Anthropic)、移除或篡改版权管理信息(仅 Anthropic)。
支撑个人责任的是 Bartz 案解封的内部材料。起诉书援引这些材料称:Mann 在内部讨论中把 LibGen 称为「sketchy AF」(极其可疑);Anthropic 自己的 Archive Team 曾把 LibGen 描述为「对版权的公然违反」;Mann 下载盗版书是「为了省去付费的麻烦」;Amodei 则承认公司本可以从多处合法购买这些书,选择 torrent 是为了更快、免费,避免「法律/实务/商业上的麻烦」。起诉书据此主张:没有 Amodei 与 Mann 的指示和批准,这一切不会发生。
从输入到输出:逐字复现与「间接污染」
起诉书没有停在「获取」,而是延伸到模型行为。它指控 Claude 能逐字或近乎逐字复现歌词,且此前诉讼后加的护栏「只需重新提问即可轻易绕过」。它还提出一个更刁钻的论点:Anthropic 否认用过盗版书训练商用模型,但这种否认取决于「训练」的定义——起诉书称,至少有一款商用 Claude 模型,是用「由盗版数据训练的非商用模型生成的合成数据」训练的,还从该模型获得过强化反馈。换言之,盗版内容可能经「合成数据」与「强化反馈」两道工序,间接进入商用模型。
与此配套的是版权管理信息(CMI)指控:起诉书称 Anthropic 用 Newspaper 等文本抽取工具清洗数据时,刻意剥离了歌词作者、版权声明等归属信息,既为掩盖侵权,也构成对联邦法第 1202 条的单独违反。它引用的内部聊天记录显示,Anthropic 曾因某工具未能去掉网页页脚的版权声明而不满,转而选用能「可靠移除页脚与版权声明」的工具。
这起诉讼改变了什么,还有什么是未知的
这起诉讼让三大唱片公司的出版部门全部站到了 Anthropic 的对立面。Music Business Worldwide梳理的诉讼链是:2023 年 10 月,环球音乐出版、Concord 与 ABKCO 在纳什维尔就约 500 首歌起诉,后转至加州;2026 年 1 月,同一批原告追加第二起、覆盖逾 2 万部作品、索赔超 30 亿美元;3 月 BMG 就 493 部作品起诉;8 月 17 日 Round Hill 起诉 Suno 与 Anthropic,各索赔最高 10 亿美元。
时间点放大了这起诉讼的分量。起诉书援引 Forbes 8 月 13 日报道,称 Anthropic 目标在 10 月以约 2 万亿美元估值 IPO;而按 5 月的 H 轮融资,其投后估值约 9650 亿美元。索尼与华纳在起诉书里直言,15 亿美元的和解「显然不足以震慑一家把大规模侵权变现为 2 万亿美元估值的公司」。
需要划清的边界有三处。其一,torrent 700 万本书是 Bartz 法院的既成认定,但「其中包含索尼华纳的歌词与乐谱」「抓取与扫描的歌词进入训练」「Claude 逐字复现」这些主张,仍是待证的新指控。其二,「每部作品最高 15 万美元」是故意侵权的法定赔偿上限,不是已确定的赔偿额;被告尚未答辩,Anthropic 截至发稿未回应。其三,「间接污染」的论证,取决于法院是否接受「合成数据与强化反馈也算训练」这一扩大解释——这恰是 Anthropic 一直否认使用盗版书训练商用模型的依据。
接下来值得观察的变量有三个:Anthropic 的答辩是否承认或继续否认盗版数据进入商用模型;法院如何处理对两位创始人的个人责任主张,这关系着 AI 公司创始人在多大程度上要为训练数据的获取方式承担连带风险;以及这起诉讼会否像 Bartz 案一样以和解而非判决收场。

