AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

汤森路透发布自研法律大模型 Thomson:4000 万美元挑战前沿实验室的规模逻辑

今天 · 共 2,998 字

LawNext / Robert Ambrogi

8 月 24 日,汤森路透发布其首个自研大模型 Thomson(正式版本号 Thomson 1.0)。一家以法律、税务、新闻内容为主业的信息公司,宣称用约 4000 万美元和自有数据,做出了"在多项任务上对标前沿模型"的领域专用模型——这个数字本身是反常的。前沿实验室训练一个旗舰模型通常以数十亿美元计,而据法律科技媒体 LawNext 从发布前媒体吹风会了解,Thomson 本次发布版本的最终一轮训练仅花费约 45 万美元。

汤森路透不是 AI 实验室。它是 OpenAI 与 Anthropic 的重要企业客户,旗下 CoCounsel 法律产品长期由第三方前沿模型驱动。现在它不再只"整合世界最好的模型",而是自己造了一个。这背后是一个比单个模型更值得读的信号:专业 AI 的竞争轴,正在从"模型规模"转向"专有数据 + 专家监督 + 可重复的模型工厂 + 验证层"。

4000 万美元与 45 万美元:钱花在了哪里

官方新闻稿的表述是:前沿实验室"通常花费数十亿美元和数年基础设施投资才到达前沿",汤森路透走了另一条路——"从一个强开源底座出发,投入 4000 万美元,把 Thomson 训练成对专业工作最关键的智能",这笔钱覆盖人才与算力。新闻稿没有点名底座模型。

更细的数字来自 LawNext 记者 Robert Ambrogi 对媒体吹风会的记录:两年间总投入约 4000 万美元,而本次发布版本的最终一轮训练只花了约 45 万美元。CTO Joel Hron 把这个数字当作论据:"这个 45 万美元的数字,说明我们能在一流开源模型之上,用我们的数据和内容做出什么。"

关键在于成本结构。Thomson 没有从零做预训练,而是付费做"中训练 + 后训练"的领域专业化,把底座模型的预训练成本留给了开源社区。据 LawNext 对媒体吹风会的报道,两年里底座模型随开源生态的进步换过近六次,最近一次采用的是 Qwen 3.5;基础研究主管 Jonathan Schwarz 强调,这次发布最重要的不是某个模型,而是"我们建成的模型工厂"(model factory)——一套可重复的、把开源底座改造成领域专才的流水线。

数据与专家监督:"喂内容"不等于"会工作"

Thomson 的训练数据来自汤森路透数十年的权威内容:法律数据库 Westlaw、实务指引 Practical Law、税务产品 Checkpoint,以及路透的新闻。公司称,目前只用掉了全部内容的不到 10%。

比数据更重的是人。据 LawNext,数百名内部律师与税务专家参与了三件事:决定模型该被训练成什么样;产出数千条高质量示范答案;以盲评方式把 Thomson 的输出与前沿模型做逐条对比。评估负责人 Andrew Bean 的说法是,这套流程衡量两个维度——完整性(答案是否覆盖了正确回答应有的要素)与事实性(引文是否真的支持论断)。

公司核心论点由此成型:把专有训练与人类专家监督施加在一个强底座上,能产生"仅靠内容访问"得不到的增益。这直接挑战一个流行假设——最通用的模型只要接入正确的内容(比如检索增强),就能在专家水平上工作。Schwarz 描述了具体做法:先对齐模型的价值观与行为,再用汤森路透专有内容持续训练,最后训练它与公司自有的研究工具协同。

还有一个治理细节:Hron 明确表示训练完全不使用客户数据,而是让内部专家复现相应任务来制造训练信号。

"对标前沿"的证据强度

"在多项任务上对标最新前沿模型"是 CEO Steve Hasker 在新闻稿中的原话,属于公司自报。目前可查的外部证据有限,需要分开看。

最具体的是汤森路透内部一个名为 Deep Research 的基准:由专家起草法律研究问题并给出"好答案应包含的要素",从完整性与事实性两个维度打分。据 LawNext,公司把 Thomson 与 GPT-5.4、Claude Sonnet 5 对比,各测两次——一次只能访问网络内容,一次可访问汤森路透内容。结果:网络内容条件下,Thomson"与其他模型在同一区间,但还不是领先者"(Bean 原话);接入汤森路透内容后,Thomson 反超两个对手。

这恰恰揭示了领域模型的真实优势边界:增益主要来自"被训练成会用自己的工具和内容",而不是在开放任务上推理能力更强。Hron 的说法更直白:"Thomson 不需要在所有维度跟上通用智能的前沿,它需要在法律智能上设定前沿。"

外部验证方面,华盛顿大学法学院教授 Jonathan H. Choi 用其公司法课程中较难的问题测试了 Thomson 与 ChatGPT、Claude,三者都答对,但他更偏好 Thomson 的回答,尤其是链接到法学专著的引文。汤森路透还把一个小版本以非商业学术许可放到 Hugging Face 上,并称本周将发布包含公开基准、法律专项基准与人工评测的技术报告。综合看,"对标前沿"目前是公司主张加单一学者测试,尚缺大规模独立基准。

从"整合他人模型"到"拥有模型",但仍多模型

Thomson 的第一个生产落点是 CoCounsel Legal 里的 Tabular Analysis——面向律所与企业法务的高频结构化文档审阅。Hron 说 Thomson 会是该功能的默认模型,但管理员可以在设置里切换到其他模型;CoCounsel 整体仍保持多模型,在 Thomson 优势最明显的地方用 Thomson,其余地方继续用 OpenAI、Anthropic 等前沿模型。

这条"自拥模型 + 保留外部模型"的路线,目标不止内部产品。公司计划把 Thomson 扩展覆盖法律与税务产品线,提供更多"主权 AI"选项;已开始与大型律所和企业谈直接授权,包括让客户用自己的数据进一步微调;开发者门户与 API 也在早期搭建中。Hron 的原话是:"我们把 Thomson 建成汤森路透的基础设施,现在开始看到它也可能成为别人的基础设施。"

对一个 OpenAI/Anthropic 的大客户而言,这一步把三件事同时摆上台面:训练方式、模型里的行为与偏见、以及数据与隐私由谁掌控——也就是公司新闻稿所说的"AI 主权"。汤森路透把这归结为一个它称之为 Fiduciary-Grade AI 的标准:面向负有注意义务与问责义务的专业人士,"几乎正确不够好",且未经明确同意不得用客户数据训练。

边界

4000 万美元不是全部成本。Thomson 建在一个前沿规模的开源底座之上,底座本身的预训练支出由他人承担;45 万美元也只是最终一轮微调的费用,不是从零到一的总账。用它反推"训练大模型很便宜"会失真。

"对标前沿"同样需要打折读:核心证据是公司自建的 Deep Research 基准与一位学者的抽样测试,比较对象是 GPT-5.4 与 Claude Sonnet 5,且优势集中在"接入汤森路透内容"这一特定条件下。要判断它是否真的在开放法律任务上追平前沿,得等技术报告与第三方复现。

更重要的边界是适用条件。这条"数据护城河"路径成立的前提,是公司拥有权威、难以复制、别人拿不到的领域数据(法律判例、实务指引、税务规则),并养得起数百名能标注与盲评的领域专家。它说明的是"拥有独特数据的组织可以低价造出够强的领域模型",而不是通用模型时代结束。对没有这类数据资产的团队,这条路径并不提供捷径。

汤森路透真正的增量,是给出了一个可核验的样本:专业 AI 的胜负手,正在从"谁的模型更大"向"谁的数据更权威、谁的专家监督更密、谁的能量产化改造开源底座"移动。Schwarz 把话说到了底:"更大的发现不是单个模型,而是我们建成的模型工厂。"

来源

  1. Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model · Thomson Reuters
  2. Thomson Reuters Launches Thomson, Its Own Proprietary LLM Trained on Westlaw and Practical Law Content · LawNext
  3. Thomson Reuters launches proprietary legal LLM 'Thomson' · Legal IT Insider

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Pew 图表:AI 写作痕迹在 .com 域名网页中约占一成,在 .edu 与 .gov 域名中仅约 1%

    ChatGPT 发布后超三分之一网页带 AI 写作痕迹:Pew 的 49 万页测量

    数据 · 2026-08-22

  • Reuters 为 Anthropic 数据留存政策报道配发的编辑插图:机械手、键盘与 Anthropic 标识

    OpenAI 推零留存安全监控,Anthropic 的 30 天数据留存政策松动

    数据 · 2026-08-21

  • OpenAI 首席执行官 Sam Altman 在美国参议院商务委员会就 AI 竞赛举行听证时作证(资料图)

    企业 AI 的领先并不黏:Fable 5 卖不动,半价的 Sol 帮 OpenAI 反攻

    数据 · 2026-08-20

  • 一名身着商务装的人与身旁透明的人物轮廓,四周环绕聊天提示词

    厂商 AI 使用报告漏掉近一半真实对话,独立测量挑战「工作用途」叙事

    数据 · 2026-08-20

  • 一架 Spirit Airlines 空客 A319 客机进近曼彻斯特-波士顿地区机场

    Google 1000 万美元拍下 Spirit 破产数据:1 亿封邮件与 5 亿条聊天将用于训练

    数据 · 2026-08-19

  • Seedance 2.0 生成的 AI 视频截图:汤姆·克鲁斯与布拉德·皮特在屋顶打斗

    MPA 与字节跳动达成首个 AI 版权协议,护栏细节未公开

    数据 · 2026-08-17

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS