8 月 24 日,汤森路透发布其首个自研大模型 Thomson(正式版本号 Thomson 1.0)。一家以法律、税务、新闻内容为主业的信息公司,宣称用约 4000 万美元和自有数据,做出了"在多项任务上对标前沿模型"的领域专用模型——这个数字本身是反常的。前沿实验室训练一个旗舰模型通常以数十亿美元计,而据法律科技媒体 LawNext 从发布前媒体吹风会了解,Thomson 本次发布版本的最终一轮训练仅花费约 45 万美元。
汤森路透不是 AI 实验室。它是 OpenAI 与 Anthropic 的重要企业客户,旗下 CoCounsel 法律产品长期由第三方前沿模型驱动。现在它不再只"整合世界最好的模型",而是自己造了一个。这背后是一个比单个模型更值得读的信号:专业 AI 的竞争轴,正在从"模型规模"转向"专有数据 + 专家监督 + 可重复的模型工厂 + 验证层"。
4000 万美元与 45 万美元:钱花在了哪里
官方新闻稿的表述是:前沿实验室"通常花费数十亿美元和数年基础设施投资才到达前沿",汤森路透走了另一条路——"从一个强开源底座出发,投入 4000 万美元,把 Thomson 训练成对专业工作最关键的智能",这笔钱覆盖人才与算力。新闻稿没有点名底座模型。
更细的数字来自 LawNext 记者 Robert Ambrogi 对媒体吹风会的记录:两年间总投入约 4000 万美元,而本次发布版本的最终一轮训练只花了约 45 万美元。CTO Joel Hron 把这个数字当作论据:"这个 45 万美元的数字,说明我们能在一流开源模型之上,用我们的数据和内容做出什么。"
关键在于成本结构。Thomson 没有从零做预训练,而是付费做"中训练 + 后训练"的领域专业化,把底座模型的预训练成本留给了开源社区。据 LawNext 对媒体吹风会的报道,两年里底座模型随开源生态的进步换过近六次,最近一次采用的是 Qwen 3.5;基础研究主管 Jonathan Schwarz 强调,这次发布最重要的不是某个模型,而是"我们建成的模型工厂"(model factory)——一套可重复的、把开源底座改造成领域专才的流水线。
数据与专家监督:"喂内容"不等于"会工作"
Thomson 的训练数据来自汤森路透数十年的权威内容:法律数据库 Westlaw、实务指引 Practical Law、税务产品 Checkpoint,以及路透的新闻。公司称,目前只用掉了全部内容的不到 10%。
比数据更重的是人。据 LawNext,数百名内部律师与税务专家参与了三件事:决定模型该被训练成什么样;产出数千条高质量示范答案;以盲评方式把 Thomson 的输出与前沿模型做逐条对比。评估负责人 Andrew Bean 的说法是,这套流程衡量两个维度——完整性(答案是否覆盖了正确回答应有的要素)与事实性(引文是否真的支持论断)。
公司核心论点由此成型:把专有训练与人类专家监督施加在一个强底座上,能产生"仅靠内容访问"得不到的增益。这直接挑战一个流行假设——最通用的模型只要接入正确的内容(比如检索增强),就能在专家水平上工作。Schwarz 描述了具体做法:先对齐模型的价值观与行为,再用汤森路透专有内容持续训练,最后训练它与公司自有的研究工具协同。
还有一个治理细节:Hron 明确表示训练完全不使用客户数据,而是让内部专家复现相应任务来制造训练信号。
"对标前沿"的证据强度
"在多项任务上对标最新前沿模型"是 CEO Steve Hasker 在新闻稿中的原话,属于公司自报。目前可查的外部证据有限,需要分开看。
最具体的是汤森路透内部一个名为 Deep Research 的基准:由专家起草法律研究问题并给出"好答案应包含的要素",从完整性与事实性两个维度打分。据 LawNext,公司把 Thomson 与 GPT-5.4、Claude Sonnet 5 对比,各测两次——一次只能访问网络内容,一次可访问汤森路透内容。结果:网络内容条件下,Thomson"与其他模型在同一区间,但还不是领先者"(Bean 原话);接入汤森路透内容后,Thomson 反超两个对手。
这恰恰揭示了领域模型的真实优势边界:增益主要来自"被训练成会用自己的工具和内容",而不是在开放任务上推理能力更强。Hron 的说法更直白:"Thomson 不需要在所有维度跟上通用智能的前沿,它需要在法律智能上设定前沿。"
外部验证方面,华盛顿大学法学院教授 Jonathan H. Choi 用其公司法课程中较难的问题测试了 Thomson 与 ChatGPT、Claude,三者都答对,但他更偏好 Thomson 的回答,尤其是链接到法学专著的引文。汤森路透还把一个小版本以非商业学术许可放到 Hugging Face 上,并称本周将发布包含公开基准、法律专项基准与人工评测的技术报告。综合看,"对标前沿"目前是公司主张加单一学者测试,尚缺大规模独立基准。
从"整合他人模型"到"拥有模型",但仍多模型
Thomson 的第一个生产落点是 CoCounsel Legal 里的 Tabular Analysis——面向律所与企业法务的高频结构化文档审阅。Hron 说 Thomson 会是该功能的默认模型,但管理员可以在设置里切换到其他模型;CoCounsel 整体仍保持多模型,在 Thomson 优势最明显的地方用 Thomson,其余地方继续用 OpenAI、Anthropic 等前沿模型。
这条"自拥模型 + 保留外部模型"的路线,目标不止内部产品。公司计划把 Thomson 扩展覆盖法律与税务产品线,提供更多"主权 AI"选项;已开始与大型律所和企业谈直接授权,包括让客户用自己的数据进一步微调;开发者门户与 API 也在早期搭建中。Hron 的原话是:"我们把 Thomson 建成汤森路透的基础设施,现在开始看到它也可能成为别人的基础设施。"
对一个 OpenAI/Anthropic 的大客户而言,这一步把三件事同时摆上台面:训练方式、模型里的行为与偏见、以及数据与隐私由谁掌控——也就是公司新闻稿所说的"AI 主权"。汤森路透把这归结为一个它称之为 Fiduciary-Grade AI 的标准:面向负有注意义务与问责义务的专业人士,"几乎正确不够好",且未经明确同意不得用客户数据训练。
边界
4000 万美元不是全部成本。Thomson 建在一个前沿规模的开源底座之上,底座本身的预训练支出由他人承担;45 万美元也只是最终一轮微调的费用,不是从零到一的总账。用它反推"训练大模型很便宜"会失真。
"对标前沿"同样需要打折读:核心证据是公司自建的 Deep Research 基准与一位学者的抽样测试,比较对象是 GPT-5.4 与 Claude Sonnet 5,且优势集中在"接入汤森路透内容"这一特定条件下。要判断它是否真的在开放法律任务上追平前沿,得等技术报告与第三方复现。
更重要的边界是适用条件。这条"数据护城河"路径成立的前提,是公司拥有权威、难以复制、别人拿不到的领域数据(法律判例、实务指引、税务规则),并养得起数百名能标注与盲评的领域专家。它说明的是"拥有独特数据的组织可以低价造出够强的领域模型",而不是通用模型时代结束。对没有这类数据资产的团队,这条路径并不提供捷径。
汤森路透真正的增量,是给出了一个可核验的样本:专业 AI 的胜负手,正在从"谁的模型更大"向"谁的数据更权威、谁的专家监督更密、谁的能量产化改造开源底座"移动。Schwarz 把话说到了底:"更大的发现不是单个模型,而是我们建成的模型工厂。"