汤森路透8月24日宣布推出公司首个自主开发的大语言模型Thomson。与从零训练通用基础模型不同,Thomson以一个开源基础模型为起点,再通过中期训练、后训练、专业内容和领域专家参与,把模型定向塑造成法律、税务与专业知识工作所需的能力。公司披露,人才与算力在内的训练投入为4000万美元,目前训练使用的汤森路透内容还不到其内容总量的10%。

这项发布最值得注意的并不是又多了一个“大模型”名称,而是内容公司开始把模型本身纳入核心资产。汤森路透过去可以把Westlaw、Practical Law、Checkpoint与路透内容连接到第三方模型;现在它拥有并控制模型的训练、运行与部署路径。公司称Thomson的推理成本显著低于典型前沿模型,并把“如何训练、在哪里运行、客户数据是否用于训练”作为模型主权问题来回答。不过,这些成本和能力判断主要来自公司披露,不能直接视为独立基准结论。

专业化路线把数据、评测与专家放到同一条链上

Thomson的差异化首先来自训练材料与流程。汤森路透表示,模型训练调用了Westlaw、Practical Law、Checkpoint和Reuters积累的专业内容,并让数百名领域专家从训练目标设计一直参与到最终评测。对法律和税务任务而言,答案不只要语言通顺,还要处理有效法域、版本时间、条文层级、引用来源和例外条件。仅在推理阶段检索几段资料,未必能让通用模型形成稳定的专业任务执行习惯;中期训练和后训练则试图把这种习惯写进模型行为。

公司公布的早期评测显示,Thomson在一系列任务上可与最新前沿模型相当,并特别强调复杂多步骤指令、密集专业材料导航和引用质量的提升。但公开新闻稿没有给出足以完整复现的全部测试集、样本量、评分者一致性或失误分布,因此“达到前沿水平”目前应理解为汤森路透的早期评价,而不是覆盖所有专业任务的普遍结论。公司已邀请法律与AI学者直接评估,还计划在未来数周和数月继续开放外部验证。

一款较小版本的Thomson将以开放权重形式在Hugging Face提供,限定学术和非商业用途。这有助于外部研究人员观察模型的基础能力和错误类型,但小版本不必然等同于产品中的完整模型,也不能代替对CoCounsel工作流、检索工具、权限体系和最终输出的整体审计。对于高责任行业,模型权重只是系统的一部分,资料版本、引用追溯、人工复核和客户数据边界同样决定风险。

首次落地仍是受限场景,多模型策略没有退出

Thomson的首个产品落点是CoCounsel Legal中的Tabular Analysis,用于高容量、结构化的文档审阅。汤森路透称,该能力将在即将到来的版本中向律师事务所与企业法务部门提供。这一措辞意味着发布已经发生,但具体产品能力仍按版本逐步开放,不能写成所有客户当前都已全面使用。公司还计划把Thomson扩展到法律与税务产品,并提供更多主权AI选项,但没有公布完整时间表。

值得强调的是,CoCounsel仍明确采用多模型设计:在Thomson优势最清晰的任务上调用它,在其他任务上继续使用领先的外部模型。这比“自研模型全面替代供应商”更接近真实路径。专业软件厂商可以把敏感、重复、数据密集的任务放到自有模型,同时保留通用模型的广度和快速迭代能力。模型路由、失败回退和结果验证由此变成产品竞争力,而不是只比较一个总榜分数。

对企业采购者来说,自有模型带来的控制力并不自动等于更高准确率。需要继续追问:训练内容是否拥有适当使用权,引用能否回到有效原文,客户输入是否默认进入训练,模型更新后如何回归测试,以及错误答案由谁复核。汤森路透提出客户数据未经明确同意不会用于训练,这是一项重要边界;其实际效果仍要由合同条款、系统设计和后续审计共同验证。

Thomson展示的是一条不同于无限扩大通用模型的路线:从成熟基础模型出发,用独家内容、专家评测和特定产品流程获得专业增益。4000万美元投入相对头部通用模型的巨额资本开支更小,但它依赖的是几十年内容积累与行业渠道,其他公司未必能够简单复制。接下来真正需要观察的,是外部评测能否验证早期结果、开放权重版本能提供多少透明度,以及Thomson在真实法律和税务工作中能否持续降低错误而非只改善演示。

来源:Thomson Reuters,Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model,2026年8月24日,https://www.thomsonreuters.com/en/press-releases/2026/august/thomson-reuters-leverages-its-world-class-data-assets-to-launch-its-own-frontier-model