Thomson Reuters押注4000万美元自研AI,而非从OpenAI或Anthropic租用

Thomson Reuters 投入约 4000 万美元自建法律大模型“Thomson”,基于阿里 Qwen 开源模型训练,而非直接租用 OpenAI 或 Anthropic 的 API。这件事的价值在于证明:拥有独家数据和专业场景的企业,可以花更少的钱做出在垂直领域不输通用前沿模型的效果。

一句话看懂:Thomson Reuters 投入约 4000 万美元自建法律大模型“Thomson”,基于阿里 Qwen 开源模型训练,而非直接租用 OpenAI 或 Anthropic 的 API。这件事的价值在于证明:拥有独家数据和专业场景的企业,可以花更少的钱做出在垂直领域不输通用前沿模型的效果。

事件核心:发生了什么

Thomson Reuters 于 2026 年 8 月发布自研法律语言模型“Thomson”,这是该公司首个完全自建的大模型。据公司披露,整个项目历时超过两年,总投入约 4000 万美元,用于人员与算力;外界流传的 45 万美元数字只覆盖了当前版本最后一次训练运行的成本,并未包含 Westlaw、Practical Law 等积累数十年的独家内容资产。

技术路线上,Thomson 基于阿里巴巴开源模型 Qwen(最新版本为 Qwen3.5-397B)开发。Thomson Reuters 先与帝国理工学院合作,将模型在安全、伦理和政治中立性上做了重塑,形成名为“Snowdon”的中间版本;随后再用自有内容进行预训练,并让公司内部法律专家参与后训练,在自建工具环境中进行智能体强化学习。目前投入训练的内容还不到公司全部语料的 10%。

公司 CTO Joel Hron 和研发主管 Jonathan Schwartz 均强调,项目真正的成果不是某一个模型,而是“模型工厂”本身——一套可根据业务需要反复迭代、更换底座的开源模型生产体系。

为什么重要

Thomson Reuters 的案例给行业提供了一个不同于“租用闭源 API”的替代路径:在数据壁垒足够高的垂直领域,自建模型具备三重优势——避免通用微调对模型能力的损伤、摆脱对单一供应商推理成本和路线图的依赖、以及让每次产品更新中的专家反馈都沉淀为长期训练资产。

从基准测试看,Thomson 的表现并非全面领先。在斯坦福 LegalBench 上,Thomson(0.823)落后于 Gemini 3.1 Pro 和 GPT-5.5;在 Harvey Legal Agent Benchmark 上略逊于 Opus 4.8。它的优势集中在指令遵循和法律专用 PrBench Legal 上,推理和编码能力则明显偏弱。更重要的是,在仅有联网访问的 Deep Research 测试中,Thomson 的事实准确率为 0.53,低于 GPT 5.4 的 0.65;只有在接入公司自有内容时,Thomson 才能以 0.83 对 0.82 微弱反超 GPT 5.4。测试负责人 Andrew Bean 也承认,联网场景下 Thomson 还谈不上领先。

值得玩味的是,GPT 5.4 在获得同样内容访问权后,成绩提升幅度与 Thomson 相近。这说明独家数据访问本身贡献了大部分性能增益,专用训练带来的增量可能没有想象中显著。Thomson Reuters 没有测试更新的模型,其优势窗口能维持多久仍是未知数。

对用户/开发者/创作者的影响

对企业级用户而言,这个案例提供了“开源模型 + 自有数据 + 领域专家”的落地参考。如果组织拥有高价值的专有数据、数百名全职领域专家以及可量化评估的工作流(如合同审查、文档复核),自建模型可以比调用闭源 API 更经济——尤其在文档审查这类高频、大体量的场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,Thomson 验证了开源大模型在垂直行业中的可用性。Qwen 这类开源底座距离前沿闭源模型的差距已缩小到几个月级别,4000 万美元的投入门槛也让中型企业有了自建的可能。不过要留意,Thomson Reuters 的优势建立在其数十年积累的数据和工具生态上,普通团队难以复制。

对内容创作和知识工作者,Thomson 的小尺寸版本将以非商用许可发布,意味着研究、教学或实验场景可能直接使用,但商用仍需谨慎评估许可条款。

值得关注的后续

目前公开信息显示,有几点值得跟踪:其一,Thomson 是否在后续版本换用更强的 Qwen3.8 底座,并将训练内容比例从 10% 大幅提升——这会直接影响其法律基准成绩能否从“微弱领先”变成“显著领先”。其二,公司如何平衡开源发布与商业利益,非商用许可的社区反馈将检验其生态策略。其三,OpenAI、Anthropic 等闭源厂商是否会对这类“数据 + 垂直微调”的客户流失做出战术调整,例如推出行业定制方案或调整企业定价。最后,Thomson Reuters 的自建模式能否复制到其他法律之外的专业领域,也有待观察。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20001

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注