一句话看懂:法律科技公司 Legora 用 OpenAI 的新模型 GPT-6 Astra,在几分钟内完成了原本需要数小时的财务报表核对工作——单次运行审阅 41 份文档,并在关键的财务勾稽测试中找回了此前模型漏掉的约 50 项核对记录。这件事值得关注,因为它展示了“大模型 + 人工复核”在专业工作流中的真实落地节奏。
事件核心:发生了什么
据 OpenAI 官方博客(9 月 3 日发布)介绍,总部位于欧洲的 Legora 是一家面向法律与专业服务领域的智能体操作系统公司,目前有超过 10 万名专业人士、1800 多家法务部门和律所在使用其产品。Legora 的客户场景之一是“财务报表勾稽”(financial-statement tie-out)——即逐项核对草拟报表中的每个数字与试算平衡表、合并附注及上一年度账目是否一致。这项工作按 Legora 法律工程师 Percevale Perks 的说法,“过去要花一个晚上,有时甚至好几天”。
Legora 基于 GPT-6 Astra 构建的 Agent,在一次运行中完成了 41 份文档的勾稽检查,耗时从数小时压缩至几分钟:系统逐项比对余额与支持性附表、标记金额断裂处、并保存每一次核对记录。测试中,Legora 预先在账目中植入了 4 处错误(包括一笔隐藏在收入附注中的 50 万英镑差额),GPT-6 Astra 全部找出。Legora 还公布了两个基准数据:在该财务报表工作流上,GPT-6 Astra 相比上一代模型性能提升近 40%,但在 Legora 的 Agentic Reasoning 基准(BAR)全任务平均提升约为 3%。目前公开信息显示,Legora 采用了“人在回路”模式,即 Agent 负责繁重的比对和记录,最终判断权仍归法律或财务专业人员。
为什么重要
这则案例的行业意义不在于“AI 取代人工”,而在于它验证了一个关键路径:把大模型的上下文处理能力用在高度结构化、高责任度的专业复核环节。以往类似财务勾稽工作很难被自动化,是因为它既要求模型能吞入大量长文档(41 份文件、跨表交叉比对),又要求输出结果可追溯、可复核。GPT-6 Astra 在 Legora 单点工作流上提升了近 40%,但在通用法律任务基准上平均提升仅 3%,这个反差说明:模型能力正在从“广泛可用”走向“垂直场景深度适配”。对 OpenAI 而言,Legora 这类案例是它向企业级市场讲述 API 价值的重要素材——不是替代专家,而是压缩专家处理琐碎比对的时间,让判断力集中在异常项上。
此外,文中“找回了前一版模型做对的全部核对项,并额外完成了约 50 项核对”这一细节,暗示新一代模型在长任务稳定性方面有实质改进,而非简单的精度提升——这正是 Agent 类应用能否从演示走向生产环境的核心瓶颈。
对用户/开发者/创作者的影响
对正在评估大模型 API 的开发者或企业技术负责人来说,这个案例提供了一个可参考的指标框架:不要只看模型在通用榜单上的分数,而要像 Legora 那样,在自己的真实工作流里测试“准确性、完整性、可靠性”三个维度——即模型是否找得出所有植入错误、是否能覆盖上一版做对的全部步骤、是否额外完成更多有效核对。Legora 用 GPT-6 Astra 的方式也值得留意:它没有让模型直接给结论,而是要求模型产出“每一条检查记录的明细”,供专业人士快速复核。这种“可审计的 AI 输出”设计,可能是专业服务类工具采用大模型的共同前提。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户而言,这类能力暂时不会以消费级产品形态出现,但它的影响会间接体现在审计、税务、合规类 SaaS 工具的交付速度上——原本按天计费的复核工作,未来可能按分钟计费,而最终收费标准取决于人工复核的介入深度,而非模型本身的调用成本。
值得关注的后续
一是 GPT-6 Astra 的正式 API 开放节奏与定价——目前 OpenAI 仅通过客户案例透露其存在,开发者更关心的是它是否取代或平行于现有 GPT-6 系列模型,以及长上下文场景下的单次调用成本是否具备商业可行性。
二是 Legora 声称要将该能力从法律场景延伸到审计、税务、合规和风险领域,这些领域对错误容忍度更低,未来若出现审计监管机构对“AI 辅助勾稽”的认可标准,将是比模型精度更重要的变量。
三是竞品动向——像 Harvey、Robin AI 等同赛道玩家,以及四大会计师事务所自研的工具,是否会跟进类似的多文档勾稽基准,并公布可比数据。目前公开信息中尚无直接对比,但这一指标有望成为衡量法律大模型真实生产力的参考刻度之一。
来源:OpenAI News


