一句话看懂:Mercor 的最新测试显示,AI 大模型在结构化记账任务上的速度和准确率已全面超过持证会计师,但在完整结账流程中仍需人工监督,无法独立完成。
事件核心:发生了什么
AI 评测机构 Mercor 让 12 位平均从业五年半的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,并与多款大模型对比。18 个月前,最强模型的得分还低于会计师约 37% 的平均水平;如今模型在同一批任务上几乎不出错,且速度更快、成本远低于人力。
不过,在规模更大的完整 APEX 基准中(10 家模拟公司、160 项任务,由 40 多位平均 11 年经验的专业人士构建),目前表现最好的 Claude Opus 5.5 仅满足 61.8% 的评分标准,Fable 5.1 为 61.0%,GPT-6 Astra 为 57.9%。Mercor 指出,没有模型能完全解决近 60% 的任务,AI 尚不能在无人监督下完成结账。
为什么重要
这组数据把 AI 的能力边界划得更清楚了:在规则明确、细节密集、可验证的结构化任务上,大模型对传统白领岗位已形成实质替代压力;但一旦涉及客户沟通、同事协作和多年积累的上下文判断,模型仍无法胜任。Mercor 也承认,该测试恰好覆盖了 AI 最擅长的事——追踪细节和执行精确指令,因此结果不能等同于“会计师可被取代”。对行业而言,这更像是一次生产力工具的重新定价,而非岗位的直接清零。
对用户/开发者/创作者的影响
对企业采购方,记账、对账、票据整理等环节可以优先引入 AI 提效,但结账、审计判断等关键节点仍需保留人工复核。对开发者,会计类 AI 应用的机会在于“人机协作工作流”,而非端到端自动化;谁能把模型的细节执行力和人的上下文判断衔接好,谁就更可能落地。对创作者和知识工作者,这一案例也提示:可被拆解为明确指令的任务更容易被模型接管,而依赖关系维护和模糊判断的部分仍具护城河。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 APEX 排行榜上头部模型的得分能否继续爬升,尤其是突破 60% 任务解决率的时间点;二是头部会计软件和财务 SaaS 是否会集成这类模型,形成新的 API 调用场景;三是监管与合规层面对 AI 参与财务流程的认可度,这将直接影响产品能否在真实企业环境中上线。


