一句话看懂:2026 年 9 月,Specific 发布 Real-SWE 基准,用真实企业私有代码库而非公开题目考察 AI 编程代理,最高解决率仅 38.8%,说明前沿模型离“独立干工程师的活”还有明显距离。
事件核心:发生了什么
Real-SWE 的每道任务都来自 Specific 从真实公司授权的私有生产代码库,题目就是这些公司工程师实际在做的工作,例如修正发票计税逻辑、迁移客户、处理账单。这些代码和答案不在公开互联网上,模型无法靠记忆或公开数据“猜”出解法。评测采用模型与工具链的组合,而不是单独考核模型,并给出八次独立运行的平均 pass@1。目前公开榜单显示:Fable 5.1 搭配 Claude Code 以 38.8% 居首,GPT-6 Astra 配 Codex CLI 为 33.8%,Gemini 3.8 Flash 配 Gemini CLI 为 31.2%,GLM 5.3、Grok 4.6、Muse Spark 1.3、Kimi K3、GPT-5.6 Sol 依次排在 28.8% 到 16.2% 之间。任务环境覆盖 TypeScript、Go、Python 代码,以及 PostgreSQL、MySQL、MongoDB、Redis、AWS 模拟器、Kubernetes、Linear MCP、Slack 等真实工具链。
为什么重要
过去的 SWE 类基准大多基于开源仓库,题目由专家编写或合成,优点是公平可复现,缺点是和企业真实开发有落差。Real-SWE 把评测门槛抬到两个更难的维度:一是代码本身私有、充满历史包袱和公司特有约定,二是指令嵌入了业务规则,比如不同企业税率不同、免税客户如何处理、跨境发票要显示双方 VAT 注册号。这直接指向 AI 编程代理商业化最关键的问题:当代码不可见、后果涉及真实账目时,模型还能不能稳定工作。38.8% 的最高解决率说明,即便搭配成熟工具链,前沿大模型在当前推理和长上下文能力下,仍难以独立承担生产环境中的工程师任务。
对用户/开发者/创作者的影响
对开发者而言,这份榜单的参考价值在于它考核的是模型加工具链的组合,而不是刷榜分数,说明选模型时要连同 CLI、MCP、代码检索和工作流一起评估。对企业采购方来说,Real-SWE 给出了一个更贴近实际风险的标尺:能通过公开题目的模型,未必能在私有代码库和跨服务依赖中把事做对,尤其在计费、税务、迁移这类错误代价高的场景。对工具厂商和开源模型团队,这类基准会倒逼它们优化长上下文检索、代码库导航和多服务调试能力,而不只是堆训练数据。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Real-SWE 是否会公开任务构成、评分细节和更多模型结果,让结论可复现。第二,榜单上的模型与工具链组合是否会因新版本快速变化,尤其是闭源模型和开源模型之间的差距。第三,企业私有代码库评测涉及的授权、数据隔离和合规问题如何处理,这决定它能否成为行业长期采信的标准。目前公开信息显示,该基准由 Specific 发布,尚未看到更广泛的第三方复核。
来源:Hacker News


