一句话看懂:Ruby on Rails 官方评测项目 Agents on Rails 发布 Stage 2 结果,用 20 个真实功能工单测试 10 个模型,最好的模型也只解决了约 35% 的任务;从”会不会写 Rails”到”能不能交付一个功能”,难度呈现断崖式上升。
事件核心:发生了什么
Rails 团队在 2026 年 9 月 9 日公布 Agents on Rails Stage 2。Stage 1 测试模型是否熟悉 Rails,两个模型能以 92% 解决语料,但任务刻意做小。Stage 2 换了问法:给模型一张产品经理式的工单,看它能否交付一个完整功能。
测试集是 20 张针对 37signals 看板应用 Fizzy 的功能工单,每张都像真实需求那样写得简略,比如”尽快给应用加上日语”。判分由确定性验证器完成:Fizzy 自带测试套件必须保持通过,预置的隐藏检查也必须全部通过,且测试目录要先还原到初始状态。
这轮纳入 10 个模型,采用各厂商默认推理强度,包括 GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、Claude Opus 5、GPT-5.6 Sol、GLM 5.3 Flash、Grok 4.6、Kimi K3、Muse Spark 1.3 和 GPT-5.6 Luna。Astra 第一、Gemini 3.8 Flash 第三,两者风格截然相反:Gemini 每轮 200 步、耗时 27 分钟,读遍跑遍;Astra 步数只有十分之一,9 分钟收工。
为什么重要
结果揭示了一个被基准分数掩盖的落差。原子任务上,模型可以靠局部改写蒙混过关;功能级任务要求跨文件规划、理解未言明的边界条件,还要判断”什么时候算做完”。日语本地化这张工单只有 Fable 的一次运行真正完成,其余多数只翻译了可见部分,看到自有测试变绿就交付。
大量零分来自隐藏检查:工单从不描述边缘情况,有经验的开发者会主动补上,模型大多不会。GPT-5.6 Luna 在 Stage 1 以 90 美分完成 63 个任务中的 46 个,到了功能工单则是 60 次全零,转而提交半成品或跳过迁移与测试套件。这说明小模型在真实交付场景里缺乏高层规划能力。
成本也值得注意:整套功能运行约 2,250 美元,是原子任务的 5 到 8 倍。预算为单次运行 90 分钟、400 步、60 美元。Kimi K3 与 GLM 5.3 Flash 是仅有的明显触顶者,分别超时 14 次和 12 次(共 60 次运行),两者均为开放权重模型,加大预算或许有改善空间。
对用户/开发者/创作者的影响
对使用 AI 编码工具的开发者,这项评测提供了一个务实参照:当前模型适合处理边界清晰的局部改动,把它当作能独立接工单的工程师仍不现实。验收环节不能省,尤其是迁移脚本、边界条件和完整交付的定义,仍需人类把关。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对团队选型而言,高步数慢跑与低步数快跑都能取得相近成绩,成本也接近,意味着延迟和吞吐可以按工作流偏好取舍,而不必默认”想得越久越好”。对开源模型阵营,Kimi 和 GLM 在 90 分钟限制下的超时表现说明,权重开放并不等于工程可用,预算与调度策略同样是变量。
值得关注的后续
Rails 团队已列出三个方向:模型能否跨会话在自己的工作成果上继续迭代;MCP 与 skills 这类扩展机制是否能改善 Rails 开发者的 agentic 工作流;以及开发者体验层面的实际收益。目前公开信息显示,Stage 2 的原始运行数据已放在 ai-evals 仓库,排行榜可在 Agents on Rails 页面查看,后续轮次是否会调整时间与费用预算,值得留意。


