一句话看懂:开发者发布了一款名为 Graft 的 Claude Code 钩子,宣称能削减 42% 的 token 消耗,但声称的 SWE-Bench 成绩(p 值仅 0.22)遭到 Hacker News 社区连番质疑,重点不在功能而在于测试方法不透明。
事件核心:发生了什么
Graft 是一个面向 Claude Code 的钩子,核心思路是维护一个跨越会话的概念图,让后续对话不必重复理解同样的上下文,从而减少 token 消耗。作者在 Show HN 中称,9→20→36→50 等测试批次下平均 token 用量下降了 42%,并在 SWE-Bench Verified 上展示了准确率提升,还提到在 DeepSWE 长任务测试中比 Sonnet 5 成绩好 20%。
不过,Hacker News 的讨论焦点几乎完全集中在统计可信度上:SWE-Bench 只测了 50 个任务、每次只跑 1 遍,p 值为 0.22,远低于常规显著性阈值 0.05。社区成员还发现任务分组的数量(9、11、16、14)非常随意,并指出“16/16 与 2/14”这种极端不稳定的成绩,疑似通过筛选任务集或排除超时用例获得。作者没有公开随机种子、题目清单、以及每个任务在 Claude 和 Graft 上的原始结果,这也加重了社区的怀疑。
为什么重要
这不是一次普通的“网友抬杠”,而是一个典型的 AI 工具评测陷阱案例。当前大量 AI 编程产品都喜欢用 SWE-Bench 或内部基准证明自己更好,但评测的条件、任务抽样方式、运行次数和统计显著性往往被一笔带过。Graft 的例子说明,即使一个工具本身可能有效,只要展示结果时省略了关键细节——比如样本只有 50 个、p 值 0.22、任务选择方式未说明——就会被视为“不可信”。在 AI 投资和采购决策越来越依赖基准分数的当下,这种不透明会直接伤害整个行业的信任度。“如何用统计撒谎”这本书被反复提到,本质上是在提醒:无意中骗过自己的门槛,比故意造假低得多。
对用户/开发者/创作者的影响
对正在使用 Claude Code 或类似编码代理的开发者,Graft 带来的启发是“跨会话记忆”方向确实有优化空间,token 消耗也确实会成为长任务的成本负担。但在作者公布更完整的数据(随机种子、完整任务列表、多次运行结果)之前,不建议把 42% 的判断直接搬到生产环境。更值得警惕的是社区指出的长期语义漂移问题:一个概念图如果只靠增量刷新,可能会积累偏差,且难以察觉。对任何造 AI 工具的开发者,这个讨论都是一次提醒:发布评测结果时,应主动附上可复现材料,而不是让读者从“任意数字”里猜结论。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Graft 作者是否会补充公开 50 个任务的选取方式和原始结果,这是当前信任重建的最短路径。第二,概念图在数周甚至更长时间的持续使用中,是否会出现语义漂移,这一点需要比 SWE-Bench 更接近真实工作流的长期验证。第三,关于 DeepSWE 上“比 Sonnet 5 高 20%准确率”的说法,如果在后续版本中同样缺乏统计细节,就会面临和这次一样的信任危机。
来源:hackernews


