Show HN:Benzi——一款在代码智能/运行框架上超越 Claude Code 和 CodeGraph 的工具

一个名为 Benzi 的代码智能工具在 Hacker News 公布基准测试,称在 SWE-bench Verified 的 500 个真实 GitHub issue 上解决率 78.2%,单次修复成本低于 10 美分,并在读取代码行的效率上优于 Claude Code 等主流 harness。

一句话看懂:一个名为 Benzi 的代码智能工具在 Hacker News 公布基准测试,称在 SWE-bench Verified 的 500 个真实 GitHub issue 上解决率 78.2%,单次修复成本低于 10 美分,并在读取代码行的效率上优于 Claude Code 等主流 harness。

事件核心:发生了什么

Benzi 团队在 HN 发布了对比基准页面,把自家 harness 与 Claude Code 等主流方案放在同一组 24 个 GitHub issue、10 种编程语言上做“同条件对比”。核心数据有两个:一是在 SWE-bench Verified 的 500 个真实 issue 中,Benzi 声称解决率 78.2%,平均每次修复成本不足 10 美分;二是代码智能层面,Benzi 以“AI 原生”方式读取代码,报告显示其每提升一档任务难度所额外打开的文件行数(斜率)低于 Claude Code,意味着它在处理更难 bug 时的上下文膨胀更慢。所有任务和尝试过程均公开,未做筛选。

为什么重要

目前公开信息显示,这组基准直指当前 AI 编程工具的两个痛点:成本和效率。Claude Code 等方案在 bug 变难时,读取行数和花费都更快上升;Benzi 想证明自己的 harness 在这些维度上斜率更平缓。如果数据可复现,它会影响开发者和企业对代码 Agent 的选型逻辑——不再只看“能不能解”,而是看“解一个 bug 要烧多少 token、读多少文件”。同时,SWE-bench Verified 是业界常用基准,78.2% 属于较高水平,但基准成绩与实际工程体验之间仍有差距。

对用户/开发者/创作者的影响

对开发者而言,这类工具的核心价值在于降低长尾 bug 的修复成本。若 Benzi 的斜率优势成立,处理复杂仓库时上下文管理和推理开销会更可控,配合低于 10 美分的单次修复价,适合接入 CI 或 issue 自动修复流程。对企业采购来说,需要区分“基准分数”和“私有代码库表现”,建议先在小范围仓库做 A/B 验证。对创作者和独立开发者,按次计费的低成本方案降低了试用门槛,但也要留意其模型依赖、数据隐私和开源/闭源边界目前公开信息有限。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Benzi 是否会公开可复现的评测脚本与完整运行日志,让第三方验证 78.2% 和成本数据;二是 Claude Code 等竞品是否会在难度-成本斜率上做出针对性优化或回应;三是该工具是否开放 API、支持私有仓库,以及定价是否随规模变化。这些将决定它只是榜单上的数字,还是能真正进入日常开发工作流。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 22860

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注