Supabase 发布 Evals:一个开源基准,用于在真实 Supabase 任务上评测 Claude Code、Codex 和 OpenCode

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

零信任安全公司ThreatLocker获得由Elephant领投的1.9亿美元F轮融资,将扩展企业安全平台以应对AI工具带来的新型安全风险。这是AI安全赛道近期规模较大的一笔融资,值得关注。

据《纽约时报》报道,Oracle创始人Larry Ellison正通过大规模举债融资,将公司全面押注AI基础设施,并试图通过政治人脉、参与Stargate项目以及与OpenAI的深度绑定,把Oracle推向AI产业的核心位置。

一位健身爱好者用同一份需求分别向新版 Siri AI 和 ChatGPT 索要居家增肌计划,在私人教练评估后判定 ChatGPT 的方案更完整、更可持续,而 Siri 的生成结果虽简洁,却在训练时长、营养建议和长期规划上存在明显短板。

生成式 AI 让没有编程经验的人也能在几分钟内做出一个能跑的原型,但“能演示”和“能上线”之间依然是天堑。作者提醒,真正的工程能力从来不是写语法,而是判断力,这种能力恰恰是 AI 时代最稀缺的。

ScribeRyte AI 是一款在 Product Hunt 上线、定位 AI 写作/记录方向的新产品,目前公开信息有限。在同类工具密集的赛道上,它的差异化定位和定价策略值得关注,但不宜过早下结论。

Y Combinator 将内部使用的多智能体编排框架「QM」开源,这是一个专为公司级协作场景设计的 AI 代理控制台。它把 YC 在会计、法律、工程等部门的真实使用经验直接开放给开发者,意味着企业级多智能体应用的门槛正在降低。

Hacker News 上围绕“AI 编程到底靠不靠谱”的争论,指向了一个关键现实:大模型能生成局部可用的代码和文档,却很难独立完成整体质量把关。这个问题直接决定了 AI 编程工具是助手还是神话。

一篇虚构“2027年程序员面试”的讽刺推文在 X 上热传,用三道夸张考题折射出 AI 行业的三种真实焦虑:人才评估标准失效、Agent 的安全责任归属模糊、大模型在基础推理任务上仍可能“翻车”。