OpenRouter 推出 Ori Eval 简化评估流程

OpenRouter 推出 Ori Eval 简化评估流程

OpenRouter 推出了一款名为 Ori Eval 的评估代理,能自动扫描你的代码库、找出模型调用点、写出评测用例并对候选模型打分排名。它把过去需要专门搭框架的评估工作压缩成一次自然语言交互,直接降低了开发者选模型的门槛。

AI能够独立完成的最大软件项目是什么?

AI能够独立完成的最大软件项目是什么?

Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

显示 HN:MCP 上代理会话的产品分析(和评估)

显示 HN:MCP 上代理会话的产品分析(和评估)

Armature 发布了一款面向 AI 代理(Agent)的会话分析工具,能自动抓取用户与 Claude、ChatGPT 或 MCP 客户端交互的完整过程,并识别失败循环与未满足的使用需求。它的价值在于,当对话式 AI 成为产品入口后,传统埋点分析工具可能失效,而 Armature 试图补上“代理会话可观测性…

App+1 | 诗经山河图:我用 AI 做了一张《诗经》地图

App+1 | 诗经山河图:我用 AI 做了一张《诗经》地图

一位不会编程的《诗经》爱好者,用 AI 编程工具 Codex 和音乐生成模型 MiniMax-Music,在 20 天内做出一张可交互的《诗经》地理地图,并为全部 305 首诗生成了 AI 歌谣。这个案例的价值在于:当 AI 让“做出来”变得容易,作品质量反而更依赖人的判断与审美。

AI能够独立完成的最大软件项目是什么?

AI能够独立完成的最大软件项目是什么?

一个开发者分享了自己让 AI 编程代理连续数周自主修复 bug、推动 bash 测试套件通过的实验,却在 Hacker News 上引发了“AI 到底能不能独立干完一个项目”的激烈争论。核心分歧不在代码能力,而在:人类为 AI 预铺的测试和架构,到底是辅助,还是必要条件。