基准测试:CadQuery 与 OpenSCAD 在 Agent 化 CAD 工作中的对比

ModelRift 用六个 Claude Opus 5 智能体、三道递增难度的 CAD 任务,对比了 OpenSCAD 与 CadQuery 的“无人值守建模”能力,结论是两边都能产出可打印零件,真正的差别在于失败方式。

ModelRift 用六个 Claude Opus 5 智能体、三道递增难度的 CAD 任务,对比了 OpenSCAD 与 CadQuery 的“无人值守建模”能力,结论是两边都能产出可打印零件,真正的差别在于失败方式。

2026 年 9 月,Specific 发布 Real-SWE 基准,用真实企业私有代码库而非公开题目考察 AI 编程代理,最高解决率仅 38.8%,说明前沿模型离“独立干工程师的活”还有明显距离。

开发者不满某爬虫服务每月 16 美元收费,自己写了开源项目 crawl4ai 并开源,如今在 GitHub 上已获约 5.1 万星。它把任意网页转成干净 Markdown 供大模型直接消费,无需 API Key 或注册。

一位财经博主把中际旭创三年从200亿到万亿市值的复盘,反向拆成了一套六层AI选股提示词,引发大量转发,但实际核验发现能同时满足全部条件的A股标的几乎没有。

一位 AI 工具使用者用 Codex 配合 X API,抓取套利交易者 CJ 的推文并筛选出 502 篇实战内容,整理成免费在线阅读站和可下载数据集。它值得关注的点不在于"又出现一个知识库",而在于这套流程展示了大模型加平台 API 如何把碎片化社交媒体内容低成本地结构化。

有研究团队把一个完整的果蝇全脑连接组(connectome)接入一个参数规模 1.2B 的冻结大模型,想看看生物神经布线能不能给语言模型“加 buff”;结果它自己的对照组显示,这套接线并没有带来帮助。

Android Police 撰稿人 Nimrod Aldea 花一个周末搭建了一个本地 AI 邮件助手 Mira,只负责判断哪些邮件需要他行动、再用一句话告诉他结论,而不是像 Gmail 里的 Gemini 那样逐封总结。试用五天后,他依然每天打开 Gmail 复查,说明"把收件箱外包给 AI"在信任层面还…

《纽约时报》刊发程序员兼作家 Paul Ford 的专栏,核心观点是 AI 能写出不错的代码,却也让"把别人的活干砸"变得更容易,因此软件行业对"AI 取代开发者"的恐慌正在退潮。他用一句话概括期待:在杀手机器人到来之前,先给我一个杀手级应用。

Android Police 作者 Parth Shah 在 2026 年 9 月的一篇体验文章中表示,Google 在 Keep Notes 上叠加的对话式 Gemini 层 Keep Live,能把随口说出的杂乱想法自动整理成结构化笔记和清单,这让他大幅减少了手动打开 Keep 编辑器的次数。

GitHub 上出现了一个名为 claude-red 的开源技能库,通过一批结构化的 SKILL.md 文件,把 Claude 变成懂攻击方法论的红队操作员。它的价值不在模型本身,而在于给通用大模型按需加载垂直安全能力的这套玩法。