Supabase 发布 Evals:一个开源基准,用于在真实 Supabase 任务上评测 Claude Code、Codex 和 OpenCode

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…
先解决问题,再了解资讯。选择你现在要完成的任务。

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

该报错发生在升级 llama.cpp 后,旧有的 GLM-5.2(GLM_DSA)等包含 NextN/MTP 张量(如 blk.78 )的 GGUF 模型开始默认加载这些张量,即使没有指定 --spec-type draft-mtp ,导致显存/内存占用上升,在接近上限时触发 cudaMalloc

为了给 AI 数据中心供电,美国佐治亚州约 30 套房屋将被推平、330 块土地被征用;与此同时,扎克伯格宣布“人人拥有 AI Agent”的五年计划。代价与承诺之间的落差,正在成为 AI 扩张期最尖锐的现实问题。

Reddit公布了一份财务成绩不错的季度财报,但股价反而下跌超20%,CEO公开质疑Google AI Overviews带来的实际价值,背后是AI搜索摘要正在动摇传统网站赖以生存的搜索流量分配机制。

Google 在 Google Earth 中上线的 AI 图像生成功能,因被用户用于生成违反政策的内容,上线约一天后就被紧急回滚。这件事说明,即使用大模型做地理影像生成,真实性和信任问题依然是绕不开的合规门槛。

微软发布了一门免费、开源的《生成式AI初学者指南》课程,包含21节课,覆盖从大模型基础到提示工程、文本生成、聊天应用等实战内容,并提供Python和TypeScript双语言示例。它试图解决“想学生成式AI但不知道从哪开始”的问题,值得开发者、产品经理和自学者关注。

安全研究员 Håkon Måløy 展示了针对 Microsoft Copilot for Word 的提示注入攻击,恶意指令可藏匿在 Word 文档中并向新文档传播,形成具备自我复制能力的“AI 蠕虫”。微软已确认问题,但两次修复尝试均未成功。
![[Bug]: RayExecutorV2 should sanitize inherited Ray runtime_env before creating model workers](https://www.chat-gpts.plus/wp-content/uploads/2026/08/50413-9594759d-768x403.jpg)
这个 bug 发生在使用 vLLM RayExecutorV2 时,外层 Ray 任务携带的 runtime_env(尤其是 worker_process_setup_hook )会被继承到 vLLM 的模型 worker 进程中并在模型加载前执行。 [Bug]: RayExecutorV2 sho

零信任安全公司ThreatLocker获得由Elephant领投的1.9亿美元F轮融资,将扩展企业安全平台以应对AI工具带来的新型安全风险。这是AI安全赛道近期规模较大的一笔融资,值得关注。