Supabase 发布 Evals:一个开源基准,用于在真实 Supabase 任务上评测 Claude Code、Codex 和 OpenCode

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

Supabase 开源了一个名为 Evals 的基准测试,用真实 Supabase 工程任务来评测 Claude Code、Codex 和 OpenCode 等 AI 编程助手的完成质量。这是后台即服务(BaaS)厂商首次把自家真实代码库当作 AI 编程代理的“考场”,让开发者能直观比较不同工具的实际工程能力…

为了给 AI 数据中心供电,美国佐治亚州约 30 套房屋将被推平、330 块土地被征用;与此同时,扎克伯格宣布“人人拥有 AI Agent”的五年计划。代价与承诺之间的落差,正在成为 AI 扩张期最尖锐的现实问题。

Reddit公布了一份财务成绩不错的季度财报,但股价反而下跌超20%,CEO公开质疑Google AI Overviews带来的实际价值,背后是AI搜索摘要正在动摇传统网站赖以生存的搜索流量分配机制。

Google 在 Google Earth 中上线的 AI 图像生成功能,因被用户用于生成违反政策的内容,上线约一天后就被紧急回滚。这件事说明,即使用大模型做地理影像生成,真实性和信任问题依然是绕不开的合规门槛。

微软发布了一门免费、开源的《生成式AI初学者指南》课程,包含21节课,覆盖从大模型基础到提示工程、文本生成、聊天应用等实战内容,并提供Python和TypeScript双语言示例。它试图解决“想学生成式AI但不知道从哪开始”的问题,值得开发者、产品经理和自学者关注。

安全研究员 Håkon Måløy 展示了针对 Microsoft Copilot for Word 的提示注入攻击,恶意指令可藏匿在 Word 文档中并向新文档传播,形成具备自我复制能力的“AI 蠕虫”。微软已确认问题,但两次修复尝试均未成功。

零信任安全公司ThreatLocker获得由Elephant领投的1.9亿美元F轮融资,将扩展企业安全平台以应对AI工具带来的新型安全风险。这是AI安全赛道近期规模较大的一笔融资,值得关注。

总部位于特拉维夫的网络安全初创公司 Bloom Security 获得 2000 万美元种子资金,正式走出隐身模式,专注为 AI 代理、浏览器扩展等端点提供安全监控工具。值得关注的是,AI 代理开始进入企业工作流,但针对它的安全监控还明显缺位。

Vercel与World Retail Congress的最新研究显示,ChatGPT和Google Gemini已超越传统社交平台,成为英国消费者发现新品的重要入口,但AI推荐在信任度和转化率上仍存明显短板,尚未给零售商带来实际收入增长。

欧盟依据《人工智能法案》(AI Act),从 8 月 2 日起强制要求企业对以逼真面貌出现的 AI 生成内容加注数字水印,覆盖图像、音频和文本。这是目前主要经济体中对 AI 内容透明度最直接的强制性规定,标志着 AI 标识从“平台自律”进入“法律合规”阶段。