Senior SWE-Bench:评估AI智能体作为高级工程师的基准测试

Snorkel AI 发布 Senior SWE-Bench,一个专门评估 AI 智能体处理“高级工程师”级别任务的基准测试,不再用过度细化的需求,而是用真实开发者会收到的模糊指令和运行时报错来考核模型,旨在打破现有基准“考初中生”的局限。
先解决问题,再了解资讯。选择你现在要完成的任务。

Snorkel AI 发布 Senior SWE-Bench,一个专门评估 AI 智能体处理“高级工程师”级别任务的基准测试,不再用过度细化的需求,而是用真实开发者会收到的模糊指令和运行时报错来考核模型,旨在打破现有基准“考初中生”的局限。

谷歌2025年电力消耗同比激增37%,创历史最大涨幅,主要受AI数据中心持续扩张推动;但同期运营碳排放反而下降2%,显示“电耗与排放脱钩”的可能性与挑战。

browser-use 团队发布了开源 AI 视频剪辑 Skill「video-use」,它并非传统剪辑软件替代品,而是一套让大语言模型(LLM)通过“读转写文本”而非“看画面”来完成视频剪辑的 Prompt 工程与工具脚本集合,核心思路是用极低的信息密度实现精准剪辑。

美国安全中心(CAIS)联合 Scale Labs 发布的远程劳动指数(RLI)显示,Fable 5 智能体已能自主完成 16.1% 的付费自由职业项目并达到专业质量,较八个月前 2.5% 的基线提升超过六倍。这一数据直接反映了 AI 自动化对远程可雇佣工作的侵蚀速度正在加速。

用户在 Ubuntu 22.04.5 LTS 系统上使用 llama.cpp (v9307, commit 549b9d843)通过 HIP 后端加载 Qwen3.6-27B-Q4_K_M.gguf 模型。显卡为 AMD Radeon RX 7900 XTX (gfx1100, 24GB VRAM)

2026年上半年,谷歌、微软、Meta密集对员工使用竞争对手AI工具设限,涉及Claude、Codex等产品。限制理由从算力不足、数据安全到防模型蒸馏,标志着AI工具从“免费试用”转向受管控的核心生产资料。

雨果奖作家郝景芳公开承认其新书中 AI 生成内容已占一半,诺贝尔文学奖得主托卡尔丘克也将 AI 用作研究工具。然而,国内图书编辑面对 “AI 代笔” 时既无检测工具、也无行业标准,只能靠个人经验判断,风险全由编辑个人承担,这正暴露出出版业在 AI 写作浪潮下的监管真空。

OpenAI 正式发布了 Codex 的 Claude Code 插件,允许用户直接在 Anthropic 的 Claude Code 工作流中调用 Codex 进行代码审查、任务委托和后台任务管理。这意味着两大 AI 开发工具首次实现跨平台协作,开发者不必离开 Claude 环境就能使用 OpenAI 的代…

Langflow 开源项目正式发布桌面版与 MCP 服务器能力,让开发者无需深入管理 Python 环境即可通过可视化方式构建、测试并部署 AI 智能体和工作流,进一步降低了 AI 应用开发的门槛。

Pieter Post 发布了名为“PieterPost MCP”的新产品,首次将 AI Agent 与实体邮政寄信流程打通。这意味着从 ChatGPT、Claude 等 AI 对话工具中,Agent 可以直接完成写信、上传附件、生成支付链接并追踪寄送状态,把“发邮件”的体验平移到“发实体信”上。