SWE-agent上手指南:让自主软件工程Agent从Issue自动生成PR https://t.co/EDLfkJmVXG

普林斯顿与斯坦福团队开源的 SWE-agent 提出了 ACI(智能体-计算机接口)范式,让大模型能在隔离沙箱里像工程师一样查代码、写补丁、跑测试,最终从 Issue 自动生成可提交的 PR。

一句话看懂:普林斯顿与斯坦福团队开源的 SWE-agent 提出了 ACI(智能体-计算机接口)范式,让大模型能在隔离沙箱里像工程师一样查代码、写补丁、跑测试,最终从 Issue 自动生成可提交的 PR。

事件核心:发生了什么

开发者 @baike888 发布了一份 SWE-agent 上手指南。SWE-agent 是普林斯顿大学与斯坦福大学团队开源的自主软件工程 Agent 系统,在真实 Bug 修复基准 SWE-bench 上有较高解决率。它的核心不是换更大的模型,而是设计了 ACI 接口:在 Docker 沙箱上封装一套专供模型使用的命令集,包括窗口化代码查看(默认每次 100 行并带行号)、按行号范围写入的精准编辑、每次保存后自动运行的轻量 Linter 语法反馈,以及结构化搜索工具,从而缓解直接使用 Bash 时的上下文爆炸、sed 文本替换脆弱、缺乏即时反馈等问题。

为什么重要

过去开发者常把报错日志直接丢给大模型要补丁,得到的多是脱离项目上下文的“幻觉代码”,甚至引入级联错误。SWE-agent 的价值在于验证了一条技术路线:与其改造模型,不如为模型定制一套符合其信息处理特征的 CLI 接口。指南给出的实战流程显示,Agent 会经历读取 Issue、用 search_dir 定位符号、分页阅读上下文、编写复现脚本、edit 行级修改、跑 pytest 回归、执行 SUBMIT 导出 git diff 的完整闭环。这意味着 AI 辅助编程正从单文件自动补全,向全流程自主软件工程代理延伸,开源生态在其中扮演了关键推动角色。

对用户/开发者/创作者的影响

对开发者而言,落地门槛并不高:宿主机需 Docker 和 Python 3.10+,用虚拟环境 editable 安装,配置 ANTHROPIC_API_KEY 或 OPENAI_API_KEY,若要自动提 PR 再加一个具 repo 权限的 GITHUB_TOKEN。目前公开信息显示,Claude 3.7/3.5 Sonnet 在该基准上表现较好。指南建议用 reproduction-first 提示词强制 Agent 先写最小复现脚本再改代码,并设置 max_cost(如 2 美元)和 max_turns(如 30 轮)控制成本,因为 15-25 步通常已能收敛。常见坑包括反复编辑陷入死循环、Docker 拉镜像超时、Patch 因基线不一致打不上、以及模型误删核心代码,对应方案是换强推理模型并调低 Temperature、预热镜像、锁定 base_commit、在提示词里禁止删功能消错。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这类 Agent 能否在真实企业仓库而非基准数据集上稳定产出可合并 PR;二是单 Issue 推理成本能否随模型价格下降而进一步压低,决定它是否适合接入 CI/CD 做夜间离线任务;三是 ACI 中的分页浏览器、行级安全编辑器和沙箱隔离机制,是否会被更多闭源厂商或内部运维重构工具借鉴。

来源:@baike888

celebrityanime
celebrityanime
文章: 27096

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注