一句话看懂:2026 年 9 月 11 日,OpenAI 披露 Cognition 将 GPT-6 Astra 接入 Devin、CLI 和桌面产品,让 AI 自动测试自己写的代码并输出运行录像与测试报告。这意味着代码审查的形态可能从“人逐行看代码”转向“人看 AI 提供的验证证据”。
事件核心:发生了什么
Cognition 是全球多类企业(从大型银行到技术型初创公司)在用的自主软件工程师 Devin 的开发方。随着内部工程团队产出代码量上升,人工审查成为瓶颈。Cognition 的解法是把 GPT-6 Astra 用于产品全线,包括 Devin 核心云代理、CLI 与桌面端,让 Devin 在写完之后自己测试并证明结果可用。
官方给出的具体例子有两个:一是 Devin 用 Astra 测试 iPhone 游戏 Otter Run,返回模拟器中游戏运行的录像,以及一份标明哪些检查通过、哪些区域尚未覆盖的报告;二是客户发来一张 bug 截图,团队把它交给带 Astra 的 Devin,修复后回传一张展示修复结果的截图。Cognition 联合创始人 Walden Yan 表示,这让他们能“更快地回复客户”,并称 Astra 提升最明显的能力之一,就是测试并证明工作成果确实按预期运行。
为什么重要
自主编程代理过去的核心卖点是“写代码快”,但真实工程流程里,写只是一半,验证才是决定能否合并上线的关键环节。Astra 把“测试 + 举证”变成 Devin 输出的一部分,等于让 AI 代理从代码生成器向可交付工程单元靠近。
从 OpenAI 的角度看,这也是模型能力叙事的一次转向:不再只强调基准分数,而是强调在具体工作流中替代人工复核的程度。目前公开信息显示,Cognition 的目标是减少工程师手动阅读代码的比例、提高最终交付量。如果这一模式成立,衡量编程大模型的指标可能会从“生成正确率”扩展到“自证正确率”,这对闭源 API 厂商和自建推理管线的团队都是新的竞争维度。
对用户/开发者/创作者的影响
对使用 Devin 或类似代理的工程团队来说,代码评审可能逐步变成看录像、看报告、抽查未覆盖区域的流程,而不是逐行 diff。这会改变团队分工:初级工程师的“读代码找问题”工作被压缩,把关能力更多体现在设定测试标准和判断证据是否充分。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对通过 API 构建 AI 应用的开发者,值得留意的是这种“测试—举证”链路能否被拆出来复用。如果 OpenAI 把类似能力开放为独立接口,测试自动化、回归验证、截图对比类工具的形态都会被改写。对企业采购方而言,评估编程代理时可以开始追问:它交付的是代码,还是代码加可核查的运行证据。目前公开信息显示,Cognition 已把这套能力用在客户支持场景,说明其落地不只限于内部研发。
值得关注的后续
一是 Devin 的测试录像与报告能否覆盖复杂后端系统,还是主要适用于有可视界面的场景;二是 OpenAI 是否会把 Astra 的验证能力做成通用 API,而不仅服务 Cognition 这类合作方;三是这种“少看代码”的流程在受监管行业(如新闻中提到的银行客户)能否通过审计要求。这三点将决定该模式是营销亮点还是工程常态。
来源:OpenAI News


