AI Agent 没有时间感知,且对此浑然不觉。

一项新研究测试了 Claude Code 和 OpenAI Codex 两款热门编程助手,发现它们对“任务要花多久”和“自己已经花了多久”几乎没有感知,估算误差最高达实际耗时的 10 倍。这个缺陷直接影响 AI Agent 在长时任务中的可靠性。

一句话看懂:一项新研究测试了 Claude Code 和 OpenAI Codex 两款热门编程助手,发现它们对“任务要花多久”和“自己已经花了多久”几乎没有感知,估算误差最高达实际耗时的 10 倍。这个缺陷直接影响 AI Agent 在长时任务中的可靠性。

事件核心:发生了什么

这项研究由两位独立 AI 研究员在 MATS 研究项目下完成,测试对象是 Anthropic 的 Claude Code 和 OpenAI 的 Codex。测试素材来自 200 个 ProgramBench 任务,加上研究者自建的 18 个基准任务。测试分为两部分:先在任务开始前让 AI Agent 预估所需时间,再在实际完成任务后让它回顾实际耗时。

结果显示,两个模型在预估阶段都严重高估时间——无论任务难度如何,它们大多给出约 90 分钟的预估。而在回顾阶段,Claude 的平均误差是实际耗时的 3 倍,Codex 则是 6 到 10 倍。短任务误差最大,只有少数多小时的长时间任务预估接近真实值。

另一个发现是:不同软件框架(harness)会直接影响同一模型的运行行为。Claude Code 默认持续运行,中位耗时约 90 分钟;Codex 则在约 30 分钟后自动停止,几乎与任务无关。同一语言模型在 Claude Code 中平均比在 Codex 中多出 2.5 倍执行步骤。

为什么重要

这个缺陷暴露了当前 AI Agent 的一个本质短板:模型没有时钟,也没有可靠的时间推理能力。对于需要数小时连续工作的任务——比如批量代码重构、长文档处理、自动化测试——用户无法预判 Agent 何时能交差,也就难以规划资源或安排人工介入。

更值得关注的是自我评估失灵。研究中,较旧的 Opus 4.8 和 GPT-5.5 平均高估自己表现 20 个百分点,甚至在失败任务上也给出高分。有一个案例中,两个模型都自评约 70% 成功率,而实际得分只有 7% 和 14.5%。这意味着在缺乏外部验证的情况下,Agent 的输出质量完全不可信。

此外,运行时高度依赖外围软件而非模型本身,说明当前 Agent 的行为在很大程度上由工程配置决定,而非模型能力。这对“哪个模型更强”的简单比较提出了方法论质疑。

对用户/开发者/创作者的影响

对开发者:如果你正在用 Claude Code 或 Codex 执行长任务,不要把 Agent 的时间预估当作排期依据。建议拆短任务链路,并在关键节点加入人工检查,而不是让 Agent 自主判断“是否完成”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用 API 的企业:在自动化流水线中接入 Agent 时,应设置外层超时和任务拆分机制,而不是依赖模型自带的完成判断。预算估算和计费预测也需要重新建模,不能按 Agent 自报时长计费。

对 AI Agent 产品设计者:研究表明,给 Agent 提供时间查询工具后,它几乎每次都能准确报时。这说明问题不是模型不可救药,而是当前产品默认没有接入时间反馈机制。产品层可以主动补上这个缺口。

值得关注的后续

研究团队计划测试 Agent 能否遵守“执行两小时”这类明确时长指令——这是判断 Agent 是否具备可控性的关键实验。如果 Claude 和 OpenAI 在后续版本中内置系统时钟反馈,Agent 的时间感知问题可能快速缓解。对用户而言,可以观察两个产品的更新日志中是否出现“接入了时间感知工具”相关条目。在此之前,对所有 Agent 的自评结果和耗时预估保持怀疑,是更务实的态度。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 21255

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注