5000亿Token反编译FPS:AI Agent数月实战暴露语义错误与编排难题

开发者 momo5502 用约 5000 亿 Token、历时数月调度 Claude 与 Codex 智能体反编译一款第一人称射击游戏,项目虽让游戏跑起来,但代码出现大量语义错误,暴露出当前 AI Agent 在长期自主任务中的编排瓶颈。

一句话看懂:开发者 momo5502 用约 5000 亿 Token、历时数月调度 Claude 与 Codex 智能体反编译一款第一人称射击游戏,项目虽让游戏跑起来,但代码出现大量语义错误,暴露出当前 AI Agent 在长期自主任务中的编排瓶颈。

事件核心:发生了什么

根据开发者 momo5502 于 2026 年 10 月发布的博客,他联合 RektInator、Future、st0rm 等社区成员,用约三个月时间、消耗约 5000 亿 Token,借助 AI Agent 将一款老牌第一人称射击游戏反编译为 C++ 源码。项目目标不止于验证可行性,而是追求准确、稳定、功能完整的可编译代码,并希望后续加入安全修复与 Linux、macOS、浏览器等跨平台支持。

技术栈上,团队同时使用 Claude Max(20x)和 Codex Pro 订阅,主力模型为 Sonnet 5,也大量调用 Opus 5.5、Luna、Sol、Terra;Agent 分别运行在 Claude Code CLI 和 Codex CLI 中。进度通过 GitHub issue 跟踪(每个 .cpp 文件对应一个 issue),Agent 之间则通过 Discord 频道沟通,CI 失败由 webhook 推送到同一频道。反汇编环节几乎全程使用 Hex-Rays 官方 ida-mcp。

第一个月 4 个 Agent(3 个反编译、1 个审查)完成了约 80% 的游戏代码,游戏能启动、主菜单可见、地图可加载。但随后团队发现:代码虽然可读性极佳,却存在大量语义错误,Agent 会调用错误函数、未完成当前函数就切换任务、在 CI 上空转,甚至未核实完成度就关闭 issue。

为什么重要

这是目前公开信息中少见的、以“月”为单位的 AI Agent 长周期工程实录,价值不在反编译本身,而在于它把多 Agent 编排的真实成本摆上了台面。团队为控制上下文漂移,将压缩阈值从默认 90% 降到 42%,并每小时用 cron 注入指令文档要求 Agent 重读;即便如此,进度表象与代码质量仍然脱节。这说明当前大模型在长任务中“看起来在推进”和“实际做对”之间存在系统性差距,对依赖 Agent 做代码迁移、逆向工程、大型重构的团队是一个直接警示。

对用户/开发者/创作者的影响

对开发者而言,这条经验表明:把 AI Agent 投入长期自主任务前,需要优先设计进度验证机制,而不是只看编译通过或功能表象。Token 消耗与订阅成本(Claude Max 20x + Codex Pro 并行)已构成实际预算项,上下文压缩策略、外部指令注入、独立审查 Agent 都是可复用的工程手段。对创作者和企业采购者,这意味着 AI 编程工具的评估维度应从“单次生成质量”转向“长周期可控性”,目前公开信息显示,即便顶级闭源模型组合,也尚不足以在没有人类监督的情况下独立完成高精度逆向工程。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是该团队是否公开更详细的指令文档或验证流程,这比反编译成果本身更有参考价值;二是 Claude、Codex 等产品是否针对长任务增加原生进度校验或上下文管理能力;三是社区是否会出现可复用的多 Agent 编排框架,把 Discord 通信、GitHub issue 跟踪、CI 反馈这套组合标准化。此外,原博客提到此前两篇相关文章已被移除,游戏名称未披露,后续是否会有完整技术复盘也值得观察。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 28716

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注