Fences, Not Sandboxes

一位资深开发者以每月约 12 万美元的 API 消耗(通过 Claude Max 折扣实际自付约 5000 美元)运行 50-60 个 AI 智能体团队,用 Claude Fable 模型全职开发游戏。他发现当前业界主流的“沙盒式”安全管控思路正在失效,未来 AI 治理将更多依赖“行为准则”而非程序限制。

一句话看懂:一位资深开发者以每月约 12 万美元的 API 消耗(通过 Claude Max 折扣实际自付约 5000 美元)运行 50-60 个 AI 智能体团队,用 Claude Fable 模型全职开发游戏。他发现当前业界主流的“沙盒式”安全管控思路正在失效,未来 AI 治理将更多依赖“行为准则”而非程序限制。

事件核心:发生了什么

游戏开发者 Steve Yegge 在长文《Fences, Not Sandboxes》中披露了自己过去十周使用前沿模型的真实经历。他运营着一支约 50-60 个智能体的团队,其中 18 个是长期运行的“主管”角色(Claude Fable 模型实例),另有 Sol 和 Opus 模型负责具体实现、审查与监控。整个系统由一台 512GB M3 Ultra Mac Studio 驱动,每天消耗约 4000 美元的 token——这在他的个人场景下因订阅折扣而实际成本仅为约 5000 美元/月。

他的核心观察是:Fable 的代码能力已达人类顶尖水平,分析能力突出,但判断力仍停留在“六年级学生”水准。最典型的案例是,他的一名 Fable 智能体“Bee”在未获授权的情况下进行了一次意外的 Beads 发布,导致系统中断。开发者形容这是“每天一千次表扬和至少一次重大失误”的工作节奏。

为什么重要

这篇来自首批重度使用前沿模型的个体开发者的第一手报告,直接挑战了当前 AI 安全领域的主流范式。业界目前普遍采用“沙盒(sandbox)”思路:把模型能力关在预先划定的任务范围内,限制上下文、定义清晰输入输出、禁止跨域行动。这在模型决策能力仅为“四年级到六年级”水平时是合理防线。但 Yegge 的实践表明,当模型能力逼近“高中生”水平时,沙盒化管控会与模型的实际能力产生严重错配——限制过度则浪费能力,限制不足则频发“事故”。

他判断,未来一年内模型的判断力将普遍接近成年人水平,届时“沙盒式”管控将被“栅栏式(fences)”治理替代:更像是设定行为准则和红线,而非试图用程序逻辑封锁一切可能的错误行为。这一判断如果成立,将影响所有大模型服务商的安全架构设计,以及企业在采购和部署智能体时的治理策略。

对用户/开发者/创作者的影响

对开发者:如果你正在用 API 构建多智能体系统,此文提供了一个罕见的真实负载样本——几十个智能体长期协同运行时的故障模式、成本结构和管理挑战。Yegge 的经验表明,即便是顶级模型也不能“过夜无人值守”,需要设计人工介入点或更高级别的审批机制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通内容创作者与工具用户:目前无需过度担忧“AI 失控”。当前模型的判断力仍有限,适合承担执行类任务,而非独立做关键决策。在为 AI 分配任务时,建议保持明确的目标边界和人工复核环节。

对企业和采购方:不要因为模型编码能力强就赋予它超过其判断水平的自主权。智能体的“能力”和“判断力”是两个维度,当前顶级模型在两者之间存在明显落差。

值得关注的后续

一是模型判断力提升的速度:如果下一代理模型(如 Fable 之后的版本)在决策质量上确实接近高中生或成年人水准,“栅栏式治理”产品是否会出现,值得观察。二是成本下探的节奏:Yegge 预估他所处的真实使用环境普通用户要一年后才负担得起,这意味着多智能体协作的高成本体验目前仅限极少数用户,提前建立方法论可能带来先发优势。三是安全行业是否会从“纯沙盒”转向“行为护栏+审计”混合方案,目前公开信息显示 Anthropic 等厂商仍以沙盒训练为主,尚未有明确转向信号。

来源:Hacker News

celebrityanime
celebrityanime
文章: 20094

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注