arXiv论文:LLM代理自我进化须限定运行时,门控通过144项变更

一篇 arXiv 新论文提出,信贷流水线中的自我改进 LLM 代理只要把进化限制在运行时框架、模型权重保持固定,每次改动就能像代码 diff 一样被审查;作者用模拟实验测量了这道门控,但尚未披露完整实验与真实模型结果。

一句话看懂:一篇 arXiv 新论文提出,信贷流水线中的自我改进 LLM 代理只要把进化限制在运行时框架、模型权重保持固定,每次改动就能像代码 diff 一样被审查;作者用模拟实验测量了这道门控,但尚未披露完整实验与真实模型结果。

事件核心:发生了什么

2026 年 10 月 9 日,arXiv cs.AI 收录了一篇题为《The Harness as the Only Mutable Surface》的论文摘要。作者主张:自我进化的 LLM 代理如果重写自身,会破坏监管者赖以审查的“具名变更、记录测试、审批”链条,因此提出把进化限定在运行时框架——指令文本、工具调用逻辑和原语组合——而模型权重保持固定。他们设计了一个双循环引擎,入口设有一道准入闸门,部署前写入哈希链记录,并在仿真中测量这道门控:使用模拟代理和带种子的搜索提议器,而非语言模型。

为什么重要

这直接触及 AI 代理在金融、信贷等强监管场景的落地障碍:可审计性。目前公开信息显示,该研究给出了一个可测量的合规折中方案——把“自我进化”从模型权重转移到运行时框架,让每次适应都附带原因和测试。在仿真中,三种监督再解释族、三种严重度、每组 10 个种子共 7,449 个候选变更,门控只放行 144 个,且没有一个在留出历史上恶化错误;而在低和中严重度每一格,假阳性率被恢复到 oracle 水平,同时没有提高漏报。作为对照,若换成无界系统常用的“近期轨迹错误更少”检查,同样循环放行了 309 个有害变更,90 次运行中有 49 次漏报率高于 10%。

对用户/开发者/创作者的影响

对开发者和企业采购方而言,这项工作的启示是:信贷、风控类 AI 应用若要接入会自我调整的代理,应优先把变更面收窄到可版本控制的运行时配置,而不是允许模型权重层面的自改。对政策合规团队,摘要还映射到欧盟 AI 法案对高风险信贷评分的条款,并指出 2026 年 4 月的美国模型风险指引把代理式 AI 排除在适用范围之外——这意味着跨区域合规口径可能出现落差。需要强调的是,以上均为基于摘要的信息,研究使用的是模拟代理而非真实大模型,也未披露完整实验。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,门控在最高结构严重度下,因固定容差在半数种子里挡住了正确替换,这个权衡是否会调整。第二,用真实 LLM 替代模拟代理后,144/7,449 的放行率是否依然稳定。第三,哈希链记录与欧盟 AI 法案高风险条款的对应关系,是否会被后续工作进一步操作化。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28538

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注