用开源小模型审计黑盒LLM智能体:Proxy Confidence 无需内部概率

一篇 arXiv 新论文提出“代理置信度”方法,用开源小模型并行读取相同上下文与工具调用,借助自身对数概率判断黑盒大模型智能体的工具调用是否可能出错;在困难编程任务上 AUROC 达 0.825,而智能体自报置信度仅 0.598。

一句话看懂:一篇 arXiv 新论文提出“代理置信度”方法,用开源小模型并行读取相同上下文与工具调用,借助自身对数概率判断黑盒大模型智能体的工具调用是否可能出错;在困难编程任务上 AUROC 达 0.825,而智能体自报置信度仅 0.598。

事件核心:发生了什么

2026 年 10 月 7 日发布于 arXiv cs.AI 的论文《Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate’s Log-Probabilities》指出,前沿闭源聊天 API 通常不暴露 token 概率,智能体自报的置信度在关键错误上几乎与随机猜测无异,而重复采样也难以发现问题,因为这些模型高度重复,多次采样往往给出同一调用。研究者的做法是:让一个低成本开源权重模型并行运行,读取与智能体相同的上下文、schema 和待执行动作,再用教师强制、请求 PMI、判别式判定和工具选择竞争等多种读出方式,从代理模型自己的对数概率中打分。摘要显示,该方法无需训练、不需访问智能体内部,只增加一次 prefill 成本。在困难编程任务上,其 AUROC 为 0.825,而行动者自报置信度仅 0.598;在另外三个行动者上,生成式读出比自报置信度高 0.07 到 0.28。与自一致性方法相比,它在接近确定性的行动者上提升 0.14 到 0.19,成本仅为后者的 1/K。

为什么重要

工具调用、代码执行和查询一旦出错,往往在结果返回前就已经产生副作用,事后审计代价高。当前主流闭源 API 不提供内部概率,开发者只能用“自报置信度”或重复采样做风险判断,但论文摘要给出的数据显示这两条路都不可靠。该工作把“缺失的置信信号”转移到开源代理模型上,为黑盒智能体提供了一种可部署的监控与反馈路径。这既避开了对闭源模型内部结构的依赖,也绕开了重复采样带来的算力与延迟成本。对正在把 AI 智能体接入真实业务流程的团队来说,这相当于在调用链路上加了一道低成本“安检”。

对用户/开发者/创作者的影响

开发者可以关注其两种部署模式:一是实时门控,把最不可信的调用升级为人工复核,摘要称在 50% 覆盖率下可将 accepted-action 准确率提升 0.05 到 0.30;二是置信度反馈,在返回工具结果时附上分数,让智能体在下一步自行调整。摘要提到,这在实时执行基准上把任务成功率提升 0.119 和 0.137(p ≤ 1e-4),并在步骤错误静默的场景下优于随机值对照 0.078(p = 0.003)。对使用 AI 编程助手、自动化运维或数据管道的团队而言,这意味着可以在不更换主模型的前提下,用开源小模型补充审计能力。不过,上述结果均来自论文摘要所述实验条件,目前公开信息显示尚未经过大规模生产验证,也不代表所有闭源 API 都能直接套用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,代理模型的选择与成本:多大参数量的开源模型才能稳定提供有效信号,额外 prefill 是否影响生产延迟。第二,工程集成方式:是否有团队将其封装为 API 网关、智能体框架插件或可观测性工具。第三,跨任务与跨模型验证:摘要只给出了编程任务和有限行动者的结果,后续需要看它在浏览、数据库操作、多步规划等场景中是否同样有效。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28023

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注