VLA 策略安全动作不等于可行:VICS-G 免训练重排序降低安全代价

2026 年 10 月 6 日 Hugging Face Papers 收录的一篇论文指出,冻结的视觉-语言-动作(VLA)策略可能选出一个局部安全但无法完成任务的下一步动作,并提出免训练的重排序方法 VICS-G 来缓解这一问题。

一句话看懂:2026 年 10 月 6 日 Hugging Face Papers 收录的一篇论文指出,冻结的视觉-语言-动作(VLA)策略可能选出一个局部安全但无法完成任务的下一步动作,并提出免训练的重排序方法 VICS-G 来缓解这一问题。

事件核心:发生了什么

论文作者提出“可行性-似然差距”概念:策略的似然只对下一步动作排序,但一个动作是否真正可行,取决于它是否为后续安全完成任务保留了路径。一个被冻结的 VLA 模型可能偏好当前时刻局部可接受、却切断所有安全完成路线的动作。为此,作者从受限安全任务完成的历史条件策略-环境轨迹分布中,推导出下一动作块边缘的精确形式,并把候选动作对应的“可行未来质量”纳入决策。由于在线精确评估不现实,论文给出一种选择性有限候选近似方法,并说明恢复最佳保留可行候选的条件。

作者的方法名为 VICS-G,是一种告警触发、免训练的重排序器。摘要称,在六个 Safety-CHORES 设定上,它将平均累计安全代价降低 1.9% 至 57.5%,同时成功率与策略采样保持在 2.5 个百分点以内,平均回合长度相差不超过 0.82 步。需要说明的是,以上结果来自论文摘要,尚未核验全文实验,也不代表已有产品上线或通过同行评审。

为什么重要

VLA 是当前机器人操作和具身智能的重要技术路线,通常把视觉输入、语言指令和动作生成放在一个大模型中。过去很多安全约束只关注“这一步是否安全”,而这篇论文强调“这一步是否让安全完成仍然可能”。如果该思路成立,它可能影响机器人策略的评测标准:除了安全违规率,还要看策略是否会把系统带入不可恢复状态。VICS-G 不需要重新训练策略,也不需要在线 rollout,这降低了在已有闭源或开源 VLA 上做安全后处理的门槛。

对用户/开发者/创作者的影响

对开发者而言,如果后续代码或权重开放,VICS-G 可能作为一种外挂式重排序模块接入现有 VLA 推理流程,在不改动基座模型的情况下调整动作选择。对机器人应用方,这类方法的价值在于把安全代价和任务完成率放在一起权衡,而不是简单地把动作限制在某个安全集合内。对研究者和创作者,论文提出的“可行未来质量”是一个值得跟踪的评测维度,但现有数据仅覆盖六个 Safety-CHORES 设定,距离真实开放环境中的通用机器人仍有距离。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是作者是否公开代码、模型接口和完整实验细节;二是 VICS-G 在 Safety-CHORES 之外的真实机器人任务上是否仍能保持成功率;三是其他 VLA 团队是否会跟进类似“可行性感知”的推理时重排序方案。在论文全文和复现结果公开前,上述效果应视为摘要范围内的报告,而非确定的行业结论。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28077

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注