没有免费的校验器:机器人策略验证器综述
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
本文综述约150种机器人策略验证器。验证器读取候选行为并给出评分,用于评估和训练视觉-语言-动作策略,涵盖成功检测器、奖励模型、运行时监控器、安全过滤器和时序逻辑规范等。文章从两个属性对验证器进行比较:可用性,即判决的成本、在策略执行过程中出现的早晚以及可请求的频率;可信度,即高分在多大程度上说明任务完成情况。按判决来源可分为人工验证器、规则与形式化验证器、学习与预训练验证器、模型内在验证器四类。研究发现,四类验证器中可信度随可用性上升而下降,即不存在免费的校验器。文章还考察了验证器自身的验证方式,包括与人工标签的一致性、所训练策略的表现以及奖励黑客情形下的行为,并提出九项指标使验证器声明可核查,同时给出尚待构建的验证器方向。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究主题
这是一篇针对机器人策略验证器的综述,核心问题是:判定的便宜、及时与密集会如何影响判断本身的可靠性。
验证器定义与用途
验证器读取候选行为并返回一个分数,表示该行为完成得如何;它既被用来评估视觉-语言-动作策略,也被用来训练这些策略。
验证器类型
涵盖成功检测器、奖励模型、运行时监视器、安全过滤器以及时序逻辑规约等。
综述规模
作者考察了大约150种验证器,并在统一的两个属性上进行比较。
可用性
可用性由三点决定:一次判定需要多少成本、判定在一次执行过程中出现得多早、以及判定可以被请求得多频繁。判定越便宜、越早、越密集,可用性越高。
可信度
可信度指高分能在多大程度上说明任务完成情况。当判定容易被钻空子或变得自我服务时,可信度下降。
四类划分
按谁来提供判定,验证器分为人类验证器、规则与形式化验证器、学习与预训练验证器、模型内在验证器四类。
核心结论
在四类验证器中,可信度随可用性上升而下降;无论判定由谁提供,都不存在免费的检查器。
验证验证器自身
文献中出现三种衡量方式:与人类标注的一致程度、其所训练策略的表现、以及在奖励攻击情境下的行为。
收尾内容
文章以九项指标收尾,使验证器的相关主张可被核查,并给出尚待构建的验证器的坐标。