紧凑视触觉世界模型用于提升:预测、奖励对齐与力约束
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
精确的触觉预测未必能改善受力约束的控制。我们研究一个具有652,157个参数、以动作为条件的视触觉世界模型,并与行为克隆、想象中策略学习、独立的反应式隐式Q学习以及模型辅助力反馈进行匹配比较。固定协议在120个全新MuJoCo环境中执行34个策略,环境涵盖几何与物理参数偏移;此外还在12个额外同分布环境中独立重放324个动作分支。视触觉动力学将力动作效果平均绝对误差从持久性基线的0.413牛顿降至0.338牛顿。模型辅助反馈使同分布力预算成功率从73.3%升至93.3%,配对差异为+20.0个百分点,95%置信区间为[+6.7,+33.4],差异出现在脚本化下放阶段。其汇总差异为+3.9个百分点,区间为[-4.5,+11.7]。想象强化学习取得11.9%的汇总联合成功率,而反应式隐式Q学习为25.0%。一项经验性触觉残差压力测试增加了330次执行。证据涉及在共同接近动作之后提升刚性盒,不包含物理机器人迁移或闭环安全保证。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。核心问题
准确触觉预测不一定改善受力学约束的控制,研究将预测、奖励对齐与力约束放在同一框架下检验。
模型设置
使用652,157参数、以动作为条件的视觉触觉世界模型,对比匹配行为克隆、想象中策略学习、独立反应式IQL和模型辅助力反馈。
评估协议
固定协议在120个新MuJoCo环境上执行34个策略,覆盖几何和物理参数偏移;另在12个额外ID环境上独立重放324个动作分支。
预测精度
视觉触觉动力学将力动作效果平均绝对误差从持续性基线的0.413 N降低到0.338 N。
ID力预算成功
模型辅助反馈将ID力预算成功率从73.3%提高到93.3%,配对差为+20.0个百分点,95%置信区间为[+6.7,+33.4]。
差异位置
该提升差异发生在脚本化下降阶段,而不是整个控制流程的均匀改善。
汇总效果
模型辅助反馈的汇总差为+3.9个百分点,95%置信区间为[-4.5,+11.7]。
策略学习比较
想象式强化学习取得11.9%的汇总联合成功率,反应式IQL为25.0%。
附加压力测试
经验性触觉残差压力测试增加330次执行。
适用范围
证据仅涉及共同接近后的刚性盒提升,没有物理机器人迁移,也没有闭环安全保证。