具身SLM中的几何条件化:0.8B混合模型的训练控制与鲁棒性诊断
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
arXiv:2609.09213v1 交叉公告。研究物理状态输入对一种面向操作任务的0.8B混合语言模型的影响,该模型可训练参数为6.2M。研究在三个 LIBERO-Spatial 任务上训练六种条件,并用三个随机种子和540个留出回合评估。将循环衰减门以几何增量作为条件时成功率为28.9%;若训练时打乱这些增量则为36.7%,而无显式物体/目标几何时为24.4%。两种几何策略在评估时都收到正确输入。使用相同增量的词元适配器得分为27.8%;差异随种子变化,仍无定论。词元时钟条件化得分为11.1%,其中有一个种子未能收敛。在独立鲁棒性测试中,仅用状态的相对坐标策略在帧重标记下保持7/10成功率,而四种受测视觉策略在物体位移5厘米后最多为3/20。结果表明,在该方案下训练时几何对齐没有可靠优势,并凸显坐标不变性与物理布局泛化之间的差距。论文附带回合记录、种子级分析和图表生成代码。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
考察物理状态输入如何影响一个为操作任务适配的0.8B混合语言模型,可训练参数为6.2M。
实验设置
在三个LIBERO-Spatial任务上训练六种条件,评估覆盖三个随机种子与540次留出测试回合。
几何条件化结果
将循环衰减门条件化于几何增量得28.9%成功率,训练时打乱这些增量得36.7%,无显式物体/目标几何得24.4%。
输入正确性
在评估阶段,两种几何策略都获得了正确的输入。
token适配器对照
使用同样几何增量的token适配器得27.8%,各条件差异随种子变化,作者认为结论尚不确定。
token时钟条件化
Token-clock条件化仅得11.1%,且其中一个种子未能收敛。
鲁棒性诊断
仅状态的相对坐标策略在坐标系重标记下保持7/10成功率;四个受测视觉策略在物体位移5厘米后最多为3/20。
总体结论
作者认为在该训练方案下,训练阶段的几何对齐没有带来可靠优势,并指出坐标不变性与物理布局泛化之间存在差距。
附带材料
论文随附回合记录、种子级分析以及图表生成代码。