NewsFi.AI
返回今日
已核验来源

具身SLM中的几何条件化:0.8B混合模型的训练控制与鲁棒性诊断

arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读

NewsFi 导读2 分钟速览

arXiv:2609.09213v1 交叉公告。研究物理状态输入对一种面向操作任务的0.8B混合语言模型的影响,该模型可训练参数为6.2M。研究在三个 LIBERO-Spatial 任务上训练六种条件,并用三个随机种子和540个留出回合评估。将循环衰减门以几何增量作为条件时成功率为28.9%;若训练时打乱这些增量则为36.7%,而无显式物体/目标几何时为24.4%。两种几何策略在评估时都收到正确输入。使用相同增量的词元适配器得分为27.8%;差异随种子变化,仍无定论。词元时钟条件化得分为11.1%,其中有一个种子未能收敛。在独立鲁棒性测试中,仅用状态的相对坐标策略在帧重标记下保持7/10成功率,而四种受测视觉策略在物体位移5厘米后最多为3/20。结果表明,在该方案下训练时几何对齐没有可靠优势,并凸显坐标不变性与物理布局泛化之间的差距。论文附带回合记录、种子级分析和图表生成代码。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

考察物理状态输入如何影响一个为操作任务适配的0.8B混合语言模型,可训练参数为6.2M。

2

实验设置

在三个LIBERO-Spatial任务上训练六种条件,评估覆盖三个随机种子与540次留出测试回合。

3

几何条件化结果

将循环衰减门条件化于几何增量得28.9%成功率,训练时打乱这些增量得36.7%,无显式物体/目标几何得24.4%。

4

输入正确性

在评估阶段,两种几何策略都获得了正确的输入。

5

token适配器对照

使用同样几何增量的token适配器得27.8%,各条件差异随种子变化,作者认为结论尚不确定。

6

token时钟条件化

Token-clock条件化仅得11.1%,且其中一个种子未能收敛。

7

鲁棒性诊断

仅状态的相对坐标策略在坐标系重标记下保持7/10成功率;四个受测视觉策略在物体位移5厘米后最多为3/20。

8

总体结论

作者认为在该训练方案下,训练阶段的几何对齐没有带来可靠优势,并指出坐标不变性与物理布局泛化之间存在差距。

9

附带材料

论文随附回合记录、种子级分析以及图表生成代码。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09213