时频几何交叉注意力:面向分块视觉-语言-动作模型的改进模块
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
现代视觉-语言-动作(VLA)策略在一次前向传播中输出一整段动作,即一到两秒的协同运动。但动作分块本质上是短时多元轨迹,在模型内部却表现为逐步的通用隐藏标记并由线性头解码,因而无法充分刻画两种运动结构:一是频率结构,一个分块同时叠加平滑的全局趋势与跨时间尺度的细微修正运动,单一标记将二者纠缠在一起;二是跨阶段几何结构,不同阶段(接近、接触、抓握调整、稳定)的运动在表示空间中沿差异极大、近乎正交的方向展开,却与任务紧密相关并沿时间轴出现。点积注意力以内积衡量对齐程度,偏好方向一致的标记,对近乎正交的关系最不敏感,只能由网络绕行恢复。为此作者提出时频几何交叉注意力(TFGCA)即插即用模块,用逐维可学习的平稳小波变换将动作分块分解为时频标记,并让每个时间标记通过交叉注意力从中检索信息,该注意力以可学习权重融合点积(相似性)与楔积幅值(对近正交关系敏感)。零初始化残差使模型在初始时保持原行为,因此可直接加装到预训练 VLA 上并联合微调。相较同源基线,TFGCA 在分布内 LIBERO 上平均提升 1.5,在分布外 LIBERO-Plus 上提升 6.3,在 RoboTwin 域随机化下的随机化平均提升 28.5,在三个真实机器人 AgiBot A2 任务上总体成功率提升 11.67 个百分点,分布外增益更大。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。动作块被当作通用隐序列
VLA 策略一次前向输出一到两秒的协调动作块,但模型内部把动作块表示为逐时刻的通用隐 token 序列,再由线性头解码,未体现其作为短时多元轨迹的本质。
盲区一:频率结构被纠缠
一个动作块同时叠加平滑的全局趋势与跨时间尺度的精细修正运动,而单个 token 将这两类成分纠缠在一起,难以分别建模。
盲区二:跨相位几何关系
到达、接触、抓取调整、稳定等不同相位的运动在表示空间中沿差异很大、近乎正交的方向展开,但任务上密切相关,且沿时间轴出现。
点积注意力的固有局限
点积注意力以內积作为对齐度量,偏好方向一致的 token,在接近正交时敏感度最低,导致上述跨相位关系需要网络绕路才能恢复。
方法:时间—频率分解
TFGCA 使用逐维可学习的平稳小波变换,把动作块分解为时间—频率 token,显式分离不同时间尺度上的运动成分。
方法:融合点积与楔积的交叉注意力
每个时间 token 通过交叉注意力从时间—频率 token 中取回信息,并以可学习权重融合点积(相似性)与楔积幅值(对近乎正交敏感),从而同时覆盖方向一致与近正交的关系。
即插即用与零初始化残差
模块采用零初始化残差,使其在初始化时复现基础模型行为,因而可直接加到预训练 VLA 上并联合微调,属于即插即用设计。
实验结果
相对于同源基线,分布内 LIBERO 平均提升 +1.5,分布外 LIBERO-Plus 提升 +6.3,RoboTwin 域随机化下的随机化平均提升 +28.5,三项 AgiBot A2 真机任务总体成功率提升 +11.67 个百分点,且分布外增益更大。