面向6G隐私保护具身智能的模态解耦联邦学习框架FedMVLA
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
本文提出面向第六代(6G)网络隐私保护具身智能的模态解耦联邦学习框架FedMVLA。6G被寄望为大规模具身智能提供关键基础设施,异构机器人依靠低时延连接、边缘智能与分布式感知协同工作;视觉-语言-动作模型将视觉感知、语言理解与动作生成整合为统一闭环策略,但将其训练并适配到分布式机器人智能体时,面临隐私保护、通信效率与模型异构等挑战。现有联邦学习方法忽视了视觉、语言与动作通路在参数规模、隐私暴露程度、更新动态以及对压缩或扰动的容忍度上的内在差异。FedMVLA包含模态感知联邦聚合、模态感知隐私分配与模态感知通信压缩三项机制,并配套模态切片传输设计,将精度关键的动作流经由受保护的超可靠低时延切片传输。基于第三代合作伙伴计划(3GPP)无线环境的联邦机器人操作案例研究涵盖衰落、同频干扰与恶意干扰,结果显示任务成功率达到84.8%,较FedAvg高出22.2个百分点,在扩展至八个小区、128个客户端时优势继续扩大,单客户端上行模型更新调度的平均负载减少95.6%(约96%),同时轮次关键上行完成时间的第95百分位保持在约1.5秒。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
6G 无线网络被期望为大规模具身智能提供关键基础设施,异构机器人通过低时延连接、边缘智能与分布式感知开展协作。
技术基础
视觉-语言-动作(VLA)模型将视觉感知、语言理解与动作生成整合为统一的闭环策略,为上述场景提供基础。
核心挑战
把 VLA 模型训练和适配到分布式机器人智能体上,会带来隐私保护、通信效率与模型异构三方面难题。
现有方法不足
既有联邦学习方法忽略了视觉、语言、动作通路在参数规模、隐私暴露、更新动态以及对压缩或扰动容忍度上的固有差异。
提出框架
文章提出 FedMVLA,一种面向 6G 隐私保护具身智能的模态解耦联邦学习框架,包含模态感知联邦聚合(MAFA)、模态感知隐私分配(MAPA)与模态感知通信压缩(MACO)三种机制。
传输设计
FedMVLA 还采用模态切片传输设计,将精度关键的动作流经由受保护的超可靠低时延切片传输。
实验结果
在基于 3GPP 无线底座、覆盖衰落、同频干扰与恶意干扰的联邦机器人操作案例中,FedMVLA 任务成功率为 84.8%,超过 FedAvg 22.2 个百分点,扩展至八个小区、128 个客户端时优势扩大,每客户端上行模型更新负载的调度平均降幅达 95.6%(约 96%),轮次关键上行完成时间的第 95 百分位接近 1.5 秒。