联邦学习中受 LT 码剥离启发的级联梯度反演
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
联邦学习共享的是模型更新而非原始数据,但这些更新可被反演以重建客户端的训练数据。以闭式方式反演梯度的解析式重建攻击会随批量增大而失效:此前的单轮攻击在批量大小为 100 时仅能恢复约一半样本,且已知上界限制了此类方法的恢复能力。本文建立梯度反演与纠删码理论之间的联系,并据此构造出突破该上界的攻击方法。该攻击可从单轮 FedSGD 中精确恢复整个批次及每个样本的标签,并能在没有真实数据的情况下验证每次恢复结果。在八个图像与表格基准上,其表现大幅优于此前的单轮攻击。即便攻击者处于被动状态、仅观察诚实训练的网络,在批量大小不超过 128 时也能恢复 ImageNet 批次的 94%–100%;在主动攻击场景下,批量达数百时恢复率仍超过 90%。这些结果表明联邦学习的隐私泄露问题被低估。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
联邦学习共享模型更新而非原始数据,但更新可被反演以重建客户端训练数据;解析重建攻击随批量增大而退化。
既有瓶颈
先前单轮攻击在批量大小为 100 时,即使攻击者完全控制网络参数,也仅能恢复约一半;已有上界限制此类方法可恢复的内容。
方法连接
论文将梯度反演与纠删码理论建立联系,并据此构造可超过既有上界的攻击。
攻击能力
所提攻击可从单轮 FedSGD 精确恢复整个批次及每个样本标签,并在无真值数据条件下认证每次恢复。
基准表现
在八个图像与表格基准上,该方法大幅优于先前单轮攻击。
被动场景
被动攻击者仅观察诚实训练的网络,在 ImageNet 批量大小不超过 128 时可恢复 94%–100% 的批次。
主动场景
主动设置下,在批量大小为数百时仍可恢复超过 90%,并超过先前主动操纵模型所能达到的效果。
总体结论
结果表明联邦学习的隐私泄漏被低估。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09659