高维线性回归中通过随机梯度下降利用合成数据的学习
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
合成数据已成为在有限人工数据之外扩展模型训练的有前景手段,但也可能引发强烈的模型崩溃,即任何固定比例的合成数据都会使数据规模化无法继续提升模型性能,留下不消失的额外风险下限。本文研究合成数据如何影响带模型偏移的高维线性回归中单遍随机梯度下降的泛化。作者为混合训练与两阶段训练建立有限样本风险界,将标准偏差和方差与源不匹配效应分离,包括混合下的波动和持续漂移,以及两阶段下的过滤初始化偏差。这些界揭示出鲜明对比:混合训练导致强烈模型崩溃,而两阶段训练仅在首阶段使用合成数据即可避免风险下限,表明在简单数据课程下崩溃并非不可避免。在随机草图模型下,作者进一步得到两种协议的缩放律,并在优化饱和区间对混合训练给出紧结果。这些缩放律表明,更大模型可能放大混合下合成数据引发的退化,并量化高质量合成预训练如何降低两阶段训练中的偏差。最后,作者给出精确的有限样本充要条件,说明在相同真实数据预算和相同真实阶段更新下,两阶段训练何时严格优于仅真实数据训练。总体而言,合成数据既非固有有害也非固有有益,其效果关键取决于数据质量和所采用的训练协议。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
合成数据被视为突破人工生成数据有限性、扩展模型训练规模的重要途径,但已有研究指出它可能引发强烈的模型崩溃,即任何固定比例的合成数据都会阻止模型性能随数据规模提升,留下无法消除的超额风险下限。
研究设定
论文在高维线性回归且存在模型偏移的条件下,研究合成数据对单遍 SGD 泛化性能的影响。
核心理论工具
作者为混合训练与两阶段训练分别建立有限样本风险界,并将标准偏差与方差项同来源失配效应项分离。
失配效应分类
混合训练下的来源失配表现为波动与持续漂移,两阶段训练下的来源失配则表现为滤波初始化偏差。
协议对比结论
混合训练会导致强烈的模型崩溃,而两阶段训练因仅在首阶段使用合成数据而规避了风险下限,表明崩溃在简单的数据课程下并非必然。
缩放律
在随机草图模型下,作者给出两种协议的缩放律,并在优化饱和区对混合训练得到紧致结果。
模型规模的影响
缩放律表明,在混合训练下更大的模型可能放大合成数据带来的性能退化。
合成数据质量的影响
缩放律量化了高质量合成预训练如何在两阶段训练中降低偏差。
充要条件
作者建立了精确的有限样本充要条件,刻画在相同真实数据预算与相同真实阶段更新下,两阶段训练何时严格优于纯真实数据训练。
总体判断
合成数据既非天然有害也非天然有益,其影响关键取决于合成数据质量与将其纳入训练所采用的协议。