教师几何结构如何决定师生神经网络的可学习性
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
师生系统常被用作研究学习的抽象框架:教师神经网络生成训练标签,学生学习实现同一函数。但已有研究通常假设教师参数随机生成且服从正态分布,忽视了教师自身结构,从而掩盖了不同教师可学习性的巨大差异。该论文将可学习性形式化为收敛到全局最小值的成功率,并考察其与过参数化程度、学习算法、学生初始化分布以及教师几何结构的关系。作者分别构造出最大化节点差异性的简单分布与最小化节点差异性的困难分布,发现两者在大量设置和不同激活函数下导致的成功率存在明显差距。为解释这一差距,作者研究含两类次优局部极小值(位于数据分布边缘的越界极小值与内部的内部极小值)的小型神经网络损失景观,在无限数据与快速读出层的假设下将其解析约化为二维,表明内部极小值的吸引域随教师结构而变化。在较大网络中,差异性最大的教师带来更多内部极小值,差异性最小的教师带来更多越界极小值。基于上述分析,作者分别提高读出层学习率并降低内部偏置学习率,从而提升了成功率。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
教师-学生系统由教师网络生成训练标签,使学生网络学习实现同一函数,被广泛用作研究学习的抽象设置。
被忽视的教师结构
既有研究常假设教师参数随机生成且服从正态分布,原文认为这掩盖了不同教师可学习性的显著差异。
可学习性的形式化
原文将可学习性定义为收敛到全局最小值的成功率,并把它看作过参数化、学习算法、学生初始化分布与教师几何的函数。
易分布与难分布
原文识别出最大化节点差异的“易”分布和最小化节点差异的“难”分布,二者在大量设置和不同激活函数下成功率明显不同。
损失景观中的两类极小值
小网络的损失景观包含两类次优局部极小值:数据分布边缘的越界极小值,以及分布内部的极小值。
二维解析简化
在无限数据和快速读出层假设下,小网络的损失景观被解析地降为二维,内部极小值的吸引域随教师结构变化。
网络规模下的差异
在更大网络中,最大差异教师诱导更多内部极小值,最小差异教师诱导更多越界极小值。
训练策略启示
原文表明,分别提高读出层学习率并降低内部偏置学习率,可以提高收敛到全局最小值的成功率。