SFT 究竟该学习哪些 token?从 token 修剪视角看数学推理
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
监督微调对所有目标 token 使用统一交叉熵损失,但不同 token 对数学推理的学习信号并不相等。这种统一处理会过度强化已掌握 token,同时放大小概率、低置信度 token 的学习压力。研究者提出 Trimmed Logit-Gap SFT(TrimSFT),一种基于 token 级别重新加权的方法,依据正确 token 与最强竞争者之间的 logit 差距调整损失。TrimSFT 从两端修剪监督:既削弱已掌握 token(logit 差距大),也削弱当前模型支持弱的 token(logit 差距小或为负),将学习集中在中间 logit 差距区域。该方法用中心为 margin m、带宽为 τ 的高斯权重实现,无需参考模型或额外前向传播。在 Llama、Qwen、DeepMath 系列六个基础模型和五个数学推理基准上评估,TrimSFT 始终优于标准 SFT,在六个模型中的五个上取得最佳平均性能,在 MATH500 上相较 SFT 提升最高达 26.9 分。分析表明带宽 τ 比具体 margin 位置更重要,仅从一侧移除监督压力的半修剪变体权衡更差。token 级 logit 差距分布分析显示,TrimSFT 比统一 SFT 或单调重新加权更平衡地重塑模型置信度。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。统一损失的问题
监督微调对全部目标词元施加相同的交叉熵损失,但不同词元为数学推理提供的学习信号并不相等;统一处理会过度强化已掌握词元,并放大对不确定、低置信词元的学习压力,造成次优训练动力学。
方法核心
论文提出 Trimmed Logit-Gap SFT(TrimSFT),按金标准词元与其最强竞争者之间的 logit 差值缩放微调损失,实现词元级重加权。
两端削减
TrimSFT 同时削减两端监督:差值大、已被掌握的词元,以及差值小或为负、当前模型弱支持的词元;学习被集中到两者之间的中间 logit 差值区间。
实现细节
该原则以中心为边界 m、带宽为 τ 的高斯权重落地,不需要参考模型,也不需要额外前向传播。
实验设置
在 Llama、Qwen、DeepMath 三大家族的六个基座模型,以及五个数学推理基准上进行评估。
主要结果
TrimSFT 相对标准 SFT 持续提升,在六个模型中的五个取得最佳平均性能,在 MATH500 上相对 SFT 最大提升达 +26.9 分。
消融与分析
带宽 τ 比边界的确切位置更重要;只从一侧移除监督压力的半削减变体带来的权衡更差;词元级 logit 差值分布分析显示,TrimSFT 比统一 SFT 或单调重加权方法更均衡地重塑模型置信度。
总体结论
推理类监督微调可从削减两端、而非统一对待所有词元中获益。