面向潜在思维链推理的结构化过程监督
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
潜在推理方法通过用紧凑的连续空间嵌入替代冗长的显式思维链,提高词元级效率与鲁棒性。然而,现有方法缺乏对这些潜在嵌入的直接过程监督,常导致表示坍缩和信息分布不均。为此,我们提出原型中介过程监督,引入可学习的推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。该方法将潜在嵌入与显式思维链嵌入投影到共享原型空间,通过原型分配实现不等长表示之间的多对多软对齐。同时,我们引入渐进序列对齐模块进一步引导训练:位置先验最初鼓励形成序列对齐结构,随后逐渐放松以允许自适应匹配。实验结果表明,在 GSM8K-Aug 上,该方法将输出词元长度压缩至显式思维链的 50% 以下。与领先基线 SIM-CoT 相比,该方法在不同模型家族上平均准确率提升 2.08%。在 GPT-2 上,该方法甚至超过思维链监督微调。在更大模型和更具挑战性的任务上,该方法在输出长度相当的情况下,于所有潜在推理方法中持续获得最高准确率。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
现有潜在推理方法用连续空间嵌入替代显式思维链词元,但缺乏对潜在嵌入的直接过程监督,常出现表示坍缩与信息分布不均。
方法核心
提出原型中介过程监督(PMPS),以可学习推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。
对齐机制
PMPS将潜在嵌入与显式思维链嵌入投影到共享原型空间,通过原型分配在不等长表示之间实现多对多软对齐。
训练策略
引入渐进顺序对齐(PSA)模块:位置先验初期鼓励顺序对齐结构,随后逐步放松以允许自适应匹配。
效率结果
在GSM8K-Aug上,PMPS将输出词元长度压缩到显式思维链的50%以下。
准确率结果
相比领先基线SIM-CoT,PMPS在不同模型家族上平均准确率提升2.08%;在GPT-2上甚至超过CoT-SFT。
扩展表现
在更大模型和更具挑战性的任务上,PMPS在可比输出长度下于所有潜在推理方法中取得最高准确率。