NewsFi.AI
返回今日
已核验来源

面向潜在思维链推理的结构化过程监督

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

潜在推理方法通过用紧凑的连续空间嵌入替代冗长的显式思维链,提高词元级效率与鲁棒性。然而,现有方法缺乏对这些潜在嵌入的直接过程监督,常导致表示坍缩和信息分布不均。为此,我们提出原型中介过程监督,引入可学习的推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。该方法将潜在嵌入与显式思维链嵌入投影到共享原型空间,通过原型分配实现不等长表示之间的多对多软对齐。同时,我们引入渐进序列对齐模块进一步引导训练:位置先验最初鼓励形成序列对齐结构,随后逐渐放松以允许自适应匹配。实验结果表明,在 GSM8K-Aug 上,该方法将输出词元长度压缩至显式思维链的 50% 以下。与领先基线 SIM-CoT 相比,该方法在不同模型家族上平均准确率提升 2.08%。在 GPT-2 上,该方法甚至超过思维链监督微调。在更大模型和更具挑战性的任务上,该方法在输出长度相当的情况下,于所有潜在推理方法中持续获得最高准确率。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

现有潜在推理方法用连续空间嵌入替代显式思维链词元,但缺乏对潜在嵌入的直接过程监督,常出现表示坍缩与信息分布不均。

2

方法核心

提出原型中介过程监督(PMPS),以可学习推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。

3

对齐机制

PMPS将潜在嵌入与显式思维链嵌入投影到共享原型空间,通过原型分配在不等长表示之间实现多对多软对齐。

4

训练策略

引入渐进顺序对齐(PSA)模块:位置先验初期鼓励顺序对齐结构,随后逐步放松以允许自适应匹配。

5

效率结果

在GSM8K-Aug上,PMPS将输出词元长度压缩到显式思维链的50%以下。

6

准确率结果

相比领先基线SIM-CoT,PMPS在不同模型家族上平均准确率提升2.08%;在GPT-2上甚至超过CoT-SFT。

7

扩展表现

在更大模型和更具挑战性的任务上,PMPS在可比输出长度下于所有潜在推理方法中取得最高准确率。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09928