NewsFi.AI
返回今日
已核验来源

证明携带认知:以现实结算奖励弥合验证鸿沟

arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读

NewsFi 导读4 分钟速览

论文指出语言模型推理的前沿进展依赖廉价可靠的验证器,而形式化领域之外的推理缺乏可扩展、不可被腐蚀的奖励,即“验证鸿沟”。作者提出四项贡献:在联合高斯最优N选一模型中证明验证器与真实答案的相关性rho是测试时计算与能力之间的精确兑换率,不可靠验证器将付出N^(1/rho^2)的多项式代价;在程序合成测试平台上展示不可靠验证器随优化推进而丧失压力下的可靠性(N=4096时从0.94降至0.32),而基于现实结算的方法可将作弊差距从约0.27降至约0;提出“证明携带认知”范式,即推理步骤被类型化为概率性主张,由仅用留出现实数据训练的世界模型定价并通过恰当评分规则结算;并指定“压力下的可靠性”作为现实结算推理基准的核心指标。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

核心论点:验证缺口

论文认为,语言模型推理的前沿收益集中在存在廉价且可靠验证器的领域,而该领域真正的约束是“验证缺口”,即形式化领域之外没有可扩展且不可被腐蚀的奖励。

2

理论贡献

在最佳N选一选择的联合高斯模型中,验证器与标准答案的相关性被视为测试时算力与能力之间的确切兑换率;不可靠验证器会付出多项式惩罚;无边际的联结函数形式对真实大模型评判器实际可靠性的预测中位误差为4%。

3

程序合成测试台演示

在具备可执行标准答案的程序合成测试台上,包括一次预注册的规模化复现,不可靠验证器随优化增长而失去压力下的可靠性(在N=4096时由0.94降至0.32),而可靠验证器单调改善。

4

现实结算优于冻结验证器

以现实为锚的结算在独立同分布与对抗压力下均优于冻结验证器,将作弊差距从约0.27压至约0;可靠性随结算标签数量呈对数线性增长,同策略结算的标签效率约为随机标注的10倍。

5

真实大模型评判器与训练实验

以单元测试执行为标准答案时,较弱的评判器在最佳N选一下失去可靠性,较强评判器更稳健,仅靠选择就能从诚实样本中制造出+0.53的作弊差距;在真实GRPO训练中,冻结奖励模型呈现完整的过度优化曲线,实际执行奖励下降90%,而在10%结算数据流上重新拟合的同一模型保留了6倍的实际执行奖励。

6

范式:证明携带认知

提出“证明携带认知”范式,将推理步骤视为带类型的概率性主张,由仅以留出的现实数据训练的自建世界模型定价,并通过恰当评分规则加以结算。

7

基准指标

论文提出把“压力下可靠性”作为现实结算推理基准的核心指标。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09776