固定采样次数下 pass@k 评估能识别什么
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
论文研究重复采样评估中将 pass@k 外推到每题采样数 n 之外的问题。在合并或随机任务的条件二项模型中,固定 n 的成功计数只能识别潜在每题成功分布的 n 个自由矩:当 k≤n 时,直接 pass@k 可识别;当 k>n 时,一般外推 pass@k、尾部指数与尾部常数不可识别,即使在同一采样预算下拥有任意多可交换任务。作者给出保持计数律但外推不相容的精确构造,说明唯一延拓的例外情形,并通过 Hausdorff 主表示计算尖锐的总体识别区间。在 Brown 等公开的每题 10000 次采样数据上,反事实 n=16 的评估使 k=1000 的失败率在四种 MATH/GSM8K/CodeContests 配置中产生 1.5 倍至逾 2600 倍的模糊性;校准表明仅凭中等规模失败份额无法确定区间宽度。该结果不否定参数化推理时扩展律,而是提供非参数基线以评估其假设,并给出精确保守的单坐标有限任务置信证书及区分直接估计、识别集与模型条件预测的报告标准。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
重复采样评估日益把 pass@k 外推到远超每问题采样数 n 的范围,本文追问固定 n 的计数实验究竟能识别什么。
核心模型
在汇总/随机任务条件二项模型中,观测为固定 n 次成功计数,潜在变量为每任务成功概率分布。
主要识别结论
固定 n 成功计数只识别潜在每任务成功分布的 n 个自由矩,不能确定更多矩。
直接与外推的区别
直接 pass@k 在 k≤n 时可识别;通用外推 pass@k、尾部指数和尾部常数在 k>n 时不可识别。
任务数量不能消除问题
即使拥有任意多可交换任务且每个任务采样预算相同,k>n 的外推仍不可识别。
强于估计量未定义
该结论不只是说常用估计量在超过 n 后未定义,而是刻画固定深度计数律实验所缺失的信息。
构造与例外
作者给出精确保持计数律但导致不兼容外推的构造,并说明存在例外唯一延拓的情形。
识别区间计算
通过 Hausdorff 主表示,作者计算了尖锐总体识别区间。
实证校准
在 Brown 等人公开的每问题 10,000 次采样轮次数据上,反事实 n=16 时 k=1000 失败模糊度在四种 MATH/GSM8K/CodeContests 配置中为 1.5 倍至超过 2,600 倍。
解释边界
校准显示仅中间尺度失败份额不能决定宽度;结果不拒绝参数化推理时缩放律,而是提供非参数基线。
报告建议
作者给出精确、保守的一坐标有限任务置信证书,以及区分直接估计、识别集和模型条件预测的报告标准。