行为语言模型中评分式与生成式读取对比:关于引出格式的实证研究
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
一项实证研究比较了在客户行为数据上微调的语言模型的两种读取方式:直接对答案词元打分得到的概率,与先写出理由再生成预测的结果。在固定模型检查点与提示内容的前提下,研究覆盖三个市场、四项零售任务的13个模型—领域单元,其中两个使用完全公开的数据与检查点。结果显示,评分式读取在13个单元中的12个里对结果的排序更准确(双侧符号检验,p约为0.003),受试者工作特征曲线下面积(AUC)高出1.5至14.5个百分点;成对自助法置信区间在所有新测量单元中均不包含零。差距随任务特定监督以及训练与推理格式的不匹配而变化,从未微调基础模型的-2.2个百分点到理由格式监督的+13.7个百分点不等。对约9000条理由的分析发现两个相关因素:对主导预测特征的依赖降低,以及表述趋于固定套话。概率饱和与差距无关。第三种读取方式即在给出结论前先引出概率,可改善校准(Brier分数从0.47降至0.15),其排序能力与评分式在噪声范围内相当,但仅对训练中出现过的结果比率有效;当评分头本身已校准时,它反而不如评分式。作者通过各读取方式所匹配的目标来解释这些差异,指出可缩小差距的训练选择,并建议保留生成的理由,同时从评分头获取排序结果。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
在模型检查点和提示内容固定不变的前提下,比较两种读数:对答案词元打分得到的概率,与先写出理由后生成预测所得的结果,检验二者是否可互换。
实验覆盖
共 13 个模型—领域单元,涵盖三个市场的四项零售任务,其中两个单元使用完全公开的数据与检查点。
主要结论
打分读数在 13 个单元中的 12 个里对结果的排序更准确,AUC 优势为 1.5 至 14.5 个百分点,双侧符号检验 p 约 0.003。
统计稳健性
在所有新测量的单元中,配对自助法置信区间均排除零。
差距来源
差距随任务特定监督以及训练格式与服务格式的不匹配程度而变化,范围从 -2.2 点(未调优基座模型)到 +13.7 点(理由格式监督)。
理由文本分析
对约 9000 条理由的分析识别出两个相关因素:对主导预测特征的依赖减少,以及对套话式表述的趋同。
概率饱和
概率饱和并不跟随该差距变化。
第三种读数
在任何判定之前先引出概率可改善校准,Brier 分数从 0.47 降到 0.15,排序与打分相比处于噪声范围内,但仅对训练中出现过的结局比例有效。
校准前提
当打分头本身已经校准时,第三种读数不如直接打分。
实践建议
作者建议保留生成式理由,同时从打分头获取排序结果,并指出哪些训练选择可缩小两种读数之间的差距。