RAP:研究注意力预测揭示目标条件化的证据获取偏差
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
大型语言模型日益充当研究智能体,但其追踪研究注意力变化的能力难以评估,因为综述与研究设想缺乏唯一可验证的结果。为此,研究者提出“研究注意力预测”(RAP),这是一个覆盖 278 个人工智能与机器学习领域、1390 个预测回合的滚动基准。在每个截点,大模型智能体在时间受限的 arXiv 语料中检索,并预测未来六个月八个固定研究方向上的论文占比。检索总体上有帮助,但四个诊断模型在构成准确度上均不如精确计数的指数加权移动平均(EWMA)基线。研究识别出两个相互关联的瓶颈:在累计历史访问条件下,状态延续对所有四个诊断模型都优于直接预测;冻结证据回放将这一反转的共有成分与面向预测的策略检索到较少的近期证据联系起来。即便拥有精确的历史活动数据,面向未来的更新仍然有限,只有 GPT-5.5 配合重新开放的检索才略优于 EWMA。在真实结果上微调,使 Qwen3-4B 在较晚起点的留出领域上的预测斯皮尔曼相关系数提升 0.105,在变化密集的回合上也有增益。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究动机
大语言模型日益充当研究代理,但其追踪研究注意力转移的能力难以评估,因为综述与研究想法缺乏唯一可验证的结果。
基准提出
论文引入研究注意力预测(RAP),这是一个滚动基准,覆盖 278 个人工智能/机器学习领域和 1390 个预测单元。
任务设定
在每个截止点,代理在时间受限的 arXiv 语料中检索,并预测未来六个月八个冻结研究方向上的论文份额。
检索作用
检索通常有帮助,但四个诊断模型在组合准确度上都劣于精确计数指数加权移动平均(EWMA)基线。
瓶颈诊断
在累积历史访问下,状态延续(State carry-forward)在四个诊断模型上都优于直接预测(Forecast);冻结证据重放显示,这一反转的共同成分与面向预测的策略检索到的近期证据份额较小有关。
更新能力受限
即使给定精确的历史活动,面向未来的更新仍然有限,只有 GPT-5.5 加上重新开启的检索略微超过 EWMA。
微调效果
在已实现结果上微调,使 Qwen3-4B 在较晚起点的留出领域上的预测斯皮尔曼相关性提高 0.105,在变化丰富的预测单元上也有增益。