OpenDiscoveryTrace:面向 AI 科学家工作流评估的流程轨迹数据集
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
现有面向自主 AI 科学家的评测基准只考察最终产出(生成的代码、假设或论文),却丢弃了得到这些产出的推理过程,导致无法审计科学方法、诊断失败模式,也难以区分系统推理与侥幸猜测。该研究发布公开数据集 OpenDiscoveryTrace,包含 558 条完整的 AI 科学智能体轨迹,逐步记录包含思考、工具调用、观察结果、错误、修订触发条件与自报信心在内的 9 个字段,覆盖药物发现、材料科学、基因组学与科学文献分析领域的 124 项科学任务,涉及三类前沿模型(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro)与四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini、Qwen2.5-1.5B),另含 60 条实时检索变体轨迹。对 363 条由大模型评判轨迹的初步分析显示,流程轨迹能暴露仅看产出时不可见的行为差异:三类前沿模型成功率相近(84%—89%),但 Claude Opus 4.6 每条轨迹平均出现 2.5 个错误,远高于 GPT-5.4 的 0.08 个,且错误构成不同,前者 66.7% 为工具误用,后者 83.6% 为推理错误。研究还定义了五项基准任务并给出逻辑回归、随机森林、循环神经网络与注意力机制模型的基线。数据集、轨迹模式、智能体框架与基准定义以 CC BY 4.0 协议公开,以支持过程级评估、科学智能体审计与 AI 治理研究。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。核心问题
现有自主 AI 科学家基准仅评测最终产出,丢弃了推理过程,因而无法审计科学方法、诊断失败模式,也无法区分系统性推理与侥幸猜测。
数据集名称与规模
作者提出 OpenDiscoveryTrace,一个包含 558 条完整 AI 科学智能体轨迹的公开数据集,强调记录模型“如何推理”而非仅“产出什么”。
追踪记录结构
每条轨迹记录逐步 9 个字段的结构化追踪,包括思维、工具调用、观察、错误、修订触发与自报置信度等。
任务覆盖
轨迹对应 124 项科学任务,横跨药物发现、材料科学、基因组学与科学文献分析等领域。
模型覆盖
数据集覆盖 7 个模型:三个前沿模型 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 各 124 条且跨领域与难度完全均衡;四个开放权重模型 Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini、Qwen2.5-1.5B 各 30 条;另有 60 条实时检索变体轨迹。
试点分析发现
对 363 条经 LLM 评判的轨迹进行试点分析,发现过程追踪能暴露仅看产出时不可见的行为差异:三个前沿模型成功率相当(84%–89%)。
错误数量差异
Claude Opus 4.6 每条轨迹错误数为 GPT-5.4 的约 30 倍(2.5 对 0.08,p<0.0001,Cliff's δ=0.613)。
错误画像差异
错误性质存在质的差别:Claude 有 66.7% 为工具误用,而 GPT-5.4 有 83.6% 为推理错误。
基准任务与基线
作者定义了五项基准任务,并提供逻辑回归、随机森林、LSTM 与 Transformer 模型的基线结果。
开放获取
数据集、追踪模式、智能体框架与基准定义均以 CC BY 4.0 许可公开,以支持过程级评测、科学智能体审计与 AI 治理研究。