NewsFi.AI
返回今日
已核验来源

OpenDiscoveryTrace:面向 AI 科学家工作流评估的流程轨迹数据集

arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读

NewsFi 导读4 分钟速览

现有面向自主 AI 科学家的评测基准只考察最终产出(生成的代码、假设或论文),却丢弃了得到这些产出的推理过程,导致无法审计科学方法、诊断失败模式,也难以区分系统推理与侥幸猜测。该研究发布公开数据集 OpenDiscoveryTrace,包含 558 条完整的 AI 科学智能体轨迹,逐步记录包含思考、工具调用、观察结果、错误、修订触发条件与自报信心在内的 9 个字段,覆盖药物发现、材料科学、基因组学与科学文献分析领域的 124 项科学任务,涉及三类前沿模型(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro)与四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini、Qwen2.5-1.5B),另含 60 条实时检索变体轨迹。对 363 条由大模型评判轨迹的初步分析显示,流程轨迹能暴露仅看产出时不可见的行为差异:三类前沿模型成功率相近(84%—89%),但 Claude Opus 4.6 每条轨迹平均出现 2.5 个错误,远高于 GPT-5.4 的 0.08 个,且错误构成不同,前者 66.7% 为工具误用,后者 83.6% 为推理错误。研究还定义了五项基准任务并给出逻辑回归、随机森林、循环神经网络与注意力机制模型的基线。数据集、轨迹模式、智能体框架与基准定义以 CC BY 4.0 协议公开,以支持过程级评估、科学智能体审计与 AI 治理研究。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

核心问题

现有自主 AI 科学家基准仅评测最终产出,丢弃了推理过程,因而无法审计科学方法、诊断失败模式,也无法区分系统性推理与侥幸猜测。

2

数据集名称与规模

作者提出 OpenDiscoveryTrace,一个包含 558 条完整 AI 科学智能体轨迹的公开数据集,强调记录模型“如何推理”而非仅“产出什么”。

3

追踪记录结构

每条轨迹记录逐步 9 个字段的结构化追踪,包括思维、工具调用、观察、错误、修订触发与自报置信度等。

4

任务覆盖

轨迹对应 124 项科学任务,横跨药物发现、材料科学、基因组学与科学文献分析等领域。

5

模型覆盖

数据集覆盖 7 个模型:三个前沿模型 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 各 124 条且跨领域与难度完全均衡;四个开放权重模型 Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini、Qwen2.5-1.5B 各 30 条;另有 60 条实时检索变体轨迹。

6

试点分析发现

对 363 条经 LLM 评判的轨迹进行试点分析,发现过程追踪能暴露仅看产出时不可见的行为差异:三个前沿模型成功率相当(84%–89%)。

7

错误数量差异

Claude Opus 4.6 每条轨迹错误数为 GPT-5.4 的约 30 倍(2.5 对 0.08,p<0.0001,Cliff's δ=0.613)。

8

错误画像差异

错误性质存在质的差别:Claude 有 66.7% 为工具误用,而 GPT-5.4 有 83.6% 为推理错误。

9

基准任务与基线

作者定义了五项基准任务,并提供逻辑回归、随机森林、LSTM 与 Transformer 模型的基线结果。

10

开放获取

数据集、追踪模式、智能体框架与基准定义均以 CC BY 4.0 许可公开,以支持过程级评测、科学智能体审计与 AI 治理研究。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09203