TRACE:以合成奖励训练用于因果探索的推理智能体
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
论文探讨能否通过工程化手段解决复杂数据诊断推理中验证成本高的问题。研究团队采样一个干预并注入受控仿真器,生成其对应观测,隐藏的干预提供客观标签与奖励,同时智能体仍需面对含噪、混杂且分散的证据。该方法在数字广告诊断环境 TRACE 中实现,包含 12 种根因和细粒度分群归因,智能体使用 Python 与 SQL 调查每个回合,须识别根因以及适用时的受影响群体。在 235 个回合的留出测试集上,最强提示基线 Claude Opus 5 的 FullAttr@1 为 0.686;监督微调将 Qwen3.5-35B-A3B 从 0.159 提升至 0.637,随后采用合成奖励的强化学习达到 0.757,超过所有被评估的提示基线,包括前沿闭源模型和提示版 Qwen3.5-122B-A10B,且工具调用次数明显少于提示版 35B 基座。结果表明,能否获得可扩展的客观训练信号,可能比模型规模本身更为关键;基于仿真的验证也让原本模糊的诊断推理任务适用于可扩展的强化学习。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
诊断推理缺少数学与代码那种低成本客观校验,确认真实根因常需昂贵专家调查,事后仍可能模糊不清。
核心思路
作者尝试工程化地制造可验证性:采样干预、注入受控模拟器、生成对应观测,用隐藏干预作为权威标签与客观奖励。
任务设定
智能体必须调查带噪声、混杂与分布式特征的证据,而非直接读取隐藏干预。
环境实例
TRACE 是数字广告诊断环境,包含 12 种根因与细粒度分群归因。
交互方式
智能体使用 Python 与 SQL 调查每个情节,并须识别根因,且在适用时给出受影响分群分配。
基线表现
在 235 段留出测试集上,最强提示基线 Claude Opus 5 达到 0.686 FullAttr@1。
训练提升
监督微调把 Qwen3.5-35B-A3B 从 0.159 提升至 0.637;后续使用合成奖励的强化学习达到 0.757。
对比结论
该结果超过所有评估的提示基线,包括前沿闭源模型与提示版 Qwen3.5-122B-A10B,且策略使用的工具调用显著少于提示版 35B 基座。
总体启示
结果提供证据表明,能否获得可扩展且客观的训练信号,可能比单纯模型规模更重要;基于模拟的验证可使原本模糊的诊断推理任务适于可扩展强化学习。