风险约束停止层Cros:临床诊断智能体何时可安全停止
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
临床诊断智能体不仅要决定下一步请求何种检测,还要决定何时给出诊断或推迟。现有智能体基准多在固定或无约束交互后评估准确率,使自主停止的可靠性成为隐含问题。作者提出Cros风险约束停止层,结合状态级错误排序、在不相交开发划分上的策略设计,以及对完整序列策略的选择性诊断错误与最低自主覆盖率进行LTT式精确检验。其有限样本保证要求候选族、检验规则及任何随机化在访问校准标签之前冻结。在1834例源自MIMIC的腹痛基准上,完整排序器的探索性状态错误AUROC为0.853,最大类概率为0.715,骨干原生停止分数为0.552。在先前查看过的367例评估划分上,对冻结的Cros权重作解析平均得到选择性错误16.9%、覆盖率78.8%、成本5.57、检测次数0.68;原生停止则为错误30.8%、覆盖率100%、成本8.14、检测次数1.53。强制继续呈非单调:仅现病史时错误为28.3%,完整检查后为34.3%。但均匀权重混合消融在该已查看划分上更便宜,尽管未达到锁定的开发边际,且Cros在20次开发重划分中仅6次名义满足联合标准。由于评估标签在早期开发中被查看,这些结果提供的是探索性可行性与审计证据,而非确认性安全证书。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。问题背景
临床诊断智能体不仅要决定下一项检测,还要决定何时诊断或推迟;现有基准多在固定或不受约束交互后评估准确率,使自主停止可靠性未被显式检验。
方法设计
Cros 是风险约束停止层,结合状态级错误排序、互斥开发划分上的策略设计,以及 LTT 风格精确检验,用于完整序贯策略的选择性诊断错误和最低自主覆盖率。
保证条件
有限样本保证要求候选家族、测试规则和任何随机化在访问校准标签之前冻结。
探索性排序结果
在 1834 回合基于 MIMIC 的腹痛基准上,完整排序器探索性状态错误受试者工作特征曲线下面积为 0.853,最大类别概率为 0.715,主干原生停止分数为 0.552。
评估划分结果
在先前查看过的 367 回合评估划分上,对冻结 Cros 权重解析平均得到选择性错误 16.9%、覆盖率 78.8%、成本 5.57、检查 0.68 次;原生停止为 100% 覆盖率下错误 30.8%、成本 8.14、检查 1.53 次。
强制继续现象
强制继续呈现非单调性:仅现病史时错误为 28.3%,完整检查后错误为 34.3%。
消融与重划分问题
均匀权重混合消融在该查看划分上更便宜,但未达到锁定开发边际;Cros 仅在 20 次开发重划分中的 6 次名义满足联合准则。
证据等级
由于评估标签在早期开发中被查看,这些发现提供探索性可行性与审计证据,不是确证性安全证书。