仅凭分数不足以证明发现:审计 AI 研究代理的发现认证协议
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
论文提出发现认证协议(DCP),把 AI 研究代理的成果主张转化为可执行的复现与反馈检验。第一道门在封闭评测上验证有效改进;第二道门向匹配代理提供登记过的起始信息与观测到的网络内容,同时隐去目标研究历史。任何达到数值目标的有效方法都要提供复现见证,并触发核心否决。DCP 核心要求具备充分对照、零观测复现,以及在一次新登记回合中对复现概率的有限样本上界。可选的第三道门从共享检查点出发,测量真实反馈相对指定中性策略的平均效应;DCP 证据在独立零假设校准与登记效应边际之后纳入该效应。两项受控审计在 SQLite 优化与虚拟催化剂控制中完整运行该协议,各在 96 个回合中产生零复现,上界为 0.0468;配对研究各得到 30 次真实反馈复现与零次中性复现,60 对零假设研究均通过。另有案例检验核心、已复现与审计不完整三类判定。一个无需大模型的确定性验证器可依据冻结证据复现这些判定。DCP 为 AI 研究中的有用成果、替代路径与反馈效应提供了共同的证据语言。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。协议目标
DCP把关于AI研究智能体结果的声明转化为可执行的复现检验与反馈检验。
门1
门1在密封评测上验证有用的改进。
门2
门2向匹配智能体提供登记起始信息与已观测网页内容,同时隐瞒目标研究历史。
复现见证与核心否决
任何达到数值目标的有效方法都会提供复现见证,并触发核心否决。
DCP核心的三项要求
DCP核心要求充分对照、零观测复现,以及在一个新登记回合中对复现概率的有限样本上界。
可选门3
门3从共享检查点衡量真实反馈相对指定中性政策的平均效应。
DCP证据
DCP证据在独立零校准与登记效应边际之后纳入门3测得的效应。
受控审计结果
两项受控审计分别在SQLite优化与虚拟催化剂控制中运行完整协议,各在96个回合中实现零复现,上界为0.0468。
配对研究结果
每项配对研究产生30次真实复现与0次中性复现,并通过60对零研究。
附加案例
其他案例用于检验核心判定、已复现判定与审计不完整判定。
验证器
一个确定性、不依赖大语言模型的验证器可从冻结证据复现各项判定。
总体意义
DCP为AI研究中的有用结果、替代路线与反馈效应提供共同的证据语言。