计算受限的安全保障:资源约束下的覆盖、验证与响应
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
该研究提出一个资源受限框架,区分重复成功、唯一覆盖、被接受的证据和运行保护等不同量。对条件独立重复尝试,若潜在成功概率为 Θ,则覆盖值为 1 减去 (1-Θ) 的 n 次方的期望,其极限值为 1 减去 Θ 等于 0 的概率。正的两两结果相关性本身并不必然意味着上限低于一:作者构造了两个模型,它们具有相同的平均成功率和两两相关性,但极限覆盖不同。该结果不同于用于估计均值的有效样本量,并说明有限预算观测通常无法识别渐近支撑上限。文章进一步将覆盖与易错证据检查、事实基础的适当评分、完整资源核算、服务容量以及包含缓解延迟的响应模型联系起来。概念性防御架构分离证据分析、裁决和操作权限;评估协议规定留出任务、配对比较、负面案例和不确定性报告。贡献在于一致的理论综合以及对无效外推的反例,而非经验缩放定律。所有数值说明均为解析性;不声称模型平价结果、硬件基准或一般攻防均衡。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。额外计算与任务解决
额外推理计算可增加正确解决的安全保障任务数量。
四类量需区分
重复成功、唯一覆盖、被接受的证据和运行保护是不同的量。
资源受限框架
作者提出资源受限框架来分离上述不同量。
覆盖公式
对重复条件独立尝试,潜在成功概率为 Θ 时,覆盖为 C_n = 1 - E[(1-Θ)^n],极限为 1 - P(Θ = 0)。
相关性反例
正的两两结果相关性本身不意味着上限低于 1;作者构造两个模型,平均成功与两两相关性相同但极限覆盖不同。
有效样本量与识别限制
作者将此结果与估计均值的有效样本量区分,并说明有限预算观测通常无法识别渐近支持上限。
连接验证与响应
覆盖被连接到易错证据检查、事实基础适当评分、完整资源核算、服务能力和含缓解延迟的响应模型。
防御架构与评估协议
概念性防御架构分离证据分析、裁决和运行权限;评估协议指定留出任务、配对比较、负面案例和不确定性报告。
贡献定位
贡献是一致理论综合和针对无效外推的反例,而非经验扩展律。
声明边界
所有数值说明为解析性;不声称模型对等结果、硬件基准或一般攻防均衡。