智能体是否知道自己成功?从内部表征校准智能体置信度
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
随着智能体系统在安全关键应用中快速采用,衡量智能体动作相关置信度至关重要。与传统机器学习系统相比,智能体工作流具有规划、工具调用和动态环境交互带来的复杂失效模式。本文研究在多轮智能体设置中,模型内部表征是否能提供更强的最终任务成功信号。作者提出两种互补方法:潜在轨迹动态,用于总结交互轨迹中残差流表征的变化;动作表征探针,用于从动作决策时形成的表征预测成功。在三个交互基准(Bash、SQL、Python)和三个模型系列(Qwen14B、Qwen7B、DeepSeek6.7B)上,这些方法持续优于表面生成与基于序列的校准基线,提供无需修改提示、也无需多样本推演的零开销可靠性监测器。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究动机
智能体系统在安全关键应用中快速采用,测量动作相关置信度变得重要。
失败模式差异
相比传统机器学习系统,智能体工作流具有规划、工具调用和动态环境交互带来的复杂失败模式。
研究问题
论文考察多轮智能体设置中,模型内部表示是否提供更强的最终任务成功信号。
方法一:潜隐轨迹动态(LTD)
LTD 汇总交互轨迹中残差流表示的变化。
方法二:动作表示探针(ARP)
ARP 从动作决策时形成的表示预测任务成功。
实验设置
评估覆盖 Bash、SQL、Python 三个交互式基准,以及 Qwen14B、Qwen7B、DeepSeek6.7B 三个模型家族。
主要结果
所提方法一致优于表层生成和基于序列的校准基线。
应用特性
方法提供零开销可靠性监控器,不需要提示修改,也不需要多次采样展开。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09448