NewsFi.AI
返回今日
已核验来源

AgentAudit:面向AI智能体全生命周期信任评估的开放可扩展框架

arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读

NewsFi 导读4 分钟速览

现有评估框架多只考察AI智能体的单一环节,如任务完成度或安全鲁棒性,难以覆盖规划、工具选择、工具执行、记忆与推理的完整流程,也几乎无法定位失败发生的具体阶段。AgentAudit 通过读取被记录的执行轨迹,对十项能力、基础、安全与行为维度进行全流程评估,涵盖指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性,并结合行为分类与失败归因,精确指出导致失败的具体环节。该框架以挂载方式接入而非替换智能体,不干预其运行方式,也不限制其内部实现。研究在九项能力与对抗任务上评测了 OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash 五个模型,Claude Sonnet 5 与 GPT-5 的平均综合信任分最高,分别为 95.1 与 80.6 分(满分 100),其余三个模型明显落后,分别为 57.6、45.7 和 22.6 分。所有轨迹均由单一固定评判模型打分,而该评判模型本身也是被评测模型之一,作者在第七节 E 部分讨论了这一局限。更重要的是,任务完成表现相近的模型在可信度上可能差异巨大,若干非前沿模型在对抗任务中反复被判定为不安全遵从,而非仅仅是任务失败,这是通过或失败型基准无法揭示的差别。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

覆盖完整执行流程

现有评估框架大多只评估 AI 智能体的某一部分,如任务完成(AgentBench)或安全鲁棒性(AgentDojo、ASB),而非规划、工具选择、工具执行、记忆与推理的完整流程。

2

失败来源难以定位

失败可能发生在智能体运行的任何阶段,但现有基准很少能识别失败的确切来源。

3

十维评估体系

AgentAudit 评估完整执行轨迹,覆盖能力、接地、安全与行为四类共十个维度:指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全、执行完整性。

4

行为分类与失败归因

框架结合行为分类与失败归因,以精确定位导致所观察失败的确切阶段。

5

非侵入式挂载设计

AgentAudit 挂载于智能体而非替换智能体,因此可评估任何基于大语言模型的 AI 智能体。

6

只读执行轨迹

它只读取已记录的执行轨迹,不干扰智能体的运行方式,因此对智能体的内部实现不作任何约束。

7

被测模型与任务

论文在九个能力与对抗任务上评估了五个语言模型:OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B 与 Gemini 2.5 Flash。

8

综合信任分数结果

Claude Sonnet 5 与 GPT-5 获得最高的平均综合信任分数,分别为 95.1 与 80.6(满分 100);Sarvam 105B、Llama 3.3 70B 与 Gemini 2.5 Flash 明显落后,分别为 57.6、45.7 与 22.6。

9

评判模型局限

所有轨迹由单一固定评判模型打分,而该评判模型本身也是被评估的模型之一,此局限在论文第 VII.E 节讨论。

10

任务完成相近但可信度分化

任务完成行为相似的模型在可信度上可能急剧分化,若干非前沿模型在对抗任务中被反复归类为 Unsafe_Compliance,而非仅仅任务失败,这种区别是通过/失败型基准无法呈现的。

11

来源信息

该工作以预印本形式发布,编号为 arXiv:2609.09875v1,公告类型为 new。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09875