NewsFi.AI
返回今日
已核验来源

XAI-Arena:大语言模型能否评估可解释人工智能解释的质量?

arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读

NewsFi 导读2 分钟速览

可解释人工智能(XAI)方法所生成解释的质量评估仍具挑战,现有做法多依赖主观人工判断,限制了研究的可复现性、可扩展性与可比性。该研究检验大语言模型能否作为一种可复现、可扩展的机制,对XAI解释的质量进行比较评估。作者提出XAI-Arena,一个以“大语言模型作为评判者”的框架,用于可扩展、可复现、多维度且兼顾利益相关者的解释质量评估。该框架可从感知简洁性、清晰度、任务充分性、信任校准、可操作性、透明度、忠实性以及整体可解释性等维度比较XAI解释,并在多个数据集、机器学习模型与利益相关者角色设定下对XAI解释方法进行基准测试。人工验证显示,大语言模型生成的评分与人类评分呈强正相关,斯皮尔曼等级相关系数为0.693,显著性水平小于0.001。研究认为,基于大语言模型的评估能够捕捉XAI解释质量上的系统性差异,为解释质量的比较评估提供可扩展且可复现的框架。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

评估 XAI 方法所产生解释的质量仍是难题,既有方法多依赖主观人工判断,限制了可复现性、可扩展性与研究间可比性。

2

核心设想

作者检验大语言模型(LLM)能否作为一种可复现、可扩展的机制,对 XAI 解释质量进行比较性评估。

3

提出框架

论文提出 XAI-Arena,一个以 LLM 作为评判者(LLM-as-a-judge)的评估框架,特点是可扩展、可复现、多维度并顾及利益相关者差异。

4

评估维度

XAI-Arena 沿八个维度比较 XAI 解释:感知简洁性、清晰度、任务适配度、信任校准、可行动性、透明度、忠实度与整体可解释性。

5

基准测试范围

作者在多个数据集、多种机器学习模型与多个利益相关者画像(personas)上对 XAI 解释方法进行了基准测试。

6

人类验证结果

人类验证显示,LLM 生成的评分与人类评分之间呈强正相关,Spearman's rho=.693,p<.001。

7

作者结论

作者认为,基于 LLM 的评估能够捕捉 XAI 解释质量的系统性差异,并为 XAI 解释的比较评估提供可扩展、可复现的框架。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09428