XAI-Arena:大语言模型能否评估可解释人工智能解释的质量?
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
可解释人工智能(XAI)方法所生成解释的质量评估仍具挑战,现有做法多依赖主观人工判断,限制了研究的可复现性、可扩展性与可比性。该研究检验大语言模型能否作为一种可复现、可扩展的机制,对XAI解释的质量进行比较评估。作者提出XAI-Arena,一个以“大语言模型作为评判者”的框架,用于可扩展、可复现、多维度且兼顾利益相关者的解释质量评估。该框架可从感知简洁性、清晰度、任务充分性、信任校准、可操作性、透明度、忠实性以及整体可解释性等维度比较XAI解释,并在多个数据集、机器学习模型与利益相关者角色设定下对XAI解释方法进行基准测试。人工验证显示,大语言模型生成的评分与人类评分呈强正相关,斯皮尔曼等级相关系数为0.693,显著性水平小于0.001。研究认为,基于大语言模型的评估能够捕捉XAI解释质量上的系统性差异,为解释质量的比较评估提供可扩展且可复现的框架。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
评估 XAI 方法所产生解释的质量仍是难题,既有方法多依赖主观人工判断,限制了可复现性、可扩展性与研究间可比性。
核心设想
作者检验大语言模型(LLM)能否作为一种可复现、可扩展的机制,对 XAI 解释质量进行比较性评估。
提出框架
论文提出 XAI-Arena,一个以 LLM 作为评判者(LLM-as-a-judge)的评估框架,特点是可扩展、可复现、多维度并顾及利益相关者差异。
评估维度
XAI-Arena 沿八个维度比较 XAI 解释:感知简洁性、清晰度、任务适配度、信任校准、可行动性、透明度、忠实度与整体可解释性。
基准测试范围
作者在多个数据集、多种机器学习模型与多个利益相关者画像(personas)上对 XAI 解释方法进行了基准测试。
人类验证结果
人类验证显示,LLM 生成的评分与人类评分之间呈强正相关,Spearman's rho=.693,p<.001。
作者结论
作者认为,基于 LLM 的评估能够捕捉 XAI 解释质量的系统性差异,并为 XAI 解释的比较评估提供可扩展、可复现的框架。