从看似合理到可行动:关于大语言模型自我解释的立场
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
大语言模型能够生成自然语言解释来合理化自身决策,这一现象通常被称为自我解释。此类解释已成为可解释人工智能中颇具前景的方向,尤其用于解读大语言模型行为。然而,自我解释虽常显得合理,是否忠实反映模型底层推理过程仍是未决问题。本文为观点论文,主张自我解释可以高度合理、忠实性存疑,却高度可行动。从传统可解释人工智能视角出发,作者指出针对大语言模型生成自我解释的标准评估协议存在局限,并提出评估其合理性与忠实性的实用指南。此外,作者主张评估应超越这些标准,扩展到可行动性,强调大语言模型合理化能力在支持知情决策和适当行动方面的应用,以服务不同利益相关者。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。论文性质
这是一篇观点论文,编号为 arXiv:2607.15957v3,公告类型标注为跨领域。
自解释现象
大语言模型能够生成自然语言解释,为自身决策提供理由,这一现象通常被称为自解释。
研究定位
自解释已成为可解释人工智能中一个颇有前景的方向,特别用于解释大语言模型的行为。
核心疑问
自解释虽然常常看似合理,但是否忠实反映模型底层推理过程,仍是一个开放问题。
核心立场
作者主张,自解释可以高度可信、忠实性存疑,同时却高度可行动。
评估局限
作者从传统可解释人工智能视角,指出针对大语言模型自解释的标准评估协议存在局限。
实践建议
文章提出实用指南,用于评估自解释的可信度与忠实性。
扩展标准
作者主张评估应超越可信度与忠实性,进一步纳入可行动性这一维度。
应用指向
文章强调模型合理化能力的应用,可支持不同利益相关者作出知情决策与恰当行动。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2607.15957