基于参考的大语言模型偏见检测:利用隐藏状态的相对表示
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
现有偏见审计方法通常依赖模型输出,需要昂贵的基准或评判模型,并可能遗漏从未出现在生成文本中的内部变化。本文提出一种基于参考的方法,跨相关模型变体(例如微调前后)审计隐藏状态表示中的偏见。由于微调会改变表示几何结构,绝对隐藏状态无法直接比较,因此作者用每句话与一组固定锚句的相似度进行编码,得到位于共享比较空间中的相对表示。在该空间中衡量目标群体与正负属性关联的变化,称为表示偏见偏移量ΔB。在三个模型系列以及WildGuardMix、DecodingTrust和ToxiGen基准上,ΔB在18种设定中的15种与输出层面的偏见变化相关;完全微调时相关系数绝对值达0.84,显著性水平小于0.001,在参数高效适配下则更依赖具体模型。对ΔB设定阈值可识别偏见上升的检查点,接受者操作特征曲线下面积在0.65至0.99之间,并在WildGuardMix和DecodingTrust上对三个模型系列的区分效果均优于基于SEAT的基线。ΔB对锚句集、属性集和目标模板的变化也保持稳定。该方法无需任务专用评估数据,约三分钟即可完成一次模型审计,计算量比本文考察的输出层面基准少3至50倍。作者认为它与基于输出的审计互为补充,而非替代。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。背景与问题
现有偏见审计通常依赖模型输出,需要昂贵基准或评判模型,且可能遗漏从未出现在生成文本中的内部变化。
方法核心
论文提出基于参考的审计方法,面向相关模型变体,例如微调前后,比较隐藏状态表示中的偏见。
相对表示
由于微调会重塑表示几何,绝对隐藏状态不可直接比较;方法将每句话编码为与固定锚句集合的相似度,形成共享比较空间中的相对表示。
指标定义
在共享比较空间中测量目标群体与正面和负面属性关联的偏移,称为表示偏见偏移量 ΔB。
主要实验
实验覆盖三个模型家族以及 WildGuardMix、DecodingTrust 和 ToxiGen 基准。
相关性结果
ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关;完全微调下 |r| 达 0.84,p<0.001;参数高效适配下更依赖模型。
检测性能
对 ΔB 设阈值可检测偏见增加的检查点,ROC AUC 在 0.65 至 0.99 之间;在 WildGuardMix 和 DecodingTrust 上对三个家族优于基于 SEAT 的基线。
稳定性与效率
ΔB 对锚句集合、属性集合和目标模板变化稳定;无需任务特定评估数据,约三分钟审计一个模型,计算量少 3 至 50 倍,定位为输出级审计的补充。