NewsFi.AI
返回今日
已核验来源

基于参考的大语言模型偏见检测:利用隐藏状态的相对表示

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

现有偏见审计方法通常依赖模型输出,需要昂贵的基准或评判模型,并可能遗漏从未出现在生成文本中的内部变化。本文提出一种基于参考的方法,跨相关模型变体(例如微调前后)审计隐藏状态表示中的偏见。由于微调会改变表示几何结构,绝对隐藏状态无法直接比较,因此作者用每句话与一组固定锚句的相似度进行编码,得到位于共享比较空间中的相对表示。在该空间中衡量目标群体与正负属性关联的变化,称为表示偏见偏移量ΔB。在三个模型系列以及WildGuardMix、DecodingTrust和ToxiGen基准上,ΔB在18种设定中的15种与输出层面的偏见变化相关;完全微调时相关系数绝对值达0.84,显著性水平小于0.001,在参数高效适配下则更依赖具体模型。对ΔB设定阈值可识别偏见上升的检查点,接受者操作特征曲线下面积在0.65至0.99之间,并在WildGuardMix和DecodingTrust上对三个模型系列的区分效果均优于基于SEAT的基线。ΔB对锚句集、属性集和目标模板的变化也保持稳定。该方法无需任务专用评估数据,约三分钟即可完成一次模型审计,计算量比本文考察的输出层面基准少3至50倍。作者认为它与基于输出的审计互为补充,而非替代。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

背景与问题

现有偏见审计通常依赖模型输出,需要昂贵基准或评判模型,且可能遗漏从未出现在生成文本中的内部变化。

2

方法核心

论文提出基于参考的审计方法,面向相关模型变体,例如微调前后,比较隐藏状态表示中的偏见。

3

相对表示

由于微调会重塑表示几何,绝对隐藏状态不可直接比较;方法将每句话编码为与固定锚句集合的相似度,形成共享比较空间中的相对表示。

4

指标定义

在共享比较空间中测量目标群体与正面和负面属性关联的偏移,称为表示偏见偏移量 ΔB。

5

主要实验

实验覆盖三个模型家族以及 WildGuardMix、DecodingTrust 和 ToxiGen 基准。

6

相关性结果

ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关;完全微调下 |r| 达 0.84,p<0.001;参数高效适配下更依赖模型。

7

检测性能

对 ΔB 设阈值可检测偏见增加的检查点,ROC AUC 在 0.65 至 0.99 之间;在 WildGuardMix 和 DecodingTrust 上对三个家族优于基于 SEAT 的基线。

8

稳定性与效率

ΔB 对锚句集合、属性集合和目标模板变化稳定;无需任务特定评估数据,约三分钟审计一个模型,计算量少 3 至 50 倍,定位为输出级审计的补充。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.10060