NewsFi.AI
返回今日
已核验来源

通过查询-键对齐量化Transformer中的逻辑一致性

arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读

NewsFi 导读2 分钟速览

大语言模型在多步逻辑推理方面仍面临挑战。思维链提示虽能生成中间步骤,但缺乏评估逻辑转换连贯性的机制。本文提出一种轻量级评估策略,利用Transformer注意力头内部的查询-键对齐,通过单次前向传播从选定头中提取“查询-键得分”,揭示能可靠区分有效与无效推理的潜在表示,为传统基于消融的技术提供可扩展替代方案。在多个逻辑推理基准上的实证验证表明,该方法对干扰项和推理深度增加具有更好的鲁棒性。实验涵盖1.5B至70B参数的不同模型。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

大型语言模型在多种自然语言处理任务上表现突出,但多步逻辑推理能力仍是开放挑战。

2

既有方法局限

思维链提示通过生成中间步骤改善逻辑推理,但缺乏评估这些逻辑转换是否连贯的机制。

3

提出方法

论文提出一种新颖、轻量级的逻辑推理评估策略,使用 Transformer 注意力头内部的查询-键对齐。

4

核心指标

方法只需计算一次前向传播,并从精心选择的注意力头中提取 QK 分数。

5

方法效果

提取出的潜在表示能可靠区分有效推理与无效推理,为传统基于消融的技术提供可扩展替代。

6

实验验证

在多个逻辑推理基准上进行实证验证,表明评估方法对干扰项更具鲁棒性,并支持增加的推理深度。

7

模型范围

实验在参数规模从 1.5B 到 70B 的多种模型上开展。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2502.17017