NewsFi.AI
返回今日
已核验来源

LexAgentHallu:面向法律智能体幻觉刻画的分层基准

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

随着大语言模型被日益部署为工具增强的法律智能体,工具调用与推理错误会级联为虚构裁判结论与错误引证,形成智能体式幻觉。但现有法律基准仅以结果层面指标评估单轮问答,而智能体幻觉基准又缺乏法律领域的诊断能力,二者都无法回答法律智能体在轨迹中在多大程度上以及如何产生幻觉。为此,研究提出 LexAgentHallu,一个旨在评估法律智能体在多步轨迹中失败程度与失败方式的法律智能体幻觉基准。该基准通过四阶段专家参与流程构建,包含 3414 个实例,覆盖 17 个法律类别与 6 种任务类型;每个实例依据 7 个高层类别、27 个细粒度子类的双层幻觉分类体系标注,涵盖实质性错误与智能体流程性失败。研究还设计了细粒度指标,用于量化失败程度并定位其在智能体执行路径中的发生位置。对 18 个闭源与开源智能体的评估发现“答案正确但推理错误”效应,并显示幻觉子类呈聚集而非分散分布,形成不同的智能体框架、法律任务与类别画像。这些在结果层面评估中不可见的现象,验证了 LexAgentHallu 对法律领域智能体幻觉的诊断能力。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

工具增强型法律智能体会产生智能体式幻觉,即工具调用与推理错误级联为捏造的裁判结论和错误引用的权威依据。

2

现有基准不足

现有法律基准只做单轮问答并以结果层面指标评估;智能体幻觉基准又缺乏法律专用诊断能力,均无法刻画轨迹中的幻觉程度与方式。

3

基准名称与目标

作者提出 LexAgentHallu,旨在评估法律智能体在多步轨迹中在多大程度上失败以及如何失败。

4

构建方式与规模

该基准通过四阶段专家参与流程构建,包含 3414 条实例,覆盖 17 个法律类别和 6 种任务类型。

5

标注体系

每条实例按双层幻觉分类体系标注,包含 7 个高层类别与 27 个细粒度子类,同时覆盖实体性错误与智能体流程性失败。

6

评估指标

研究设计细粒度指标,用于量化失败程度,并在智能体执行路径上定位每种失败的发生方式。

7

主要发现

对 18 个专有与开源智能体的评估发现“答案正确但推理错误”效应,并显示幻觉子类呈聚集而非分散分布,形成智能体框架、法律任务与法律类别的不同画像。

8

结论意义

这些在结果层面评估中不可见的发现,验证了 LexAgentHallu 在法律领域评估智能体式幻觉方面的诊断能力。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09754