NewsFi.AI
返回今日
已核验来源

信念状态引擎:在部分可观测条件下增强大语言模型以实现有原则的规划

arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读

NewsFi 导读4 分钟速览

该论文指出,大语言模型智能体虽能生成流畅动作序列,但在环境仅部分可观测时会出现典型失败:模糊反馈导致过早承诺,单条信息性观测使不确定性坍缩到错误假设,策略随历史增长而漂移。作者认为共同的结构性根源在于,常规部署的大语言模型智能体只是以历史为条件的策略,缺乏对隐藏状态的显式信念。为此提出信念状态引擎,作为置于大语言模型之外的推理模块,在给定部分可观测马尔可夫决策过程模型上维护隐状态的贝叶斯后验,并在每个决策步骤只向模型暴露该后验,而不展示原始动作与观测日志。作者给出信念一致内部状态所需满足的四条公理,并证明在模型不接触原始历史的前提下,该组合是底层模型所诱导信念马尔可夫决策过程上的可靠马尔可夫策略,从而继承经典部分可观测马尔可夫决策过程理论的最优性保证。在虎问题与该红队攻击图任务上,该方法相较反应式大语言模型、思维链、ReAct、自然语言信念追踪器、QMDP 与 POMCP 六种基线,提升了任务回报、信念校准与决策一致性,十项针对性消融实验进一步确认效果并非依赖单一模型。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

核心问题

语言模型智能体在环境部分可观测时出现三类典型失败:含糊反馈导致过早承诺、单条强信息观测把不确定性收敛到错误假设、历史增长引发策略漂移。

2

结构性归因

作者认为这些症状源于共同结构原因:常规部署的语言模型智能体是以历史为条件的策略,没有对隐藏状态的显式信念。

3

提出方案

提出信念状态引擎(BSE),作为置于语言模型外部的推理模块,针对给定部分可观测马尔可夫决策过程模型维护潜在状态的贝叶斯后验。

4

信息接口

每个决策步只向语言模型暴露信念后验,不展示原始动作—观测日志,以保证语言模型不接触原始历史。

5

理论规范与证明

给出信念一致内部状态必须满足的最小四公理规范,并证明语言模型与 BSE 的组合是底层部分可观测马尔可夫决策过程所诱导信念马尔可夫决策过程上的可靠马尔可夫策略。

6

最优性保证

在语言模型从不接触原始历史的条件下,该组合继承经典部分可观测马尔可夫决策过程理论的贝尔曼最优性保证。

7

实验设置

在 Tiger 部分可观测马尔可夫决策过程与红队攻击图任务上评估,对比六个基线:反应式语言模型、思维链、ReAct、自然语言信念追踪器、QMDP 与 POMCP。

8

实验结果

在两个任务域中,BSE 增强后的智能体在任务回报、信念校准与决策一致性三项指标上均有提升。

9

消融与泛化

十项定向消融实验分离了每项架构选择的贡献,并确认该效果并非只对某一个模型成立。

10

开放材料

论文随附代码、环境规格、提示模板与随机种子日志。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.10036