PRAGMA:评估长期对话中基于记忆对齐的个性化指导
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
研究指出,大语言模型作为长期个性化助手时,依赖完整交互历史会带来计算开销且难以稳定定位当前请求所需信息,因此出现结构化和检索用户信息的记忆系统。现有对话记忆评测多聚焦检索与事实回忆,而个性化指导需要跨多轮对话整合信息并推理用户偏好变化。为此,作者提出 PRAGMA 基准,包含纵向对话历史、证据标注和基于用户语境演变及错误假设的指导场景。实验显示现有检索系统、记忆系统和长上下文模型在恢复合适对话证据及用于个性化指导方面均存在困难,说明需要支持稳健对话检索和记忆基础推理的记忆架构。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
大语言模型正越来越多地被部署为长期与用户交互的个性化助手。
长对话挑战
随着对话变长,依赖完整交互历史变得低效且不可靠;长上下文带来显著计算开销,使模型难以持续识别并利用当前请求最相关的信息。
记忆系统动机
上述挑战推动了结构化并检索用户特定信息的记忆系统。
现实需求
在现实交互中,用户常寻求推荐、规划和决策支持等实用指导。
任务难点
与事实回忆不同,个性化指导要求模型整合多段过去对话的信息,并推理用户变化中的偏好与经验。
评测侧重
现有对话记忆评测主要关注检索和事实回忆。
基准提出
为研究该挑战,作者提出 PRAGMA,一个用于评估长期对话中个性化指导的基准。
基准构成
PRAGMA 包含经过整理的纵向对话历史、证据标注,以及基于演变用户情境和错误用户假设的指导场景。
实验发现
实验覆盖检索系统、记忆系统和长上下文模型;结果显示当前系统既难以找回合适的对话证据,也难以为个性化指导有效使用这些证据。
结论启示
结果强调需要支持稳健对话检索和基于记忆推理的记忆架构,而不止于证据召回。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09664