Fortunate Recall:面向大语言模型持久一致性的本体驱动记忆生命周期管理
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
当前大语言模型记忆系统对所有个人事实一视同仁,导致存储无限增长而检索精度下降。核心难题是生命周期管理:依据每条事实的行为类型,决定哪些记忆应当保留、哪些应被替换以及以何种速率替换。Fortunate Recall(FR)是一个可组合的策略层,将个人事实归入 10+1 的行为本体分类,并以确定性函数形式对模型抽取的元数据施加分类专属的生命周期策略,包括差异化时间衰减、槽位键替代、事件时间有效性与类别感知检索路由。其实现 FR-Bank 在包含 516 个问题的时序消歧基准 LifecycleBench 上通过率为 76.9%,高于 Mem0、A-MEM、Memory-R1 与 MemoryOS 的 61% 至 70.5%;在标准评测协议下的完整 LongMemEval-S 上达到 75.2%。预注册消融实验显示,用三个通用生命周期原语替换类型化层后正确率无统计显著变化(-1.7 个百分点,95% 置信区间 [-6.0, +2.7]),说明通用生命周期元数据带来正确率优势,而行为本体带来校准能力,使下游虚构减少一半(12.0% 对 24.2%,p<0.001)。端到端而言,FR-Bank 将已作答查询的虚构率从 Mem0 的 45.1% 降至 22.4%,全部查询的虚构率从 32.2% 降至 13.0%,同时正确作答更多(31.2% 对 18.6%);该排序在开放权重模型 Kimi K2.5 上复现。其分解方法也迁移到独立构建的基准 BEAM:在 280 个问题上正确率为 46.8%,对比 Mem0 的 32.9%,本体带来的收益集中在矛盾消解上,并在约七个策略聚类处趋于饱和。本体、基准与代码均已公开发布。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。问题背景
当前 LLM 记忆系统把所有个人事实同等对待,记忆库无界增长,同时检索精度持续下降。
核心挑战
难点在于生命周期管理:哪些记忆应长期保留、哪些应被替换、以多快的速率替换,且要视每条事实的行为类型而定。
方法要点
Fortunate Recall 是可组合的策略层,把个人事实分为 10+1 行为本体,并对 LLM 抽取的元数据施加确定性函数形式的分类型生命周期策略:差异化时间衰减、槽位键取代、事件时间有效性与类别感知检索路由。
实现与基准
FR-Bank 为与基础设施无关的实现,在 LifecycleBench 这一新的 516 题时间消歧基准上取得 76.9% 的通过率。
横向对比
在上述基准上,Mem0、A-MEM、Memory-R1 与 MemoryOS 的通过率区间为 61% 至 70.5%,均低于 FR-Bank。
标准检索无损失
在完整 LongMemEval-S 上按经典 Wu 等人评审协议,FR-Bank 达 75.2%,说明生命周期策略未给标准检索带来可测成本。
消融结论
预注册消融显示,把类型化层替换为三个通用生命周期原语后,正确率在统计上未变(-1.7 个百分点,95% 置信区间为 -6.0 至 +2.7)。
优势归属
通用生命周期元数据承载正确性优势,行为本体则承载校准能力,使下游虚构减半(12.0% 对 24.2%,p<0.001)。
端到端效果
FR-Bank 把 Mem0 的虚构率从 45.1% 降至 22.4%(已回答查询口径),从 32.2% 降至 13.0%(全部查询口径),同时正确回答比例提高(31.2% 对 18.6%)。
跨模型复现
该排序在开放权重模型 Kimi K2.5 上得到复现。
跨基准迁移
该分解迁移到独立构建的 BEAM 基准:280 题上正确率 46.8%,高于 Mem0 的 32.9%;本体收益集中于矛盾消解,并在约七个策略簇附近饱和。
开放资源
作者公开了本体、基准与代码。