ConvMem:面向长上下文推理的卷积记忆框架
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
针对大语言模型受固定上下文长度限制、难以处理超长文本的问题,现有 MemAgent 等顺序方法虽能通过分段阅读与迭代更新固定大小记忆来扩展有效上下文,但存在延迟高、需昂贵强化学习训练且易在特定数据集上过拟合的缺陷。为此,研究者提出 ConvMem,一种免训练、高度可并行化的框架,将长上下文推理重构为层次化卷积。该方法受卷积神经网络启发,把带有特定查询提示的大语言模型视为卷积核,对文本片段进行层次化摘要,将推理路径从线性链缩短为对数级树结构。ConvMem 引入可配置步长与跳跃连接以保证证据的稳健捕获与传递,并采用多核卷积将复杂查询分解为相互解耦的语义通道,从而缓解误差累积,并实现文本片段与推理线程的大规模并行。在 RULER-HotpotQA 与 RULER-2WikiMultiHopQA 上的实验表明,ConvMem 优于免训练基线,并避免了经强化学习训练的模型在分布外任务中常见的参数先验过拟合风险。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。问题背景
大型语言模型能力突出,但因上下文长度固定,面对极长上下文时往往力不从心。
既有方案的局限
MemAgent 等顺序方法以分段读取并迭代更新固定大小记忆的方式扩展有效上下文,但延迟高,且需要昂贵的强化学习训练,可能对特定数据集过拟合。
ConvMem 的定位
ConvMem 是一个无需训练、可高度并行的框架,把长上下文推理重新表述为层次卷积。
核心类比
受卷积神经网络启发,ConvMem 将带有特定查询提示的大型语言模型视为卷积核,对文本片段进行层次化摘要,把线性链式推理路径缩短为对数级树结构。
关键组件
框架集成可配置步幅与跳跃连接,以保证证据捕获与传播的稳健性;并采用多核卷积将复杂查询分解为相互解耦的语义通道。
设计收益
该设计既缓解误差累积,又能在文本片段与推理线程两个层面实现大规模并行。
实验结果
在 RULER-HotpotQA 与 RULER-2WikiMultiHopQA 上,ConvMem 优于免训练基线,并避免了强化学习训练模型在分布外任务上对参数化先验过拟合的风险。