NewsFi.AI
返回今日
已核验来源

程序性记忆在变化下的复用与干扰:受控网页任务研究

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

研究探讨语言智能体复用程序性记忆时,若存储流程不再适用会发生什么。工作结合 BrowserGym TimeWarp 的回顾性、人工辅助界面适配案例,以及合成购物决策上的受控冻结记忆对比。在 WebShop V1-V6 开发路径中,界面专用代码被调整,而单独存储的高层流程未报告变化,该阶段不构成自主记忆智能体评估。受控阶段早期试点出现一个任务:两种记忆条件选择了更贵商品,无记忆条件选择参考最低价;后续探针未确立反复出现的行序或身份绑定模式。随后在32个正式单元中测试四类错配:数量变化、证据表示不同、局部与全局优化冲突、分布式推广证据。每个单元使用一次温度0生成、相同 qwen3:8b 配置且无自适应重试。在当前任务证据明确充分时,预定义诊断干扰特征未出现。结果识别出一个经测试的非干扰区域:程序性记忆可被错配而不产生行为扰乱,但不证明通用安全性或机制。剩余问题是哪些附加条件会把适用性错配变成可观察的、由记忆导致的错误。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究主题

程序性记忆支持语言智能体复用成功流程,但复用预设存储流程仍然适用;研究故意违反这一预设并观察后果。

2

方法构成

研究结合两个部分:BrowserGym TimeWarp 中回顾性、人类辅助的界面适配案例,以及合成购物决策上的受控冻结记忆比较。

3

回顾阶段性质

在 WebShop V1-V6 开发路径中,界面特定代码被适配,而单独存储的高层流程未报告改变;该阶段不构成自主记忆体评估。

4

早期试点观察

受控阶段早期试点产生一个任务:两个记忆条件选择更贵商品,无记忆条件选择参考最低价。

5

后续探针结果

后续探针未能确立重复出现的行序或身份绑定模式。

6

四类失配与规模

研究测试四类失配:数量变化、不同证据表示、局部与全局优化冲突、分布式提升证据;覆盖32个正式单元。

7

生成配置

每个单元使用一次温度0生成,采用相同局部 qwen3:8b 配置,不进行自适应重试。

8

主要发现

在这些配对中,当前任务证据明确且充分时,预设诊断干扰特征未在其定义任务上出现,识别出非干扰测试区域。

9

结论边界

结果说明程序性记忆可失配而不造成行为破坏,但不建立通用安全,也不建立机制。

10

遗留问题

尚待回答的问题是:哪些附加条件会使适用性失配变成可观察的、由记忆导致的错误。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09774