我们信任RAG吗?文档投毒下检索增强生成的鲁棒性测量
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
该研究在基于FEVER构建的事实核查任务上,测量小型量化模型Llama 3.1 8B在检索上下文被投毒时的性能退化程度。实验测试三种污染策略——实体替换、数字替换与否定,分别作用于三篇检索段落中的零篇、一篇、两篇或三篇,共完成588次因子扫描运行。准确率从干净上下文下的77.9%下降到三篇段落全部被污染时的43.5%。实体替换翻转的原本正确答案比例最高;数字类污染在污染段落占少数时保持平稳,一旦其成为多数便出现跃升,该模式通过查询级自助法区间进行复核。模型很少编造新的虚假内容,其主要反应是拒答,而无支撑生成的词汇重叠代理指标在攻击下不升反降。作者指出,这是一项小规模测量,且使用粗粒度的自动标签,在解码环节受控并引入更强的判定机制之前,策略之间的对比结果仅具提示意义。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究对象
以 RAG 为对象,考察检索文本被篡改后语言模型是否会重复虚假信息,使用小规模量化模型 Llama 3.1 8B。
攻击面
RAG 用检索文档为模型提供依据,可减少幻觉,但同时形成新的攻击面:检索文本被污染即可能被模型采信。
污染策略
测试实体替换、数字替换与否定三种污染方式。
实验设计
每条样本含三条检索段落,污染分别施加于零、一、二或三条段落,在基于 FEVER 的事实核查任务上完成 588 次因子扫描。
准确率下降
准确率从干净上下文的 77.9% 降至三条段落全部被污染时的 43.5%。
实体替换影响最大
在干净上下文中原本正确的答案里,实体替换翻转的比例最大。
数字污染的非线性
数字类污染在污染段落占少数时表现平稳,占多数时出现明显跃升,并用查询级 bootstrap 区间复核该模式。
模型反应
模型很少凭空编造新的虚假信息,主要反应是拒答;无支撑生成的词重叠代理指标在攻击下下降而非上升。
结论定位
研究属于小规模测量,使用粗粒度自动标签,策略对比结论在解码受控与更强判定完成前应视为提示性。