面向代理式人工智能框架的多模态提示注入攻击实验评估
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
研究提出可复现基准 MMPIBench,用于评估代理式人工智能框架中的多模态提示注入攻击。该基准通过光学字符识别文本、图像叠加层、图像元数据、二维码、伪造界面及混合方式等六类视觉载体投放固定攻击,并追踪注入指令从感知、规划到工具调用的传播路径。在覆盖六个框架、五种基础模型、六类载体和四类攻击目标的 720 次运行中,约 1% 的攻击得以完成,12.8% 被尝试发起,二者差距几乎全部在规划阶段被阻断,模型读取注入指令后拒绝执行。模型对指令是否被执行的影响远大于框架:一个模型从未尝试攻击,并在 59.7% 的运行中识别出注入;另有两个模型的尝试比例为 23.6%。研究进一步将基准扩展至音频,五种模型中仅两种可接收音频,六个框架中仅三个可传递音频,但在信号到达之处攻击完成率达 49%,其中一个模型达 75%。因此仅报告完成率会低估暴露程度,视觉之外的感知通道更窄,却防护更弱。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。基准目标
MMPIBench 是可复现基准,用于量化多模态提示注入在智能体式 AI 框架中的传导过程,而非仅给出单一成功率。
攻击载体
通过六类视觉载体投放固定攻击:OCR 文本、叠加层、EXIF 元数据、二维码、伪造界面以及混合形式。
度量链路
基准记录每条注入指令走了多远,即从感知阶段经规划阶段到最终工具调用的全链路传播情况。
实验规模
共 720 次运行,覆盖六个框架、五个基础模型、六类载体和四类攻击者目标。
核心数据
攻击仅在约 1% 的运行中完成,但有 12.8% 被尝试执行,差距几乎全部在规划阶段被弥合——模型读到注入指令后拒绝执行。
模型差异
模型对指令是否被执行的影响远大于框架;一个模型从不尝试攻击,并在 59.7% 的运行中识别出注入,另有两个模型的尝试率为 23.6%。
音频扩展
基准扩展到音频,这是当前前沿模型接受的唯一其他原始感知通道。五个模型中仅两个可摄取音频,六个框架中仅三个可传递音频。
音频风险
在音频信号能够到达的场景中,攻击在 49% 的单元内完成,其中一个模型高达 75%。
结论含义
只报告攻击完成率会低估暴露程度;视觉之外的感知通道覆盖更窄,但防御也薄弱得多。