NewsFi.AI
返回今日
已核验来源

面向代理式人工智能框架的多模态提示注入攻击实验评估

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

研究提出可复现基准 MMPIBench,用于评估代理式人工智能框架中的多模态提示注入攻击。该基准通过光学字符识别文本、图像叠加层、图像元数据、二维码、伪造界面及混合方式等六类视觉载体投放固定攻击,并追踪注入指令从感知、规划到工具调用的传播路径。在覆盖六个框架、五种基础模型、六类载体和四类攻击目标的 720 次运行中,约 1% 的攻击得以完成,12.8% 被尝试发起,二者差距几乎全部在规划阶段被阻断,模型读取注入指令后拒绝执行。模型对指令是否被执行的影响远大于框架:一个模型从未尝试攻击,并在 59.7% 的运行中识别出注入;另有两个模型的尝试比例为 23.6%。研究进一步将基准扩展至音频,五种模型中仅两种可接收音频,六个框架中仅三个可传递音频,但在信号到达之处攻击完成率达 49%,其中一个模型达 75%。因此仅报告完成率会低估暴露程度,视觉之外的感知通道更窄,却防护更弱。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

基准目标

MMPIBench 是可复现基准,用于量化多模态提示注入在智能体式 AI 框架中的传导过程,而非仅给出单一成功率。

2

攻击载体

通过六类视觉载体投放固定攻击:OCR 文本、叠加层、EXIF 元数据、二维码、伪造界面以及混合形式。

3

度量链路

基准记录每条注入指令走了多远,即从感知阶段经规划阶段到最终工具调用的全链路传播情况。

4

实验规模

共 720 次运行,覆盖六个框架、五个基础模型、六类载体和四类攻击者目标。

5

核心数据

攻击仅在约 1% 的运行中完成,但有 12.8% 被尝试执行,差距几乎全部在规划阶段被弥合——模型读到注入指令后拒绝执行。

6

模型差异

模型对指令是否被执行的影响远大于框架;一个模型从不尝试攻击,并在 59.7% 的运行中识别出注入,另有两个模型的尝试率为 23.6%。

7

音频扩展

基准扩展到音频,这是当前前沿模型接受的唯一其他原始感知通道。五个模型中仅两个可摄取音频,六个框架中仅三个可传递音频。

8

音频风险

在音频信号能够到达的场景中,攻击在 49% 的单元内完成,其中一个模型高达 75%。

9

结论含义

只报告攻击完成率会低估暴露程度;视觉之外的感知通道覆盖更窄,但防御也薄弱得多。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09404