AgentHijack:针对多模态计算机使用代理的视觉补丁攻击
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
该论文提出一套端到端评测框架,用于检验图像触发的命令注入能否作用于计算机使用代理。研究者在自行控制的 GitHub Pages 页面和本地部署的 CSDN 镜像上训练并投放视觉补丁,并在真实环境中对五种开源或公开可用的图形界面代理与视觉语言模型后端进行测试,共汇总 600 个实例级在线案例。任务级攻击成功率、轨迹相关指标和端到端攻击成功率分别达到 84.5%、47.0% 和 20.3%。轨迹分析进一步显示,在部分成功案例中,代理会先执行恶意终端命令,随后继续完成原本的正常任务。这说明经过优化的局部视觉信号不仅会影响模型输出,还会沿开放计算机使用代理的执行流程传导,造成真实的环境风险。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究目标
论文旨在检验局部视觉补丁能否在计算机使用代理的完整链条上诱发可验证的环境后果,链条包括截图输入、VLM 生成、动作解析与环境执行。
攻击形式
研究关注的是图像触发的命令注入,即通过视觉补丁影响代理行为,而非仅停留在模型输出层面的扰动。
部署方式
研究在作者控制的 GitHub Pages 页面和本地部署的 CSDN 克隆站点上训练并部署视觉补丁。
评估范围
评估在真实环境中进行,覆盖五种开源或公开可用的 GUI 代理或 VLM 后端。
数据规模
实验汇总了 600 个实例级在线案例。
量化结果
T-ASR 达到 84.5%,TAPR 达到 47.0%,E2E-ASR 达到 20.3%。
轨迹观察
轨迹分析显示,在部分成功案例中,代理先执行恶意终端命令,然后继续原本的良性任务。
核心结论
优化后的局部视觉信号不仅影响 VLM 输出,还能传播到开放 CUA 的执行流水线,并造成真实环境风险。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09212