面向智能体式 AI 的黑盒红队测试:基于分类体系的自动化风险发现框架
arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读
智能体系统正快速进入生产环境,会读取不可信输入、以真实权限调用工具并自主行动,使安全面超出仅对话模型。现有评测多为单轮,难以捕捉多步智能体漏洞。该研究提出仅需基本系统描述的黑盒风险评估框架:构建七域分类体系,将可观察行为映射到风险类别;全自动 SAGE-RT 红队测试每个领域生成 120 个对抗场景;并由大语言模型评审结合人工验证开展评估。在 CrewAI 与 AutoGen 两种智能体架构和四个基座模型上的实证显示:平均治理风险 56.25%,多智能体配置中的隐私风险达 65%,智能体行为漏洞最高达 85%。该方法无需特权访问即可识别关键架构漏洞,为更安全的智能体部署提供可扩展路径。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究动机
代理式系统正快速进入生产环境,会读取不可信输入、以真实权限调用工具并自主行动,安全风险不再局限于聊天模型。
评估缺口
标准评估仍以单轮交互为主,无法捕捉多步代理流程中的漏洞。
框架定位
论文提出系统化黑盒框架,只需基本系统描述即可开展风险感知的代理评估。
七域分类法
框架引入七域分类法,将可观察行为映射到相应风险类别。
自动化红队
全自动 SAGE-RT 红队流程可针对每个风险域生成120个对抗场景。
评估方式
评估采用 LLM 评审,并经过人工验证。
实证设置
实证验证覆盖 CrewAI 与 AutoGen 两种代理架构,并结合四个基础模型。
主要风险数据
结果显示平均治理风险为56.25%,多代理配置隐私风险为65%,代理行为漏洞达到85%。
结论意义
黑盒方法无需特权访问即可识别关键架构漏洞,为更安全的代理部署提供可扩展路径。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09647