NewsFi.AI
返回今日
已核验来源

面向智能体式 AI 的黑盒红队测试:基于分类体系的自动化风险发现框架

arXiv cs.AI · · 发布于 2026-09-11 · 2 分钟阅读

NewsFi 导读2 分钟速览

智能体系统正快速进入生产环境,会读取不可信输入、以真实权限调用工具并自主行动,使安全面超出仅对话模型。现有评测多为单轮,难以捕捉多步智能体漏洞。该研究提出仅需基本系统描述的黑盒风险评估框架:构建七域分类体系,将可观察行为映射到风险类别;全自动 SAGE-RT 红队测试每个领域生成 120 个对抗场景;并由大语言模型评审结合人工验证开展评估。在 CrewAI 与 AutoGen 两种智能体架构和四个基座模型上的实证显示:平均治理风险 56.25%,多智能体配置中的隐私风险达 65%,智能体行为漏洞最高达 85%。该方法无需特权访问即可识别关键架构漏洞,为更安全的智能体部署提供可扩展路径。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究动机

代理式系统正快速进入生产环境,会读取不可信输入、以真实权限调用工具并自主行动,安全风险不再局限于聊天模型。

2

评估缺口

标准评估仍以单轮交互为主,无法捕捉多步代理流程中的漏洞。

3

框架定位

论文提出系统化黑盒框架,只需基本系统描述即可开展风险感知的代理评估。

4

七域分类法

框架引入七域分类法,将可观察行为映射到相应风险类别。

5

自动化红队

全自动 SAGE-RT 红队流程可针对每个风险域生成120个对抗场景。

6

评估方式

评估采用 LLM 评审,并经过人工验证。

7

实证设置

实证验证覆盖 CrewAI 与 AutoGen 两种代理架构,并结合四个基础模型。

8

主要风险数据

结果显示平均治理风险为56.25%,多代理配置隐私风险为65%,代理行为漏洞达到85%。

9

结论意义

黑盒方法无需特权访问即可识别关键架构漏洞,为更安全的代理部署提供可扩展路径。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09647