研究显示:针对大语言模型的任意密码攻击无需微调即可实现
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
arXiv 一篇交叉领域论文指出,大语言模型安全研究长期关注越狱攻击的检测与防范。任意密码攻击属于隐蔽通信类越狱,此前已在商业模型的微调接口上得到验证:攻击者用加密的有害问答语料训练目标模型,使其通过学到的加密方案回应有害请求。该论文表明,更新的前沿模型无需微调即可获得基于密码的通信能力,通过提示词乃至上下文学习即可掌握。当通信经由学到的密码进行时,模型对齐会被显著削弱甚至完全绕过,构成针对商业黑盒大语言模型的新型攻击途径。作者称已对 Anthropic、Google 和 OpenAI 的前沿模型实现成功越狱,且因有害内容被加密成无意义文本或乱码,攻击可绕过商业危害性分类器。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究主题
大语言模型安全与安全研究关注检测和预防越狱攻击,这类攻击通过绕过对齐让对抗用户诱导模型输出不想要或有害的内容。
攻击类型
任意密码或隐蔽通信攻击属于越狱攻击的一种,此前已在商业模型的微调接口上得到演示。
旧有攻击方式
在以往攻击中,目标模型会在加密的有害问题与回答语料上训练,然后通过学到的加密方案回应对有害请求。
核心新发现
较新的前沿模型无需微调即可获得基于密码的通信技能,可通过提示以及必要时通过上下文学习来掌握。
对齐失效
当模型使用学到的密码进行通信时,其对齐会被显著削弱或完全绕过。
攻击向量定位
作者称据其所知,这构成一种针对商业黑盒大语言模型的新型攻击向量。
目标模型
论文称已对 Anthropic、Google 和 OpenAI 开发的前沿模型成功实施越狱。
绕过分类器
该攻击能绕过商业危害性分类器,因为有害内容被加密后表现为无意义文本或乱码。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09553