SaFeR-Steer:通过合成自举和反馈动力学演化多轮大型语言模型
HuggingFace Daily Papers · · 发布于 2026-09-14 · 1 分钟阅读
arXiv:2604.16358v3 公告类型:替换交叉 摘要:多模态大型语言模型(MLLMs)越来越多地部署在多轮对话环境中,在这些环境中,攻击者可以通过不断演变的视觉-文本历史提升不安全意图,并利用长上下文下的安全性衰减。然而,安全对齐仍然被
要点 1
arXiv:2604.16358v3 公告类型:替换交叉 摘要:多模态大型语言模型(MLLMs)越来越多地部署在多轮对话环境中,在这些环境中,攻击者可以通过不断演变的视觉-文本历史提升不安全意图,并利用长上下文下的安全性衰减。
SOURCES
共 1 个来源