NewsFi.AI
返回今日
已核验来源

SaFeR-Steer:通过合成自举和反馈动力学演化多轮大型语言模型

HuggingFace Daily Papers · · 发布于 2026-09-14 · 1 分钟阅读

NewsFi 导读1 分钟速览

arXiv:2604.16358v3 公告类型:替换交叉 摘要:多模态大型语言模型(MLLMs)越来越多地部署在多轮对话环境中,在这些环境中,攻击者可以通过不断演变的视觉-文本历史提升不安全意图,并利用长上下文下的安全性衰减。然而,安全对齐仍然被

1

要点 1

arXiv:2604.16358v3 公告类型:替换交叉 摘要:多模态大型语言模型(MLLMs)越来越多地部署在多轮对话环境中,在这些环境中,攻击者可以通过不断演变的视觉-文本历史提升不安全意图,并利用长上下文下的安全性衰减。

当前为原文抽取式整理,不包含站外事实推断。
SOURCES

来源与引用

共 1 个来源
官方原文HuggingFace Daily Papers 原始发布2026-09-14 · 一手信息