RESCUE-BENCH:迈向关系感知的多方情感支持对话系统
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
现有情感支持对话系统主要关注一对一的求助者与支持者互动及个体情绪状态,对多方场景中的人际关系探讨不足。该研究提出关系感知情感支持对话这一新任务,评估大语言模型能否捕捉并利用不断变化的关系动态,以提供更有效的情感支持。研究基于真实伴侣与家庭访谈对话构建了关系感知情感支持对话理解与评估基准,包含191个样本、7079个标注对话轮次和1064.8分钟视频。该基准依据社会情绪与支持动态的丰富标注,定义了六个任务,评估关系理解与关系敏感支持两项核心能力。对十种大语言模型的实验显示,当前模型在依赖局部情绪或干预线索的任务上表现较好,但在关系模式预测、观点预测和支持策略预测等关系密集型任务上仍有困难。这些发现揭示了当前大语言模型在建模人际关系和作出关系敏感支持决策方面的局限。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究出发点
现有情感支持对话系统主要关注一对一的求助者与支持者互动以及个体情绪状态,多主体场景中的人际关系尚未被充分探索。
新任务定义
论文提出“关系感知型情感支持对话”任务,用于评估大语言模型能否捕捉并利用不断演变的关系动态,从而提供更有效的情感支持。
基准构建
研究构建了 RESCUE 基准,全称为关系感知型情感支持对话理解与评估基准,数据来自真实的伴侣与家庭访谈对话。
数据规模
RESCUE 包含 191 个样本、7,079 个已标注话轮,以及总长 1,064.8 分钟的视频。
标注与任务
基于对社会情感动态和支持相关动态的丰富标注,RESCUE 定义了六项任务,覆盖关系理解与关系敏感型支持两种核心能力。
实验结果
对十种大语言模型的实验显示,现有模型在依赖局部情绪线索或干预线索的任务上表现相对较好。
暴露的短板
模型在关系密集型任务上表现困难,包括关系模式预测、观点预测和支持策略预测。
结论含义
上述发现揭示了当前大语言模型在建模人际关系以及做出关系敏感型支持决策方面的局限。