通过证据解耦研究医学视觉语言分割中的文本分支敏感性
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
预训练视觉语言模型通过引入临床文本在医学图像分割中表现良好,但文本信息对像素级预测的贡献仍不明确。本研究系统考察文本在多模态医学图像分割中的作用:首先分析多种常用融合策略,发现分割性能对融合模块的选择基本不敏感。为理解模态交互,提出基于证据深度学习与深度监督的证据解耦解码器,在解码过程中分解图像证据与文本调制证据,并保持有竞争力的分割性能。实验显示,对文本扰动的敏感性在不同数据集间差异显著:在 BUSI 与 BTMRI 上移除文本会导致性能大幅下降,表明模型强烈依赖文本输入;在 ISIC 与 Kvasir-SEG 上文本影响相对有限。研究还发现,文本主要通过全局语义调制而非独立空间定位影响预测,且驱动文本敏感性的具体语义成分因数据集而异。这些发现加深了对多模态医学图像分割中模态交互的理解,并为未来模型设计提供实用启示。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
预训练视觉语言模型在医学图像分割中结合临床文本表现良好,但文本信息对像素级预测的实际贡献尚不清楚。
融合策略分析
作者分析若干常用融合策略,发现分割性能对融合模块的选择大体不敏感。
提出证据解耦解码器
为理解模态交互,作者提出基于证据深度学习和深度监督的证据解耦解码器(EDD)。
EDD 的作用
EDD 作为内部表示分析工具,在解码过程中分解图像证据和文本调制证据,同时保持有竞争力的分割性能。
数据集间差异
实验结果显示,对文本扰动的敏感性在不同数据集之间差异显著。
高依赖数据集
在 BUSI 和 BTMRI 上,移除文本会导致灾难性性能下降,表明模型强烈依赖文本输入。
低敏感数据集
在 ISIC 和 Kvasir-SEG 上,文本的影响相对边缘。
作用机制
文本主要通过全局语义调制影响预测,而非通过独立空间定位;驱动文本敏感性的具体语义成分因数据集而异。
研究意义
这些发现加深了对多模态医学图像分割中模态交互的理解,并为未来模型设计提供实际启示。