NewsFi.AI
返回今日
已核验来源

通过证据解耦研究医学视觉语言分割中的文本分支敏感性

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

预训练视觉语言模型通过引入临床文本在医学图像分割中表现良好,但文本信息对像素级预测的贡献仍不明确。本研究系统考察文本在多模态医学图像分割中的作用:首先分析多种常用融合策略,发现分割性能对融合模块的选择基本不敏感。为理解模态交互,提出基于证据深度学习与深度监督的证据解耦解码器,在解码过程中分解图像证据与文本调制证据,并保持有竞争力的分割性能。实验显示,对文本扰动的敏感性在不同数据集间差异显著:在 BUSI 与 BTMRI 上移除文本会导致性能大幅下降,表明模型强烈依赖文本输入;在 ISIC 与 Kvasir-SEG 上文本影响相对有限。研究还发现,文本主要通过全局语义调制而非独立空间定位影响预测,且驱动文本敏感性的具体语义成分因数据集而异。这些发现加深了对多模态医学图像分割中模态交互的理解,并为未来模型设计提供实用启示。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

研究问题

预训练视觉语言模型在医学图像分割中结合临床文本表现良好,但文本信息对像素级预测的实际贡献尚不清楚。

2

融合策略分析

作者分析若干常用融合策略,发现分割性能对融合模块的选择大体不敏感。

3

提出证据解耦解码器

为理解模态交互,作者提出基于证据深度学习和深度监督的证据解耦解码器(EDD)。

4

EDD 的作用

EDD 作为内部表示分析工具,在解码过程中分解图像证据和文本调制证据,同时保持有竞争力的分割性能。

5

数据集间差异

实验结果显示,对文本扰动的敏感性在不同数据集之间差异显著。

6

高依赖数据集

在 BUSI 和 BTMRI 上,移除文本会导致灾难性性能下降,表明模型强烈依赖文本输入。

7

低敏感数据集

在 ISIC 和 Kvasir-SEG 上,文本的影响相对边缘。

8

作用机制

文本主要通过全局语义调制影响预测,而非通过独立空间定位;驱动文本敏感性的具体语义成分因数据集而异。

9

研究意义

这些发现加深了对多模态医学图像分割中模态交互的理解,并为未来模型设计提供实际启示。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.02663