可靠性感知的混合K集成选择用于宫颈细胞学分类:融合判别、校准与选择性预测
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
该研究针对宫颈细胞学多分类任务,基于 SIPaKMeD 数据集提出可靠性感知的混合K集成选择框架。研究评估了九种深度学习架构,采用固定分层五折划分与三个训练随机种子,并在事后温度缩放后,使用宏观F1、准确率、受试者工作特征曲线下面积、预期校准误差、最差类别预期校准误差、风险-覆盖率曲线下面积、布里尔分数与负对数似然进行评价。模型通过等权综合得分排序,排名靠前者以软投票构建混合K集成。稳健性通过5000组狄利克雷采样指标权重、逐一剔除指标分析以及15次折与种子组合的校正配对检验加以考察。最终由 Swin-Tiny 与 TinyViT-5M 组成的混合2集成,相较最佳单模型使风险-覆盖率曲线下面积降低43%、负对数似然降低17%、最差类别预期校准误差降低36%,并在96.8%的随机权重情形中被选中,且在所有逐一剔除指标分析中保持不变,综合得分亦获提升;但经霍尔姆-邦费罗尼校正后,各单项指标提升均无统计学显著性。由于事后校准未使用完全独立的校准集,依赖校准的结果应视为探索性内部估计。总体上,该框架在单一数据集的内部验证下识别出对替代指标权重稳健的紧凑集成,并改善了可靠性点估计。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究动机
仅靠高分类准确率不足以支撑临床图像分析,因为校准后的置信度与可靠的不确定性估计同样关键。
方法框架
研究提出可靠性感知的 Hybrid-K 集成选择框架,用于基于 SIPaKMeD 数据集的宫颈细胞学多分类任务。
实验设计
共评估九种深度学习架构,使用固定的分层五折划分与三个训练种子,并在事后温度缩放后进行评价。
评价指标
评价指标包括 macro-F1、准确率、AUROC、期望校准误差、最差类期望校准误差、风险-覆盖曲线下面积、Brier 分数与负对数似然。
集成构建
模型按等权复合分数排序,并采用软投票方式由排名靠前的模型构建 Hybrid-K 集成。
稳健性检验
通过 5,000 个 Dirichlet 采样指标权重向量、留一指标分析与跨 15 个折与种子评估的校正配对检验考察稳健性。
主要结果
最终 Hybrid-2 集成由 Swin-Tiny 与 TinyViT-5M 组成,相对最佳单模型使 AURC 降低 43%、NLL 降低 17%、WC-ECE 降低 36%。
稳健性表现
该集成在 96.8% 的随机加权场景中被选中,在所有留一指标分析中保持不变,并提升了整体复合分数。
统计显著性
经 Holm-Bonferroni 校正后,各单项指标增益均不具统计显著性,调整后 p 值均不低于 0.168。
局限说明
由于事后校准未使用完全独立的校准集,依赖校准的结果应被解释为探索性的内部估计。