|
|
|
|
|
可解释的医学图像诊断与自关注变压器:卫生保健领域可解释人工智能综述 | MDPI BioMedInformatics |
|
|
论文标题:Interpretable Medical Imagery Diagnosis with Self-Attentive Transformers: A Review of Explainable AI for Health Care
论文链接:https://www.mdpi.com/2673-7426/4/1/8
期刊名:BioMedInformatics
期刊主页:https://www.mdpi.com/journal/biomedinformatics
一、引言
AI在医学影像自动分析、诊断和决策中进步显著。医学图像是常见临床诊断方法,覆盖皮肤、胸部、脑、肝等。深度学习已用于糖尿病、基因组学、心理健康等。ViT利用自注意力在视觉任务中达到先进水平。医疗依赖AI时,模型可解释与透明至关重要。深度学习内部复杂,常被视为黑箱。XAI解释模型内部运作与决策,弥合黑箱与人类理解差距,增强信任、问责与公平。本文综述ViT医学图像分析进展及可解释方法。
二、可解释模型:可解释人工智能(XAI)
AI普及引发透明、问责和可信关注。在医疗诊断等关键场景,透明使利益相关者理解预测依据。XAI揭示模型内部,连接深度学习复杂性与医学影像人类理解。关键概念包括:数据需求,高质量、多样、标注数据;计算成本,训练复杂模型需大量资源;可解释性,理解AI决策,增强信任、调试和偏见识别;透明性,公开架构、数据与算法过程。XAI让临床医生理解、验证、排查决策;可解释ML提供解释,帮助评估预测可靠性并解决偏见。
三、Vision Transformer基础
ViT将图像分为固定大小patch,线性嵌入后由Transformer编码器处理,捕获全局上下文。与CNN不同,ViT直接学习长程关系。编码器含多头自注意力和MLP,通过Q、K、V计算注意力:Softmax(QKT/√d)V,并配合层归一化、GELU和残差连接。最后层嵌入用于下游任务。
四、XAI中的可解释性方法
Grad-CAM利用最后卷积层梯度生成定位图,突出对决策最重要的区域,无需重训练或改架构;Guided Grad-CAM可生成高分辨率、类判别可视化。
4.1.1 显著性图
通过反向传播计算损失对输入像素的梯度,揭示每个像素对分类的影响,突出重要像素。
4.1.2 概念激活向量(CAV)
基于用户定义概念提供全局解释。训练二分类器区分概念相关与无关图像,导出CAV系数向量;TCAV可平均概念贡献并比较,连接高层概念与类别。
4.1.3 DeepLift
通过比较神经元激活与参考行为确定贡献分,反向传播分解输出预测,克服梯度零化或不连续问题。
4.1.4 逐层相关性传播(LRP)
将预测相关性反向传播,确保低层神经元均分相关性,适用于文本、图像和视频,参数和规则设置可产生高质量解释。
4.1.5 引导反向传播
结合ReLU和反卷积,阻止负梯度回传,可视化神经网络中间层和最后层。
五、用于医学图像的Vision Transformer
ViT能捕获长程关系,但解释其决策过程存在挑战。
5.1 黑箱方法
TransMed结合CNN低层特征与ViT全局上下文,分类腮腺肿瘤;Lu等提出两阶段框架用于脑胶质瘤亚型分类;Gheflati和Rivaz评估ViT用于乳腺超声分类;Genetransformer预测肺癌亚型;GasHis-Transformer诊断胃癌;ViT-CNN集成模型诊断急性淋巴细胞白血病。
5.2 可解释Vision Transformer
可解释视觉模型揭示影响决策特征,用显著性图和Grad-CAM可视化。表1总结面向Transformer的可解释方法,包括Raw Attention、Rollout、GradCAM、Partial LRP、Transformer Attribution、Generic Attribution、Token-wise Approximation,以像素准确率、mAP、mF1、mIoU评估,标注是否类特定。应用包括:COVID-19诊断中ViT结合SimCLR与显著性图;COVID-ViT;xViTCOS用于CT/X光筛查并提供临床可解释可视化;TransMIL用于全切片脑肿瘤分类;AB-MIL突出感兴趣区域;GTN结合GraphCAM诊断肺肿瘤;U-Transformer跨注意力图展示层级贡献;不确定性引导像素对比学习改善分割透明度。
六、结论
可解释性技术在医疗深度学习中日益重要。Grad-CAM、显著性图等方法提供决策洞见,帮助临床医生和患者理解并信任预测,识别偏见、贡献因素和重要区域。可解释ML在医学影像中确保公平、减少偏见、建立信任,有望改善患者护理和全球医疗实践。
七、局限与未来方向
ViT局限:全局上下文可能忽略关键局部特征;需大量训练数据;自注意力计算昂贵,二次复杂度限制高分辨率图像扩展;小诊所可能依赖外部资源。未来方向:开发统一可解释框架,整合多种技术;量化数据不确定性并融入可解释模型,提高关键医疗决策可靠性和鲁棒性;不确定性估计可改善医学图像分割,减少误分类。通过这些方向,增强医疗AI信任、透明和有效性。
Lai, T. Interpretable Medical Imagery Diagnosis with Self-Attentive Transformers: A Review of Explainable AI for Health Care. BioMedInformatics 2024, 4, 113-126.
期刊介绍
主编:Dr. Alexandre G. De Brevern, 法国巴黎大学红细胞生物学研究部
BioMedInformatics (ISSN 2673-7426) 是一个跨学科的科学开放获取期刊,其使命是推动面向生物学与医学计算科学所需的多学科研究与教育范式。本刊展示基于计算机科学及相关领域的方法与成果,旨在从生物医学数据中提取信息,并将这些信息转化为知识,从而促进数据驱动的科研范式。期刊重点关注针对生物医学问题的数据驱动型解决方案——包括创新性方法与计算工作流程的开发,其侧重点至少与利用这些方法获得的特定生物医学发现具有同等学术权重。
2025 Impact Factor:3.6
2025 CiteScore:7.1
Time to First Decision:20.8 Days
Acceptance to Publication:5.6 Days
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。