医学图像跨模态学习研究综述

李 国坤
齐鲁医药学院

摘要


随着深度学习技术在医学人工智能领域的快速发展,传统单一模态的医学影像分析方法已难以满足复杂疾
病精准诊疗需求。临床实践中,疾病诊断通常需要综合医学影像、病理切片、临床文本、生理信号及组学数据等
多源异构信息,因此,跨模态学习(Cross-modal Learning)逐渐成为医学人工智能的重要研究方向。近年来,以
Transformer、对比学习及视觉语言预训练模型为代表的新型深度学习方法显著推动了医学跨模态学习的发展,在医
学报告生成、视觉问答、跨模态检索及肿瘤预后预测等任务中表现出较高性能。然而,由于医学数据存在异构性强、
配准困难、标注成本高及临床泛化能力有限等问题,当前跨模态模型距离真实临床应用仍存在较大差距。本文结合
近年来医学图像跨模态学习相关研究成果,系统梳理了医学跨模态学习的理论基础、关键技术演化及典型应用场景,
重点分析了Transformer与对比学习在医学跨模态统一表征中的作用机制,并针对当前研究中存在的模型可解释性不
足、数据孤岛及跨中心泛化能力差等问题进行了深入讨论。最后,对医学跨模态大模型、自监督学习及可信医学人
工智能的发展趋势进行了展望,以期为后续医学图像智能分析研究提供参考。

关键词


医学图像;跨模态学习;多模态深度学习;对比学习;医学人工智能

全文:

PDF


参考


[1]Sun Z, Lin M, Zhu Q, et al. A scoping review on

multimodal deep learning in biomedical images and texts[J].

Journal of Biomedical Informatics, 2023, 146:104482.

[2]Han X, Zhang Y, Li J, et al. Cross-Modal

Contrastive Hashing Retrieval for Infrared Video and EEG[J].

IEEE Transactions on Multimedia, 2024.

[3]Liu T, Zheng Y, Chen C, et al. Integrative CrossModal Fusion of Preoperative MRI and Histopathological

Signatures for Improved Survival Prediction in

Glioblastoma[J]. Bioengineering, 2026, 13(2):179.

[4]Huang S C, Pareek A, Jensen M, et al. Fusion of

Medical Imaging and Electronic Health Records Using

Deep Learning: A Systematic Review and Implementation

Guidelines[J]. NPJ Digital Medicine, 2020, 3(1):136.

[5]Zhou Z, Sodha V, Siddiquee M M R, et al. Models

Genesis: Generic Autodidactic Models for 3D Medical Image

Analysis[C]//International Conference on Medical Image

Computing and Computer-Assisted Intervention. Shenzhen,

China: Springer, 2019: 384-393.

[6]Wang X, Peng Y, Lu L, et al. TieNet: TextImage Embedding Network for Common Thorax Disease

Classification and Reporting in Chest X-rays[C]//

Proceedings of the IEEE Conference on Computer Vision

and Pattern Recognition. Salt Lake City, UT, USA: IEEE,

2018: 9049-9058.

[7]Vaswani A, Shazeer N, Parmar N, et al. Attention

Is All You Need[C]//Advances in Neural Information

Processing Systems. Long Beach, CA, USA: NeurIPS, 2017:

5998-6008.

[8]Radford A, Kim J W, Hallacy C, et al. Learning

Transferable Visual Models From Natural Language

Supervision[C]//Proceedings of the 38th International

Conference on Machine Learning. Virtual Event: PMLR,

2021: 8748-8763.

[9]Johnson A E W , Pollard T J , Greenbaum N R

,et al.MIMIC-CXR: A large publicly available database

of labeled chest radiographs[J]. 2019.DOI:10.48550/

arXiv.1901.07042.


Refbacks

  • 当前没有refback。