论文解读 | 医学图像修复中的扩散模型:挑战、分类与未来方向

导读

医学图像修复并不是普通图像补全的医疗版。自然图像修复只要视觉上合理,往往就能满足编辑和美化需求;但医学图像修复必须面对更高风险:被补全的区域可能影响病灶判断、治疗规划、分割结果和下游诊断。换句话说,医学场景中的“看起来像”远远不够,模型还必须尽可能保持解剖结构一致性和临床相关性。 这篇综述《Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions》聚焦一个快速增长的方向:扩散模型用于医学图像修复。作者系统检索 Scopus、Web of Science 和 IEEE Xplore 等数据库,从 841 篇初始文献中筛选出 60 篇符合条件的研究,分析其模型类别、医学模态、应用任务、数据集、评价指标和实验设置,并提出扩散模型方法分类。 论文的核心结论是:扩散模型已经成为医学图像修复的重要生成式路线,尤其适合产生解剖上合理的重建结果,并支持伪健康组织重建、伪影去除、数据增强和异常检测等任务。但领域仍存在明显短板,包括统一 benchmark 缺失、数据集多样性不足、临床验证有限、评价指标偏图像质量而非诊断有效性等。

论文信息

论文题目:Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions 作者:Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu arXiv:2607.21904v1 类别:cs.CV 时间:2026 年 7 月 24 日 链接:https://arxiv.org/pdf/2607.21904

一、研究问题:为什么医学图像修复重要

医学影像在诊断、监测和治疗规划中处于核心位置,但真实临床采集中经常出现缺失或损坏信息。例如 MRI 或 CT 可能受到患者运动、设备限制、安全协议、扫描时间约束、金属植入物或不完整投影数据影响。缺失区域可能遮挡关键解剖结构或病灶,进而降低诊断可靠性。 图像修复的目标是在缺失或损坏区域生成合理内容,并与周围组织保持视觉和语义一致。在医疗场景中,这个目标更严格:模型不仅要补得自然,还要避免产生虚假病灶、掩盖真实异常或改变临床判断依据。 扩散模型的优势在于,它通过逐步加噪和反向去噪学习数据分布,训练稳定、样本多样性较好,并能生成高质量图像。相比 GAN,扩散模型较少受 mode collapse 和对抗训练不稳定影响;相比传统自编码器,其生成质量和复杂分布建模能力更强;相比纯 Transformer,它在 U-Net 或混合结构中仍保留了适合图像局部空间结构的归纳偏置。

二、系统综述方法:从 841 篇到 60 篇

论文采用 PRISMA 流程进行系统综述。作者使用 image inpainting、diffusion models、image completion、medical images、clinical、healthcare、radiology 等关键词,在多个数据库中检索 2023-2026 年的相关工作。初始共检索 841 篇,去重后剩 565 篇,经过标题与摘要筛选后剩 141 篇,再经全文评估,最终纳入 60 篇。

筛选标准也体现了本文范围:研究必须使用扩散式架构,必须处理图像数据,必须面向医疗或健康场景,并且必须涉及 image inpainting。一般医学图像生成、缺失模态合成或与修复无关的扩散模型工作不纳入核心分析。 这一流程使论文不只是“列论文”,而是有明确证据边界的系统综述:它关注扩散模型如何被具体用于医学图像修复,而不是泛泛讨论医学生成模型。

三、扩散模型分类:从 DDPM 到 LDM

论文首先比较了深度生成模型家族:自编码器、GAN、Transformer 与扩散模型。不同模型在质量、多样性和计算效率之间有不同取舍。GAN 生成快但训练不稳定,AE 多样性较好但样本可能更模糊,扩散和 Transformer 模型通常能在质量与覆盖性之间取得更好平衡,但推理成本较高。

论文提出了扩散模型理论分类,将医学图像修复中的方法归入四个主要家族:Denoising Diffusion Probabilistic Models、Latent Diffusion Models、Score-Based Generative Models 和 Stochastic Differential Equations。

DDPM 通过离散 Markov 链逐步向数据添加高斯噪声,并训练网络反向去噪。LDM 把扩散过程放在潜空间中进行,先用自编码器压缩图像,再在低维 latent 上去噪,从而降低计算成本。Score-based 方法学习数据分布对数密度梯度,通过 score matching 和 Langevin 动力学采样。SDE 方法则把扩散过程推广到连续时间,用随机微分方程统一描述正向扰动和反向生成。

对医学图像修复而言,模型选择并不只是理论问题。DDPM 通常在重建质量上表现稳健,但采样较慢;LDM 更适合高分辨率医学图像,因为潜空间扩散能显著降低资源开销;条件 LDM 可进一步纳入文本、掩码、类别或模态信息;SDE 与 score-based 方法在理论表达上更统一,但实际应用数量相对少。

四、核心架构:DDPM 与 LDM

DDPM 是文献中最常见的扩散模型家族。其基本流程是:正向过程逐步把原始图像变成噪声,反向过程训练神经网络预测噪声或恢复干净图像。在医学图像修复中,模型还会结合 mask、条件图像或上下文区域,使网络只重建缺失或损坏区域。

LDM 则把扩散过程移动到潜空间。输入图像先经 encoder 映射为 latent 表示,扩散模型在 latent 上学习去噪,最后通过 decoder 重建图像。由于医学图像常具有高分辨率和大体积数据特点,LDM 的压缩优势非常重要。

论文指出,在所综述的工作中,DDPM 和 LDM 是主导架构。DDPM 数量最多,说明标准去噪扩散仍是当前医学修复研究的基本范式;LDM 数量紧随其后,反映出领域正在转向更高效、更适合大规模医学影像的潜空间建模。

五、研究趋势与应用分布

论文统计显示,扩散模型医学图像修复研究在 2023-2025 年增长明显。纳入综述的工作中,2023 年有 7 篇,2024 年 16 篇,2025 年达到 32 篇,2026 年截至论文检索时为 5 篇。这说明该方向仍处于快速扩张阶段。

从模型家族看,DDPM 有 34 篇,LDM 有 20 篇,SDE 有 3 篇,score-based 方法有 2 篇,Diffusion Transformer 有 1 篇。当前应用仍以 DDPM 和 LDM 为主体,DiT 类方法在该领域尚处早期。

从医学模态看,MRI 和 CT 是最常见的研究对象,分别对应 21 篇和 15 篇;其他还包括组织病理、乳腺摄影、OCT、结肠镜、超声等。这与临床需求和公开数据可得性有关:MRI/CT 数据量较大,且伪影去除、肿瘤修复、缺失区域补全等任务更常见。

论文将应用场景归纳为四类。第一是 artifact removal,即伪影去除,处理运动伪影、金属伪影、不完整采样等问题。第二是 data augmentation,用修复或生成方式扩充数据,提升分割、分类等下游任务。第三是 pseudo-healthy tissue inpainting,即伪健康组织重建,常用于异常检测:把病灶区域修复成健康组织,再通过差异定位异常。第四是其他应用,包括缺失区域恢复、图像补全、模态相关任务等。

六、评价指标与案例研究

医学图像修复评价仍以图像质量指标为主。论文统计发现,SSIM 和 PSNR 是最常用指标,均出现在 53.3% 的研究中;DSC 出现在 28.3% 的工作中,常用于下游分割或结构重叠评价。其他指标虽然频率较低,但在临床相关性、感知质量和任务性能方面有补充价值。 不过,这也暴露出一个问题:PSNR/SSIM 衡量的是像素或结构相似性,不一定等同于诊断可靠性。一个图像可能 PSNR 很高,但关键病灶被弱化;也可能视觉质量好,却在下游诊断上引入偏差。因此,论文强调未来需要更标准化、更临床相关的评价协议。 论文还进行了一个案例研究,在 BraTS 和 TCGA 数据集上统一评测多个公开扩散修复方法,并设置三种缺失机制:MCAR、MAR 和 MNAR,分别代表完全随机缺失、随机缺失和非随机缺失。评价指标包括 PSNR、SSIM 和计算时间。

结果显示,不同模型的优势并不一致。NeuroLIT 在多个设置下取得较高 PSNR,TPDM 在 SSIM 和时间方面表现突出,PathoPainter、DM_Inpainting 等方法在特定数据集或缺失机制下也具有竞争力。这说明医学图像修复不存在单一万能模型,模型选择需要考虑模态、缺失机制、目标任务和计算约束。

七、挑战与未来方向

论文总结了该领域的几个关键挑战。 首先是 benchmark 不统一。不同研究使用的数据集、缺失 mask、评价指标和实验协议差异很大,使得方法之间难以公平比较。本文案例研究尝试用统一设置评测多个方法,但领域仍需要更大规模、更公开、更贴近临床场景的标准 benchmark。 其次是数据集多样性不足。当前研究集中在 MRI 和 CT,其他模态如超声、OCT、内镜、病理切片等还不充分。不同模态有完全不同的噪声机制、结构特征和临床任务,不能简单假设一个模型能跨模态泛化。 第三是临床验证有限。很多工作报告 PSNR、SSIM 或 FID,但较少验证修复结果是否真的改善诊断、分割、风险分层或治疗规划。医学修复模型一旦用于临床流程,必须避免 hallucination 式补全,尤其不能生成不存在的结构或抹去真实病灶。 第四是模型效率问题。扩散模型推理通常较慢,医学图像又常常是高分辨率 2D 或 3D 数据,部署成本明显高于自然图像。LDM、加速采样、蒸馏和轻量化网络可能成为未来关键方向。 第五是可解释性和不确定性。医学图像修复需要知道模型在哪些区域可信、哪些区域不确定。未来方法需要输出不确定性估计,或者结合医生可解释反馈,使修复结果能被审查、追踪和校正。

八、总结

这篇综述的价值在于,它把扩散模型医学图像修复从零散方法整理成了一个可讨论的研究地图:从模型家族看,DDPM 和 LDM 是主流;从任务看,伪影去除、数据增强、伪健康组织重建和异常检测是主要应用;从模态看,MRI 与 CT 占据主导;从评价看,PSNR/SSIM 仍是常用指标,但远不能覆盖临床可靠性。 对研究者而言,下一阶段的重点不只是提高图像质量分数,而是建立面向真实医疗场景的完整验证链条:更统一的数据与 mask 生成机制,更贴近诊断任务的评价指标,更广泛的模态覆盖,更高效的推理框架,以及能够量化不确定性的可审查模型。 扩散模型已经证明自己能生成解剖上合理的医学图像修复结果。真正困难的问题在下一步:如何让这些结果可信、可解释、可复现,并最终在临床任务中带来可靠收益。

成为VIP会员查看完整内容
0
VIP会员
最新内容
面向国防作战的最佳自主与蜂群无人机技术
专知会员服务
4+阅读 · 今天8:04
《异构人类团队的协作决策过程混合建模研究》
专知会员服务
4+阅读 · 今天7:59
博士论文 | 面向大模型推理的内存高效算法
专知会员服务
4+阅读 · 7月27日
美空军新型反无人机部队初探
专知会员服务
7+阅读 · 7月27日
《防空交战流程的概率建模研究》
专知会员服务
11+阅读 · 7月27日
ICML 2026 教程 | 数值优化理论还重要吗?
专知会员服务
7+阅读 · 7月26日
ICM 2026 | 陶哲轩:人工智能时代的数学
专知会员服务
10+阅读 · 7月26日
微信扫码咨询专知VIP会员