扩散模型和流模型最初被广泛关注,是因为它们能生成高质量图像、视频、音频和三维内容。但这篇综述强调了另一个正在变得更重要的事实:生成模型不仅能“生成”,也在大规模训练中学到了丰富的视觉表示。这些表示既可以反过来提升生成质量、可控性和可信度,也可以迁移到分类、分割、检测、少标注学习、世界模型和统一多模态系统中。 论文《Representation Learning in Diffusion and Flow-based Model: An Application Aspect》从应用视角系统梳理扩散模型与流模型中的表示学习。作者提出一个三层递进框架:第一层是生成中心应用,即用表示学习改进生成模型本身;第二层是感知导向应用,即把预训练生成模型中的中间特征、注意力图、潜变量或合成数据用于下游视觉理解;第三层是通用与统一应用,即走向聚类、世界模型和统一多模态架构。 这篇综述的价值在于,它没有把扩散模型和流模型只当作“图像生成器”,而是把它们放在视觉表示学习的发展脉络中看:生成过程中的噪声预测、轨迹建模、潜空间对齐、跨注意力和多尺度特征,本质上都可能成为可迁移的表示。对研究者而言,这提供了一个很清晰的路线图:未来的生成模型不只要生成更真实的样本,还要学习更可解释、更可迁移、更能支撑统一任务的表示空间。
扩散模型已经成为现代生成建模的重要范式,在图像合成、视频生成、音频生成和分子设计等任务中表现突出。与此同时,流模型通过学习从简单分布到数据分布的确定性传输路径,在推理效率、采样灵活性和大规模生成方面展现出新的潜力。两类模型虽然训练目标和采样过程不同,但都依赖对数据分布的逐步建模,因此会在网络内部形成多层次表示。 论文指出,生成模型与表示学习之间存在双向关系。一方面,更好的表示学习可以提升生成模型的训练效率、语义可控性、编辑能力和可信度;另一方面,经过大规模训练的扩散模型和流模型本身也能作为表示提取器、数据生成器或任务求解器,为分类、分割、检测、低标注学习等感知任务提供帮助。 过去许多综述更关注扩散模型的生成质量、采样效率或理论机制,而对“生成模型学到的表示如何服务应用”梳理不足。本文因此采用应用导向的组织方式,把研究分为三层:围绕生成能力的表示增强,围绕视觉理解的表示复用,以及面向统一模型和世界模型的通用表示。
扩散模型通常从数据逐步加噪,再学习反向去噪过程。训练目标让模型在不同噪声水平下预测噪声、分数或干净样本,因此模型需要同时捕捉低层纹理、中层结构和高层语义。不同时间步、不同 U-Net 或 Transformer 层中往往包含不同粒度的信息,这也是扩散模型能被用于表示学习的基础。 流匹配模型则把生成过程表述为从源分布到目标数据分布的连续路径,并学习时间相关向量场。与传统扩散采样相比,流模型在路径设计和常微分方程采样上更直接,能够在较少步数下完成生成。Rectified Flow 等变体进一步强调线性路径和高效传输,使流模型逐渐成为扩散模型的重要补充。
早期扩散模型大量使用 U-Net 架构。U-Net 的编码器-解码器结构和跳连天然提供多尺度特征,对分割、深度估计和密集预测等任务非常有用。随着 DiT 等 Transformer 架构兴起,扩散模型开始更多利用 token 表示、注意力机制和大规模预训练能力,这让表示对齐、跨模态控制和统一架构成为可能。 流模型也在从卷积结构走向 Transformer 和多模态结构。对于表示学习而言,架构差异决定了可提取特征的位置、粒度和可解释性。U-Net 更适合多尺度空间特征,Transformer 更适合全局语义与跨模态对齐,流模型的轨迹和速度场则提供了另一种连续动态表示。
论文第三节是全文主体,按三层递进框架组织:生成中心应用、感知导向应用、通用与统一应用。这个结构体现了表示学习在生成模型中的角色变化:从辅助生成,到服务理解,再到支撑统一智能系统。
生成中心应用关注如何利用表示学习改进生成模型本身。第一类是图像与视频生成。许多方法通过把扩散或流模型的中间表示与强视觉编码器对齐,提升训练效率和语义质量。例如,表示对齐可以让生成模型更快获得高层语义结构,减少只依赖像素级损失带来的低效学习。 第二类是图像编辑。图像编辑任务要求模型既保留原图身份、布局和上下文,又按用户指令改变目标区域。论文把编辑方法从两个视角分类:视觉目标视角和模型适配视角。前者关注编辑对象、场景上下文、结构、风格、光照和纹理;后者区分训练无关编辑、测试时适配和训练式编辑。这里的核心问题是:编辑控制到底作用在哪一类表示上,是潜变量、注意力、文本嵌入、特征方向,还是完整模型参数。
第三类是可信生成。可信生成把表示学习用于水印与溯源、后门攻击和对抗保护。水印方法需要决定水印信号承载在哪里,是输出图像、解码器、初始噪声、潜变量还是生成轨迹。后门攻击则把触发器或恶意语义嵌入到条件表示、潜空间或模型内部动态中。对抗保护则希望扰动下游模型的特征学习,使未经授权的个性化、蒸馏或风格模仿失效。
从生成中心应用可以看到,表示不只是生成过程中的中间副产物,而是控制生成内容、保护版权、注入攻击、抵御滥用和提升质量的关键抓手。
感知导向应用则反过来利用生成模型服务视觉理解。论文首先讨论图像分类。生成模型可以通过三种方式参与分类:提取中间表示作为特征,直接把生成模型改造成预测器,或者合成训练数据改善分类器。扩散模型在不同时间步和网络层中包含不同判别信息,因此如何选择层、时间步和聚合方式成为关键。 第二类是密集视觉预测,包括语义分割、二分分割、单目深度估计、指代表达分割等。这些任务要求表示同时保留高分辨率空间细节和全局语义。扩散 U-Net 的多尺度结构和跨注意力图因此很有吸引力。部分方法直接提取 U-Net 中间激活,部分方法用扩散模型的注意力图生成伪标签,还有方法重新设计扩散编码器,使其更适合分割和深度预测。 第三类是实例级感知,包括目标检测、实例分割、全景分割和开放词汇分割。相比分类和语义分割,实例级任务更强调同类对象之间的区分和位置精度。生成模型可以通过内部表示辅助定位,也可以合成带实例标注的数据,降低人工标注成本。
第四类是少标注场景。扩散模型在这里的作用更直接:生成额外样本、补足长尾类别、提供伪标注或把大型生成模型的视觉先验蒸馏给小模型。论文强调,问题不再只是“生成更多图片”,而是生成能覆盖真实决策边界、避免语义漂移和标签噪声的有效样本。
通用与统一应用是论文的第三层。首先是聚类分析。预训练扩散或流模型中的特征可以用于无监督聚类,因为它们包含从低层纹理到高层语义的多尺度结构。与传统自监督表示相比,生成模型的优势在于它学习了数据分布和生成轨迹,而不仅是判别式不变性。 其次是世界模型。扩散与流模型可以预测未来视觉状态、构建视频世界模型,或在潜空间中学习环境动态。像素级世界模型适合可视化和数据闭环,潜空间或 JEPA 风格世界模型强调效率和规划能力,三维或四维世界模型则更注重几何一致性和物理约束。对于具身智能而言,世界模型不只是视频预测器,而是连接表示学习、未来预测和动作控制的中间层。 最后是统一模型。论文将代表性统一多模态模型分为三类:带扩散或流解码器的通用大语言或视觉语言模型,端到端扩散或流式模型,以及自回归与扩散或流融合模型。它们共同尝试把理解和生成放进同一架构中,统一处理文本、图像、视频和多模态交互。
这一部分也揭示了未来方向:生成模型中的表示学习正在从单任务模块走向统一基础能力。真正的统一系统需要同时具备高质量生成、语义理解、跨模态对齐、快速推理和可控交互。
论文认为,当前研究仍缺少统一评测框架。生成中心任务通常使用图像质量、编辑一致性或水印鲁棒性指标;感知任务则使用分类准确率、分割指标或检测指标;统一模型又涉及多模态理解和生成能力。由于任务和指标分散,很难判断某种表示机制是否真正具备跨任务价值。 未来需要更系统的基准来比较不同时间步、不同层、不同架构和不同生成范式中的表示质量。尤其是扩散模型与流模型之间的差异,需要在相同任务和相同计算预算下评估,而不是只依赖个别任务结论。
扩散和流模型的内部表示很丰富,但还不够可解释。不同时间步到底编码了哪些语义,哪些层更适合分类、分割或编辑,表示如何随采样轨迹演化,这些问题仍缺少统一答案。可解释性不仅有助于方法设计,也关系到可信生成、安全审计和模型调试。
许多基于生成模型的感知方法成本较高。若每次分类都需要多时间步去噪,或每次编辑都需要反演和优化,实际部署会受到限制。流模型因其较高采样效率受到关注,但如何在效率、质量和表示可迁移性之间取得平衡,仍是开放问题。
统一多模态模型正在把生成与理解整合到同一系统中,但架构选择仍然分散:有的保留自回归语言骨干和扩散解码器,有的尝试端到端扩散,有的融合自回归与生成过程。未来的关键问题是,如何让视觉表示既能支持精确理解,又能支持高保真生成,还能在多模态任务中保持一致。
论文在声明部分列出资助、利益冲突、数据可用性、代码可用性、作者贡献和致谢等信息。作为综述论文,本文主要基于公开文献进行归纳与分类,并未提出新的实验数据集或代码系统。读者如果希望进一步追踪具体方法,可从论文中的分类图表和参考文献索引进入对应方向。
这篇综述的主线很清楚:扩散模型和流模型正在从生成工具演化为表示学习平台。它们的价值不再局限于生成更真实的图像,而是体现在更广泛的应用链条中:用表示提升生成,用生成模型服务感知,再用统一架构连接理解、生成和行动。 对未来研究来说,真正值得深挖的问题不是“扩散模型能不能做某个下游任务”,而是“生成模型在哪些层、哪些时间步、哪些轨迹状态中学到了可迁移表示,以及这些表示如何被可靠、高效、可控地释放出来”。这也是本文最重要的启发。 论文链接:https://arxiv.org/abs/2608.24068