综述 | Lifelong Representations:视觉模型持续自监督学习综述

导读

现实世界中的视觉系统很少面对一次性、静态、完整标注好的数据。机器人进入新城市,会看到不同道路、物体、光照和场景布局;遥感模型会持续接收新地区、新季节、新传感器的数据;视觉语言模型在部署后也会不断遇到新的图文分布。如果每次环境变化都从头训练,成本巨大;如果直接用新数据更新模型,又可能把旧知识覆盖掉。

这篇《Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models》聚焦的正是持续自监督学习,简称 CSSL。它把持续学习与自监督表征学习结合起来,让模型从不断到来的无标注数据流中持续预训练,同时尽量避免灾难性遗忘。论文指出,传统持续学习研究大多依赖标签,但真实部署场景往往没有稳定标签;自监督学习天然适合利用海量无标注视觉流,因此 CSSL 是构建终身视觉基础模型的重要方向。

本文按照原论文结构展开,依次梳理目标、协议与评估,自监督表征为什么更抗遗忘,CSSL 方法分类,SSL 如何辅助监督持续学习,以及未来走向大规模基础模型时面临的挑战。文章控制在 1 万字以内,并保留论文中的核心图表。

论文信息

论文标题:Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models 作者:Sergi Masip、Alicja Dobrzeniecka、Jonathan Swinnen、Joachim Collin、Bartłomiej Twardowski、Szymon Łukasik、Tinne Tuytelaars 机构:KU Leuven、NASK、Computer Vision Center、IDEAS Research Institute 接收情况:已被 IEEE EAIS 2026 接收 论文链接:https://arxiv.org/pdf/2607.09785

I. Introduction 引言

为什么需要持续自监督学习

大多数机器学习模型仍然假设训练数据一次性可用,但真实部署更像一个不断变化的数据流。论文用机器人导航举例:一个在北美和欧洲物流配送数据上训练的视觉基础模型,部署到撒哈拉以南非洲后,会遇到训练集中缺失的物体外观、道路布局和光照条件。周期性从头训练很浪费,而持续更新又会带来新旧知识冲突。 持续学习试图让模型按时间顺序学习新数据,同时降低灾难性遗忘。但现有持续学习主要研究有标签的类别增量任务,这绕开了一个核心现实:真实系统很难等待人工标注。相比之下,无标注视觉数据随部署自动产生,自监督学习可以直接从数据结构中构造监督信号,因此更适合作为持续适配的基础。 持续自监督学习就是在新数据流到来时持续预训练模型,不依赖显式标签。论文认为,这一方向相较监督持续学习仍明显欠探索,尤其缺少面向视觉模型和视觉语言模型的系统综述。

论文贡献

论文的贡献包括四点。第一,梳理 CSSL 常见评估协议、基准和指标,并指出评估不统一阻碍公平比较。第二,解释为什么自监督目标往往比监督目标更抗遗忘。第三,按照遗忘缓解策略建立统一方法分类,包括蒸馏、回放、正则、架构方法、模型合并和目标层适配。第四,总结开放问题,强调未来应从小规模 benchmark 走向大规模持续预训练范式。

II. Objectives, Protocols and Evaluation 目标、协议与评估

自监督目标

论文首先回顾视觉自监督学习目标。对比学习通过拉近同一图像不同增强视图、拉远不同样本来学习表征,典型方法包括 SimCLR 和 MoCo。非对比学习不显式使用负样本,而是通过自蒸馏、停止梯度、冗余约束或聚类原型避免坍缩,例如 BYOL、SimSiam、Barlow Twins、VICReg 和 SwAV。掩码建模则借鉴 NLP,通过重建被遮挡的图像区域学习全局结构,代表方法是 MAE。 这些目标在持续学习中的意义不同。对比学习依赖负样本和 batch 结构,在线场景下成本较高;非对比方法对表征稳定性更友好,但也可能在持续微调时失稳;掩码建模适合 ViT 和大规模预训练,但其在非平稳数据流中的规律仍不充分清楚。

训练协议

论文区分两类训练协议。离线 CSSL 是当前最常见设置:数据按离散经验或任务序列到来,每个经验可以完整训练若干 epoch,任务边界通常明确。多数工作在每个经验结束后评估表征质量。 在线或无任务边界 CSSL 更接近真实部署。数据以 mini-batch 单流到来,通常只能单遍处理,任务身份和边界不可见或模糊。它还带来严格计算约束,因此需要用累计反向传播次数等指标衡量训练预算。

评估指标与基准

CSSL 评估通常依赖线性探测和 k-NN 准确率,以衡量表征是否具备线性可分性和局部类别结构。持续学习标准指标包括平均准确率、遗忘、后向迁移和前向迁移。对于视觉语言模型,论文还提到平均知识积累和平均零样本保持,用于衡量塑性与稳定性之间的权衡。 除了下游准确率,表征稳定性也很关键。Centered Kernel Alignment 可以比较不同阶段或不同模型的表示相似度,帮助诊断遗忘发生在网络哪些层。基准方面,视觉常用 CIFAR-10/100、ImageNet-100、TinyImageNet;多模态持续预训练则包括 TiC 系列和 FoMo-in-Flux。

III. Properties of SSL in Continual Learning Setups 性质:自监督为什么更抗遗忘

更通用的表征

论文总结了一个反复出现的经验观察:在持续学习设置中,自监督方法学到的表征通常比监督损失更抗遗忘。原因之一是监督分类容易产生神经坍缩:同类样本被压到相近点,类别均值形成对称结构。这有利于当前分类任务,却会抹去类内变化和未来任务可能需要的特征。 自监督目标则倾向于学习任务无关的数据描述特征。许多自监督方法本身就以避免表征坍缩为目标,因此表征有效维度更高、可迁移信息更丰富。换言之,自监督学习不是把特征直接压成当前标签空间,而是保留更多关于数据分布的结构。

更平坦的损失景观

另一个解释来自损失景观。已有研究观察到,自监督目标通常形成更平滑、更平坦的解。平坦解对参数扰动更不敏感,因此在持续更新时更能容忍新任务带来的权重变化。这为自监督表征的抗遗忘提供了另一种解释。

仍然存在的挑战

自监督并不自动解决持续适配。首先,SSL 通常数据和计算开销更大,需要长训练、较大 batch 和动量编码器等组件。其次,稳定性和塑性仍然冲突:模型既要保留旧知识,又要快速吸收新分布。第三,回放方法在 SSL 中更容易过拟合,因为 replay buffer 样本会被反复使用很多 epoch。第四,在视觉语言模型中,还会出现跨模态漂移:模型持续更新后,图像和文本共享嵌入空间可能逐渐失配,导致跨模态检索和零样本泛化下降。

IV. Continual Self-Supervised Learning 持续自监督学习方法

六类方法

论文将严格无标签训练的 CSSL 方法分为六类:蒸馏、权重正则、回放、架构方法、模型合并和目标层适配。 蒸馏是当前最常见的抗遗忘策略。它通过保持当前模型与旧模型在表征空间、相似度矩阵或跨模态相似度上的一致性,减少旧知识丢失。在视觉语言场景中,跨模态相似度蒸馏尤其重要,因为它可以保护图文共享嵌入空间。 权重正则方法试图限制重要参数变化,例如 EWC、SI、MAS 等传统持续学习方法。它们能降低遗忘,但在 CSSL 和多模态持续预训练中往往不是最强方案,因为单纯限制权重也可能限制新知识吸收。 回放方法保存部分旧样本,并在学习新数据时混合训练。它直观有效,但在自监督场景会遭遇记忆样本反复训练导致的过拟合。为缓解这一点,一些工作使用 mixup、样本选择、FIFO buffer 或增强稳定性约束。 架构方法通过冻结、分支、参数隔离或可训练模块控制稳定性与塑性。例如只让部分参数更新、用分支保存旧知识、或在视觉语言模型中使用 LoRA 限制权重偏移。这类方法可扩展性较好,但需要小心避免塑性不足。 模型合并方法在持续预训练中逐步融合不同时间点的模型,例如在 CLIP 持续预训练中递归合并模型检查点,以实现知识积累和零样本保持之间的平衡。目标层适配则直接修改自监督损失,把持续学习约束嵌入表示学习目标中,是论文认为仍然欠探索但很有前景的方向。

方法启示

论文对各类方法的总体判断比较克制:自监督表征更稳定,但仍需要额外机制;蒸馏和回放有效但可能带来计算与存储开销;架构和参数高效方法更适合大模型,但容易限制塑性;目标层适配最有潜力形成真正贴合 CSSL 特性的方案。

V. SSL in Supervised Continual Learning 监督持续学习中的自监督

自监督作为辅助模块

第 V 节讨论一个相关问题:即使任务有标签,自监督学习是否仍能帮助监督持续学习?论文给出的答案是肯定的。SSL 可以作为辅助损失、预训练阶段或混合训练目标,帮助模型学习更鲁棒、更可迁移的特征。 在类别增量学习中,自监督预训练或辅助自监督目标可以缓解监督信号过度压缩特征空间的问题。它让模型在学习标签分类的同时保留更多底层结构和跨任务可迁移信息。对于医学、遥感、SAR 等领域,SSL 也可以帮助模型利用大量无标签数据,提高持续适配能力。

但不能简单套用

论文也提醒,不能把 CSSL 当作“没有标签的监督持续学习”。不同 SSL 家族有不同动态:BYOL、SwAV、MAE、DINO、JEPA 等目标在非平稳数据流中的行为可能不同。未来方法需要针对 SSL 目标本身设计,而不是简单移植监督持续学习技巧。

VI. Discussion 讨论

评估协议仍不统一

论文指出,CSSL 当前最大问题之一是评估不统一。不同工作使用不同任务划分、训练预算、探测方式和指标,导致方法之间很难公平比较。尤其在在线设置中,如果不控制计算预算,方法优劣可能只是训练次数差异。

从小基准走向基础模型

多数 CSSL 研究仍集中在 CIFAR、TinyImageNet、ImageNet-100 等较小 benchmark 上。然而真实终身学习系统需要面对长时间跨度、海量数据、非平稳分布和多模态输入。论文认为,未来应从“短任务序列”转向“持续预训练”,研究模型在真正长期部署中的表征演化。

大模型与多模态挑战

基础模型规模带来新的问题:完整更新成本过高,参数高效更新、模型合并、选择性冻结和预算感知训练会更重要。对于视觉语言模型,还需要处理图文对齐随时间漂移的问题,以及某一模态缺失时如何保持鲁棒表征。 论文还强调长时段设置下的选择性遗忘。模型不应无条件保留所有旧特征,因为世界会变化,某些旧模式会过时。真正可靠的终身表征需要知道哪些结构可迁移、哪些知识应更新、哪些特征可以丢弃。

VII. Conclusions 结论

这篇综述系统梳理了视觉模型中的持续自监督学习。它的核心判断是:自监督目标确实能产生更通用、更稳定的表征,这种鲁棒性来自任务无关特征和更平坦的损失景观;但自监督并不自动解决持续适配,仍然需要蒸馏、回放、架构方法、模型合并和目标层适配等机制。 面向未来,CSSL 的关键不只是把监督持续学习去掉标签,而是围绕自监督目标、非平稳数据流、多模态对齐和大规模持续预训练重新设计方法与评估。只有解决统一评测、计算扩展、快速适配、跨模态漂移和长时段表征演化等问题,CSSL 才能真正成为终身视觉基础模型的核心训练范式。

成为VIP会员查看完整内容
5

相关内容

面向图像分割的自监督学习:全面综述
专知会员服务
13+阅读 · 2025年5月26日
《视觉Transformers自监督学习机制综述》
专知会员服务
29+阅读 · 2024年9月2日
【牛津大学博士论文】自监督视频表示学习,204页pdf
专知会员服务
40+阅读 · 2023年7月6日
持续学习:研究综述
专知会员服务
83+阅读 · 2023年1月30日
多模态视觉语言表征学习研究综述
专知
27+阅读 · 2020年12月3日
【自监督学习】OpenAI科学家一文详解自监督学习
产业智能官
25+阅读 · 2020年3月18日
OpenAI科学家一文详解自监督学习
新智元
18+阅读 · 2019年11月20日
【泡泡图灵智库】密集相关的自监督视觉描述学习(RAL)
泡泡机器人SLAM
11+阅读 · 2018年10月6日
国家自然科学基金
40+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
17+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
Arxiv
0+阅读 · 6月11日
Arxiv
13+阅读 · 2023年2月7日
Arxiv
15+阅读 · 2021年8月5日
VIP会员
最新内容
印度精确打击与指挥架构的断层
专知会员服务
4+阅读 · 7月20日
美空军AI完成F-16战斗机自主空战历史性试飞
专知会员服务
5+阅读 · 7月20日
深入Project Maven:为何人工智能在战场上依然失灵
锻造未来士兵:外骨骼、基因工程与赛博格
专知会员服务
7+阅读 · 7月19日
《无人机蜂群通信技术研究》50页
专知会员服务
8+阅读 · 7月19日
相关VIP内容
相关基金
国家自然科学基金
40+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
17+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员