论文题目:Unsupervised Post-Training of Foundation Models: A Survey 作者:Yijie Xu、Qianyi Cai、Huizai Yao、Yili Wang、Tianfu Wang、Cehao Yang、Xingbo Yao、Zhiyu Guo、Aiwei Liu、Xuming Hu、Weiyu Guo、Hui Xiong 机构:香港科技大学(广州)、香港科技大学、小红书、腾讯微信、香港中文大学、AI2 Robotics 论文链接:https://arxiv.org/pdf/2608.24982
基础模型后训练通常依赖外部监督:人工标注、偏好数据、更强教师模型,或数学验证器、单元测试、可执行环境等外部反馈。本文关注的是另一条正在快速增长的路线:无监督后训练。它只使用未标注输入,并从同一模型谱系自身产生的样本、分布、判断、目标或课程中提取学习信号,进而对参数、适配器、记忆或持久状态进行更新。 这篇综述的价值在于给“无监督后训练”划出严格边界。作者收录 2023 年 1 月至 2026 年 5 月的相关工作,冻结出 94 条方法记录,其中 80 条属于严格无监督后训练。严格定义需要同时满足四个条件:真实发生更新;输入没有标签;更新信号只来自同一模型谱系的样本或判断;任何评判器、打分器或奖励模型都必须来自同一谱系。也就是说,只在推理时搜索、不更新模型,不算;用了外部验证器、工具判定、人工标签或更强教师,也不算。 论文提出一个非常清晰的分类主轴:到底是什么“模型内部对象”提供了更新信号。由此得到四大家族:预测统计优化、样本关系监督、自生成目标自举、内部评估器自举。作者进一步给出一个正交视角:输入何时可见,更新能持续多久。两条视角合在一起,构成了选择和评估无监督后训练方法的技术地图。
基础模型后训练经历了两波外部监督。第一波是人工标签与偏好学习,例如监督微调和基于偏好的强化学习。第二波是外部验证器,例如数学检查器、单元测试和可执行环境,这类信号推动了可验证奖励强化学习。 第三波正在形成:模型只面对未标注提示、文本或目标输入,通过自身生成的样本、分布、判断和课程产生更新信号。它适合标签难以获得、验证器难以迁移或开放式生成难以精确打分的场景,例如领域语料适配、对话、摘要、长上下文和多模态推理。
论文的贡献包括三点。第一,提出严格的边界协议,把信号来源和任务结构分开讨论,避免把外部验证器或教师信号混入无监督后训练。第二,以“更新对象”为核心建立四大家族分类,并用输入可见性和更新持久性给出部署时机图。第三,从跨家族角度讨论适用场景、递归错误传播和部署检查,为未来评测提供统一语言。
论文覆盖文本和多模态基础模型,从 2023 年 1 月到 2026 年 5 月,聚焦在预训练之后使用未标注输入进行更新的方法。检索覆盖继续预训练、测试时适配、内部一致性、自训练、自奖励和多模态无监督后训练等关键词,最终整理出 80 个严格方法、8 个相邻方法以及若干边界或前驱记录。
无监督后训练被定义为:从已微调基础模型出发,使用未标注提示、文本或目标输入,修改模型参数、适配器、记忆或持久局部状态,并且更新信号不来自外部监督。外部监督包括标准答案、验证器反馈、工具执行判定、人工标签和更强教师标签。 作者提出四个边界检查。第一,必须有显式更新。第二,更新信号只能来自未标注输入和同一谱系模型产物。第三,不得引入外部监督。第四,任何评判器、打分器或奖励模型都必须由同一模型谱系产生。这个边界让许多看似相近的方法被归入“相邻轨道”,例如无更新的推理时搜索、工具辅助自训练、人工或种子监督自举、跨模型蒸馏和外部奖励方法。
论文把“内部更新对象”定义为产生更新信号的模型派生产物。它可以是预测分布、多个 rollouts 之间的关系、自生成目标、偏好对、候选答案、评判结果或奖励信号。分类不看方法名称,而看梯度实际消费的对象。多数投票如果直接作为奖励,是样本关系监督;如果用来筛选伪标签再做监督训练,则是自生成目标自举。
第一类方法最直接:从模型在单个观测上的预测统计量提取更新信号,例如负对数似然、熵、置信度或几何规则统计。它不生成伪标签,不构造偏好对,也不训练内部评判器,而是直接优化模型自身分布的某个量。 最典型的形式是继续预训练,即在未标注领域语料上最小化语言模型损失。当瓶颈是领域分布迁移时,这条路线简单有效。相关工作还将预测似然扩展到长上下文扩展、测试时学习和样本局部状态更新。
这类方法路径最短,成本和概念复杂度相对低,适合领域语料适配、长上下文语料扩展和分布漂移下的快速调整。但它的风险也很明确:优化低熵或高置信度不一定等于模型更正确。若内部统计与下游行为不一致,模型可能只是更自信地犯错。因此评测不能只看被优化统计量,还要看独立下游任务、校准和 held-out 质量。
第二类方法不读取单个样本的标量,而是读取多个模型样本之间的关系。内部更新对象可以是聚类质量、一致性得分、多数投票、语义簇、候选答案频率、样本间对比一致等。核心假设是:如果多个独立生成路径聚到同一答案,这个关系本身就包含有用信号。 单提示内部一致性是最简单的版本:对同一提示采样多个回答,按语义聚类、路径一致性或不确定性构造奖励。更常见的路线是测试时强化学习,例如对每个目标问题采样多个 rollouts,用多数答案构造伪奖励,再进行策略优化。
样本关系监督也迁移到多模态模型。视觉语言模型可以对图像问题生成多个答案,用频率、熵或一致性构造奖励;也可以通过自生成视觉问题、候选回答和多轮一致性形成训练信号。这些方法不依赖图像文本标签、外部 captioner 或外部验证器,而是从模型自身的多模态 rollouts 中提取监督。
一致性并不等于正确性。多数投票只有在错误足够分散、答案等价关系稳定时才可靠。如果多个样本共同落入同一个错误模式,训练会把“流行错误”放大。因此论文建议报告样本多样性、错误多数频率、不同答案规范化器下的稳定性,以及开放式改写后的收益是否保持。
第三类方法先从模型分布中构造可训练目标,再用监督微调或偏好优化训练。目标可以是指令、回答、知识问答、推理链、计划、课程、辩论轨迹或偏好对。与样本关系监督不同,这里的梯度不是直接消费“多数关系”,而是消费被筛选出来的目标数据。 例如,自教式知识获取可以从原始文档生成问答和反思任务;推理自训练可以生成多条思维链,用自一致性筛选后继续微调;课程自举可以让一个模型提出接近另一个模型能力边界的问题,再用内部伪标签训练求解器。
推理目标是这一家族最大的分支。方法通常生成多条推理轨迹,再按自一致性、置信度、前瞻质量或辩论共识筛选。另一条分支生成偏好对,再用类似偏好优化的目标训练,例如按自一致性、短长上下文表现或内部答案置信度对回答排序。
自生成目标的优势是数据对象可检查、可缓存、可复用,也更容易与离线训练流水线结合。风险是选择错误一旦进入目标集,会在后续轮次中持续存在,形成确认偏差。因此需要跟踪目标多样性、重复率、难度分布、轮次间漂移和 held-out 质量。
第四类方法把模型自身提升为评估器。内部更新对象不再只是目标,而是同一谱系模型产生的评判器、奖励模型、打分器或元评审。它可以输出成对偏好,也可以输出标量奖励;训练则通过偏好优化或策略梯度消费这些 verdict。 典型路线是自奖励语言模型:同一个模型交替扮演生成者和评判者,把选择与拒绝样本喂给偏好优化。后续方法通过跨轮一致性、元评审、时间锚定等方式缓解偏差放大、评判饱和和梯度消失。
内部评估器适合开放式任务,因为开放式输出很难用答案相等或多数投票来定义正确性。对话、创作、摘要、长文本和多模态生成往往需要语义标准,而不是硬答案。内部评估器能够提供更灵活的语义反馈,但反馈链也更长:评判器本身会漂移,演员和评判器可能共同偏向,错误更难被外部观察。
四大家族本质上把不同内部代理信号变成更新。预测统计优化利用分布形状;样本关系监督利用多样本聚合;自生成目标自举把选择结果物化为训练数据;内部评估器自举为开放式输出提供语义标准。语义灵活性越强,反馈路径越长,越需要独立评估、一致性约束和多样性保护。
如果数据是原始领域语料,问题主要是分布迁移,预测统计优化是直接基线。如果能够负担多样本采样,而且任务存在可靠的答案等价关系,样本关系监督可以利用共识。如果生成目标能被离线检查,自生成目标自举提供清晰的数据接口。如果输出开放且难以定义相等,内部评估器自举更合适,但必须监控评判漂移。
每个家族的防护点不同。第一类要检查校准和下游质量,而不是只看熵或似然。第二类要检查样本多样性、错误多数和答案规范化敏感性。第三类要检查目标集多样性和轮次更新。第四类要检查演员与评判器相关性、偏好边际、跨轮一致性和评判饱和。通用要求是保留冻结基线、回滚检查点和独立评测集。
更新对象回答“什么信号驱动更新”,适配时机回答“什么时候看见目标输入、更新能持续多久”。论文用输入可见性和更新持久性构成正交视角。相同更新对象可以被部署到不同时间制度中,因此家族决定监督形态,时机决定部署成本和风险。
离线语料适配发生在部署前,目标分布不可见,典型形式包括继续预训练、自奖励和离线自训练。全队列转导适配在目标推理前看到整个目标集合,常见于测试时强化学习。少样本目标适配只看到少量目标样本,再泛化到剩余目标,要求更强泛化。流式持续适配按时间推进,只能使用过去样本。测试实例适配为当前样本临时更新并在边界处重置。序列内适配则在一个长序列的 token 或 chunk 之间更新局部状态。
更新越靠近目标输入,潜在收益越针对当前分布,但也越容易引入不稳定性、计算开销和评测污染。更新越持久,越可能积累长期收益,也越可能积累错误。因此无监督后训练不应只报告“有没有提升”,还要报告输入可见性、更新预算、持续时间、是否重置、是否使用 held-out 目标评测。
递归错误传播是核心开放问题。内部代理信号不完美时,更新会强化被错误选择或错误奖励的输出,下一轮模型又在更偏的分布上产生新的代理信号。不同家族错误链起点不同:第一类从统计错配开始,第二类从错误多数开始,第三类从目标集污染开始,第四类从评判器漂移开始。
论文强调要把信号质量和任务结构分开。boxed answer、有限选项和代码签名可以帮助判断答案等价,但它们并不提供正确答案;单元测试和可执行验证器则提供正确性判定,越过严格无监督边界。未来评测应报告这些结构先验,并测试方法在不同规范化器和开放式改写下是否仍有效。
未来跨家族基准需要固定骨干模型、起始检查点、目标划分、采样预算、更新预算、任务结构和 held-out 评测,以区分信号家族、初始化和适配时机的作用。特别是内部反馈训练会强烈依赖起始模型和更新时长,如果协议不统一,很难判断方法本身是否有效。
这篇综述围绕一个问题组织 80 个严格方法:哪个模型派生对象提供了更新信号?答案形成四类方法:预测统计、样本关系、自生成目标和内部评估器。再加上输入可见性与更新持久性,论文给出了无监督后训练从方法选择到部署评估的完整坐标系。 最重要的权衡是:越语义化的内部信号越能处理开放式输出,但也会产生更长反馈路径,让代理错误被递归放大。无监督后训练的关键不是简单“不给标签也能变强”,而是把更新对象、任务结构和部署时机对齐,并在代理信号进入更新的位置设置防护。
论文的清单冻结在 2026 年 5 月,之后的新工作没有纳入。代表性结果保留各原论文的骨干、预算、指标和适配协议,因此适合机制级综合,不适合直接做合并效应估计。混合方法按梯度主要消费的更新对象归类。最后,严格边界限制的是更新规则,而不是部署栈;即使训练中没有外部 oracle,实际部署仍需要独立评测、监控和红队测试,防止奖励黑客和静默退化长期积累。