博士论文 | 缓解后训练对大模型生成多样性的影响

图1:Berkeley EECS 2026 博士论文《Mitigating Post-Training Effects on Generative Diversity in Language Models》标题页。

导读

大语言模型越来越会给出高质量、连贯、符合人类偏好的答案,但这也带来一个常被低估的问题:当一个问题存在多个同样合理的答案时,模型往往会反复生成少数高概率模式,而不是覆盖完整解空间。对聊天问答来说,这可能只是“答案有点单调”;但对对抗测试、搜索、合成数据、创意写作、强化学习探索和智能体任务生成来说,多样性不足会直接限制系统能力。 这篇 UC Berkeley 博士论文聚焦“后训练如何影响生成多样性”。作者 Justin Yat-Fung Wong 先解释为什么 RLHF、SFT 等后训练容易把模型推向 mode-seeking 行为,再提出两条训练无关的补救路线:一是面向语言模型的 SimpleStrat,通过自动分层和分层采样恢复重采样多样性;二是面向扩散模型的 Stylus,通过自动选择和组合 LoRA 适配器,在图像质量与多样性之间取得更好平衡。 这篇论文的一个重要判断是:提升多样性不等于牺牲质量。只要能显式识别解空间中的“合理分区”,并让采样过程覆盖这些分区,模型可以在保持生成质量的同时获得更丰富的输出。更进一步,论文也提醒我们:多样性是创造力的必要条件,但并不是充分条件。真正的机器创造力还需要目标、品味、语境、长期积累和对“有意义的新颖性”的判断。

论文信息

论文题目:Mitigating Post-Training Effects on Generative Diversity in Language Models 作者:Justin Yat-Fung Wong 学校:University of California, Berkeley 学位:Doctor of Philosophy in Computer Science 委员会主席:Sanjit A. Seshia、Joseph E. Gonzalez 技术报告编号:UCB/EECS-2026-223 时间:2026 年 5 月 26 日 论文链接:https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-223.pdf

一、为什么需要生成多样性

多答案任务不是单答案任务

许多任务并不存在唯一正确答案。例如“说出一个美国州”“列举一个有效测试用例”“生成一个网页智能体训练任务”“写一个故事大纲”,都可能有大量合理输出。单次生成质量高,并不代表模型能覆盖这些可能性。 论文把这种能力称为 resampling diversity:当我们多次从同一模型中采样时,模型是否能生成不同且有效的答案。它不同于简单的词面多样性,也不同于让模型胡乱发散。真正有价值的多样性必须同时满足两个条件:答案有效,且覆盖不同语义区域。

三类场景尤其依赖多样性

第一是测试时扩展。Tree-of-thought、AgentQ、搜索式推理等方法依赖多候选解。如果候选解高度重复,增加采样次数并不会显著提升搜索覆盖。 第二是覆盖导向任务。对抗测试、集成测试和合成数据生成需要系统性覆盖边界条件、罕见案例和不同输入类别。模型如果总生成最常见模式,就会遗漏真正有价值的长尾。 第三是强化学习探索。RL 的核心是探索不同策略,但语言模型后训练常常强化少数“看起来最好”的响应,使模型在多轮生成中更快收缩到固定模式。

二、为什么问题还没有解决

后训练会恶化校准与分布覆盖

论文指出,后训练虽然提升了有用性、安全性和偏好一致性,但也可能损害模型的概率校准和分布覆盖。GPT-4 技术报告中的校准图显示,预训练模型在部分任务上较好校准,而经过 PPO 等后训练后,校准质量明显下降。

图2:后训练可能恶化模型校准。左图为预训练 GPT-4 在 MMLU 子集上的校准曲线,右图显示后训练后校准变差。 从分布角度看,RLHF 类目标往往是 mode-seeking 的:它会鼓励模型把概率集中到高奖励答案上,而不是保留真实答案分布中的多峰结构。即便多个答案都合理,模型也可能偏向最常见、最安全、最符合偏好的那一小部分。

提高温度不是完整解法

很多人会用升高 temperature 来获得多样性。但论文通过“美国州”“五大湖”等例子说明,温度只能在模型已经赋予非零概率的区域内放大随机性。如果模型本身已经把概率集中在少数答案上,升温只会让输出更 noisy,并不能保证覆盖被压低的语义分区。

小规模微调能纠偏,但不是通用解

论文展示,针对明显偏斜的输出分布,小规模平衡 SFT 可以部分恢复多样性。例如在石头剪刀布、宝可梦类型等实验中,平衡数据可改变模型输出分布。但这种方法需要知道偏差在哪里、准备纠偏数据,并重新训练或微调模型。因此,论文主体更关注不改训练数据和训练流程的部署时方法。

三、SimpleStrat:用分层采样恢复语言模型多样性

核心直觉

SimpleStrat 的核心思想很朴素:如果模型总在一个模糊问题上给出少数答案,那么先让模型自己找出解空间的有意义划分,再按这些划分进行采样。例如“说出一个美国州”,模型可能强烈偏向 California;SimpleStrat 会让模型提出东西部、南北部等划分,然后按分区提示生成答案,从而覆盖更多州。![]

图3:SimpleStrat 在温度缩放失效时恢复多样性。通过自动发现“密西西比河东西侧”等分层维度,模型能覆盖更多合理答案。 这相当于把“直接采样答案”改成“先采样一个语义子空间,再在子空间内采样答案”。随机性不只来自解码温度,也来自 prompt 分布本身。

三阶段流程

SimpleStrat 包含三个阶段。第一阶段是自动分层:模型以类似“20 个问题”的方式提出能把解空间切分得较均衡的属性。第二阶段是启发式估计:模型估计每个分层下可能包含多少有效解。第三阶段是概率提示:系统根据前两步得到的分布,随机选择具体分区提示,再让模型生成答案。

图4:SimpleStrat 工作流:自动分层、启发式估计、概率提示三阶段共同构成分层重采样过程。 这种方法的关键好处是轻量。它不需要访问模型权重,不需要重新训练,也不依赖专门标注数据。只要模型具备足够世界知识,就可以让它自己提出分层维度。

CoverageQA:如何衡量多答案覆盖

为了评估重采样多样性,论文提出 CoverageQA。它面向“有多个有效答案”的问答任务,关注多次采样后模型能覆盖多少真实答案。论文使用三类指标:在可枚举答案分布和 logits 可用时,用 KL 散度衡量分布多样性;在黑盒访问时,用 recall 和 precision 衡量覆盖多样性;在开放任务中,用文本嵌入距离作为开放式多样性的近似。 这套评估避免了一个常见误区:多样性不是简单生成更多不同字符串,而是生成更多有效、互不重复、语义上覆盖更广的答案。

实验结果

在 Llama 3.1 8B 和 70B 上,SimpleStrat 能改善原本过度集中的答案分布,让低概率但合理的答案更容易被采到。论文还显示,在 GPT-4o、Claude 3.5 Sonnet 等闭源模型上,SimpleStrat 在 CoverageQA 上提升 recall,且精度只出现较小下降。

图5:分布多样性对比。SimpleStrat 能降低过度代表答案的概率,同时提升原本被低估答案的覆盖。 更有意思的是,SimpleStrat 的收益与 temperature 基本正交。它不是简单替代升温,而是提供另一种“结构化随机性”:温度控制局部采样噪声,分层提示控制语义空间覆盖。

生产场景:任务生成

论文还将 SimpleStrat 用于浏览器智能体训练任务生成。系统从随机网页开始,让 SimpleStrat 提出更有挑战性但仍然合理的目标,再让待训练智能体执行任务,并基于轨迹总结生成训练样本。上线后,新生成任务中“困难任务”的比例从约 20% 提升到最高约 60%,基于这些任务训练还能带来内部基准约 5% 的 SFT 性能提升。

四、Stylus:在扩散模型中做适配器组合

从文本多样性到权重空间多样性

SimpleStrat 主要在 prompt 和采样层面工作。论文进一步提出 Stylus,把“恢复多样性”的思想扩展到图像生成模型的权重空间。现代 Stable Diffusion 生态中有大量 LoRA 适配器,分别捕捉角色、风格、对象、场景等能力。问题是:用户很难手动选择合适适配器,多个适配器组合也可能互相覆盖概念,损害图像质量。 Stylus 的目标是自动选择并组合适配器,使生成图像既贴合 prompt,又拥有更高视觉质量和更丰富多样性。

方法框架

Stylus 包含三个阶段。第一阶段是 refiner:用 VLM 读取适配器模型卡,生成更好的文本描述,并编码为向量。第二阶段是 retriever:根据用户 prompt 检索候选适配器。第三阶段是 composer:由 LLM 将 prompt 分解为关键词任务,筛选并组合相关适配器,同时通过随机子集选择引入权重空间多样性。

图6:Stylus 算法框架:系统先构建适配器向量数据库,再按提示检索、筛选、组合 LoRA 适配器完成图像生成。 论文还构建了 StylusDocs,一个包含约 7.5 万个适配器及其预计算嵌入的数据集,用于支持适配器检索和组合评估。

质量与多样性的共同提升

Stylus 的实验覆盖自动指标、人类评测和 VLM-as-a-judge。自动指标显示,Stylus 在 CLIP/FID tradeoff 上相对 Stable Diffusion 1.5 取得更好的视觉质量和相近文本对齐;与 reranker、retriever-only、random 等检索策略相比,Stylus 的 FID 最优,说明组合策略比单纯检索更有效。

图7:Stylus 自动评估指标。相较多种检索策略,Stylus 在 FID 上取得更优结果,并保持接近 Stable Diffusion 的文本对齐能力。 在图像多样性上,给定同一 prompt,Stylus 能生成更丰富的图像集合。其多样性来自两部分:一是适配器 masking 机制,二是 composer LLM 的温度参数。

图8:Stylus 图像多样性样例。相同提示下,Stylus 生成的图像集合更丰富,覆盖更多构图、场景和风格变化。

扩展到图像编辑任务

Stylus 不只适用于 text-to-image,还可以扩展到 image-to-image。论文展示了图像翻译和 inpainting 两类任务:前者在保持内容结构的同时改变风格,后者在遮罩区域中引入新角色或新概念。由于 Stylus 能检索特定 LoRA,它比基础 SD v1.5 更擅长把 prompt 中的风格、角色和对象落实到图像中。

图9:Stylus 在图像到图像任务上的扩展,包括图像翻译和局部重绘。

局限性

Stylus 也有明确局限。首先,适配器可能覆盖或压制其他概念,例如某个 LoRA 强化“火车”后会遮蔽“玩具火车”语义。其次,多主体场景下,适配器可能让多个对象趋同,降低细粒度多样性。第三,composer 使用长上下文提示,会给推理带来额外开销;在 batch size 为 1 时,Stylus 增加的时间占比较高,但随着批量增大,开销会下降。

五、多样性必要但不充分

论文总结

论文最后总结了两条主线。第一,后训练目标具有 mode-seeking 倾向,可能导致生成分布坍缩;第二,部署时方法可以在不修改训练算法和训练数据的情况下缓解多样性损失。SimpleStrat 从 prompt 和采样分布入手,Stylus 从适配器组合和权重空间入手,二者都说明:多样性可以通过外部结构化随机性重新引入。 作者特别强调,这些方法类似强化学习中的 epsilon-greedy:不是改变模型本体,而是在部署策略中加入探索机制。区别在于,SimpleStrat 和 Stylus 不是盲目随机,而是让随机性沿着语义结构、任务分区或适配器功能展开。

未来方向

论文提出几个值得继续研究的问题。第一是训练 delegation agent。SimpleStrat 的自动分层可以看作一个“委派智能体”,负责把总任务拆成不同子空间;未来可训练它最大化信息增益、平衡比例或 Gini impurity。 第二是无放回采样。当前 SimpleStrat 可视为有放回采样,而许多真实场景希望系统知道已经生成过哪些答案,并主动探索尚未覆盖的区域。这对进化式代码搜索、AlphaEvolve、GEPA 等候选解生成场景尤其重要。 第三是保留多样性的 RL 算法。与其在后处理阶段恢复多样性,未来也可以从训练目标本身设计更能保留多峰分布的算法,避免模型在偏好优化中提前坍缩。

创造力问题

论文最后回到一个更大的问题:多样性是否意味着创造力?作者的答案是否定的。多样性是必要条件,因为没有足够多的候选、角度和语义变化,就谈不上新颖性。但创造力还要求选择、意图、语境、审美和长期积累。故事创作不是把不同词句排列出来,而是拥有值得讲述的经验、结构和判断。 因此,这篇论文的价值不只是提出两个方法,更是提醒大模型研究:当我们追求“更对齐、更有用、更安全”时,也要警惕模型把可能性空间压缩得过窄。一个真正强的生成系统,不应只会给出最可能被喜欢的答案,还应能在高质量边界内探索多种合理未来。

结语

《Mitigating Post-Training Effects on Generative Diversity in Language Models》把“生成多样性”从一个模糊审美问题变成了可分析、可测量、可干预的系统问题。它告诉我们,后训练带来的模式收缩不是小毛病,而会影响搜索、测试、合成数据、智能体训练和创造性任务。 SimpleStrat 的启发在于:让模型先理解解空间,再采样答案。Stylus 的启发在于:让系统先理解能力空间,再组合模型部件。二者共同指向一个更一般的原则:高质量生成不应只追求单点最优,而应保留结构化探索的能力。

成为VIP会员查看完整内容
0

相关内容

大模型是基于海量多源数据打造的预训练模型,是对原有算法模型的技术升级和产品迭代,用户可通过开源或开放API/工具等形式进行模型零样本/小样本数据学习,以实现更优的识别、理解、决策、生成效果和更低成本的开发部署方案。
【博士论文】基于多模态基础模型的上下文学习
专知会员服务
24+阅读 · 2025年12月17日
【斯坦福博士论文】基础模型后训练的新方法
专知会员服务
25+阅读 · 2025年11月8日
从数据中心视角出发的高效大语言模型训练综述
专知会员服务
23+阅读 · 2025年10月31日
什么是后训练?大语言模型训练后优化方法综述,87页pdf
大模型时代的个性化生成:综述
专知会员服务
43+阅读 · 2025年3月10日
【博士论文】朝向大规模语言模型的原则性训练与服务
专知会员服务
10+阅读 · 2025年2月10日
统一的多模态文字理解与生成大模型
专知会员服务
30+阅读 · 2024年10月11日
【博士论文】大规模预训练语言模型的高效适配技术研究
专知会员服务
60+阅读 · 2023年11月29日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
Arxiv
28+阅读 · 2021年10月1日
VIP会员
最新内容
《无人机对海面作战影响评估》
专知会员服务
1+阅读 · 今天15:30
印度精确打击与指挥架构的断层
专知会员服务
4+阅读 · 7月20日
美空军AI完成F-16战斗机自主空战历史性试飞
专知会员服务
6+阅读 · 7月20日
深入Project Maven:为何人工智能在战场上依然失灵
锻造未来士兵:外骨骼、基因工程与赛博格
专知会员服务
7+阅读 · 7月19日
相关VIP内容
【博士论文】基于多模态基础模型的上下文学习
专知会员服务
24+阅读 · 2025年12月17日
【斯坦福博士论文】基础模型后训练的新方法
专知会员服务
25+阅读 · 2025年11月8日
从数据中心视角出发的高效大语言模型训练综述
专知会员服务
23+阅读 · 2025年10月31日
什么是后训练?大语言模型训练后优化方法综述,87页pdf
大模型时代的个性化生成:综述
专知会员服务
43+阅读 · 2025年3月10日
【博士论文】朝向大规模语言模型的原则性训练与服务
专知会员服务
10+阅读 · 2025年2月10日
统一的多模态文字理解与生成大模型
专知会员服务
30+阅读 · 2024年10月11日
【博士论文】大规模预训练语言模型的高效适配技术研究
专知会员服务
60+阅读 · 2023年11月29日
相关基金
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员