综述|从参数到行为:大语言模型融合的统一框架与实践边界

论文:From Parameters to Behaviors: A Survey of Model Fusion for Large Language Models 作者:Shuo Cai、Yanggan Gu、Zihao Wang 等 来源:arXiv:2609.19553,论文标注为 Findings of ACL: EMNLP 2026 录用稿 原文链接:论文页面|PDF|论文 HTML|配套论文清单 导读:模型融合常被狭义地理解为“合并权重”。这篇综述把问题重新放到一个更完整的坐标系中:给定多个各有专长的源模型,能否得到一个推理时无需调用完整源模型、却尽量保留其能力的目标模型?作者以构建目标模型时使用的主要信号为准,将方法分为参数融合、表示融合、行为融合三层,并贯通定义、方法、评测、实践建议与风险。本文依照论文正文顺序整理,重点解释三层之间的边界及适用条件;图均截取自原文,中文图题为编译说明。

1 Introduction|引言

开源模型及领域微调模型持续积累,重复训练一个覆盖所有任务的模型并不总是经济。模型融合希望把数学推理、代码、对话或垂直领域等分散能力整合到一个可独立部署的目标模型中。论文的核心贡献不是推出某个新算法,而是给出能同时容纳模型合并与知识蒸馏的统一定义,并综述 150 余篇相关研究。 这一统一视角有现实意义:最便宜的权重平均可能遭遇任务向量冲突;能够观察隐藏状态时,可定位并修复层间表示漂移;只能查询外部模型时,则可通过分布、示例或反馈迁移行为。选择方法首先取决于能访问什么信号,其次才是算法名称。作者还强调,模型融合能服务持续学习和能力复用,但平均成绩提升并不保证每项源能力都被保留下来。

图1|模型融合的总体定义。多个源模型向目标模型提供参数、内部表示或可观察行为;融合完成后,目标模型推理不再依赖完整源模型。图内英文为论文原图,图片来源:原文图1。

图2|代表性模型融合方法的发展时间线。颜色对应三类主要融合层级;图中的 2026 年数量只是部分年度快照,不能视作全年统计。图片来源:原文图2。

2 Definition and Formulation|定义与形式化

论文把模型融合定义为:通过组合参数、对齐表示或蒸馏输出行为,从多个源模型构造一个目标模型,整合源模型知识与能力,同时保持高效推理。设源模型集合为 S,可选融合数据为 D,目标模型参数为 θ,则融合过程可写作 θ=Φ(S,D)。这里 D 可以为空,所以无数据的权重合并与需要数据的表示校准、行为蒸馏均在框架内。 关键约束是推理独立性:目标模型一旦构建完成,生成预测不再需要完整源模型。因此,多模型集成、按请求路由至某个源模型的系统,不属于本文定义的融合;单纯用大模型评审输出,也没有构造目标模型。作者还刻意区分行为蒸馏与仅使用标量奖励的强化学习:若教师在学生自己生成的状态上提供密集的 token 级目标或等价的分布约束,可算在策略蒸馏;只返回一个奖励分数、没有迁移教师输出行为,则不算。 形式化目标是减少目标模型在各源任务分布上与相应源模型的输出差异。这是能力保留的统一表述,并不是说所有方法都必须直接优化同一个损失函数。由此可见,分类依据是构建或更新目标模型时的主导信号,而非最后产物是否也是一组参数。

3 Taxonomy of Model Fusion|模型融合分类

图3|论文提出的模型融合分类树。参数层细分为算术规则、子空间、优化和模块;表示层分为加权、闭式求解和反向传播;行为层分为分布、示范、反馈,并另标注在策略学习;最下方是评测资源。图中方法仅为代表,不是穷尽清单。图片来源:原文图3。

3.1 参数层融合

若多个源模型共享参考参数 θ₀,可将第 i 个模型相对参考模型的变化写作任务增量 Δᵢ。参数层方法对这些增量做加权、屏蔽、缩放、置换或子空间投影,再合成目标参数。其优点是通常不必反复查询源模型,也可以完全不依赖训练数据;其前提是参数坐标有可比较性,至少要认真处理结构、初始化和词表兼容性。 论文将参数层方法分为四组。算术规则包括随机权重平均、Model Soups 和 Task Arithmetic;后者把微调前后的参数差看作可加减的任务向量。Fisher Merging 等方法根据参数重要性赋权,而 TIES-Merging、DARE、DELLA-Merging试图通过符号一致性、稀疏化或重标定减少任务增量冲突。子空间方法利用奇异值分解等工具辨别共享方向和任务特有方向,降低不同能力相互覆盖的风险。优化方法如 AdaMerging 学习不同任务或层的融合系数;即便系数是从无标签数据中估计出来,只要它服务于源参数的组合,仍归入参数层。模块方法融合 LoRA、Adapter、投影器等可插拔部件,适合参数高效微调的场景。 这里最容易误解的是“能平均”不等于“平均后能兼顾能力”。源模型虽来自同一底座,微调方向也可能冲突;而来源不同的模型若连参数对应关系都没有,直接求平均通常缺少合理解释。参数层的实际价值是为兼容模型提供低成本基线,再据保留率和干扰程度决定是否需要修复。

3.2 表示层融合

表示层以隐藏状态、注意力、激活统计等中间表示为主要融合信号,目标是在对齐后的层或组件上,缩小源模型与目标模型的表示差异。这里的“对齐”可包含层匹配、归一化、维度投影;距离可采用均方误差、余弦或相关性差异、分布矩等。它比仅看权重更容易发现“参数已经合并,内部特征却发生漂移”的问题,但需要内部访问权限和校准样本。 作者概括了三条路径。第一,表示驱动的加权与匹配:利用激活量级或子空间估计合并权重,或用单元相似度、最优传输建立组件对应关系,代表方法包括 AIM、MAGIC、REPAIR、ZipIt!。第二,局部闭式求解:把线性层的表示匹配化成回归问题,直接求解;RegMean 使用输入协方差,RegMean++考虑层内与跨层依赖,FeatCal 进一步校准沿网络前向传播累积的漂移。第三,反向传播修复:训练目标模型或轻量修复模块,使隐藏状态、注意力等对齐;Patient KD、TinyBERT、TED 将中间层监督纳入蒸馏,Representation Surgery 系列则着重修补初步合并后的表示偏差。 三条路径对应不同开销:加权快,但对校准数据敏感;闭式方法适合可对齐的线性部件;反向传播可处理更复杂失配,却需要更多数据、训练与正则化。论文提醒,融合后表示漂移的诊断、异构模型之间的层对齐,仍是未解决问题。

3.3 行为层融合

行为层不要求拿到源权重或隐藏状态,而是用源模型可观察的输出训练一个目标模型。行为信号可以是 token 分布、logits、完整回答、推理步骤、工具使用轨迹,也可以是有来源可追溯的偏好、批评、纠错或验证器反馈。它适合闭源或异构源模型,但不能把“用了一个外部评分器”一概称为模型融合;必须确有源模型行为向目标模型转移。 论文按信号将其分为三类。分布融合对齐软标签或输出概率,经典知识蒸馏与 FuseLLM 类工作属于此类;细粒度分布信息丰富,但可能需要昂贵的 logits 访问。示范融合使用源模型生成的回答、推理链和轨迹,访问门槛低,却可能复制错误推理、风格偏差与数据噪声。反馈融合利用多源答案的排序、偏好、修正或验证标签来调整目标模型,适合对齐和安全能力迁移,但质量受评估器与反馈可靠性制约。 另一个与上述三类正交的区分是离策略与在策略。离策略方法在固定数据上训练,便于扩展,但学生部署时遇到的状态可能不在训练分布内。在策略蒸馏先让目标模型生成前缀、回答或轨迹,再让源模型针对这些状态给出监督;GKD 等方法由此针对学生真实会犯的错误学习。代价是反复查询教师和训练目标模型,预算、稳定性及多源行为冲突随之成为关键约束。

3.4 评测

指标。 论文首先区分目标模型在任务池上的平均表现与逐任务的归一化能力保留率。如果模型在四项任务上大幅提高、在第五项关键任务上显著下降,仅看平均值会误判融合成功。还应观察干扰程度、未见任务泛化、对齐、安全性,以及融合和推理成本。 基准。 一个有效的融合基准不仅是排行榜,还应给出统一的源模型池、任务池与评测协议。FusionBench 支持多种参数层方法在共享设置下比较;MergeBench 侧重领域源模型的能力保留、泛化和成本。当前可复用资源仍偏重参数层,表示层常在具体论文中评测漂移,行为层多借用蒸馏或安全任务基准。论文因此建议未来统一报告源模型设置、逐能力保留、最差任务退化、行为迁移与融合开销。

4 Practical Takeaways|实践启示

图4|三种融合层级的典型信号与实践权衡。图中的数据需求和源模型访问条件表示常见相对要求,并非绝对门槛;完整流水线可以组合多个层级。图片来源:原文图4。 第一,按可用信号和失效模式选方法。 同架构、同初始化、同词表且可获取权重时,可先试参数合并;若融合后出现明显层表示漂移,并能访问隐藏状态,可做表示校准;当只有回答可用或源模型高度异构时,行为蒸馏更现实。这个顺序是工程筛选路径,不是性能排名。 第二,跨层级排名随数据与预算变化。 论文只采用同一研究内的对比以减少条件混杂:在 M2RL 的五领域设置下,TIES 与 TA+DARE 的均分分别为 61.00、60.99,行为层 MT-OPD 为 60.46,但后者报告约 967.9 GPU 小时训练;在 MergeBench 的另一组任务中,RegMean 为 46.3,介于 TIES 的 46.8 与 DARE 的 45.2 之间。ProDistill 在 16、32 样本下落后于 Task Arithmetic,在 64 样本下以 0.2496 略高于其 0.2448。这些数字属于不同实验设置,不能互相横比或推出统一优胜者。

第三,跨层级流水线有互补性。 先用低成本参数合并得到目标,再以表示校准修复内部漂移,仍有缺失能力时增加行为监督,是论文归纳出的实用路线。原文所引同论文对比中,FeatCal 将 Task Arithmetic 六任务均分从 63.5 提升至 65.8;Patient KD 将 RACE 准确率从 58.74 提升至 60.34。它们说明“增加第二种信号可能有效”,并非保证所有融合任务都会获益。

5 Challenges and Future Directions|挑战与未来方向

理论基础与适用条件

目前仍难在构建目标模型前可靠预测:哪些源模型可兼容、目标容量是否足够、何时会损失某一源能力。针对相近参数盆地或特定平均策略的理论,尚不能直接推广到表示对齐与行为蒸馏。研究需要把源模型差异、数据覆盖、目标容量与能力保留联系起来,给出可检验的适用条件。

异构源模型的对齐

不同架构、参数化、词表、模态接口,会同时破坏权重坐标、隐藏状态对应与输出空间的可比性。最优传输、投影和跨模型翻译提供了探索方向,但对齐错误会让源能力相互干扰,甚至形成表面上均分提高、实则重要能力丢失的结果。

多源能力保留的评测

应围绕“每个源模型的优势是否仍在”建立评测,而不只报告目标平均分。论文主张共享源设置,检查最差任务退化、跨能力干扰、成本和单模型推理条件,并把表示漂移与行为迁移纳入可复现协议。对于持续融合,还须记录新知识加入后旧能力的遗忘曲线。

融合中的风险转移

恶意参数更新、后门、不安全回答和隐私信息可能随参数合并或行为蒸馏进入目标模型;源模型移除后风险也可能仍然存在。作者建议对源模型与贡献进行筛查、溯源和归因,融合后再做专门安全测试。原论文指出已有攻击与防御研究,但尚没有一套保证所有融合设置安全的通用机制。

6 Conclusion|结论

这篇综述最重要的判断是:模型融合的共同目标是形成可独立推理的单一目标模型;参数、表示、行为是按主要融合信号划分的三层,而非互斥的工艺流程。 三层各有优势与代价,现有研究不支持“某一层始终最佳”的结论。面向实际应用,应该先检查可访问性与兼容性,再用逐能力评测发现退化,必要时叠加表示修复或行为监督,并始终计入安全与部署成本。

Limitations|论文局限

作者承认领域更新迅速,最新预印本或细节未公开的工业系统可能未被覆盖;一些方法横跨多个层级,按主导信号归类存在边界争议。论文中的跨研究数字只用来说明条件依赖,模型规模、数据、调参和硬件成本没有统一控制,不能视为严格的跨方法排行榜。读者引用具体效果时,应回查相应原论文的设置与方差报告。

Appendices|附录导览

原文附录 A 给出符号定义;附录 B 讨论持续学习、多任务与领域能力整合、安全控制、模型压缩四类应用;附录 C、D、E 分别扩展参数层、表示层、行为层方法表;附录 F、G 对照融合基准与评测指标;附录 H 补充持续融合的遗忘问题和大规模部署成本。本文为控制篇幅未逐表翻译,具体方法与基准细节可从上方论文链接核对。

成为VIP会员查看完整内容
0
VIP会员
最新内容
致命七类无人机:无人机时代的演进型合成兵种
《异构无人水面艇集群作战自主制导算法》130页
微信扫码咨询专知VIP会员