综述|最优传输遇见强化学习:从分布匹配到稳健决策

论文:Optimal Transport Meets Reinforcement Learning: A Survey 作者:Yujie Zhu、Charles A. Hepburn、Matthew Thorpe、Giovanni Montana,英国华威大学 来源:arXiv:2610.01413,2026 年 10 月 1 日提交的综述预印本 原文链接:论文页面|完整 PDF 导读:强化学习中的许多问题,本质上都在比较分布:学习者与专家访问了哪些状态,新策略与旧策略如何分配动作,世界模型预测的转移与真实环境差多少。当这些分布重叠很少时,常用散度可能难以提供有效指导。最优传输(OT)通过“把概率质量从一处分布搬到另一处分布的最小代价”引入任务几何,为模仿、策略优化、离线学习和稳健控制提供另一类工具。 这篇 72 页综述以四个问题贯穿全文:OT 在目标中起什么作用?比较哪些分布?采用哪种传输形式?如何处理时间结构? 本文严格沿原文九节正文组织,保留方法选择、局限和开放问题。配图为原论文截图,图内标签保留原文,图题和说明使用中文。作者主要覆盖截至 2026 年 4 月的工作,并于 9 月更新参考文献;各方法的结果依赖任务和实验设置,论文没有建立统一性能排行榜。

1 Introduction|引言

强化学习让智能体通过动作影响未来状态并优化长期回报。除了奖励最大化,算法还不断比较策略诱导的分布:模仿学习比较学习者和专家的访问“足迹”;信赖域方法限制新旧策略变化;离线学习约束策略偏离数据的程度;稳健控制考虑环境转移可能发生的变化;课程学习则逐步调整训练任务分布。 KL、JS 等散度主要逐点比较密度。在学习者与专家访问区域几乎分离时,某些方向的 KL 可能无穷大,JS 判别器也可能饱和。OT 用点对之间的基础代价函数衡量搬运质量的代价:机器人动作可采用运动学距离,导航可考虑可达路径,高维视觉观测可进入学习得到的特征空间。由此,OT 能在支持集不重叠时仍表达“相距多远”。 但“采用 OT”不等于自动获得正确几何。错误的代价、过强的熵正则、不稳定的对偶网络或忽略时序的耦合,均可能产生误导信号。综述因此按 OT 的算法角色组织文献:奖励信号、正则项、信赖域约束、分布不确定性集合、模型损失等,并区分核心 RL 工作与迁移、偏好学习等相关应用。 图1|最优传输在强化学习流程中的主要角色:模仿、信赖域、分布式价值学习、世界模型、离线约束和稳健性。图中的 W 泛指不同应用采用的 OT 差异量,并不都等于同一种距离。来源:原论文图1,PDF 第4页。

2 Preliminaries|预备知识

2.1 强化学习基础

马尔可夫决策过程包含状态、动作、转移、奖励、折扣因子和初始状态分布。策略 π(a|s) 是给定状态的动作分布;它与环境动力学共同诱导完整轨迹分布。折扣占用测度将各时间步访问状态—动作对的概率按折扣加权,并归一化成概率分布,描述策略“在哪里停留、在那里做什么”。它受到环境流量守恒约束,不能任意指定。 需要区分四种常用对象:每状态动作分布用于局部策略约束;占用测度用于整体访问行为比较;轨迹分布或轨迹嵌入用于行为级比较;回报分布用于描述随机收益。把一条轨迹的状态组成经验分布,可简化计算,却丢弃了出现顺序。轨迹长度、访问频率相同,也可能代表完全不同的行动过程。

2.2 最优传输基础

OT 给定源分布 μ、目标分布 ν 和代价 c(x,y),寻找满足两边边缘分布约束的耦合 Γ,使总搬运代价最小。耦合允许一个位置的质量分到多个目的地;确定性传输映射则要求每个源点只有一个目的地。若基础代价由距离的 p 次方构成,再取适当根,可得到 p 阶 Wasserstein 距离。 代价函数是建模选择。 同一对分布,改变“哪些点匹配更便宜”,就会改变最优计划。因此,像素接近、动作接近、动力学接近和任务价值接近不可直接混用。一个最简单的例子是两个不同位置的点质量:OT 可返回两点间距离,逐点密度比较却难以表达移动的幅度。 图2|相同边缘分布,不同基础代价产生不同匹配。左图同序号匹配便宜,右图交叉匹配便宜。几何由代价定义,而非由“使用 OT”自动决定。来源:原论文图2,PDF 第7页。 精确离散 OT 可解线性规划,但大样本成本较高。熵正则化用平滑换取更稳定、易求解的计划,常采用 Sinkhorn 迭代;熵系数过大又可能使计划过于弥散。Sinkhorn 散度减去自传输偏置,使同一分布与自身的差异为零,但不应据此把它一概称为度量。W₁ 对偶形式常训练满足 Lipschitz 条件的势函数;W₂ 在一定条件下可通过凸势的梯度表示传输映射。切片 Wasserstein 则把高维比较拆成多个一维投影以降低开销。 若两域之间缺少合理的直接点对代价,Gromov–Wasserstein(GW)比较各域内部的相对关系。若示范或数据含离群点、缺失覆盖或质量不一致,平衡 OT 的全量匹配可能不适合:部分 OT只匹配指定质量,非平衡 OT通过边缘偏差惩罚允许质量变化。二者也需要校准匹配量或惩罚强度。 图3|三种质量约束。平衡 OT 精确满足边缘分布;部分 OT 只传输一部分质量;非平衡 OT 以代价允许质量创建或消失,并软约束边缘。点的大小表示相对质量。来源:原论文图5,PDF 第12页。

3 Imitation Learning and Reward Inference|模仿学习与奖励推断

3.1 用占用测度理解模仿

模仿学习可写成让策略的状态—动作占用测度接近专家占用测度。若只取得专家观测而没有动作,则需比较状态或转移表征,目标本身也随之改变。状态访问接近并不在所有条件下都保证动作相同、回报相同,结论依赖动力学和其他假设。

3.2 最优传输为何有用

训练初期,学习者和专家的访问区域常不重叠。OT 可按任务几何指示向哪些状态移动,而非只告诉算法两者可分。收益取决于观测特征是否保留可达性与目标信息;视觉相似却无法到达的状态,可能在错误表征中被认为非常接近。

3.3 在线对抗式奖励塑造

WAIL 等方法以 Wasserstein 目标替换传统判别式差异,交替训练学习者与对偶势函数,再把势函数转为奖励。另一些方法使用原始熵正则 OT 或 Sinkhorn 目标。其优势是弱重叠条件下仍有几何信号;代价是额外优化、Lipschitz 控制和小批量过拟合问题。这里的传输势函数与 RL 中估计回报的价值网络,需要按作用区分。

3.4 离线奖励标注

OTR、PWIL 类方法从学习者/数据轨迹和专家轨迹的经验测度求出耦合,把匹配代价分摊为逐步伪奖励,再接入标准 RL 流程。这样可避免持续在线的对抗训练,但每个状态的标签可能依赖整条轨迹的匹配。同一状态在不同轨迹中得到不同奖励,是这种标注方式的自然结果。 图4|离线奖励标注的耦合矩阵示例。行对应学习者状态,列对应专家状态,逐行匹配代价可转成伪奖励。图中矩阵展示一种耦合,原文明确它不一定是最优耦合。来源:原论文图3,PDF 第8页。

3.5 时间与意图感知扩展

把轨迹视为无序状态集合,可能把动作顺序反转或速度不同的轨迹匹配得很近。修正有两条路径:在耦合中加入近对角带、时间掩码和上下文窗口;在代价中引入短期动力学、目标意图或可达性特征。前者约束匹配顺序,后者改变什么算行为相近。窗口过窄会限制合理速度变化,过宽又可能恢复错误匹配。 图5|普通 OT 可产生跨时间的错误对应;带状约束或上下文代价使匹配保持局部时间一致性,同时容许有限速度变化。来源:原论文图7,PDF 第18页。

3.6 跨域模仿

机器人形态或观测空间不同,源状态与目标状态之间可能不存在自然的欧氏距离。GW 通过保持各域内部关系做对应,为异构模仿提供路线。但若已有可靠共享表征,标准 OT 往往更简单;使用 GW 仍需承担更复杂的优化与关系失配。

3.7 本节小结

模仿中的 OT 可以提供在线奖励,也可生成离线标签;比较占用测度与比较经验轨迹不是同一问题。代价设计与时间处理往往比求解器名称更影响奖励质量,多专家数据也应谨慎处理模式混合。

4 Policy Optimisation and Regularisation|策略优化与正则化

4.1 经典策略优化

TRPO 用 KL 信赖域,PPO 通过概率比裁剪控制更新。它们关注同一动作的概率如何变化。OT 进一步考虑概率质量在动作空间中移动多远,适合动作具有有意义的几何结构时使用。

4.2 最优传输信赖域

在给定状态下约束新旧动作分布的 Wasserstein 距离,可让相近动作间移动概率更便宜。连续控制中,小幅关节变化与方向逆转应有不同代价。但局部动作距离小,不直接保证整个轨迹变化小;约束半径与状态取样仍影响稳定性。若动作间没有有用几何,增加 OT 未必带来收益。

4.3 潜在空间的行为引导

有些方法把轨迹映射为行为嵌入,再约束不同策略诱导的嵌入分布,用来靠近目标或维持行为多样性。相比逐状态动作约束,这更贴近整体行为,但嵌入可能丢失关键时序或发生分布偏移,需要检查哪些差异被保留。

4.4 梯度流与自然梯度

Wasserstein 梯度流把策略更新视为分布空间中的近端优化;Wasserstein 自然梯度则改变参数更新采用的局部几何。粒子和神经传输映射可近似实现这种更新,但受限方向或数值求解不应等同于精确连续梯度流。函数逼近下的稳定性与误差分析仍有限。

4.5 基于运输距离的价值学习

分布式强化学习估计完整回报分布,而非只有期望;一维回报的 Wasserstein 比较可借助分位数,QR-DQN 是代表。SinkhornDRL 等扩展到粒子表征及多维奖励。另一条路线如 Wasserstein Q-learning,用 Wasserstein 重心更新 Q 值后验分布,表达估计不确定性。前者描述回报随机性,后者描述价值知识的不确定性,不能互相替代。收缩保证也取决于具体算子、投影与假设。

4.6 本节小结

OT 在策略侧可控制动作或行为变化,在价值侧可成为分布损失。选用前先明确运输对象;若只是优化稳定性,经典 KL/PPO 方法应保留为比较基线。

5 Model-Based RL and Wasserstein World Models|基于模型的强化学习与世界模型

5.1 基于模型的强化学习

学习环境转移可提升数据利用率,但多步预测会放大局部误差。世界模型是否好,关键不仅是平均预测误差低,还在于错误是否改变规划和控制结果。例如,相同位置误差在抓取容差方向上无害,在垂直于容差的方向上可能导致失败。

5.2 价值感知模型学习

比较真实与学习到的下一状态分布,OT 可按控制相关几何惩罚偏差。在价值函数满足相应 Lipschitz 条件时,Wasserstein 误差可约束预期价值误差。这个联系需要条件成立;OT 不会自动发现抓取容差,必须通过方向加权、可达性或价值相关代价表达。

5.3 双模拟与马尔可夫结构传输

双模拟式状态距离结合即时奖励差异和下一状态分布差异,判断哪些状态在长期决策上等价。把 OT 放入距离的固定点,可保留动力学结构。与无序状态匹配相比,马尔可夫结构的耦合更重视合法转移,却也增加求解难度。

5.4 潜在世界模型

Wasserstein 自编码与 OT 潜在模型可在压缩空间匹配状态、转移或轨迹,学习控制相关的抽象表示。视觉等高维观测通常需特征代价;只优化重建可能留下与决策无关的细节,压缩过度则会丢失规划信息。

5.5 本节小结

模型学习用 OT 拟合转移,稳健控制用 OT 防备转移偏移,两者目的不同。小批量 Sinkhorn、部分/非平衡匹配及流匹配提供扩展思路,但表示质量、覆盖缺口和多步误差仍应单独检验。

6 Offline Policy Optimisation and Regularisation|离线策略优化与正则化

6.1 离线强化学习基础

离线 RL 只能使用固定数据。策略选择数据中少见的动作时,价值网络可能错误外推。约束策略接近行为数据能缓解这一问题;OT 把“接近”定义为动作空间中的搬运代价。移动方向相同的 4 厘米与 5 厘米动作之间插值,在合适几何下比反向动作更近,但距离近不能证明动作安全或价值高。

6.2 策略约束、部分和非平衡匹配

BRAC 将行为差异作为策略或价值目标的模块,BRAC-W 使用对偶 Wasserstein 惩罚。Q-DOT 采用凸势/输入凸神经网络构造 W₂ 传输映射,提供不依赖判别器的路线,但有凸性和表示条件。另一些方法把更新解释为分布梯度流,其近似与有限预算依然限制偏离幅度。 面对次优或污染数据,强制复制全部行为会妨碍改进。部分策略学习(PPL)采用单侧不完整传输的动机,松弛目标侧约束;不能简单把它等同于只保留某个固定百分比样本。非平衡方法则软约束边缘,允许重加权质量。二者并非自动找出“好数据”,选择仍依赖代价、价值估计和松弛强度。

6.3 本节小结

离线 OT 方法的作用有三类:限制 actor 偏离、为数据生成奖励、筛选/加权数据。小批量目标也不同于完整分布 Wasserstein 目标;梯度对小批量目标无偏,不意味着对总体 OT 无偏。数据覆盖窄、价值外推差时,距离工具本身无法解除限制。

7 Robustness, Safety and Transfer|分布偏移下的稳健性、安全与迁移

7.1 运输距离不确定性集合

围绕名义转移分布建立 Wasserstein 球,再按球内最坏情形优化策略,可训练智能体应对合理动力学偏移。代价决定哪些变化合理,半径决定保守程度;半径太大可能损害正常任务回报,太小则无法覆盖部署变化。 图6|分布稳健强化学习的不确定性集合。蓝点为名义转移分布,红点为集合中的最坏情形;基础度量与半径共同决定可考虑的扰动。来源:原论文图12,PDF 第38页。

7.2 访问分布与安全控制

将策略状态访问分布向安全参考分布靠近,可把避障偏好加入奖励。它是几何感知的软机制,不等于硬安全约束;参考分布不准,策略就可能被推往错误区域。论文所引部分证据来自较小离散任务,应用范围需要结合原研究判断。

7.3 动作不确定性评分

当缺少安全参考,可比较当前 Q 值与更新目标诱导的动作分布,以 Sinkhorn 耦合中的质量变化识别不稳定动作。该评分用于调整探索与选择,表达价值估计变化,而不是直接测量真实事故概率。

7.4 偏好偏移与人类反馈

偏好数据分布变化也可建模为不确定性集合,对 DPO、REBEL 等目标做分布稳健优化;另有方法以 OT 对齐偏好、奖励或 token 表征。综述将这些列为与序贯决策有关的邻近方向,其证据不能直接解释为经典 RL 环境中的统一提升。

7.5 奖励歧义

同一专家行为可能由多种奖励函数解释。把这些奖励映射到几何空间,并用 Wasserstein 距离描述差异,可研究奖励解释的不确定性;它提供度量视角,并不消除逆强化学习的不可辨识性。

7.6 迁移

OT 可对齐源域和目标域的共享特征分布,或用匹配分数筛选、加权数据;空间异构时可考虑 GW。跨域几何、覆盖和代价噪声决定迁移质量。硬阈值筛选容易因错误代价丢掉有用数据,软重加权通常是更稳妥的初始实验。

7.7 本节小结

稳健性比较环境变化,安全塑造访问行为,偏好对齐处理反馈变化,迁移寻找域间对应。虽然都使用 OT,其对象与保证不同;半径、惩罚权重和参考几何均需校准。

8 Other Applications|其他应用

8.1 多策略与技能

技能发现可奖励不同策略访问分布之间的 Wasserstein 分离,鼓励覆盖不同区域;这里追求远离,与模仿中的靠近方向相反。多样性是否有用仍取决于特征和任务,单纯拉大距离可能得到无意义行为。

8.2 多智能体强化学习

OT 可用于策略协调、资源分配或把访问分布拉向共同重心。核心取舍是比较团队联合分布还是各智能体边缘分布:前者保留交互但规模大,后者更便宜却可能漏掉协同关系。即使策略去中心化,单体访问分布也受全体策略通过环境动力学的影响。

8.3 课程生成

以 OT 插值、重心或接近约束在容易任务与目标任务之间生成课程,可同时约束“接近最终目标”和“当前策略能够解决”。几何插值出的任务不一定物理可行或可学,必须考虑任务语义与可达性。

8.4 进一步交叉方向

论文还讨论组合问题中的 Sinkhorn 指派、生成轨迹对齐、探索奖励、学习效率评价,以及上下文老虎机和因果流等相关工具。部分工作属于邻近领域,作者把它们视为可能启发 OT-RL 的方向,而非已经成熟的通用方案。

8.5 本节小结

这些方向比模仿、离线约束和策略优化更分散。评价时应检查额外统计和计算成本,以及运输对象是否足以描述想要的多样性、协同或任务进度。

9 Discussion|讨论

9.1 跨应用权衡

第一是匹配锐度与稳定性:W₁ 对偶能提供几何信号,却依赖 Lipschitz 控制;熵正则便于求解,却引入平滑与偏置。第二是表示与时间:特征空间可改善高维比较,但错误嵌入会歪曲任务几何;时间掩码可避免错误对应,却限制匹配自由度。第三是超参数校准:熵系数、不确定性半径、部分匹配量和边缘惩罚,尚缺跨任务统一的数据驱动规则。

9.2 何时适合最优传输

OT 特别适合弱支持重叠、具有明确动作/状态几何、需要显式耦合分配奖励,或异构空间关系匹配的任务。当分布已充分重叠、几何无任务意义、样本极少或计算预算不足时,额外优化可能不划算。论文指出,部分邻近性和轻量时间基线可在广泛基准上匹敌 OT 奖励标注,应在固定表示、奖励变换和下游算法后比较,以分辨收益来自表征还是耦合。

9.3 实践指南

原文表1提供初始实验建议:在线模仿尝试特征空间 Sinkhorn 散度;离线奖励标注结合熵正则与时间掩码;策略信赖域比较逐状态动作分布;离线约束保留 Wasserstein 行为惩罚基线;世界模型比较控制相关的下一状态特征;稳健控制校准不确定性半径。作者明确这些是起点,尚未被证明为所有问题类别的最佳默认设置。 实施时先确定运输对象和单位,再缩放代价;熵系数应相对典型点对代价设置。Sinkhorn 可用对数域迭代,对缓慢变化的问题热启动;对偶网络容量与 Lipschitz 控制需适合批量大小。长轨迹先试窗口与掩码,并记录样本量、求解器成本和任务回报。完整 OT、切片、熵正则、小批量和受限耦合可能改变优化问题,比较时应明确所用近似。

9.4 开放问题

耦合结构何时不可替代? 需要隔离表示、代价、时间和求解成分,找出多模式、质量失配或严重时序错位中耦合真正必要的条件。 如何扩展与摊销计算? 当前方法常每次更新重新求 OT。学习可复用映射或势函数、采用投影近似,可降低成本;高维长时域控制的结构化传输仍难扩展。 如何把质量失配当作常见情形处理? 真实数据混杂且不完整,需要根据覆盖、价值误差和不确定性校准部分匹配量与边缘惩罚,而非只靠调参。 如何建立现实函数逼近下的理论? Wasserstein 信赖域、自然梯度和近端更新仍需更完整的稳定性、样本复杂度和误差分析,并区分代价表示错误与数值优化错误。 论文最后强调,OT 为强化学习提供了比较分布的几何语言。下一步应验证这种几何何时改善决策,并建立可校准、可扩展的方法。原文附录给出符号表、各节方法对照及环境级证据表;完整定义和文献请查阅文首链接。

成为VIP会员查看完整内容
0

相关内容

强化学习(RL)是机器学习的一个领域,与软件代理应如何在环境中采取行动以最大化累积奖励的概念有关。除了监督学习和非监督学习外,强化学习是三种基本的机器学习范式之一。 强化学习与监督学习的不同之处在于,不需要呈现带标签的输入/输出对,也不需要显式纠正次优动作。相反,重点是在探索(未知领域)和利用(当前知识)之间找到平衡。 该环境通常以马尔可夫决策过程(MDP)的形式陈述,因为针对这种情况的许多强化学习算法都使用动态编程技术。经典动态规划方法和强化学习算法之间的主要区别在于,后者不假设MDP的确切数学模型,并且针对无法采用精确方法的大型MDP。

知识荟萃

精品入门和进阶教程、论文和代码整理等

更多

查看相关VIP内容、论文、资讯等
【伯克利马毅老师】强化学习与最优控制综述
专知会员服务
79+阅读 · 2022年4月26日
专知会员服务
174+阅读 · 2021年8月3日
专知会员服务
240+阅读 · 2020年1月23日
MIT新书《强化学习与最优控制》
专知会员服务
283+阅读 · 2019年10月9日
「强化学习可解释性」最新2022综述
专知
12+阅读 · 2022年1月16日
【深度强化学习】深度强化学习揭秘
产业智能官
21+阅读 · 2017年11月13日
国家自然科学基金
44+阅读 · 2015年12月31日
国家自然科学基金
41+阅读 · 2015年12月31日
国家自然科学基金
24+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2014年12月31日
国家自然科学基金
11+阅读 · 2012年12月31日
国家自然科学基金
10+阅读 · 2012年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
12+阅读 · 2008年12月31日
Arxiv
21+阅读 · 2022年11月8日
VIP会员
最新内容
刚刚!Jev中文教程项目发布了
专知会员服务
0+阅读 · 今天12:14
《人工智能赋能的适应性多功能电磁战》
专知会员服务
12+阅读 · 9月29日
俄乌战场实验室:全面战争如何重塑现代作战
专知会员服务
8+阅读 · 9月29日
2026年美空军协会会议上的无人机系统趋势
专知会员服务
11+阅读 · 9月28日
反制无人机:乌克兰提供的五点启示
专知会员服务
16+阅读 · 9月23日
《各指挥层级均亟需红队能力》报告
专知会员服务
11+阅读 · 9月23日
相关基金
国家自然科学基金
44+阅读 · 2015年12月31日
国家自然科学基金
41+阅读 · 2015年12月31日
国家自然科学基金
24+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2014年12月31日
国家自然科学基金
11+阅读 · 2012年12月31日
国家自然科学基金
10+阅读 · 2012年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
12+阅读 · 2008年12月31日
微信扫码咨询专知VIP会员