强化学习正在经历一次范式扩展。经典强化学习关心智能体如何在环境中通过试错最大化长期回报;多智能体强化学习进一步引入竞争、协作、均衡与激励;而在基础模型时代,生成模型、扩散模型、视频世界模型和长时序记忆又开始成为决策系统的一部分。Zihan Ding 的 Princeton 博士论文《Reinforcement Learning: From Algorithms To Foundation Models》正是围绕这条主线展开:从算法基础走向基础模型,从博弈中的策略学习走向能建模世界、生成未来、服务规划与控制的新型 RL 系统。 这篇论文不是单一方法论文,而是一组相互衔接的研究:前半部分研究游戏中的多智能体 RL,包括两人零和博弈、复杂视频格斗环境和多人一般和博弈;后半部分研究基础模型时代的 RL,包括扩散世界模型、Consistency 模型作为策略、少步视频生成的 RL 后训练、交互式视频世界模型,以及带记忆的长时序世界模型。 如果要用一句话概括,论文试图回答的是:当强化学习从小规模 MDP 走向复杂交互环境和生成式基础模型时,算法、模型和系统应如何共同演化?这也是当前智能体研究、世界模型研究和生成式 AI 后训练共同面对的问题。
论文题目:Reinforcement Learning: From Algorithms To Foundation Models 作者:Zihan Ding 学校:Princeton University 院系:Department of Electrical and Computer Engineering 导师:Chi Jin 论文时间:2026 年 5 月 arXiv:2607.17560v1 链接:https://arxiv.org/pdf/2607.17560
论文第一部分先回到强化学习的基本问题:智能体与环境交互,基于状态选择动作,环境返回下一个状态和奖励,智能体通过策略优化最大化长期累计回报。这个框架看似简单,却可以承载从游戏、网络系统到机器人控制、视频生成和世界模型的多种问题。
在单智能体环境中,核心对象包括 MDP、策略、价值函数、Bellman 方程、值迭代和策略梯度。论文用这些内容建立统一语言:状态转移描述世界如何变化,奖励定义目标,价值函数评估未来收益,策略优化则把智能体推向更高回报。 但真实智能系统往往不只面对一个固定环境。其他智能体的行为会改变环境,奖励函数可能彼此冲突,最优策略也不再只是单个智能体的最优,而要考虑 Nash 均衡、Markov game、potential game 等博弈结构。论文由此自然进入多智能体强化学习:从“如何最大化自己的回报”扩展到“如何在其他策略也在变化的系统中学习稳定、不可轻易被利用的行为”。 这也是论文标题中“From Algorithms To Foundation Models”的第一层含义:RL 先要有清晰的算法与博弈基础,之后才能进入更复杂的基础模型时代。
论文第二部分聚焦游戏场景。游戏是强化学习的重要试验场,因为它同时具备明确目标、可控环境、多样策略空间和可重复评测。作者先研究两人零和 Markov game,提出 Nash-DQN 与 Nash-DQN-Exploiter,将单智能体 DQN 与 Nash 均衡求解思想结合,试图在连续状态和函数逼近条件下学习更难被 exploit 的策略。 Nash-DQN 的关键在于,不再只学习单个动作价值,而是在每个状态下近似一个两人博弈的 Q 矩阵,并基于 Nash 策略进行行动选择。Nash-DQN-Exploiter 则额外训练一个利用者,让主智能体暴露弱点并被迫改善。这种设计把探索过程与对抗压力结合起来:智能体不是在随机扰动中被动探索,而是在对手不断寻找漏洞的过程中修补策略。 论文随后将这一思想推向更真实的游戏环境,构建 FightLadder 基准。相比棋盘或小型表格博弈,格斗游戏具有像素输入、连续动作节奏、复杂时序依赖和强对抗性,更接近真实多智能体系统中的非平稳学习挑战。
FightLadder 的意义不仅是“多了一个游戏环境”,而是把 fully competitive two-player setting 做成可系统评测的研究平台。论文强调,现有多智能体基准很多偏合作或小规模,而完全竞争环境中,策略之间的可利用性、种群训练、Elo 分布和 payoff matrix 都是重要指标。一个真正好的竞争型智能体,不能只在固定对手上得分高,还要在面对新的 exploiter 时保持稳健。
在两人零和游戏中,一个玩家收益的增加对应另一个玩家收益的减少,Nash 均衡有相对清晰的结构。但现实系统往往是多人一般和博弈:不同智能体既可能冲突,也可能部分一致;整体系统目标可能是公平性、稳定性、吞吐或资源效率,而不是某个玩家的单独胜负。 论文第五章以网络负载均衡为例研究多人一般和环境。每个负载均衡器只能看到局部观测,需要把请求分配到服务器,同时与其他负载均衡器共同影响系统延迟和公平性。这一问题天然具有部分可观测、多智能体耦合和实时决策属性。
这一章的理论支点是 Markov potential game。它把多智能体的局部激励与一个全局 potential function 联系起来:虽然每个智能体只做自己的局部更新,但如果激励结构满足某些条件,整体系统可以被一个全局势函数刻画。这为分布式 RL 提供了桥梁:不必让每个智能体掌握全局信息,也能通过合适的奖励设计和潜在博弈结构逼近稳定解。 从公众号读者角度看,这部分最值得关注的是“RL 如何进入系统工程”。网络负载均衡并不是漂亮的 benchmark,而是具有延迟、吞吐、公平性和观测限制的真实基础设施问题。论文把一般和博弈、分布式 actor-critic 和系统指标结合起来,展示了多智能体 RL 从游戏走向真实系统的一种路径。
论文第三大部分进入 foundation models。这里的关键变化是:RL 不再只从环境交互中学习,也可以借助预训练生成模型和世界模型。基础模型提供先验,世界模型提供未来预测,策略优化可以在“想象出来”的轨迹中进行。 第六章提出 Diffusion World Model。传统 model-based RL 常用一步动力学模型反复 rollout,但长 horizon 下误差会逐步累积。扩散世界模型则试图一次建模多步未来轨迹:给定当前状态、动作和目标回报,模型生成未来若干步状态与奖励,从而降低逐步预测带来的 compounding error。
论文把 DWM 接入离线 RL:先用离线数据训练扩散世界模型,再用它生成 imagined data 或做 value expansion,辅助 actor-critic 学习。这里的核心优势有两点。第一,扩散模型能表达复杂、多模态的未来轨迹分布,不必把未来压成单一确定性预测。第二,它能够直接生成多步未来,使规划和价值估计更少依赖逐步滚动。 这部分与今天“世界模型 + 智能体”的讨论高度相关。一个智能体如果能在内部模拟未来,就可以在真实交互成本很高时进行离线规划;而生成式世界模型的作用,正是把环境动态、奖励结构和长期结果压进一个可采样的模型中。
第七章讨论 Consistency Models as Reinforcement Learning Policy。扩散策略能够表示多模态动作分布,但多步去噪带来较高训练和推理成本。Consistency 模型则试图用更少采样步骤得到高质量动作,因此适合作为更高效的策略类。 论文设计了 Consistency-BC 和 Consistency-AC。前者用于行为克隆,后者把 consistency policy 嵌入 actor-critic 框架,并用 BC 正则避免生成离线数据分布之外的动作。实验显示,Consistency-AC 在部分任务上略低于 Diffusion-QL,但在计算效率上更有优势,并能在 offline、offline-to-online 和 online 设置中形成可行的权衡。 这一章的重点不只是“换一种策略网络”,而是把生成模型的表达能力带入 RL 策略空间。传统高斯策略对多模态行为建模较弱;扩散和 consistency policy 能更自然地表示“同一状态下多个合理动作”。这对离线 RL 尤其重要,因为离线数据常由多个行为策略混合而来,动作分布本身就是多模态的。
第八章将 RL 与视频生成结合,研究 few-step video generation。扩散视频模型通常生成质量高,但推理步数多、成本高;少步生成器速度快,但可能牺牲质量、多样性或奖励对齐。论文提出 DOLLAR,将 variational score distillation、consistency distillation 和 latent reward fine-tuning 结合起来,使少步视频生成器在效率和质量之间取得更好平衡。
这里的 RL 思想体现在 reward fine-tuning:视频生成结果不只要拟合训练分布,还要满足美学、文本一致性、运动质量或人类偏好等奖励指标。直接在像素空间通过大型奖励模型反向传播会非常昂贵,因此论文引入 latent reward model,在潜空间中近似奖励信号,从而降低显存和计算负担。 这一章说明,RL 在基础模型时代的角色正在变化。它不只是控制智能体在环境中拿奖励,也可以作为生成模型的后训练工具,用奖励模型把少步生成器推向更符合偏好的输出分布。
第九章研究 Video World Model,重点是交互式长视频生成。普通视频生成模型往往给定提示后生成一段视频,但世界模型需要更强的交互性:动作会影响未来观察,历史状态需要被记住,长期生成还要避免误差累积。 论文提出 VRAG,即 Retrieval Augmented Video World Model with Global State。它在视频生成中引入全局状态条件和记忆检索机制:历史帧、动作和状态被保存在 buffer 中,模型通过相似性检索获取相关记忆,再作为上下文参与 DiT block 的自注意力。
VRAG 的核心问题是长期一致性。视频世界模型如果只依赖有限上下文,很容易在长时间生成中忘记早期状态;如果简单扩大上下文,又会带来训练和推理成本。检索增强提供了折中:不是把所有历史都塞进上下文,而是动态取回对当前生成最有用的记忆。 这与 LLM 中的 RAG 有相似精神,但对象从文本变成了视频世界状态。对于具身智能、游戏 agent、长时序模拟和交互式视觉环境来说,模型不仅要“看起来真实”,还要在动作干预下保持可控和连贯。
第十章继续推进长期世界建模,提出 Recurrent Autoregressive Diffusion。普通 DiT 视频模型擅长空间与局部时序建模,但长序列生成需要一种能跨越窗口传递信息的记忆机制。RAD 在 DiT block 中加入 RNN memory block,并结合 spatial attention、temporal attention 与 recurrent state,让模型在生成长视频时保留全局记忆。
论文还比较了 chunk-wise 与 frame-wise 两种自回归方式。chunk-wise 把视频分块处理,效率更高但时间依赖更粗;frame-wise 逐帧递归,能更细粒度地传递隐藏状态。为了提高训练效率,论文还设计 hidden state prefetch,使 frame-wise RNN 可以更好地并行注意力计算。
这部分的长期意义在于:世界模型不是短视频生成器,而应成为能持续滚动、记忆过去、响应动作并预测未来的动态系统。对于通用智能体来说,记忆不是额外插件,而是世界建模架构的一部分。
这篇博士论文的贡献可以分成两条线。第一条线是算法与博弈:从单智能体 RL 出发,进入两人零和博弈、竞争型视频游戏和多人一般和系统,强调策略学习必须面对非平稳性、均衡、可利用性和分布式激励。第二条线是基础模型与生成式世界建模:从扩散世界模型到 consistency policy,再到少步视频生成、VRAG 和 RAD,强调预训练生成模型可以成为规划、控制、策略表示和长期模拟的核心组件。 更重要的是,论文把强化学习放在了一个更大的智能系统图景中。经典 RL 提供目标驱动的适应机制,博弈论提供多智能体交互的稳定性语言,基础模型提供强先验和生成能力,世界模型提供面向未来的内部模拟。未来的智能体很可能不是单靠其中某一块,而是在这些组件之间形成闭环:观察世界、建模未来、用奖励或偏好调整行为,并在多智能体环境中保持稳健。 从研究趋势看,这篇论文也提示了几个值得继续关注的方向:多智能体 RL 如何在真实系统中稳定落地;生成模型策略如何在表达能力和推理效率之间平衡;视频世界模型如何从“生成好看视频”走向“可交互、可控制、可长期一致的环境模拟”;以及 RL 后训练如何成为基础模型对齐、控制和智能体化的重要机制。 强化学习的下一阶段,或许不再只是寻找更强的单一算法,而是把算法、生成模型、世界模型、记忆和多智能体系统整合成能够长期行动的基础设施。这正是这篇博士论文最值得读的地方。