推荐系统、广告投放、个性化内容分发和交互式决策平台都有一个共同难题:系统面对的“动作”数量极大。一个视频平台可能要从数万部影片中选择推荐项,一个电商平台可能要从百万商品中选择展示对象,一个广告系统还要同时决定广告与出价。对学习算法来说,这不只是计算量变大,而是探索、估计、优化和泛化都同时变难。 这篇博士论文《On-Policy and Off-Policy Learning for Large Action Spaces》围绕大动作空间下的上下文老虎机问题,系统研究了两类核心学习范式:在线学习和离线学习。在线学习要求算法在与环境交互时边探索边利用,离线学习则要求算法只依赖历史日志评估并改进策略。论文的核心判断是:当动作空间足够大时,不能把每个动作都当作完全独立的对象来学,也不能只追求更准确的奖励估计器;真正关键的是利用动作之间的结构共享,并选择能够被优化器稳定求解的学习目标。 论文分为两个部分。第一部分研究在线学习,提出混合效应汤普森采样和扩散汤普森采样,用共享潜变量或深度生成先验刻画动作参数之间的相关性,从而降低遗憾、内存和运行开销。第二部分研究离线策略学习,提出结构化直接方法、优化友好的策略加权似然目标,以及基于指数平滑和 PAC-Bayes 悲观性的离线学习框架。整篇论文的价值在于,它把“大动作空间”从一个规模问题,推进为一个结构建模与可优化目标共同决定的问题。
图1 上下文老虎机的交互框架:环境产生上下文,智能体选择动作,奖励生成器返回反馈。
论文题目:On-Policy and Off-Policy Learning for Large Action Spaces 作者:Imad Aouali 论文类型:博士论文 单位:Institut Polytechnique de Paris、ENSAE、EDMH 答辩时间:2026 年 3 月 13 日 导师:Victor-Emmanuel Brunel、Anna Korba、David Rohde 论文链接:https://arxiv.org/abs/2607.28408
上下文老虎机把交互式机器学习抽象为一个循环:每一轮环境给出上下文,智能体从有限动作集合中选择一个动作,随后只观察该动作对应的奖励。与监督学习不同,系统看不到“如果选择其他动作会怎样”;与完整强化学习不同,它不建模长期状态转移,因此更适合推荐、广告和交互式平台的单步决策问题。 论文强调,大动作空间会同时制造三类困难。第一是统计困难。若每个动作都有独立参数,百万级动作意味着大量动作很少被选择,甚至从未出现在日志中,后验或奖励估计会极不充分。第二是计算困难。经典线性老虎机或贝叶斯方法往往需要维护动作级协方差矩阵,内存和矩阵运算会随动作数急剧增长。第三是优化困难。离线策略学习常用重要性采样目标,但在大动作 softmax 策略下,这类目标可能高度非凸、梯度病态,对初始化和学习率极其敏感。 因此,论文的主线不是简单“扩容”已有算法,而是回答两个更根本的问题:在线学习中如何让动作之间共享信息,离线学习中如何构造既有统计意义又能被稳定优化的目标。
在线学习的目标是在真实交互过程中最大化累积奖励。算法每一轮都必须决定是否探索不确定动作,或利用当前看来最优的动作。汤普森采样是一类重要方法:它从后验中采样一个可能的世界,再在该世界中选择最优动作。问题是,若每个动作参数独立,算法几乎无法从一个动作的反馈推广到其他动作。 离线学习的目标则相反:训练数据已经由历史日志策略产生,学习器不能主动收集新反馈,只能利用包含上下文、已选动作和奖励的日志学习新策略。这里的困难来自反事实缺失和支持不匹配。如果日志策略从未选择某些动作,标准离线方法很难可靠评估这些动作;如果新策略偏离日志策略太多,重要性权重会急剧放大方差。 论文把这两类范式统一到大动作空间视角下:在线学习要用结构先验提升探索效率,离线学习要用结构、优化和悲观性共同控制不可观测反事实带来的风险。
第三章提出混合效应老虎机框架和混合效应汤普森采样。其思想是:动作参数并非彼此独立,而是由少量共享“效应”组合而成。以电影推荐为例,电影可以由题材、风格、演员、受众偏好等潜在因素共同决定;用户对某部电影的反馈不仅提供该电影的信息,也能反向更新相关因素,从而帮助其他电影。 在模型上,每个动作参数由若干共享效应参数生成,动作与效应之间通过混合权重连接。缺失连接表示某个动作与某个效应无关。这种两层图模型允许算法在动作之间传递统计信息,尤其适合动作数远大于潜在效应数的场景。
图2 混合效应模型的图结构:多个共享效应共同生成动作参数,被选择动作再与上下文一起产生奖励。 理论上,论文给出了混合效应汤普森采样的贝叶斯遗憾界。遗憾由两部分组成:学习动作自身参数的成本,以及学习共享效应参数的成本。若结构先验较好,算法的有效动作规模小于原始动作数,遗憾可以随有效动作数而非原始动作数增长。计算上,在高斯线性情形中可以得到闭式后验;在更一般的广义线性情形中,则使用近似后验保持可 tractable。 实验结果显示,混合效应汤普森采样在合成线性、逻辑奖励和 MovieLens 推荐任务上都优于忽略结构的基线。尤其当动作数从 100 增至 100000 时,结构化方法与普通线性汤普森采样的差距持续扩大,说明大动作空间越大,动作共享结构越重要。
图3 动作数量增大时,混合效应汤普森采样的最终累积遗憾增长更慢,结构优势随动作空间扩大而增强。
第四章进一步提出扩散汤普森采样。混合效应模型依赖相对明确的线性或层级结构,但真实动作空间往往更复杂。例如商品、电影、分子、图像或文本动作的参数可能来自高度非线性的生成分布。论文因此引入扩散模型作为动作参数的先验,用预训练生成模型捕捉动作之间的复杂相关性。 扩散汤普森采样的关键是,把动作参数看作由潜变量经扩散式生成过程产生。这样,算法可以先离线学习一个动作参数分布,再在线交互时根据奖励反馈更新后验并采样动作。与为每个动作单独维护高维后验相比,扩散先验把信息压缩到共享生成结构中,内存复杂度可降到与潜在层数和动作数线性相关,运行复杂度也更适合大规模动作集合。
图4 扩散汤普森采样在不同扩散先验、奖励模型和动作规模下的遗憾表现,整体优于忽略生成结构的基线。 实验覆盖线性扩散、非线性扩散、线性奖励和非线性奖励的组合。结果表明,当动作参数确实具有生成结构时,扩散汤普森采样能显著提升探索效率;即使先验存在一定错配,它仍保持较强鲁棒性。论文由此给出一个重要启发:大动作空间中的探索不应只依赖动作级置信区间,还应利用离线数据中已经存在的动作表示和生成规律。
第六章进入离线策略学习。传统直接方法会先估计每个上下文-动作对的奖励函数,再选择最大化估计奖励的策略。问题在于,大动作空间下很多动作日志覆盖不足,未出现动作的奖励估计会退回到先验,策略改进容易被稀疏数据限制。 论文提出结构化直接方法。它假设所有动作参数由共同潜变量生成,动作之间因此天然相关。即使某个动作在日志中很少出现,其他相关动作的反馈也能更新共享潜变量,再间接改善该动作的奖励估计。这一结构化先验使离线学习不再完全依赖每个动作的独立覆盖。
图5 结构化直接方法的先验图:共享潜变量生成所有动作参数,缓解日志数据覆盖不足带来的估计问题。 理论上,论文在贝叶斯次优性意义下给出收敛结果,证明结构化直接方法可以在不要求日志完全覆盖所有动作的情况下学习到有效策略。实验同样显示,随着动作空间增大,结构化直接方法相对标准直接方法的优势更加明显。 这一章的重要性在于,它把在线部分的“共享结构”迁移到离线场景:如果动作之间确实存在潜在相关性,那么离线日志中的局部反馈也能被转化为跨动作信息,而不是只服务于被观察到的单个动作。
第七章提出了论文中很有洞察力的观点:在大动作空间离线策略学习中,最终性能差往往不只是因为奖励估计不准,而是因为优化目标本身难以求解。许多经典重要性采样目标在理论上无偏或低偏,但当策略由大规模 softmax 参数化时,目标函数可能出现平坦区域、尖锐曲率和大量局部困难。 论文用玩具例子展示了这种差异。策略加权对数似然目标呈现更平滑、更接近凸优化的几何结构;重要性采样目标则存在梯度消失和梯度爆炸并存的问题。对于真实大规模推荐场景,这种优化病态会放大到百万动作级别,使“更复杂的估计器”未必带来更好的策略。
图6 策略加权对数似然与重要性采样目标的优化景观对比:前者更平滑,后者更容易出现病态梯度。 因此,论文主张使用策略加权对数似然类目标。它本质上把日志动作的对数似然按奖励和日志概率进行加权,使优化形式更接近带权交叉熵。这类目标虽然牺牲了部分传统反事实估计意义上的直接性,却显著改善了可优化性。实验表明,在 MovieLens、Amazon 和大规模推荐数据上,优化友好的目标往往比复杂但难优化的估计器更有效。 这一结论对工程实践尤其重要。大动作空间系统最终要靠随机优化器训练,如果目标函数几何结构恶劣,再漂亮的统计性质也可能无法转化为可部署策略。论文由此把离线策略学习的评估重点,从“估计器是否更精确”扩展到“目标是否能被稳定优化”。
第八章研究重要性采样的方差控制。传统做法常用硬截断:当日志概率太小或重要性权重太大时直接裁剪。硬截断能降低方差,但会引入偏差,且截断点难以选择。论文提出使用指数平滑作为更连续的正则化方式,在偏差和方差之间形成可微、可优化的折中。 更进一步,论文将指数平滑纳入 PAC-Bayes 悲观学习框架。悲观原则的直觉是:离线数据无法充分验证的策略不应被过度乐观地选择。算法不只是最大化经验估计奖励,而是最大化带置信惩罚的下界。这样可以同时考虑经验收益、模型复杂度、重要性权重波动和泛化风险。
图7 不同日志策略质量下的离线学习结果:基于悲观原则的方法在多个数据集上获得更稳定的策略收益。 实验显示,论文提出的 PAC-Bayes 悲观目标在 MNIST、FashionMNIST、EMNIST 和 CIFAR 等离线分类式老虎机数据上整体优于多个基线。更值得注意的是,论文发现“选择何种悲观学习目标”通常比“选择哪种重要性权重正则化技巧”影响更大。这与第七章呼应:大动作空间离线学习不是单纯估计问题,而是估计、优化和风险控制共同作用。
整篇论文的实验覆盖合成环境、MovieLens 推荐数据和多个分类数据集,并反复考察动作数、潜在效应数、上下文维度、奖励模型、生成先验错配、日志策略质量和优化超参数。主要结论可以概括为四点。 第一,动作共享结构能显著提升在线探索效率。无论通过混合效应模型还是扩散先验,只要动作之间存在可利用相关性,算法就能从少量反馈中推广到更多动作,尤其在动作数远大于潜在结构维度时收益最大。 第二,深度生成模型可以作为大动作空间的先验接口。扩散汤普森采样展示了一种可行路径:先从离线动作表示中学习生成分布,再将该分布用于在线贝叶斯探索。这为推荐、分子设计、内容生成和组合动作空间提供了方法模板。 第三,离线策略学习必须重视优化几何。重要性采样估计器的统计性质并不足以保证策略可学;在大动作 softmax 策略下,稳定的对数似然式目标可能比理论上更直接的估计目标更可靠。 第四,悲观性是离线学习的必要保护。日志数据越偏、动作空间越大,未观测反事实越多,算法越需要对高方差和低覆盖区域保持保守。PAC-Bayes 下界提供了把这种保守性转化为可优化目标的方式。
论文最后指出,大动作空间学习仍有多条开放路线。在线学习方面,未来可以研究更丰富的动作结构,例如图结构、文本或图像动作表示、组合动作和动态动作集合。扩散先验也可以进一步与深度上下文编码器、非高斯奖励和真实系统反馈结合。 离线学习方面,结构化直接方法还可以与双重稳健估计、保守策略改进和不确定性校准结合。对于百万级动作系统,如何在保证可优化性的同时保留更强反事实解释,是一个重要问题。悲观学习也需要更自动的超参数选择机制,否则工程部署仍会依赖大量调参。 更广义地看,论文把推荐系统和交互式决策中的一个老问题重新表述为:当动作极多、反馈极稀疏、日志有偏时,学习算法必须同时知道“哪些动作相似”“哪些目标可优化”“哪些收益值得相信”。这三个问题缺一不可。
这篇博士论文围绕大动作空间上下文老虎机,系统推进了在线与离线学习两条路线。在线部分通过混合效应和扩散先验解决动作间信息共享与计算可扩展性;离线部分通过结构化直接方法、策略加权似然、指数平滑和 PAC-Bayes 悲观性解决覆盖不足、优化病态和高方差风险。 它给出的核心启示非常清晰:大动作空间不是把动作数扩大后的普通老虎机问题,而是一个必须引入结构、优化和保守性的新问题。对于推荐、广告、内容平台和智能体决策系统,这篇论文提供了一套较完整的方法框架,也提醒我们在评估算法时不要只看估计误差或单个指标,而要同时检查结构假设、优化稳定性和离线数据支持度。