Distributional Value Estimation Without Target Networks for Robust Quality-Diversity - 专知论文

会员服务 ·

0

样本 · 多样性 · 算法 · 鲁棒 · Actor-Critic学习 ·

Distributional Value Estimation Without Target Networks for Robust Quality-Diversity

翻译：无需目标网络的分布式值估计实现鲁棒的质量-多样性

Behrad Koohy,Jamie Bayne

from arxiv, Accepted as Full Paper at GECCO'26

Quality-Diversity (QD) algorithms excel at discovering diverse repertoires of skills, but are hindered by poor sample efficiency and often require tens of millions of environment steps to solve complex locomotion tasks. Recent advances in Reinforcement Learning (RL) have shown that high Update-to-Data (UTD) ratios accelerate Actor-Critic learning. While effective, standard high-UTD algorithms typically utilise target networks to stabilise training. This requirement introduces a significant computational bottleneck, rendering them impractical for resource-intensive Quality-Diversity (QD) tasks where sample efficiency and rapid population adaptation are critical. In this paper, we introduce QDHUAC, a sample-efficient, target-free and distributional QD-RL algorithm that provides dense and low-variance gradient signals, which enables high-UTD training for Dominated Novelty Search whilst requiring an order of magnitude fewer environment steps. We demonstrate that our method enables stable training at high UTD ratios, achieving competitive coverage and fitness on high-dimensional Brax environments with an order of magnitude fewer samples than baselines. Our results suggest that combining target-free distributional critics with dominance-based selection is a key enabler for the next generation of sample-efficient evolutionary RL algorithms.

翻译：质量-多样性（QD）算法在发现多样化的技能库方面表现卓越，但受限于样本效率低下，通常需要数千万的环境步数才能解决复杂的运动控制任务。强化学习（RL）的最新进展表明，高更新-数据比（UTD）能加速Actor-Critic学习。然而，标准的高UTD算法通常依赖目标网络来稳定训练，这一需求引入了显著的计算瓶颈，使其难以应用于对样本效率和种群快速适应至关重要的资源密集型质量-多样性（QD）任务。本文提出QDHUAC——一种样本高效、无目标网络且分布式的QD-RL算法，它提供密集且低方差的梯度信号，使得主从新颖性搜索能够在减少一个数量级的环境步数下进行高UTD训练。我们证明，该方法能在高UTD比率下实现稳定训练，在高维Brax环境中以比基线少一个数量级的样本量达到具有竞争力的覆盖度和适应度。研究结果表明，将无目标网络的分布式评论家与基于主导性的选择相结合，是下一代样本高效进化强化学习算法的关键推动因素。

0

相关内容

【博士论文】多目标奖励与偏好优化：理论与算法

【博士论文】多目标奖励与偏好优化：理论与算法

专知会员服务

32+阅读 · 2025年12月12日

【博士论文】用于排序与扩散模型的安全、高效与鲁棒强化学习

【博士论文】用于排序与扩散模型的安全、高效与鲁棒强化学习

专知会员服务

11+阅读 · 2025年10月21日

【NeurIPS2025】迈向鲁棒的零样本强化学习

【NeurIPS2025】迈向鲁棒的零样本强化学习

专知会员服务

14+阅读 · 2025年10月20日

多样化偏好优化

多样化偏好优化

专知会员服务

12+阅读 · 2025年2月3日

【CMU博士论文】面向可部署的强化学习：安全性、鲁棒性、适应性和可扩展性

【CMU博士论文】面向可部署的强化学习：安全性、鲁棒性、适应性和可扩展性

专知会员服务

40+阅读 · 2024年4月23日

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

专知会员服务

42+阅读 · 2024年3月3日

【牛津大学博士论文】通过合成环境和离线数据实现高效且鲁棒的强化学习，229页pdf

【牛津大学博士论文】通过合成环境和离线数据实现高效且鲁棒的强化学习，229页pdf

专知会员服务

35+阅读 · 2024年1月21日

【NeurIPS 2023】Mix-ME:多智能体学习的质量多样性

【NeurIPS 2023】Mix-ME:多智能体学习的质量多样性

专知会员服务

17+阅读 · 2023年11月6日

对比学习需要哪样的数据？UCLA最新ICML2023论文《数据高效对比学习：简单样本贡献最大》，探究量化样本对SSL的贡献度

对比学习需要哪样的数据？UCLA最新ICML2023论文《数据高效对比学习：简单样本贡献最大》，探究量化样本对SSL的贡献度

专知会员服务

37+阅读 · 2023年5月14日

【MIT博士论文】通过奇异值分解、端到端基于模型的方法和奖励塑造的有效强化学习

【MIT博士论文】通过奇异值分解、端到端基于模型的方法和奖励塑造的有效强化学习

专知会员服务

49+阅读 · 2022年9月22日

【MIT博士论文】数据高效强化学习，176页pdf

【MIT博士论文】数据高效强化学习，176页pdf

专知

19+阅读 · 2022年7月11日

淘宝 at KDD 2020，提出M2GRL优化大规模推荐中的多任务多视角图表示学习

淘宝 at KDD 2020，提出M2GRL优化大规模推荐中的多任务多视角图表示学习

AINLP

23+阅读 · 2020年6月16日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【ICML2019】中科院自动化所-针对小样本问题的学习生成匹配网络方法

【ICML2019】中科院自动化所-针对小样本问题的学习生成匹配网络方法

专知

59+阅读 · 2019年5月27日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

PlaNet 简介：用于强化学习的深度规划网络

PlaNet 简介：用于强化学习的深度规划网络

谷歌开发者

13+阅读 · 2019年3月16日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

基于数据的分布式鲁棒优化算法及其应用【附PPT与视频资料】

基于数据的分布式鲁棒优化算法及其应用【附PPT与视频资料】

人工智能前沿讲习班

27+阅读 · 2018年12月13日

朴素贝叶斯和贝叶斯网络算法及其R语言实现

朴素贝叶斯和贝叶斯网络算法及其R语言实现

R语言中文社区

10+阅读 · 2017年10月2日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

基于微型批量采样的分布式多智能个体网络协同优化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于多样化查询的多标记主动学习研究

国家自然科学基金

0+阅读 · 2015年12月31日

通信网络在不确定业务流量需求下的路由鲁棒性优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于概率语义分析的多关系图多类标分类方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向主动配电网的分布式能源多目标鲁棒经济优化调度

国家自然科学基金

1+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于异构信息网络的分类算法推荐方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

对具有非平衡多标签特性的蛋白质功能类型分类预测研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于生物网络的高维多目标算法及其在分布式调度中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

Distributional Loss for Robust Classification

Arxiv

0+阅读 · 6月11日

Quantized Stochastic Primal-Dual Methods for Distributed Optimization under Relaxed Global Geometry

Arxiv

0+阅读 · 6月9日

LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

Arxiv

0+阅读 · 6月9日

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

Arxiv

0+阅读 · 6月9日

Towards Optimal Robustness in Learning-Augmented Paging

Arxiv

0+阅读 · 6月8日

U-Net-Accelerated Quality-Diversity Optimization for Climate-Adaptive Urban Layouts

Arxiv

0+阅读 · 6月3日

Tournament Informed Adversarial Quality Diversity

Arxiv

0+阅读 · 5月15日

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

Arxiv

0+阅读 · 5月10日

Discount Model Search for Quality Diversity Optimization in High-Dimensional Measure Spaces

Arxiv

0+阅读 · 4月30日

Distribution-Free Stochastic Analysis and Robust Multilevel Vector Field Anomaly Detection

Arxiv

0+阅读 · 4月29日

VIP会员

文章信息

相关主题

Actor-Critic学习

最新内容

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

专知会员服务

0+阅读 · 今天6:30

网状网络及其在军事领域的运用

网状网络及其在军事领域的运用

专知会员服务

1+阅读 · 今天6:18

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

专知会员服务

2+阅读 · 今天6:08

无美国参与的欧洲战争方式（万字长文）

无美国参与的欧洲战争方式（万字长文）

专知会员服务

2+阅读 · 今天5:54

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

重构“下一场战争”的制胜理论：超越兰彻斯特方程与现代系统

专知会员服务

0+阅读 · 今天5:22

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

《国防工业中基于模型定义的实施：产品定义数字化转型的战略路径》90页

专知会员服务

3+阅读 · 今天5:15

《国防领域敏感性分析白皮书》

《国防领域敏感性分析白皮书》

专知会员服务

2+阅读 · 今天3:42

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

4+阅读 · 6月24日

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

3+阅读 · 6月24日

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

8+阅读 · 6月24日

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

7+阅读 · 6月24日

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

5+阅读 · 6月24日

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

7+阅读 · 6月24日

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

专知会员服务

6+阅读 · 6月24日

军事欺骗：供作战战术指挥官使用的工具

军事欺骗：供作战战术指挥官使用的工具

专知会员服务

6+阅读 · 6月24日

相关VIP内容

【博士论文】多目标奖励与偏好优化：理论与算法

【博士论文】多目标奖励与偏好优化：理论与算法

专知会员服务

32+阅读 · 2025年12月12日

【博士论文】用于排序与扩散模型的安全、高效与鲁棒强化学习

【博士论文】用于排序与扩散模型的安全、高效与鲁棒强化学习

专知会员服务

11+阅读 · 2025年10月21日

【NeurIPS2025】迈向鲁棒的零样本强化学习

【NeurIPS2025】迈向鲁棒的零样本强化学习

专知会员服务

14+阅读 · 2025年10月20日

多样化偏好优化

多样化偏好优化

专知会员服务

12+阅读 · 2025年2月3日

【CMU博士论文】面向可部署的强化学习：安全性、鲁棒性、适应性和可扩展性

【CMU博士论文】面向可部署的强化学习：安全性、鲁棒性、适应性和可扩展性

专知会员服务

40+阅读 · 2024年4月23日

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

专知会员服务

42+阅读 · 2024年3月3日

【牛津大学博士论文】通过合成环境和离线数据实现高效且鲁棒的强化学习，229页pdf

【牛津大学博士论文】通过合成环境和离线数据实现高效且鲁棒的强化学习，229页pdf

专知会员服务

35+阅读 · 2024年1月21日

【NeurIPS 2023】Mix-ME:多智能体学习的质量多样性

【NeurIPS 2023】Mix-ME:多智能体学习的质量多样性

专知会员服务

17+阅读 · 2023年11月6日

对比学习需要哪样的数据？UCLA最新ICML2023论文《数据高效对比学习：简单样本贡献最大》，探究量化样本对SSL的贡献度

对比学习需要哪样的数据？UCLA最新ICML2023论文《数据高效对比学习：简单样本贡献最大》，探究量化样本对SSL的贡献度

专知会员服务

37+阅读 · 2023年5月14日

【MIT博士论文】通过奇异值分解、端到端基于模型的方法和奖励塑造的有效强化学习

【MIT博士论文】通过奇异值分解、端到端基于模型的方法和奖励塑造的有效强化学习

专知会员服务

49+阅读 · 2022年9月22日

热门VIP内容

开通专知VIP会员享更多权益服务

网状网络及其在军事领域的运用

无美国参与的欧洲战争方式（万字长文）

重塑决策优势：美军作战艺术与多域作战中联盟联合全域指挥控制（CJADC2）体系的融合

《意识即战场——全球安全体系中认知战的演进：乌克兰构建认知作战体系的展望》

相关资讯

【MIT博士论文】数据高效强化学习，176页pdf

【MIT博士论文】数据高效强化学习，176页pdf

专知

19+阅读 · 2022年7月11日

淘宝 at KDD 2020，提出M2GRL优化大规模推荐中的多任务多视角图表示学习

淘宝 at KDD 2020，提出M2GRL优化大规模推荐中的多任务多视角图表示学习

AINLP

23+阅读 · 2020年6月16日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【ICML2019】中科院自动化所-针对小样本问题的学习生成匹配网络方法

【ICML2019】中科院自动化所-针对小样本问题的学习生成匹配网络方法

专知

59+阅读 · 2019年5月27日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

PlaNet 简介：用于强化学习的深度规划网络

PlaNet 简介：用于强化学习的深度规划网络

谷歌开发者

13+阅读 · 2019年3月16日

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

分布式优化算法及其在多智能体系统与机器学习中的应用【附PPT与视频资料】

人工智能前沿讲习班

21+阅读 · 2018年12月21日

基于数据的分布式鲁棒优化算法及其应用【附PPT与视频资料】

基于数据的分布式鲁棒优化算法及其应用【附PPT与视频资料】

人工智能前沿讲习班

27+阅读 · 2018年12月13日

朴素贝叶斯和贝叶斯网络算法及其R语言实现

朴素贝叶斯和贝叶斯网络算法及其R语言实现

R语言中文社区

10+阅读 · 2017年10月2日

各种相似性度量及Python实现

各种相似性度量及Python实现

机器学习算法与Python学习

11+阅读 · 2017年7月6日

相关论文

Distributional Loss for Robust Classification

Arxiv

0+阅读 · 6月11日

Quantized Stochastic Primal-Dual Methods for Distributed Optimization under Relaxed Global Geometry

Arxiv

0+阅读 · 6月9日

LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

Arxiv

0+阅读 · 6月9日

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

Arxiv

0+阅读 · 6月9日

Towards Optimal Robustness in Learning-Augmented Paging

Arxiv

0+阅读 · 6月8日

U-Net-Accelerated Quality-Diversity Optimization for Climate-Adaptive Urban Layouts

Arxiv

0+阅读 · 6月3日

Tournament Informed Adversarial Quality Diversity

Arxiv

0+阅读 · 5月15日

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

Arxiv

0+阅读 · 5月10日

Discount Model Search for Quality Diversity Optimization in High-Dimensional Measure Spaces

Arxiv

0+阅读 · 4月30日

Distribution-Free Stochastic Analysis and Robust Multilevel Vector Field Anomaly Detection

Arxiv

0+阅读 · 4月29日

相关基金

基于微型批量采样的分布式多智能个体网络协同优化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于多样化查询的多标记主动学习研究

国家自然科学基金

0+阅读 · 2015年12月31日

通信网络在不确定业务流量需求下的路由鲁棒性优化研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于概率语义分析的多关系图多类标分类方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向主动配电网的分布式能源多目标鲁棒经济优化调度

国家自然科学基金

1+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于异构信息网络的分类算法推荐方法研究

国家自然科学基金

7+阅读 · 2015年12月31日

对具有非平衡多标签特性的蛋白质功能类型分类预测研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于生物网络的高维多目标算法及其在分布式调度中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员