基于Sigmoid有界熵的离策略行动者-评论家方法及其在真实世界机器人学习中的应用 (Off-Policy Actor-Critic with Sigmoid-Bounded Entropy for Real-World Robot Learning) - 专知论文

会员服务 ·

0

SAC · Sigmoid（一种激活函数） · 离策略 · 机器人 · 稀疏 ·

Off-Policy Actor-Critic with Sigmoid-Bounded Entropy for Real-World Robot Learning

翻译：基于Sigmoid有界熵的离策略行动者-评论家方法及其在真实世界机器人学习中的应用

Xiefeng Wu,Mingyu Hu,Shu Zhang

from arxiv, 7 pages main text 2 page reference

Deploying reinforcement learning in the real world remains challenging due to sample inefficiency, sparse rewards, and noisy visual observations. Prior work leverages demonstrations and human feedback to improve learning efficiency and robustness. However, offline-to-online methods need large datasets and can be unstable, while VLA-assisted RL relies on large-scale pretraining and fine-tuning. As a result, a low-cost real-world RL method with minimal data requirements has yet to emerge. We introduce \textbf{SigEnt-SAC}, an off-policy actor-critic method that learns from scratch using a single expert trajectory. Our key design is a sigmoid-bounded entropy term that prevents negative-entropy-driven optimization toward out-of-distribution actions and reduces Q-function oscillations. We benchmark SigEnt-SAC on D4RL tasks against representative baselines. Experiments show that SigEnt-SAC substantially alleviates Q-function oscillations and reaches a 100\% success rate faster than prior methods. Finally, we validate SigEnt-SAC on four real-world robotic tasks across multiple embodiments, where agents learn from raw images and sparse rewards; results demonstrate that SigEnt-SAC can learn successful policies with only a small number of real-world interactions, suggesting a low-cost and practical pathway for real-world RL deployment.

翻译：在现实世界中部署强化学习仍然面临样本效率低、奖励稀疏和视觉观测噪声大等挑战。先前的研究通过利用示范数据和人类反馈来提高学习效率和鲁棒性。然而，离线到在线方法需要大规模数据集且可能不稳定，而视觉语言模型辅助的强化学习则依赖于大规模预训练和微调。因此，一种数据需求极少的低成本现实世界强化学习方法尚未出现。我们提出了\textbf{SigEnt-SAC}，这是一种离策略行动者-评论家方法，能够仅使用单条专家轨迹从头开始学习。我们的核心设计是一个sigmoid有界熵项，该设计能防止负熵驱动的优化过程偏离分布动作，并减少Q函数振荡。我们在D4RL任务上对SigEnt-SAC与代表性基线方法进行了基准测试。实验表明，SigEnt-SAC显著缓解了Q函数振荡，并比现有方法更快达到100\%的成功率。最后，我们在多个机器人实体上通过四个真实世界机器人任务验证了SigEnt-SAC，其中智能体从原始图像和稀疏奖励中学习；结果表明SigEnt-SAC仅需少量真实世界交互即可学习到成功策略，这为现实世界强化学习的部署提供了一条低成本且实用的路径。

0

相关内容

SAC

SAC：Selected Areas in Cryptography。 Explanation：密码术的选择区。 Publisher：Springer。 SIT：http://dblp.uni-trier.de/db/conf/sacrypt/

【伯克利博士论文】物理世界中可泛化且可扩展的机器人学习

【伯克利博士论文】物理世界中可泛化且可扩展的机器人学习

专知会员服务

21+阅读 · 1月18日

【博士论文】推进数据高效的深度学习：非参数 Transformer、主动测试与上下文学习

【博士论文】推进数据高效的深度学习：非参数 Transformer、主动测试与上下文学习

专知会员服务

25+阅读 · 2025年8月7日

【博士论文】大规模人工智能中的强化学习智能体：高效训练与更严谨分析

【博士论文】大规模人工智能中的强化学习智能体：高效训练与更严谨分析

专知会员服务

16+阅读 · 2025年7月1日

【ICML2024教程】策略机器学习：如何处理“有行为”的数据进行学习

【ICML2024教程】策略机器学习：如何处理“有行为”的数据进行学习

专知会员服务

26+阅读 · 2024年8月4日

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

专知会员服务

41+阅读 · 2024年3月3日

面向机器人系统的虚实迁移强化学习综述

面向机器人系统的虚实迁移强化学习综述

专知会员服务

44+阅读 · 2024年2月8日

【NTU博士论文】开放世界中机器学习的自然鲁棒性，175页pdf

【NTU博士论文】开放世界中机器学习的自然鲁棒性，175页pdf

专知会员服务

33+阅读 · 2023年12月24日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

融合零样本学习和小样本学习的弱监督机器学习方法综述

专知会员服务

113+阅读 · 2020年3月20日

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

专知会员服务

19+阅读 · 2019年10月30日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

最新《可解释机器学习》报告，164页ppt建模阐述XAI进展

最新《可解释机器学习》报告，164页ppt建模阐述XAI进展

专知

10+阅读 · 2022年8月25日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

专知

16+阅读 · 2020年12月9日

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

深度强化学习实验室

19+阅读 · 2020年8月11日

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

深度强化学习实验室

43+阅读 · 2020年7月6日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

在线元学习：通过持续元学习解决传统机器学习方式的致命不足

在线元学习：通过持续元学习解决传统机器学习方式的致命不足

新智元

12+阅读 · 2019年3月3日

【强化学习】用于真实机器人的高效深度强化学习算法、全面解读深度强化学习

【强化学习】用于真实机器人的高效深度强化学习算法、全面解读深度强化学习

产业智能官

16+阅读 · 2018年12月27日

展望：模型驱动的深度学习

展望：模型驱动的深度学习

人工智能学家

12+阅读 · 2018年1月23日

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

开放动态环境下在线机器学习理论与方法

国家自然科学基金

11+阅读 · 2013年12月31日

强化学习关键技术及其在机器人行为学习中的应用

国家自然科学基金

23+阅读 · 2009年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

48+阅读 · 2009年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

RISE: Self-Improving Robot Policy with Compositional World Model

Arxiv

0+阅读 · 2月11日

Online Fine-Tuning of Pretrained Controllers for Autonomous Driving via Real-Time Recurrent RL

Arxiv

0+阅读 · 2月3日

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

Arxiv

0+阅读 · 2月2日

FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification

Arxiv

0+阅读 · 2月2日

Zero-Shot Off-Policy Learning

Arxiv

0+阅读 · 2月2日

End-to-end example-based sim-to-real RL policy transfer based on neural stylisation with application to robotic cutting

Arxiv

0+阅读 · 1月28日

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Arxiv

0+阅读 · 1月28日

E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning

Arxiv

0+阅读 · 1月27日

Statistical Reinforcement Learning in the Real World: A Survey of Challenges and Future Directions

Arxiv

0+阅读 · 1月21日

AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning

Arxiv

0+阅读 · 1月20日

VIP会员

文章信息

相关主题

Sigmoid（一种激活函数）

相关VIP内容

【伯克利博士论文】物理世界中可泛化且可扩展的机器人学习

【伯克利博士论文】物理世界中可泛化且可扩展的机器人学习

专知会员服务

21+阅读 · 1月18日

【博士论文】推进数据高效的深度学习：非参数 Transformer、主动测试与上下文学习

【博士论文】推进数据高效的深度学习：非参数 Transformer、主动测试与上下文学习

专知会员服务

25+阅读 · 2025年8月7日

【博士论文】大规模人工智能中的强化学习智能体：高效训练与更严谨分析

【博士论文】大规模人工智能中的强化学习智能体：高效训练与更严谨分析

专知会员服务

16+阅读 · 2025年7月1日

【ICML2024教程】策略机器学习：如何处理“有行为”的数据进行学习

【ICML2024教程】策略机器学习：如何处理“有行为”的数据进行学习

专知会员服务

26+阅读 · 2024年8月4日

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

【MIT博士论文】在真实世界环境中的强化学习系统的鲁棒性，292页pdf

专知会员服务

41+阅读 · 2024年3月3日

面向机器人系统的虚实迁移强化学习综述

面向机器人系统的虚实迁移强化学习综述

专知会员服务

44+阅读 · 2024年2月8日

【NTU博士论文】开放世界中机器学习的自然鲁棒性，175页pdf

【NTU博士论文】开放世界中机器学习的自然鲁棒性，175页pdf

专知会员服务

33+阅读 · 2023年12月24日

【ICLR2021】一种基于距离度量学习及行为正则化的完全离线的元强化学习方法

专知会员服务

17+阅读 · 2021年2月9日

融合零样本学习和小样本学习的弱监督机器学习方法综述

专知会员服务

113+阅读 · 2020年3月20日

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

【ICCV 2019 Tutorial】Learning to enhance in the real world（在现实世界中学习增强），苏黎世联邦理工学院 Martin Danelljan副教授

专知会员服务

19+阅读 · 2019年10月30日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

最新《可解释机器学习》报告，164页ppt建模阐述XAI进展

最新《可解释机器学习》报告，164页ppt建模阐述XAI进展

专知

10+阅读 · 2022年8月25日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

【NeurIPS 2020 Tutorial】离线强化学习:从算法到挑战，80页ppt

专知

16+阅读 · 2020年12月9日

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

Distributional Soft Actor-Critic (DSAC)强化学习算法的设计与验证

深度强化学习实验室

19+阅读 · 2020年8月11日

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

【万字长文总结】如何解决"稀疏奖励(Sparse Reward)"下的强化学习问题？

深度强化学习实验室

43+阅读 · 2020年7月6日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

在线元学习：通过持续元学习解决传统机器学习方式的致命不足

在线元学习：通过持续元学习解决传统机器学习方式的致命不足

新智元

12+阅读 · 2019年3月3日

【强化学习】用于真实机器人的高效深度强化学习算法、全面解读深度强化学习

【强化学习】用于真实机器人的高效深度强化学习算法、全面解读深度强化学习

产业智能官

16+阅读 · 2018年12月27日

展望：模型驱动的深度学习

展望：模型驱动的深度学习

人工智能学家

12+阅读 · 2018年1月23日

相关论文

RISE: Self-Improving Robot Policy with Compositional World Model

Arxiv

0+阅读 · 2月11日

Online Fine-Tuning of Pretrained Controllers for Autonomous Driving via Real-Time Recurrent RL

Arxiv

0+阅读 · 2月3日

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

Arxiv

0+阅读 · 2月2日

FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification

Arxiv

0+阅读 · 2月2日

Zero-Shot Off-Policy Learning

Arxiv

0+阅读 · 2月2日

End-to-end example-based sim-to-real RL policy transfer based on neural stylisation with application to robotic cutting

Arxiv

0+阅读 · 1月28日

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Arxiv

0+阅读 · 1月28日

E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning

Arxiv

0+阅读 · 1月27日

Statistical Reinforcement Learning in the Real World: A Survey of Challenges and Future Directions

Arxiv

0+阅读 · 1月21日

AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning

Arxiv

0+阅读 · 1月20日

相关基金

针对大规模环境下复杂任务的策略搜索强化学习方法研究

国家自然科学基金

42+阅读 · 2015年12月31日

复杂环境下机器学习的理论研究

国家自然科学基金

21+阅读 · 2015年12月31日

基于重要性采样的并行离策略强化学习方法研究

国家自然科学基金

23+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

基于逆向强化学习和人工智能的移动机器人自主学习方法研究

国家自然科学基金

12+阅读 · 2013年12月31日

开放动态环境下在线机器学习理论与方法

国家自然科学基金

11+阅读 · 2013年12月31日

强化学习关键技术及其在机器人行为学习中的应用

国家自然科学基金

23+阅读 · 2009年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

48+阅读 · 2009年12月31日

基于支持向量机的复杂连续系统强化学习控制研究

国家自然科学基金

11+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员