Deep Pareto Reinforcement Learning for Multi-Objective Recommender Systems - 专知论文

会员服务 ·

0

多目标 · 系统 · 多目标推荐 · 情境 · 阿里巴巴 ·

Deep Pareto Reinforcement Learning for Multi-Objective Recommender Systems

翻译：深度帕累托强化学习用于多目标推荐系统

Pan Li,Alexander Tuzhilin

from arxiv, This is a preliminary version of the paper accepted at MISQ: https://doi.org/10.25300/MISQ/2025/19488 Please do not cite this version

Optimizing multiple objectives simultaneously is an important task for recommendation platforms to improve their performance. However, this task is particularly challenging since the relationships between different objectives are heterogeneous across different consumers and dynamically fluctuating according to different contexts. Especially in those cases when objectives become conflicting with each other, the result of recommendations will form a pareto-frontier, where the improvements of any objective comes at the cost of a performance decrease of another objective. Existing multi-objective recommender systems do not systematically consider such dynamic relationships; instead, they balance between these objectives in a static and uniform manner, resulting in only suboptimal multi-objective recommendation performance. In this paper, we propose a Deep Pareto Reinforcement Learning (DeepPRL) approach, where we (1) comprehensively model the complex relationships between multiple objectives in recommendations; (2) effectively capture personalized and contextual consumer preference for each objective to provide better recommendations; (3) optimize both the short-term and the long-term performance of multi-objective recommendations. As a result, our method achieves significant pareto-dominance over the state-of-the-art baselines in the offline experiments. Furthermore, we conducted a controlled experiment at the video streaming platform of Alibaba, where our method simultaneously improved three conflicting business objectives over the latest production system significantly, demonstrating its tangible economic impact in practice.

翻译：同时优化多个目标是推荐平台提升性能的重要任务。然而，由于不同目标之间的关系在不同消费者间具有异质性，且会随不同情境动态波动，该任务尤为困难。特别是在目标之间相互冲突的情况下，推荐结果将形成帕累托前沿，其中任一目标的改进均以另一目标性能下降为代价。现有的多目标推荐系统未能系统性地考虑此类动态关系；相反，它们以静态且统一的方式在这些目标间进行权衡，导致仅能获得次优的多目标推荐性能。本文提出一种深度帕累托强化学习（DeepPRL）方法，其中我们（1）全面建模推荐中多目标间的复杂关系；（2）有效捕捉每个目标的个性化及情境化消费者偏好以提供更优推荐；（3）优化多目标推荐的短期与长期性能。因此，我们的方法在离线实验中相较于现有先进基线实现了显著的帕累托支配。此外，我们在阿里巴巴的视频流媒体平台上进行了对照实验，结果表明该方法相较于最新生产系统同时显著提升了三个相互冲突的业务目标，证明了其在实践中切实的经济影响。

0

相关内容

多目标

【新书】深度学习推荐系统

【新书】深度学习推荐系统

专知会员服务

31+阅读 · 2025年5月9日

推荐系统融合排序的多目标寻优技术

推荐系统融合排序的多目标寻优技术

专知会员服务

19+阅读 · 2024年8月17日

【深度推荐系统：基础与进展】密歇根州立大学、香港理工大学、百度专家联合推出教程，Deep Recommender System: Fundamentals and Advances

【深度推荐系统：基础与进展】密歇根州立大学、香港理工大学、百度专家联合推出教程，Deep Recommender System: Fundamentals and Advances

专知会员服务

20+阅读 · 2022年2月25日

基于强化学习的推荐研究综述

基于强化学习的推荐研究综述

专知会员服务

85+阅读 · 2021年10月21日

强化学习如何用于推荐？厦大最新《强化学习推荐系统》综述论文，25页pdf156篇文献论述五种典型RL推荐方法

专知会员服务

81+阅读 · 2021年9月23日

强化学习如何用于推荐？新南威尔士首篇《深度强化学习推荐系统》综述论文，32页pdf135篇参考文献

强化学习如何用于推荐？新南威尔士首篇《深度强化学习推荐系统》综述论文，32页pdf135篇参考文献

专知会员服务

36+阅读 · 2021年9月9日

深度学习推荐进展到哪了？看这份IJCAI2021《深度学习推荐系统：基础与进展》教程，附Slides

专知会员服务

60+阅读 · 2021年8月23日

WWW21最新「深度学习推荐系统」教程，230页PPT阐述深度强化学习、自动机器学习和GNN在推荐系统应用进展

WWW21最新「深度学习推荐系统」教程，230页PPT阐述深度强化学习、自动机器学习和GNN在推荐系统应用进展

专知会员服务

124+阅读 · 2021年4月26日

基于双注意力机制和迁移学习的跨领域推荐模型

专知会员服务

48+阅读 · 2020年10月20日

南洋理工大学，深度学习推荐系统综述

南洋理工大学，深度学习推荐系统综述

专知会员服务

178+阅读 · 2019年10月14日

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

微软研究院AI头条

18+阅读 · 2019年8月13日

【综述】深度学习在视频多目标跟踪上的应用

【综述】深度学习在视频多目标跟踪上的应用

专知

14+阅读 · 2019年8月8日

十种深度学习推荐系统代码实现，持续更新中！！！

十种深度学习推荐系统代码实现，持续更新中！！！

专知

113+阅读 · 2019年4月25日

36页最新《深度学习在推荐系统上的应用》综述论文，209篇参考论文

36页最新《深度学习在推荐系统上的应用》综述论文，209篇参考论文

专知

24+阅读 · 2018年9月6日

【论文推荐】最新八篇推荐系统相关论文—可解释推荐、上下文感知推荐系统、异构知识库嵌入、深度强化学习、移动推荐系统

【论文推荐】最新八篇推荐系统相关论文—可解释推荐、上下文感知推荐系统、异构知识库嵌入、深度强化学习、移动推荐系统

专知

17+阅读 · 2018年6月16日

一张长图，让你直击推荐系统背后算法、架构、深度学习等运用！

一张长图，让你直击推荐系统背后算法、架构、深度学习等运用！

AI前线

11+阅读 · 2018年5月15日

深度学习在推荐系统中的应用综述（最全）

深度学习在推荐系统中的应用综述（最全）

七月在线实验室

17+阅读 · 2018年5月5日

【论文推荐】最新六篇推荐系统相关论文—注意力机制、多任务、协同跨网络、非结构化文本、TransRev、章节推荐

【论文推荐】最新六篇推荐系统相关论文—注意力机制、多任务、协同跨网络、非结构化文本、TransRev、章节推荐

专知

12+阅读 · 2018年4月26日

深度学习在推荐系统上的应用

深度学习在推荐系统上的应用

架构文摘

13+阅读 · 2018年2月22日

推荐系统主要算法总结及Youtube深度学习推荐算法实例概括

推荐系统主要算法总结及Youtube深度学习推荐算法实例概括

深度学习探索

13+阅读 · 2017年7月16日

推荐系统的信息核挖掘及其应用研究

国家自然科学基金

8+阅读 · 2015年12月31日

面向推荐系统中异构隐式反馈建模的迁移学习技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于排序法和分解的高维多目标演化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于领域知识和链路预测的个性化推荐研究

国家自然科学基金

4+阅读 · 2014年12月31日

社交网络环境下基于协同过滤的上下文感知推荐系统研究

国家自然科学基金

6+阅读 · 2014年12月31日

面向多源遥感图像的深度学习技术与系统研究

国家自然科学基金

17+阅读 · 2014年12月31日

基于人眼关注度与情感分析的电子商务智能推荐计算

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下融合多源信息的推荐系统关键问题研究

国家自然科学基金

6+阅读 · 2014年12月31日

排序管理的帕累托优化问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

50+阅读 · 2009年12月31日

RecBundle: A Next-Generation Geometric Paradigm for Explainable Recommender Systems

Arxiv

0+阅读 · 3月17日

Deep Research for Recommender Systems

Arxiv

0+阅读 · 3月8日

An Adaptive KKT-Based Indicator for Convergence Assessment in Multi-Objective Optimization

Arxiv

0+阅读 · 3月4日

DReX: An Explainable Deep Learning-based Multimodal Recommendation Framework

Arxiv

0+阅读 · 2月23日

Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning

Arxiv

0+阅读 · 2月22日

Locally Adaptive Multi-Objective Learning

Arxiv

0+阅读 · 2月16日

Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization

Arxiv

0+阅读 · 2月13日

Rethinking Multi-objective Ranking Ensemble in Recommender System: From Score Fusion to Rank Consistency

Arxiv

0+阅读 · 2月9日

Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization

Arxiv

0+阅读 · 2月8日

LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation

Arxiv

0+阅读 · 2月6日

VIP会员

文章信息

相关主题

多目标推荐

最新内容

印度精确打击与指挥架构的断层

印度精确打击与指挥架构的断层

专知会员服务

0+阅读 · 51分钟前

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

专知会员服务

2+阅读 · 55分钟前

美空军AI完成F-16战斗机自主空战历史性试飞

美空军AI完成F-16战斗机自主空战历史性试飞

专知会员服务

2+阅读 · 今天14:13

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

专知会员服务

2+阅读 · 今天14:11

《美国陆军：通过弹性分布式模型库实现自适应AI优势》

《美国陆军：通过弹性分布式模型库实现自适应AI优势》

专知会员服务

2+阅读 · 今天14:05

博士论文 | 理解与改进大语言模型推理：从反转诅咒到连续思维链

博士论文 | 理解与改进大语言模型推理：从反转诅咒到连续思维链

专知会员服务

1+阅读 · 今天13:23

综述 | 终身视觉表征：持续自监督学习CSSL系统综述

综述 | 终身视觉表征：持续自监督学习CSSL系统综述

专知会员服务

1+阅读 · 今天13:11

深入Project Maven：为何人工智能在战场上依然失灵

深入Project Maven：为何人工智能在战场上依然失灵

专知会员服务

14+阅读 · 7月19日

锻造未来士兵：外骨骼、基因工程与赛博格

锻造未来士兵：外骨骼、基因工程与赛博格

专知会员服务

7+阅读 · 7月19日

《无人机系统（UAS）通信网状网络试验性部署》50页报告

《无人机系统（UAS）通信网状网络试验性部署》50页报告

专知会员服务

7+阅读 · 7月19日

《无人机蜂群通信技术研究》50页

《无人机蜂群通信技术研究》50页

专知会员服务

8+阅读 · 7月19日

《基于智能体建模与仿真的无人机蜂群模型目标定位涌现行为比较分析》360页

《基于智能体建模与仿真的无人机蜂群模型目标定位涌现行为比较分析》360页

专知会员服务

11+阅读 · 7月18日

欧洲智能弹药战略创新管理：迈向制导弹药、巡飞系统与自主无人机蜂群的技术主权研究路线图

欧洲智能弹药战略创新管理：迈向制导弹药、巡飞系统与自主无人机蜂群的技术主权研究路线图

专知会员服务

8+阅读 · 7月18日

从领域适配到部署与可解释：Berkeley博士论文解析大语言模型真实落地

从领域适配到部署与可解释：Berkeley博士论文解析大语言模型真实落地

专知会员服务

13+阅读 · 7月18日

综述 | 长程智能体研究全景：基础、演化、框架、优化与前沿

综述 | 长程智能体研究全景：基础、演化、框架、优化与前沿

专知会员服务

9+阅读 · 7月18日

相关VIP内容

【新书】深度学习推荐系统

【新书】深度学习推荐系统

专知会员服务

31+阅读 · 2025年5月9日

推荐系统融合排序的多目标寻优技术

推荐系统融合排序的多目标寻优技术

专知会员服务

19+阅读 · 2024年8月17日

【深度推荐系统：基础与进展】密歇根州立大学、香港理工大学、百度专家联合推出教程，Deep Recommender System: Fundamentals and Advances

【深度推荐系统：基础与进展】密歇根州立大学、香港理工大学、百度专家联合推出教程，Deep Recommender System: Fundamentals and Advances

专知会员服务

20+阅读 · 2022年2月25日

基于强化学习的推荐研究综述

基于强化学习的推荐研究综述

专知会员服务

85+阅读 · 2021年10月21日

强化学习如何用于推荐？厦大最新《强化学习推荐系统》综述论文，25页pdf156篇文献论述五种典型RL推荐方法

专知会员服务

81+阅读 · 2021年9月23日

强化学习如何用于推荐？新南威尔士首篇《深度强化学习推荐系统》综述论文，32页pdf135篇参考文献

强化学习如何用于推荐？新南威尔士首篇《深度强化学习推荐系统》综述论文，32页pdf135篇参考文献

专知会员服务

36+阅读 · 2021年9月9日

深度学习推荐进展到哪了？看这份IJCAI2021《深度学习推荐系统：基础与进展》教程，附Slides

专知会员服务

60+阅读 · 2021年8月23日

WWW21最新「深度学习推荐系统」教程，230页PPT阐述深度强化学习、自动机器学习和GNN在推荐系统应用进展

WWW21最新「深度学习推荐系统」教程，230页PPT阐述深度强化学习、自动机器学习和GNN在推荐系统应用进展

专知会员服务

124+阅读 · 2021年4月26日

基于双注意力机制和迁移学习的跨领域推荐模型

专知会员服务

48+阅读 · 2020年10月20日

南洋理工大学，深度学习推荐系统综述

南洋理工大学，深度学习推荐系统综述

专知会员服务

178+阅读 · 2019年10月14日

热门VIP内容

开通专知VIP会员享更多权益服务

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

印度精确打击与指挥架构的断层

美空军AI完成F-16战斗机自主空战历史性试飞

相关资讯

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

微软研究院AI头条

18+阅读 · 2019年8月13日

【综述】深度学习在视频多目标跟踪上的应用

【综述】深度学习在视频多目标跟踪上的应用

专知

14+阅读 · 2019年8月8日

十种深度学习推荐系统代码实现，持续更新中！！！

十种深度学习推荐系统代码实现，持续更新中！！！

专知

113+阅读 · 2019年4月25日

36页最新《深度学习在推荐系统上的应用》综述论文，209篇参考论文

36页最新《深度学习在推荐系统上的应用》综述论文，209篇参考论文

专知

24+阅读 · 2018年9月6日

【论文推荐】最新八篇推荐系统相关论文—可解释推荐、上下文感知推荐系统、异构知识库嵌入、深度强化学习、移动推荐系统

【论文推荐】最新八篇推荐系统相关论文—可解释推荐、上下文感知推荐系统、异构知识库嵌入、深度强化学习、移动推荐系统

专知

17+阅读 · 2018年6月16日

一张长图，让你直击推荐系统背后算法、架构、深度学习等运用！

一张长图，让你直击推荐系统背后算法、架构、深度学习等运用！

AI前线

11+阅读 · 2018年5月15日

深度学习在推荐系统中的应用综述（最全）

深度学习在推荐系统中的应用综述（最全）

七月在线实验室

17+阅读 · 2018年5月5日

【论文推荐】最新六篇推荐系统相关论文—注意力机制、多任务、协同跨网络、非结构化文本、TransRev、章节推荐

【论文推荐】最新六篇推荐系统相关论文—注意力机制、多任务、协同跨网络、非结构化文本、TransRev、章节推荐

专知

12+阅读 · 2018年4月26日

深度学习在推荐系统上的应用

深度学习在推荐系统上的应用

架构文摘

13+阅读 · 2018年2月22日

推荐系统主要算法总结及Youtube深度学习推荐算法实例概括

推荐系统主要算法总结及Youtube深度学习推荐算法实例概括

深度学习探索

13+阅读 · 2017年7月16日

相关论文

RecBundle: A Next-Generation Geometric Paradigm for Explainable Recommender Systems

Arxiv

0+阅读 · 3月17日

Deep Research for Recommender Systems

Arxiv

0+阅读 · 3月8日

An Adaptive KKT-Based Indicator for Convergence Assessment in Multi-Objective Optimization

Arxiv

0+阅读 · 3月4日

DReX: An Explainable Deep Learning-based Multimodal Recommendation Framework

Arxiv

0+阅读 · 2月23日

Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning

Arxiv

0+阅读 · 2月22日

Locally Adaptive Multi-Objective Learning

Arxiv

0+阅读 · 2月16日

Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization

Arxiv

0+阅读 · 2月13日

Rethinking Multi-objective Ranking Ensemble in Recommender System: From Score Fusion to Rank Consistency

Arxiv

0+阅读 · 2月9日

Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization

Arxiv

0+阅读 · 2月8日

LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation

Arxiv

0+阅读 · 2月6日

相关基金

推荐系统的信息核挖掘及其应用研究

国家自然科学基金

8+阅读 · 2015年12月31日

面向推荐系统中异构隐式反馈建模的迁移学习技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于排序法和分解的高维多目标演化算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于领域知识和链路预测的个性化推荐研究

国家自然科学基金

4+阅读 · 2014年12月31日

社交网络环境下基于协同过滤的上下文感知推荐系统研究

国家自然科学基金

6+阅读 · 2014年12月31日

面向多源遥感图像的深度学习技术与系统研究

国家自然科学基金

17+阅读 · 2014年12月31日

基于人眼关注度与情感分析的电子商务智能推荐计算

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下融合多源信息的推荐系统关键问题研究

国家自然科学基金

6+阅读 · 2014年12月31日

排序管理的帕累托优化问题研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于多智能体强化学习的多机器人系统研究

国家自然科学基金

50+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员