推荐系统正在从“给用户排一个列表”走向“围绕用户目标持续行动”。传统推荐依赖历史点击、评分、购买等记录,核心是预测偏好并排序;LLM 推荐引入自然语言理解和生成能力,但很多系统仍只是被动响应提示。本文关注更进一步的 Agentic Recommender Systems,代理式推荐系统:系统中存在一个或多个由大模型驱动的代理,能够理解目标、拆解任务、调用检索/排序/API 等工具、维护用户状态与记忆,并在多轮交互中修正推荐。 论文提出了一个以 自主等级 Level of Autonomy,LoA 为主线的统一框架,并将现有工作归纳为三类核心范式:代理辅助推荐、代理作为推荐器、代理作为用户/环境模拟器。这三个范式覆盖了从 RAG 增强、工具调用、单代理规划,到多代理协作与仿真评测的完整研究版图。更重要的是,论文强调代理式推荐不能只用 NDCG、Recall 这类最终排序指标评估,还必须评估工具调用、规划轨迹、记忆更新、用户体验、安全性、隐私与部署成本。 这篇综述的价值在于给出清晰判断标准:一个系统是否“代理式”,不取决于是否用了 LLM,而取决于它是否能在推荐环境中选择行动、维护状态、调用外部能力并根据反馈适应。
传统推荐系统通常被建模为静态映射:给定用户、上下文与候选物品,输出排序列表。这一范式在电影、电商、新闻、短视频等场景中很有效,但越来越多真实任务并不只是“一次排序”能解决。例如旅行规划、穿搭协调、餐厅选择等场景,都需要同时处理预算、时间、地点、偏好和外部变化。 这些任务的难点不只是偏好预测,而是目标理解、约束推理、外部信息获取、多步规划与持续修正。大模型带来了自然语言交互和生成解释能力,但 LLM-based RS 并不天然等于 Agentic RS。许多系统仍只是回答提示或重排候选,并不显式规划、调用工具或维护持久记忆。 论文因此将代理式推荐系统定义为:在推荐循环中嵌入一个或多个代理,使其具备行动选择、工具使用、记忆更新和交互适应能力。一个典型 ARS 可以解释自然语言目标,将目标拆成子任务,调用检索、排序、过滤、搜索或外部 API,跟踪候选集合、用户反馈与约束条件,并迭代改进推荐结果。 为避免“agentic”概念泛化,论文采用 LoA 自主等级视角,由任务范围与规划方式、上下文感知与记忆、交互灵活性、适应能力四个维度驱动。论文重点讨论 L2 到 L5:检索增强、工具驱动、单代理规划和多代理编排。L6 是概念性的“代理社会”,目前更多是远期愿景。 论文系统检索了 2018 年至 2026 年 3 月的相关研究,并通过关键词搜索、引用滚雪球和人工标注构建研究集合。统计显示,代理式推荐研究在 2024 至 2026 年快速增长,其中“代理作为推荐器”占比最高,“代理作为模拟器”和多代理系统也持续升温。
论文首先将推荐系统重新表述为交互式决策过程。传统系统输出推荐列表,而代理式系统在多轮中接收用户输入、环境状态和工具结果,再决定下一步行动。这里的行动不只包括“推荐物品”,还包括澄清问题、检索候选、应用约束、调用工具、验证计划、生成解释和更新记忆。 在这一框架下,面向推荐的 LLM 代理需要具备观察、理解、规划、行动和状态更新能力;代理式推荐系统则是包含一个或多个此类代理的交互式推荐系统,能够利用工具和记忆产生个性化结果。
传统推荐系统分类通常围绕算法家族、任务类型或数据模态展开,适合静态流水线,却难以描述代理式推荐的关键差异。两个系统可能都使用 LLM 和 RAG,但一个只是把自然语言转成查询,另一个让代理负责规划、调用工具、反思并协作。仅靠算法标签无法说明“代理被允许做什么”。 因此,论文提出二维分类:宏观角色 与 自主等级。宏观角色回答代理在推荐循环中的位置,自主等级回答代理拥有多大行动空间和能力边界。
第一类是 代理辅助推荐。代理围绕传统推荐模型工作,增强偏好获取、证据检索、结果过滤或解释生成,但最终排序仍主要由经典推荐组件完成。 第二类是 代理作为推荐器。一个或多个代理承担推荐决策的主要责任,维护用户状态,编排工具调用,检索和排序物品,并生成解释。传统模型如果存在,更多作为工具而不是主控制器。 第三类是 代理仿真。代理不直接面向真实用户推荐,而是模拟用户或环境,生成点击、评分、评论、对话行为或反馈信号,用于训练、评估和鲁棒性分析。
L2 是检索增强,重点是证据 grounding 与信息新鲜度。L3 是工具编排,代理可调用检索器、排序器、SQL 查询、搜索引擎、属性过滤器或多模态工具。L4 是单代理规划,覆盖多步推理、计划执行、记忆维护和自我反思。L5 是多代理编排,不同代理通过通信、协商和仲裁共同完成推荐。
代理辅助推荐系统是在既有推荐流水线周围插入 LLM 代理。它们通常不替代完整推荐器,而是增强其中一个或多个阶段,如偏好澄清、候选检索、工具调用、约束过滤、解释生成与错误恢复。论文将这一类系统分为三条主线:检索增强辅助、工具驱动辅助、规划式辅助。
检索增强是 L2 系统的主导模式,也是 L3 系统的重要构件。与 NLP 中的通用 RAG 不同,推荐场景中的检索证据必须与推荐结构对齐。被检索的信息可能是用户侧信息,例如历史偏好、约束和评论;也可能是物品侧信息,例如描述、属性、评论和库存;还可能是辅助知识,例如领域事实、知识图谱、天气、地点或实时网页信息。 论文从三个角度组织检索增强辅助。第一是为什么检索:偏好 grounding 降低意图漂移,物品 grounding 支持解释并减少幻觉,上下文扩展补充领域信息。第二是检索什么:用户信息、物品语义和辅助知识。第三是如何检索:粗到细检索、反思式迭代检索和多源融合。
工具使用把代理的行动空间从文本生成扩展到外部系统。论文将工具分为推荐工具、外部知识工具、属性导向工具和多模态工具。其核心价值是让代理既保持语言交互能力,又能把候选召回、排序、数据库查询、约束过滤等关键计算委托给可靠组件,从而降低纯 LLM 生成的幻觉风险,并保留传统推荐器在大规模候选空间中的效率。
当用户目标包含多个子目标或复杂约束时,代理需要先规划再行动。规划式辅助通常包括交互规划、表征规划、排序/重排规划三类。交互规划决定何时询问用户、何时推荐、何时澄清;表征规划决定如何把用户目标转成可检索、可排序的结构化表示;排序规划决定如何组合多种候选来源、约束和重排策略。 这类系统通常仍依赖经典推荐模型输出最终候选,但代理成为推荐流程的“调度层”。它不一定拥有完整决策权,却能显著提升系统的可控性、可解释性和面向复杂任务的适应性。
代理作为推荐器是自主性更高的一类范式。此时,代理不再只是外挂辅助模块,而是推荐系统的控制器和决策者。论文进一步区分单代理推荐器和多代理推荐器。
单代理推荐器通常包含五个核心组件:用户画像、记忆、工具使用、工作流控制和优化机制。用户画像保存长期偏好与约束;记忆支撑上下文推理,包括工作记忆、情节记忆和语义记忆;工具使用则让代理调用检索器、排序器、搜索、数据库和多模态模块。
工作流控制决定代理如何组织推理与行动。论文总结出三种范式:ReAct 让推理和行动交替进行;Plan-then-Execute 先分解目标再按计划执行工具调用;Reflex 通过自我批评或 judge-checker 模式评估推荐结果并更新策略。 优化机制主要分为自我反思和反馈反思:前者评估自身推理与推荐质量,后者利用用户或环境反馈更新策略,共同推动系统从静态策略走向持续适应。
多代理推荐器把决策过程分配给规划者、检索者、分析者、批评者、验证者等专门代理。相较单代理,多代理系统可以分散上下文压力,引入不同视角相互校验,并通过协作、辩论、仲裁和协商提升可靠性。其关键问题包括角色设计、通信协议和协作优化。 多代理推荐也带来新风险:通信成本、延迟、角色冗余、责任归因困难和一致性问题。一个多代理系统如果只在最终排序上略有提升,却无法证明每个代理的贡献,就很难说明架构复杂度是值得的。
代理仿真是论文非常强调的一条路线。推荐系统的真实在线交互成本高、风险高,而且很多长期效应难以直接观测,例如过滤气泡、用户兴趣漂移、创作者激励变化和平台生态反馈。代理仿真试图用一个或多个代理近似用户、创作者或环境,为训练、评估和鲁棒性测试提供可控实验场。
论文总结了四个动机。第一,降低昂贵交互成本,在冷启动、隐私受限或流量不足时生成行为信号。第二,支持反事实和压力测试,在可控条件下观察推荐策略对公平性、安全性和鲁棒性的影响。第三,进行数据合成和增强,生成对话、偏好说明、物品描述和结构化用户画像。第四,研究生态系统和反馈回路,例如长期曝光偏差、用户兴趣收缩和内容供给变化。
第一类是数据合成/数据增强。代理生成训练或评估所需的合成样本,如对话、物品描述、偏好理由或用户画像,尤其适合冷启动和真实交互数据稀缺的场景。 第二类是用户仿真。一个 LLM 代理扮演用户,根据上下文生成点击、评分、批评、对话动作或显式理由。关键设计轴包括保真度、可控性、可观测性和校准,即仿真行为既要像真实用户,又要能被研究者控制、解释和对齐。 第三类是多代理环境仿真。系统同时模拟用户、创作者、推荐代理甚至市场环境,使研究者能够观察长期动态和多方利益关系。这类仿真对平台级推荐尤其重要,因为推荐不只是用户与物品的匹配,还会改变内容供给、创作者行为和用户群体结构。
论文提醒,仿真不能被简单当作真实世界替代品。LLM 用户模拟器可能存在人格模板化、行为分布偏差、过度理性、记忆不稳定和数据泄漏等问题。如果推荐器在仿真环境中学习到了模拟器的伪规律,线下收益未必能迁移到真实用户。因此,仿真器本身也必须被评估,包括分布相似性、行为校准、泄漏控制、稳健性和下游迁移效果。
代理式推荐系统必须被评估为交互式系统,而不只是静态排序器。传统 top-N 推荐主要比较预测列表与真实交互,常用指标包括 Recall、NDCG、MRR、MAP 等。但在 ARS 中,一个 episode 往往包含用户输入、内部状态、工具调用、观察结果、中间推理、记忆更新、最终输出与反馈。系统可能最终推荐了相关物品,却使用了错误证据、泄露了敏感画像或进行了重复无效工具调用;也可能排序准确,但交互体验很差。
论文指出,ARS 评测中常见混淆是没有区分 target、protocol 和 metric。Target 是被评估对象,例如排序结果、对话、解释、RAG 证据、模拟器、工具轨迹、记忆更新、多代理协作或部署服务。Protocol 是评测过程,例如离线基准、仿真、用户研究、人工标注、LLM-as-judge、对抗测试、案例研究或在线实验。Metric 是实际测量结果,例如 NDCG、Recall、Success@K、平均轮次、BLEU、faithfulness、攻击成功率、延迟、token 成本和 GMV。 不同自主等级需要不同评测重点。L2 要评估检索证据是否相关、是否被忠实使用;L3 要评估工具选择、参数有效性、执行成功和错误恢复;L4 要评估规划质量、记忆更新和自我修正;L5 要评估通信质量、共识形成、角色贡献和失败归因。只报告最终排序指标,无法证明系统真的具备代理能力。
对于推荐结果本身,传统指标仍然重要,但必须配合消融和上下文报告。对于对话与生成输出,还要评估任务完成度、澄清问题质量、解释有用性、事实一致性和用户满意度。对于 RAG,需要分别评估检索质量、引用准确性、证据覆盖、事实忠实性和幻觉率。 仿真评测则要区分“仿真器是否有用”和“仿真器是否真实”。一个仿真器可能提升下游训练效果,但行为分布不一定真实;也可能与日志统计相似,却无法模拟反事实变化。因此,论文建议同时报告分布相似性、行为一致性、校准数据、泄漏控制和不确定性。 代理轨迹评测尤其关键。工具调用要看选择、参数、执行与恢复;记忆要看写入、检索和过期冲突;规划要看约束覆盖和无效循环;多代理要看通信、共识、冲突解决和每个代理的边际贡献。
论文从建模、用户和系统三个角度总结开放问题。
第一是长期用户建模。代理式推荐需要处理随时间变化的偏好、目标和约束,但长期记忆容易带来过时信息、隐私风险和错误累积,因此需要更好的压缩、冲突检测、遗忘机制和生命周期管理。 第二是上下文抽象。真实用户请求往往包含隐含目标和模糊约束,系统需要把自然语言、历史行为、环境状态和外部知识抽象成可行动的状态表示。这个过程既要保留足够细节,又要避免把噪声写入画像。 第三是多模态对齐。电商、短视频、音乐、旅游和餐饮推荐都依赖图像、视频、音频、地点与文本混合信号。如何让代理在多模态信息中形成统一偏好表示,并把这些信号与用户目标对齐,是重要方向。
从用户角度,代理式推荐需要解决可控性、信任和体验问题。系统越主动,越需要明确边界:何时询问、何时沉默、何时更新画像、何时需要确认。解释也不能只追求流畅,而要让用户理解约束权衡、证据来源和不确定性。 隐私同样是核心挑战。ARS 可能维护更丰富的记忆,访问外部工具,并在多代理之间传递用户信息。未来系统必须明确记录什么、存在哪里、如何检索、何时删除,以及怎样避免敏感属性泄露或跨场景滥用。
从系统角度,代理式推荐面临成本、延迟、可扩展性和可靠性压力。多步规划、工具调用和多代理通信会增加 token 成本和响应时间;真实部署还要处理工具失败、API 变更、网络延迟和高并发流量。架构越复杂,越需要工程级观测能力:平台不仅要知道最终推荐是否被点击,还要知道工具、记忆、证据、代理贡献和失败位置。
这篇综述给代理式推荐系统建立了一套较完整的路线图。它的核心观点是:推荐系统正在从静态排序模型,走向能够理解目标、调用工具、维护记忆、规划行动并与用户持续互动的自主系统。论文提出的 LoA 自主等级框架,有助于区分“使用 LLM 的推荐系统”和“真正具备代理能力的推荐系统”。 从研究版图看,代理辅助推荐、代理作为推荐器和代理仿真分别对应不同阶段的系统自主性。前者增强现有推荐流水线,中者把代理提升为决策控制器,后者为训练和评测提供可控环境。三者共同推动推荐系统从“预测用户会点什么”,转向“帮助用户完成复杂目标”。 但论文也指出,代理式推荐的评测和治理仍落后于架构发展。未来关键不只是让系统更会规划和调用工具,而是要让规划、工具、记忆、协作和仿真都可测、可信、可控、可解释。只有当代理行为本身能被系统性评估,推荐系统才能从交互演示走向可靠部署。