Quantizing Intent: Cross-Domain Semantic IDs from Organic Activity for Industrial Ranking - 专知论文

会员服务 ·

0

嵌入 · AUC · 排序 · 稀疏 · 存储 ·

Quantizing Intent: Cross-Domain Semantic IDs from Organic Activity for Industrial Ranking

翻译：量化意图：基于有机活动的跨域语义ID用于工业排序

Julie Choi,Haoran Ye,Zhiwei Ding,Bo Long,Benjamin Zelditch,Arpita Vats

Ads click-through rate (CTR) prediction is constrained by sparse user supervision: most users engage with ads infrequently while generating dense behavioral evidence in organic surfaces such as feed. Transferring these cross-domain signals into ads ranking is difficult due to domain mismatch, serving cost, and production complexity. We introduce cross-domain user Semantic IDs (SIDs) derived from organic feed activity and show that behavioral activity richness governs cross-domain transfer quality: SIDs from user profile text yield +0.036% AUC, SIDs from an activity-tuned LLaMA-based user embedding model yield +0.107%, and SIDs from direct feed activity behavioral embeddings yield +0.213%. We further propose RQ-FSQ, a residual finite scalar quantization method that discretizes pre-trained embeddings while matching dense-embedding AUC at substantially smaller storage. Across two heterogeneous sources, RQ-FSQ matches or slightly exceeds dense source embeddings, achieving +0.351% AUC for Feed Activity at about 30x smaller storage and +0.265% AUC for Activity-Tuned LLaMA at about 280x smaller storage. We also introduce a Hierarchical Discrete Embedding module that encodes multi-level SIDs through prefix n-gram sparse embedding tables trained end-to-end under the CTR objective. In a large-scale industrial ads ranking system, cold-start segment analysis shows gains up to +1.522% for users with near-zero ad interaction history, validating cross-domain behavioral transfer as an effective bridge for sparse-history ranking.

翻译：广告点击率（CTR）预测受限于稀疏的用户监督：大多数用户与广告交互频率低，但在Feed等有机界面中生成密集的行为证据。由于域不匹配、服务成本和生成复杂性，将这些跨域信号转移到广告排序中较为困难。我们引入了源自有机Feed活动的跨域用户语义ID（SID），并表明行为活动丰富度主导跨域迁移质量：来自用户文本的SID获得+0.036%AUC，基于活动微调LLaMA的用户嵌入模型SID获得+0.107%AUC，直接来自Feed活动行为嵌入的SID获得+0.213%AUC。我们进一步提出RQ-FSQ，一种残差有限标量量化方法，在显著减小存储的同时对预训练嵌入进行离散化并匹配稠密嵌入AUC。在两种异构源上，RQ-FSQ匹配或略超过稠密源嵌入，在约30倍存储缩减下为Feed活动实现+0.351%AUC提升，在约280倍存储缩减下为活动微调LLaMA实现+0.265%AUC提升。我们还引入层次离散嵌入模块，通过CTR目标下端到端训练的前缀n-gram稀疏嵌入表编码多级SID。在大规模工业广告排序系统中，冷启动分段分析显示，对近乎无广告交互历史的用户增益高达+1.522%，验证了跨域行为迁移作为稀疏历史排序有效桥梁的可行性。

0

相关内容

【WWW2024】基于提示增强的联邦内容表征学习的跨域推荐

【WWW2024】基于提示增强的联邦内容表征学习的跨域推荐

专知会员服务

19+阅读 · 2024年1月29日

【SIGIR2021】ScaleFreeCTR：超大规模Embedding推荐模型分布式训练系统

专知会员服务

28+阅读 · 2021年4月26日

【WWW2021】场矩阵分解机推荐系统

【WWW2021】场矩阵分解机推荐系统

专知会员服务

33+阅读 · 2021年2月27日

【WSDM2021】多交互注意力网络细粒度特征学习的CTR预测

【WSDM2021】多交互注意力网络细粒度特征学习的CTR预测

专知会员服务

25+阅读 · 2020年12月27日

【NeurIPS 2020京东】基于卡尔曼滤波的注意力机制—广告点击率预估中的用户行为建模

专知会员服务

26+阅读 · 2020年10月30日

基于双注意力机制和迁移学习的跨领域推荐模型

专知会员服务

48+阅读 · 2020年10月20日

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

专知会员服务

27+阅读 · 2020年6月10日

【序列推荐系统:挑战、进展和展望】Sequential Recommender Systems

【序列推荐系统:挑战、进展和展望】Sequential Recommender Systems

专知会员服务

82+阅读 · 2020年4月25日

【Google-WWW2020】会话域探索的动态组合， Conversational Domain Exploration

专知会员服务

10+阅读 · 2020年3月22日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知会员服务

55+阅读 · 2020年3月17日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

初学者系列：Deep FM详解

初学者系列：Deep FM详解

专知

110+阅读 · 2019年8月26日

计算机视觉方向简介 | 基于自然语言的跨模态行人re-id的SOTA方法（上）

计算机视觉方向简介 | 基于自然语言的跨模态行人re-id的SOTA方法（上）

计算机视觉life

12+阅读 · 2019年6月29日

大众点评搜索基于知识图谱的深度学习排序实践

大众点评搜索基于知识图谱的深度学习排序实践

数据猿

11+阅读 · 2019年1月22日

领域应用 | 大众点评搜索基于知识图谱的深度学习排序实践

领域应用 | 大众点评搜索基于知识图谱的深度学习排序实践

开放知识图谱

11+阅读 · 2019年1月21日

深度学习在CTR预估中的应用 | CTR深度模型大盘点

深度学习在CTR预估中的应用 | CTR深度模型大盘点

PaperWeekly

15+阅读 · 2018年4月11日

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

专知

10+阅读 · 2018年3月10日

代码+实战：TensorFlow Estimator of Deep CTR —— DeepFM/NFM/AFM/FNN/PNN

代码+实战：TensorFlow Estimator of Deep CTR —— DeepFM/NFM/AFM/FNN/PNN

AI研习社

14+阅读 · 2018年2月17日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

[推荐] 这些年，我用过的点击率（CTR）预估模型！！！

[推荐] 这些年，我用过的点击率（CTR）预估模型！！！

菜鸟的机器学习

28+阅读 · 2017年7月31日

有限域上指数和的计算及其在序列设计中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于关键词的大规模链接数据搜索技术研究

国家自然科学基金

7+阅读 · 2015年12月31日

基于概率语义分析的多关系图多类标分类方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

多重排序数据的整合分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于视觉差异特征的跨域图像匹配方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

有限域上指数和与量子码的研究

国家自然科学基金

0+阅读 · 2014年12月31日

关于面板(纵向）数据的动态统计分析

国家自然科学基金

0+阅读 · 2014年12月31日

基于领域知识和链路预测的个性化推荐研究

国家自然科学基金

4+阅读 · 2014年12月31日

排序集抽样下随机删失数据的非参数估计

国家自然科学基金

1+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

Beyond Positive Signals: Unlocking Implicit Negative Behaviors for Enhanced Sequential User Modeling

Arxiv

0+阅读 · 6月13日

Abstracting Cross-Domain Action Sequences into Interpretable Workflows

Arxiv

0+阅读 · 6月12日

Towards Conditional Feature Alignment for Cross-Domain Counting

Arxiv

0+阅读 · 6月10日

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

Arxiv

0+阅读 · 6月9日

Decoupled Residual Quantization for Robust Semantic IDs in Recommendation

Arxiv

0+阅读 · 6月1日

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

Arxiv

0+阅读 · 5月31日

An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking

Arxiv

0+阅读 · 5月29日

Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems

Arxiv

0+阅读 · 5月29日

FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets

Arxiv

0+阅读 · 5月27日

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

Arxiv

0+阅读 · 5月12日

VIP会员

文章信息

相关主题

最新内容

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

0+阅读 · 53分钟前

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

0+阅读 · 55分钟前

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

6+阅读 · 今天8:00

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

5+阅读 · 今天7:44

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

4+阅读 · 今天7:28

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

4+阅读 · 今天7:18

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

专知会员服务

5+阅读 · 今天7:07

军事欺骗：供作战战术指挥官使用的工具

军事欺骗：供作战战术指挥官使用的工具

专知会员服务

4+阅读 · 今天7:03

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

4+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

6+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

10+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

4+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

5+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

8+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

7+阅读 · 6月23日

相关VIP内容

【WWW2024】基于提示增强的联邦内容表征学习的跨域推荐

【WWW2024】基于提示增强的联邦内容表征学习的跨域推荐

专知会员服务

19+阅读 · 2024年1月29日

【SIGIR2021】ScaleFreeCTR：超大规模Embedding推荐模型分布式训练系统

专知会员服务

28+阅读 · 2021年4月26日

【WWW2021】场矩阵分解机推荐系统

【WWW2021】场矩阵分解机推荐系统

专知会员服务

33+阅读 · 2021年2月27日

【WSDM2021】多交互注意力网络细粒度特征学习的CTR预测

【WSDM2021】多交互注意力网络细粒度特征学习的CTR预测

专知会员服务

25+阅读 · 2020年12月27日

【NeurIPS 2020京东】基于卡尔曼滤波的注意力机制—广告点击率预估中的用户行为建模

专知会员服务

26+阅读 · 2020年10月30日

基于双注意力机制和迁移学习的跨领域推荐模型

专知会员服务

48+阅读 · 2020年10月20日

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

【SIGIR2020】策略感知的无偏排序学习—Top-K排序，Policy-Aware Unbiased Learning to Rank for Top-𝑘 Rankings

专知会员服务

27+阅读 · 2020年6月10日

【序列推荐系统:挑战、进展和展望】Sequential Recommender Systems

【序列推荐系统:挑战、进展和展望】Sequential Recommender Systems

专知会员服务

82+阅读 · 2020年4月25日

【Google-WWW2020】会话域探索的动态组合， Conversational Domain Exploration

专知会员服务

10+阅读 · 2020年3月22日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知会员服务

55+阅读 · 2020年3月17日

热门VIP内容

开通专知VIP会员享更多权益服务

Agentic RL：框架、实践与长程智能体训练

重新思考无人机时代的生存能力

综述 | 从问答到任务完成：Agent系统与Harness设计

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

相关资讯

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

初学者系列：Deep FM详解

初学者系列：Deep FM详解

专知

110+阅读 · 2019年8月26日

计算机视觉方向简介 | 基于自然语言的跨模态行人re-id的SOTA方法（上）

计算机视觉方向简介 | 基于自然语言的跨模态行人re-id的SOTA方法（上）

计算机视觉life

12+阅读 · 2019年6月29日

大众点评搜索基于知识图谱的深度学习排序实践

大众点评搜索基于知识图谱的深度学习排序实践

数据猿

11+阅读 · 2019年1月22日

领域应用 | 大众点评搜索基于知识图谱的深度学习排序实践

领域应用 | 大众点评搜索基于知识图谱的深度学习排序实践

开放知识图谱

11+阅读 · 2019年1月21日

深度学习在CTR预估中的应用 | CTR深度模型大盘点

深度学习在CTR预估中的应用 | CTR深度模型大盘点

PaperWeekly

15+阅读 · 2018年4月11日

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

【论文推荐】最新六篇用户建模精选论文推荐—深度多模态融合、跨平台、时序性RNN、ATRank、嵌入因子分解、异构信息网络

专知

10+阅读 · 2018年3月10日

代码+实战：TensorFlow Estimator of Deep CTR —— DeepFM/NFM/AFM/FNN/PNN

代码+实战：TensorFlow Estimator of Deep CTR —— DeepFM/NFM/AFM/FNN/PNN

AI研习社

14+阅读 · 2018年2月17日

推荐算法：Match与Rank模型的交织配合

推荐算法：Match与Rank模型的交织配合

从0到1

15+阅读 · 2017年12月18日

[推荐] 这些年，我用过的点击率（CTR）预估模型！！！

[推荐] 这些年，我用过的点击率（CTR）预估模型！！！

菜鸟的机器学习

28+阅读 · 2017年7月31日

相关论文

Beyond Positive Signals: Unlocking Implicit Negative Behaviors for Enhanced Sequential User Modeling

Arxiv

0+阅读 · 6月13日

Abstracting Cross-Domain Action Sequences into Interpretable Workflows

Arxiv

0+阅读 · 6月12日

Towards Conditional Feature Alignment for Cross-Domain Counting

Arxiv

0+阅读 · 6月10日

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

Arxiv

0+阅读 · 6月9日

Decoupled Residual Quantization for Robust Semantic IDs in Recommendation

Arxiv

0+阅读 · 6月1日

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

Arxiv

0+阅读 · 5月31日

An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking

Arxiv

0+阅读 · 5月29日

Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems

Arxiv

0+阅读 · 5月29日

FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets

Arxiv

0+阅读 · 5月27日

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

Arxiv

0+阅读 · 5月12日

相关基金

有限域上指数和的计算及其在序列设计中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于关键词的大规模链接数据搜索技术研究

国家自然科学基金

7+阅读 · 2015年12月31日

基于概率语义分析的多关系图多类标分类方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

多重排序数据的整合分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于视觉差异特征的跨域图像匹配方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

有限域上指数和与量子码的研究

国家自然科学基金

0+阅读 · 2014年12月31日

关于面板(纵向）数据的动态统计分析

国家自然科学基金

0+阅读 · 2014年12月31日

基于领域知识和链路预测的个性化推荐研究

国家自然科学基金

4+阅读 · 2014年12月31日

排序集抽样下随机删失数据的非参数估计

国家自然科学基金

1+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员