困惑度感知数据缩放定律：困惑度景观预测持续预训练性能 (Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training) - 专知论文

会员服务 ·

0

困惑度 · 缩放 · Scaling Law · 预训练 · 感知数据 ·

2025 年 12 月 25 日

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

翻译：困惑度感知数据缩放定律：困惑度景观预测持续预训练性能

Lei Liu,Hao Zhu,Yue Shen,Zhixuan Chu,Jian Wang,Jinjie Gu,Kui Ren

Continual Pre-training (CPT) serves as a fundamental approach for adapting foundation models to domain-specific applications. Scaling laws for pre-training define a power-law relationship between dataset size and the test loss of an LLM. However, the marginal gains from simply increasing data for CPT diminish rapidly, yielding suboptimal data utilization and inefficient training. To address this challenge, we propose a novel perplexity-aware data scaling law to establish a predictive relationship between the perplexity landscape of domain-specific data and the test loss. Our approach leverages the perplexity derived from the pre-trained model on domain data as a proxy for estimating the knowledge gap, effectively quantifying the informational perplexity landscape of candidate training samples. By fitting this scaling law across diverse perplexity regimes, we enable adaptive selection of high-utility data subsets, prioritizing content that maximizes knowledge absorption while minimizing redundancy and noise. Extensive experiments demonstrate that our method consistently identifies near-optimal training subsets and achieves superior performance on both medical and general-domain benchmarks.

翻译：持续预训练（CPT）是将基础模型适配到特定领域应用的基本方法。预训练的缩放定律定义了数据集大小与大型语言模型测试损失之间的幂律关系。然而，单纯增加CPT数据所带来的边际收益会迅速递减，导致数据利用次优和训练效率低下。为应对这一挑战，我们提出了一种新颖的困惑度感知数据缩放定律，以建立领域数据困惑度景观与测试损失之间的预测关系。我们的方法利用预训练模型在领域数据上计算得到的困惑度作为估计知识差距的代理，有效量化了候选训练样本的信息困惑度景观。通过在不同困惑度区间拟合该缩放定律，我们能够自适应地选择高效用数据子集，优先考虑那些能最大化知识吸收同时最小化冗余和噪声的内容。大量实验表明，我们的方法能持续识别出接近最优的训练子集，并在医学和通用领域基准测试中均取得更优性能。

0

相关内容

困惑度

【ICML2025】从混淆的离线数据中自动构造奖励函数

【ICML2025】从混淆的离线数据中自动构造奖励函数

专知会员服务

9+阅读 · 2025年5月22日

【CVPR2025】CarPlanner: 一种用于自动驾驶大规模强化学习的一致性自回归轨迹规划

【CVPR2025】CarPlanner: 一种用于自动驾驶大规模强化学习的一致性自回归轨迹规划

专知会员服务

14+阅读 · 2025年3月2日

【ICLR2025】基于图形引导的图像场景重建：3D高斯散射方法

【ICLR2025】基于图形引导的图像场景重建：3D高斯散射方法

专知会员服务

13+阅读 · 2025年2月25日

【NeurIPS2023】元适配器:面向视觉-语言模型的在线少样本学习器

【NeurIPS2023】元适配器:面向视觉-语言模型的在线少样本学习器

专知会员服务

24+阅读 · 2023年11月8日

【CVPR2023】DynamicDet:目标检测的统一动态架构

【CVPR2023】DynamicDet:目标检测的统一动态架构

专知会员服务

26+阅读 · 2023年4月15日

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

专知会员服务

42+阅读 · 2023年4月14日

【AAAI2023】MHCCL:多变量时间序列的掩蔽层次聚类对比学习

【AAAI2023】MHCCL:多变量时间序列的掩蔽层次聚类对比学习

专知会员服务

17+阅读 · 2022年12月9日

CVPR 2022 | 点云分割的对比边界学习

CVPR 2022 | 点云分割的对比边界学习

专知会员服务

16+阅读 · 2022年4月30日

【CVPR 2022】长尾视觉数据识别的嵌套式协同学习方法 Nested Collaborative Learning for Long-Tailed Visual Recognition

【CVPR 2022】长尾视觉数据识别的嵌套式协同学习方法 Nested Collaborative Learning for Long-Tailed Visual Recognition

专知会员服务

13+阅读 · 2022年3月19日

【AAAI2021】低资源医疗对话生成的图演化元学习

【AAAI2021】低资源医疗对话生成的图演化元学习

专知会员服务

48+阅读 · 2020年12月26日

【MIT】硬负样本的对比学习

【MIT】硬负样本的对比学习

专知

13+阅读 · 2020年10月15日

【CIKM2020】多模态知识图谱推荐系统，Multi-modal KG for RS

【CIKM2020】多模态知识图谱推荐系统，Multi-modal KG for RS

专知

33+阅读 · 2020年8月24日

【CVPR 2020 Oral】小样本类增量学习

【CVPR 2020 Oral】小样本类增量学习

专知

20+阅读 · 2020年6月26日

【CVPR2020-北京大学】自适应间隔损失的提升小样本学习

【CVPR2020-北京大学】自适应间隔损失的提升小样本学习

专知

12+阅读 · 2020年6月9日

【CVPR2020-旷视】DPGN：分布传播图网络的小样本学习

【CVPR2020-旷视】DPGN：分布传播图网络的小样本学习

专知

13+阅读 · 2020年4月1日

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

微软研究院AI头条

18+阅读 · 2019年8月13日

KDD 2019 | 自动探索特征组合，第四范式提出新方法AutoCross

KDD 2019 | 自动探索特征组合，第四范式提出新方法AutoCross

机器之心

18+阅读 · 2019年6月12日

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器学习研究会

12+阅读 · 2017年12月24日

斯坦福Jure Leskovec图表示学习：无监督和有监督方法（附PPT下载）

斯坦福Jure Leskovec图表示学习：无监督和有监督方法（附PPT下载）

专知

24+阅读 · 2017年12月17日

SSD: Single Shot MultiBox Detector 深度学习笔记之SSD物体检测模型

SSD: Single Shot MultiBox Detector 深度学习笔记之SSD物体检测模型

AI研习社

18+阅读 · 2017年8月31日

大规模多视角高维图像特征提取

国家自然科学基金

3+阅读 · 2017年12月31日

基于混合蛙跳算法的三维重力密度异常快速反演

国家自然科学基金

0+阅读 · 2015年12月31日

模糊情况下的最优消费与投资

国家自然科学基金

3+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

T-S模糊神经网络的容错同步性分析

国家自然科学基金

0+阅读 · 2015年12月31日

求解一类公平疏散问题的高性能混合算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

“数据-知识”驱动的大区域高分辨率遥感影像多尺度分割并行计算方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于自主学习的Ad hoc Agent序贯决策研究

国家自然科学基金

46+阅读 · 2015年12月31日

基于非对称群体兴趣相关性并融合情境与群体信任的Web服务推荐研究

国家自然科学基金

1+阅读 · 2015年12月31日

非均质量子器件Schr？dinger-Poisson系统多尺度分析与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

PI-Light: Physics-Inspired Diffusion for Full-Image Relighting

Arxiv

0+阅读 · 1月29日

Dynamics of Human-AI Collective Knowledge on the Web: A Scalable Model and Insights for Sustainable Growth

Arxiv

0+阅读 · 1月27日

PYRREGULAR: A Unified Framework for Irregular Time Series, with Classification Benchmarks

Arxiv

0+阅读 · 1月27日

Dual-Prototype Disentanglement: A Context-Aware Enhancement Framework for Time Series Forecasting

Arxiv

0+阅读 · 1月27日

Dual-Prototype Disentanglement: A Context-Aware Enhancement Framework for Time Series Forecasting

Arxiv

0+阅读 · 1月23日

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

Arxiv

0+阅读 · 1月21日

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

Arxiv

0+阅读 · 1月20日

Group-Invariant Unsupervised Skill Discovery: Symmetry-aware Skill Representations for Generalizable Behavior

Arxiv

0+阅读 · 1月20日

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

Arxiv

0+阅读 · 1月16日

Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

相关VIP内容

【ICML2025】从混淆的离线数据中自动构造奖励函数

【ICML2025】从混淆的离线数据中自动构造奖励函数

专知会员服务

9+阅读 · 2025年5月22日

【CVPR2025】CarPlanner: 一种用于自动驾驶大规模强化学习的一致性自回归轨迹规划

【CVPR2025】CarPlanner: 一种用于自动驾驶大规模强化学习的一致性自回归轨迹规划

专知会员服务

14+阅读 · 2025年3月2日

【ICLR2025】基于图形引导的图像场景重建：3D高斯散射方法

【ICLR2025】基于图形引导的图像场景重建：3D高斯散射方法

专知会员服务

13+阅读 · 2025年2月25日

【NeurIPS2023】元适配器:面向视觉-语言模型的在线少样本学习器

【NeurIPS2023】元适配器:面向视觉-语言模型的在线少样本学习器

专知会员服务

24+阅读 · 2023年11月8日

【CVPR2023】DynamicDet:目标检测的统一动态架构

【CVPR2023】DynamicDet:目标检测的统一动态架构

专知会员服务

26+阅读 · 2023年4月15日

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

【CVPR2023】基于梯度不确定性归因的可解释贝叶斯深度学习

专知会员服务

42+阅读 · 2023年4月14日

【AAAI2023】MHCCL:多变量时间序列的掩蔽层次聚类对比学习

【AAAI2023】MHCCL:多变量时间序列的掩蔽层次聚类对比学习

专知会员服务

17+阅读 · 2022年12月9日

CVPR 2022 | 点云分割的对比边界学习

CVPR 2022 | 点云分割的对比边界学习

专知会员服务

16+阅读 · 2022年4月30日

【CVPR 2022】长尾视觉数据识别的嵌套式协同学习方法 Nested Collaborative Learning for Long-Tailed Visual Recognition

【CVPR 2022】长尾视觉数据识别的嵌套式协同学习方法 Nested Collaborative Learning for Long-Tailed Visual Recognition

专知会员服务

13+阅读 · 2022年3月19日

【AAAI2021】低资源医疗对话生成的图演化元学习

【AAAI2021】低资源医疗对话生成的图演化元学习

专知会员服务

48+阅读 · 2020年12月26日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【MIT】硬负样本的对比学习

【MIT】硬负样本的对比学习

专知

13+阅读 · 2020年10月15日

【CIKM2020】多模态知识图谱推荐系统，Multi-modal KG for RS

【CIKM2020】多模态知识图谱推荐系统，Multi-modal KG for RS

专知

33+阅读 · 2020年8月24日

【CVPR 2020 Oral】小样本类增量学习

【CVPR 2020 Oral】小样本类增量学习

专知

20+阅读 · 2020年6月26日

【CVPR2020-北京大学】自适应间隔损失的提升小样本学习

【CVPR2020-北京大学】自适应间隔损失的提升小样本学习

专知

12+阅读 · 2020年6月9日

【CVPR2020-旷视】DPGN：分布传播图网络的小样本学习

【CVPR2020-旷视】DPGN：分布传播图网络的小样本学习

专知

13+阅读 · 2020年4月1日

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

IJCAI 2019 | 为推荐系统生成高质量的文本解释：基于互注意力机制的多任务学习模型

微软研究院AI头条

18+阅读 · 2019年8月13日

KDD 2019 | 自动探索特征组合，第四范式提出新方法AutoCross

KDD 2019 | 自动探索特征组合，第四范式提出新方法AutoCross

机器之心

18+阅读 · 2019年6月12日

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器翻译新时代：Facebook 开源无监督机器翻译模型和大规模训练语料

机器学习研究会

12+阅读 · 2017年12月24日

斯坦福Jure Leskovec图表示学习：无监督和有监督方法（附PPT下载）

斯坦福Jure Leskovec图表示学习：无监督和有监督方法（附PPT下载）

专知

24+阅读 · 2017年12月17日

SSD: Single Shot MultiBox Detector 深度学习笔记之SSD物体检测模型

SSD: Single Shot MultiBox Detector 深度学习笔记之SSD物体检测模型

AI研习社

18+阅读 · 2017年8月31日

相关论文

PI-Light: Physics-Inspired Diffusion for Full-Image Relighting

Arxiv

0+阅读 · 1月29日

Dynamics of Human-AI Collective Knowledge on the Web: A Scalable Model and Insights for Sustainable Growth

Arxiv

0+阅读 · 1月27日

PYRREGULAR: A Unified Framework for Irregular Time Series, with Classification Benchmarks

Arxiv

0+阅读 · 1月27日

Dual-Prototype Disentanglement: A Context-Aware Enhancement Framework for Time Series Forecasting

Arxiv

0+阅读 · 1月27日

Dual-Prototype Disentanglement: A Context-Aware Enhancement Framework for Time Series Forecasting

Arxiv

0+阅读 · 1月23日

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

Arxiv

0+阅读 · 1月21日

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

Arxiv

0+阅读 · 1月20日

Group-Invariant Unsupervised Skill Discovery: Symmetry-aware Skill Representations for Generalizable Behavior

Arxiv

0+阅读 · 1月20日

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

Arxiv

0+阅读 · 1月16日

Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis

Arxiv

0+阅读 · 1月13日

相关基金

大规模多视角高维图像特征提取

国家自然科学基金

3+阅读 · 2017年12月31日

基于混合蛙跳算法的三维重力密度异常快速反演

国家自然科学基金

0+阅读 · 2015年12月31日

模糊情况下的最优消费与投资

国家自然科学基金

3+阅读 · 2015年12月31日

分布式有监督学习的学习理论

国家自然科学基金

17+阅读 · 2015年12月31日

T-S模糊神经网络的容错同步性分析

国家自然科学基金

0+阅读 · 2015年12月31日

求解一类公平疏散问题的高性能混合算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

“数据-知识”驱动的大区域高分辨率遥感影像多尺度分割并行计算方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于自主学习的Ad hoc Agent序贯决策研究

国家自然科学基金

46+阅读 · 2015年12月31日

基于非对称群体兴趣相关性并融合情境与群体信任的Web服务推荐研究

国家自然科学基金

1+阅读 · 2015年12月31日

非均质量子器件Schr？dinger-Poisson系统多尺度分析与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员