玄奥语言模型 (Esoteric Language Models) - 专知论文

会员服务 ·

0

International Conference on Mobile Data Management · 自回归模型 · 并行 · 掩码 · 困惑度 ·

2025 年 12 月 31 日

Esoteric Language Models

翻译：玄奥语言模型

Subham Sekhar Sahoo,Zhihan Yang,Yash Akhauri,Johnna Liu,Deepansha Singh,Zhoujun Cheng,Zhengzhong Liu,Eric Xing,John Thickstun,Arash Vahdat

Diffusion-based language models offer a compelling alternative to autoregressive (AR) models by enabling parallel and controllable generation. Within this family, Masked Diffusion Models (MDMs) currently perform best but still underperform AR models in perplexity and lack key inference-time efficiency features, most notably KV caching. We introduce Eso-LMs, a new family of models that fuses AR and MDM paradigms, smoothly interpolating between their perplexities while overcoming their respective limitations. Unlike prior work, which uses transformers with bidirectional attention as MDM denoisers, we exploit the connection between MDMs and Any-Order autoregressive models and adopt causal attention. This design lets us compute the exact likelihood of MDMs for the first time and, crucially, enables us \to introduce KV caching for MDMs while preserving parallel generation for the first time, significantly improving inference efficiency. Combined with an optimized sampling schedule, Eso-LMs achieves a new state of the art on the speed-quality Pareto frontier for unconditional generation. On long contexts, it yields $\mathbf{14 - 65{}\times}$ faster inference than standard MDMs and $\mathbf{3 - 4{}\times}$ faster inference than prior semi-autoregressive approaches. We provide code, model checkpoints, and video tutorials on the project page: http://s-sahoo.github.io/Eso-LMs

翻译：基于扩散的语言模型通过支持并行与可控生成，为自回归模型提供了一种极具吸引力的替代方案。在该模型家族中，掩码扩散模型目前表现最佳，但在困惑度上仍逊于自回归模型，且缺乏关键的推理时效率特性，尤其是KV缓存。我们提出了Eso-LMs这一新模型家族，它融合了自回归与掩码扩散模型范式，能在两者困惑度之间平滑插值，同时克服各自局限。与先前使用具有双向注意力的Transformer作为MDM去噪器的工作不同，我们利用MDM与任意顺序自回归模型之间的关联，采用因果注意力机制。这一设计首次实现了MDM精确似然度的计算，并且关键地首次为MDM引入了KV缓存，同时保留了并行生成能力，显著提升了推理效率。结合优化的采样策略，Eso-LMs在无条件生成任务的速度-质量帕累托边界上达到了新的最优水平。在长上下文场景中，其推理速度比标准MDM快$\mathbf{14 - 65{}\times}$，比先前的半自回归方法快$\mathbf{3 - 4{}\times}$。我们在项目页面提供了代码、模型检查点及视频教程：http://s-sahoo.github.io/Eso-LMs

0

相关内容

International Conference on Mobile Data Management

International Conference on Mobile Data Management

MDM会议旨在寻找移动计算和数据管理领域寻求原始研究贡献，移动数据驱动的创新应用。官网地址：http://dblp.uni-trier.de/db/conf/mdm/

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

专知会员服务

12+阅读 · 2025年9月21日

扩散语言模型综述

扩散语言模型综述

专知会员服务

18+阅读 · 2025年8月15日

【阿姆斯特丹博士论文】语言模型与人类理解与行为的对齐

【阿姆斯特丹博士论文】语言模型与人类理解与行为的对齐

专知会员服务

18+阅读 · 2025年7月19日

【牛津大学博士论文】迈向具有类人自然语言理解的语言模型

【牛津大学博士论文】迈向具有类人自然语言理解的语言模型

专知会员服务

29+阅读 · 2024年10月28日

大型语言模型对齐

大型语言模型对齐

专知会员服务

119+阅读 · 2023年9月27日

从语言模型到语言智能体，普林斯顿Shunyu Yao

从语言模型到语言智能体，普林斯顿Shunyu Yao

专知会员服务

63+阅读 · 2023年9月18日

大模型如何可解释？新泽西理工学院等最新《大型语言模型可解释性》综述

大模型如何可解释？新泽西理工学院等最新《大型语言模型可解释性》综述

专知会员服务

98+阅读 · 2023年9月11日

大语言模型简明指南

大语言模型简明指南

专知会员服务

143+阅读 · 2023年7月29日

《大型语言模型》最新全面概述

《大型语言模型》最新全面概述

专知会员服务

111+阅读 · 2023年7月14日

UIUC-Gargi《增强型语言模型》，64页ppt与视频

UIUC-Gargi《增强型语言模型》，64页ppt与视频

专知会员服务

37+阅读 · 2023年5月12日

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知

14+阅读 · 2020年8月30日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知

13+阅读 · 2020年8月9日

【复旦大学】最新《预训练语言模型》2020综述论文大全，50+PTMs分类体系，25页pdf205篇参考文献

【复旦大学】最新《预训练语言模型》2020综述论文大全，50+PTMs分类体系，25页pdf205篇参考文献

专知

22+阅读 · 2020年3月19日

华为诺亚方舟预训练语言模型NEZHA、TinyBERT开源代码

华为诺亚方舟预训练语言模型NEZHA、TinyBERT开源代码

专知

17+阅读 · 2019年12月7日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

预训练语言模型关系图+必读论文列表，清华荣誉出品

预训练语言模型关系图+必读论文列表，清华荣誉出品

机器之心

18+阅读 · 2019年10月11日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

“模块化自组装”DNA计算模型的研究

国家自然科学基金

3+阅读 · 2015年12月31日

即时通信中的隐蔽通信模型及方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于格值逻辑的语言真值α-群锁语义归结自动推理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

多尺度模块网络下的储备池神经计算模型及算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机文法作为通用统计模型的扩展

国家自然科学基金

1+阅读 · 2015年12月31日

中文句子语义概念图自动构建方法及应用研究

国家自然科学基金

3+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

概率图模型学习及其在数据分析中的应用研究

国家自然科学基金

16+阅读 · 2013年12月31日

Simple Denoising Diffusion Language Models

Arxiv

0+阅读 · 2月3日

Sentence Curve Language Models

Arxiv

0+阅读 · 2月3日

Residual Context Diffusion Language Models

Arxiv

0+阅读 · 1月30日

Corrective Diffusion Language Models

Arxiv

0+阅读 · 1月29日

Recursive Language Models

Arxiv

0+阅读 · 1月28日

Dual-objective Language Models: Training Efficiency Without Overfitting

Arxiv

0+阅读 · 1月28日

Auto-Regressive Masked Diffusion Models

Arxiv

0+阅读 · 1月23日

Closing the Modality Reasoning Gap for Speech Large Language Models

Arxiv

0+阅读 · 1月9日

Advancing Language Models for Code-related Tasks

Arxiv

0+阅读 · 1月8日

Modeling Language as a Sequence of Thoughts

Arxiv

0+阅读 · 2025年12月31日

VIP会员

文章信息

相关主题

International Conference on Mobile Data Management

自回归模型

相关VIP内容

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

专知会员服务

12+阅读 · 2025年9月21日

扩散语言模型综述

扩散语言模型综述

专知会员服务

18+阅读 · 2025年8月15日

【阿姆斯特丹博士论文】语言模型与人类理解与行为的对齐

【阿姆斯特丹博士论文】语言模型与人类理解与行为的对齐

专知会员服务

18+阅读 · 2025年7月19日

【牛津大学博士论文】迈向具有类人自然语言理解的语言模型

【牛津大学博士论文】迈向具有类人自然语言理解的语言模型

专知会员服务

29+阅读 · 2024年10月28日

大型语言模型对齐

大型语言模型对齐

专知会员服务

119+阅读 · 2023年9月27日

从语言模型到语言智能体，普林斯顿Shunyu Yao

从语言模型到语言智能体，普林斯顿Shunyu Yao

专知会员服务

63+阅读 · 2023年9月18日

大模型如何可解释？新泽西理工学院等最新《大型语言模型可解释性》综述

大模型如何可解释？新泽西理工学院等最新《大型语言模型可解释性》综述

专知会员服务

98+阅读 · 2023年9月11日

大语言模型简明指南

大语言模型简明指南

专知会员服务

143+阅读 · 2023年7月29日

《大型语言模型》最新全面概述

《大型语言模型》最新全面概述

专知会员服务

111+阅读 · 2023年7月14日

UIUC-Gargi《增强型语言模型》，64页ppt与视频

UIUC-Gargi《增强型语言模型》，64页ppt与视频

专知会员服务

37+阅读 · 2023年5月12日

热门VIP内容

开通专知VIP会员享更多权益服务

论学习、公平性与复杂度

《整合杀伤链：一个用于边缘目标验证与战术推理的零样本框架》最新资料

2025中国人工智能学会系列白皮书⸺棋盘上的人工智能|附下载

通用智能体评估的逻辑架构

相关资讯

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知

14+阅读 · 2020年8月30日

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

最新《深度生成式模型进展》视频报告，43页ppt，斯坦福Aditya Grover

专知

13+阅读 · 2020年8月9日

【复旦大学】最新《预训练语言模型》2020综述论文大全，50+PTMs分类体系，25页pdf205篇参考文献

【复旦大学】最新《预训练语言模型》2020综述论文大全，50+PTMs分类体系，25页pdf205篇参考文献

专知

22+阅读 · 2020年3月19日

华为诺亚方舟预训练语言模型NEZHA、TinyBERT开源代码

华为诺亚方舟预训练语言模型NEZHA、TinyBERT开源代码

专知

17+阅读 · 2019年12月7日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

预训练语言模型关系图+必读论文列表，清华荣誉出品

预训练语言模型关系图+必读论文列表，清华荣誉出品

机器之心

18+阅读 · 2019年10月11日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

Simple Denoising Diffusion Language Models

Arxiv

0+阅读 · 2月3日

Sentence Curve Language Models

Arxiv

0+阅读 · 2月3日

Residual Context Diffusion Language Models

Arxiv

0+阅读 · 1月30日

Corrective Diffusion Language Models

Arxiv

0+阅读 · 1月29日

Recursive Language Models

Arxiv

0+阅读 · 1月28日

Dual-objective Language Models: Training Efficiency Without Overfitting

Arxiv

0+阅读 · 1月28日

Auto-Regressive Masked Diffusion Models

Arxiv

0+阅读 · 1月23日

Closing the Modality Reasoning Gap for Speech Large Language Models

Arxiv

0+阅读 · 1月9日

Advancing Language Models for Code-related Tasks

Arxiv

0+阅读 · 1月8日

Modeling Language as a Sequence of Thoughts

Arxiv

0+阅读 · 2025年12月31日

相关基金

“模块化自组装”DNA计算模型的研究

国家自然科学基金

3+阅读 · 2015年12月31日

即时通信中的隐蔽通信模型及方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于格值逻辑的语言真值α-群锁语义归结自动推理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

多尺度模块网络下的储备池神经计算模型及算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

随机文法作为通用统计模型的扩展

国家自然科学基金

1+阅读 · 2015年12月31日

中文句子语义概念图自动构建方法及应用研究

国家自然科学基金

3+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

概率图模型学习及其在数据分析中的应用研究

国家自然科学基金

16+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员