令牌成熟化：通过连续令牌动态实现自回归语言生成 (Token Maturation: Autoregressive Language Generation via Continuous Token Dynamics) - 专知论文

会员服务 ·

0

令牌 · 离散 · 表示 · 离散化 · 解码 ·

Token Maturation: Autoregressive Language Generation via Continuous Token Dynamics

翻译：令牌成熟化：通过连续令牌动态实现自回归语言生成

Oshri Naparstek

from arxiv, In preperation to ICML 2026

Autoregressive language models are conventionally defined over discrete token sequences, committing to a specific token at every generation step. This early discretization forces uncertainty to be resolved through token-level sampling, often leading to instability, repetition, and sensitivity to decoding heuristics. In this work, we introduce a continuous autoregressive formulation of language generation in which tokens are represented as continuous vectors that \emph{mature} over multiple update steps before being discretized. Rather than sampling tokens, the model evolves continuous token representations through a deterministic dynamical process, committing to a discrete token only when the representation has sufficiently converged. Discrete text is recovered via hard decoding, while uncertainty is maintained and resolved in the continuous space. We show that this maturation process alone is sufficient to produce coherent and diverse text using deterministic decoding (argmax), without reliance on token-level sampling, diffusion-style denoising, or auxiliary stabilization mechanisms. Additional perturbations, such as stochastic dynamics or history smoothing, can be incorporated naturally but are not required for the model to function. To our knowledge, this is the first autoregressive language model that generates text by evolving continuous token representations to convergence prior to discretization, enabling stable generation without token-level sampling.

翻译：自回归语言模型传统上定义在离散令牌序列之上，在每个生成步骤中必须确定一个具体的令牌。这种早期离散化迫使不确定性必须通过令牌级采样来解决，常常导致生成结果不稳定、重复以及对解码启发式方法的敏感性。在本研究中，我们提出了一种连续自回归语言生成框架，其中令牌被表示为连续向量，这些向量在离散化之前会经历多个更新步骤的"成熟"过程。该模型不是通过采样令牌，而是通过确定性动态过程演化连续令牌表示，仅当表示充分收敛时才确定离散令牌。离散文本通过硬解码恢复，而不确定性则在连续空间中得以保持和解决。我们证明，仅凭这种成熟过程就足以使用确定性解码（argmax）生成连贯且多样化的文本，无需依赖令牌级采样、扩散式去噪或辅助稳定机制。额外的扰动（如随机动态或历史平滑）可以自然地融入该框架，但并非模型运行的必要条件。据我们所知，这是首个通过演化连续令牌表示至收敛再进行离散化的自回归语言模型，实现了无需令牌级采样的稳定生成。

0

相关内容

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

专知会员服务

12+阅读 · 2025年9月21日

【ICML2025】用于提升生成式口语语言模型自然度的变分框架

【ICML2025】用于提升生成式口语语言模型自然度的变分框架

专知会员服务

7+阅读 · 2025年6月18日

【ICML2025】《基于低分辨率词元枢轴的层级掩码自回归模型》

【ICML2025】《基于低分辨率词元枢轴的层级掩码自回归模型》

专知会员服务

7+阅读 · 2025年5月27日

【CVPR2025】基于离散扩散时间步令牌的生成式多模态预训练

【CVPR2025】基于离散扩散时间步令牌的生成式多模态预训练

专知会员服务

11+阅读 · 2025年4月26日

【NTU博士论文】自然语言处理的自回归生成，173页pdf

【NTU博士论文】自然语言处理的自回归生成，173页pdf

专知会员服务

26+阅读 · 2024年2月18日

【ICML2023】基于自然语言指令的受控文本生成

【ICML2023】基于自然语言指令的受控文本生成

专知会员服务

29+阅读 · 2023年4月28日

自然语言生成技术及其在军事领域应用

自然语言生成技术及其在军事领域应用

专知会员服务

83+阅读 · 2023年1月6日

自然语言生成综述

专知会员服务

65+阅读 · 2021年5月29日

【EMNLP2020】自然语言生成，Neural Language Generation

【EMNLP2020】自然语言生成，Neural Language Generation

专知会员服务

39+阅读 · 2020年11月20日

【微软雷德蒙研究院】小样本自然语言生成，Few-shot Natural Language Generation for Task-Oriented Dialog

【微软雷德蒙研究院】小样本自然语言生成，Few-shot Natural Language Generation for Task-Oriented Dialog

专知会员服务

33+阅读 · 2020年2月29日

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

专知

19+阅读 · 2020年8月31日

自然语言生成资源列表

自然语言生成资源列表

专知

17+阅读 · 2020年1月4日

一文看懂自然语言生成 - NLG（6个实现步骤+3个典型应用）

一文看懂自然语言生成 - NLG（6个实现步骤+3个典型应用）

AINLP

11+阅读 · 2019年8月11日

Bert 之后：预训练语言模型与自然语言生成

Bert 之后：预训练语言模型与自然语言生成

AINLP

16+阅读 · 2019年7月16日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

强化学习与文本生成

强化学习与文本生成

微信AI

41+阅读 · 2019年4月4日

最新论文解读 | 基于预训练自然语言生成的文本摘要方法

最新论文解读 | 基于预训练自然语言生成的文本摘要方法

微软研究院AI头条

57+阅读 · 2019年3月19日

微软最新论文解读 | 基于预训练自然语言生成的文本摘要方法

微软最新论文解读 | 基于预训练自然语言生成的文本摘要方法

PaperWeekly

14+阅读 · 2019年3月18日

博客 | 总结+paper分享|对话系统中的自然语言生成技术（NLG）

博客 | 总结+paper分享|对话系统中的自然语言生成技术（NLG）

AI研习社

16+阅读 · 2018年12月4日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于格值逻辑的语言真值α-群锁语义归结自动推理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于形态和多词的有限语料蒙汉互译调序优化方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

面向二进制程序的静态结构化符号执行与动态组合方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于发音特征的汉语语音识别分层解码方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

中文句子语义概念图自动构建方法及应用研究

国家自然科学基金

3+阅读 · 2014年12月31日

生命起源过程中“标签介导的遗传信息复制和表达的出现及演化”的计算机模拟研究

国家自然科学基金

0+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

Multi-Token Prediction via Self-Distillation

Arxiv

0+阅读 · 2月5日

Skin Tokens: A Learned Compact Representation for Unified Autoregressive Rigging

Arxiv

0+阅读 · 2月4日

Frontend Token Enhancement for Token-Based Speech Recognition

Arxiv

0+阅读 · 2月4日

LINA: Linear Autoregressive Image Generative Models with Continuous Tokens

Arxiv

0+阅读 · 1月30日

Token Caching for Diffusion Transformer Acceleration

Arxiv

0+阅读 · 1月27日

Token-Weighted Multi-Target Learning for Generative Recommenders with Curriculum Learning

Arxiv

0+阅读 · 1月25日

Token Maturation: Autoregressive Language Generation via Continuous Token Dynamics

Arxiv

0+阅读 · 1月21日

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

Arxiv

0+阅读 · 1月19日

Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding

Arxiv

0+阅读 · 1月18日

Decentralized Autoregressive Generation

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

相关VIP内容

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

【NeurIPS2025】基于卷积解码与拒斥式微调的快速流畅扩散语言模型

专知会员服务

12+阅读 · 2025年9月21日

【ICML2025】用于提升生成式口语语言模型自然度的变分框架

【ICML2025】用于提升生成式口语语言模型自然度的变分框架

专知会员服务

7+阅读 · 2025年6月18日

【ICML2025】《基于低分辨率词元枢轴的层级掩码自回归模型》

【ICML2025】《基于低分辨率词元枢轴的层级掩码自回归模型》

专知会员服务

7+阅读 · 2025年5月27日

【CVPR2025】基于离散扩散时间步令牌的生成式多模态预训练

【CVPR2025】基于离散扩散时间步令牌的生成式多模态预训练

专知会员服务

11+阅读 · 2025年4月26日

【NTU博士论文】自然语言处理的自回归生成，173页pdf

【NTU博士论文】自然语言处理的自回归生成，173页pdf

专知会员服务

26+阅读 · 2024年2月18日

【ICML2023】基于自然语言指令的受控文本生成

【ICML2023】基于自然语言指令的受控文本生成

专知会员服务

29+阅读 · 2023年4月28日

自然语言生成技术及其在军事领域应用

自然语言生成技术及其在军事领域应用

专知会员服务

83+阅读 · 2023年1月6日

自然语言生成综述

专知会员服务

65+阅读 · 2021年5月29日

【EMNLP2020】自然语言生成，Neural Language Generation

【EMNLP2020】自然语言生成，Neural Language Generation

专知会员服务

39+阅读 · 2020年11月20日

【微软雷德蒙研究院】小样本自然语言生成，Few-shot Natural Language Generation for Task-Oriented Dialog

【微软雷德蒙研究院】小样本自然语言生成，Few-shot Natural Language Generation for Task-Oriented Dialog

专知会员服务

33+阅读 · 2020年2月29日

热门VIP内容

开通专知VIP会员享更多权益服务

《无人机与战争：被忽视的环境影响及无人机保护潜力》

俄罗斯规划未来无人机驱动军队

《整合杀伤链：一个用于边缘目标验证与战术推理的零样本框架》最新资料

《人工智能、武器与影响力：前沿模型在模拟核危机中展现复杂推理》2026最新46页报告

相关资讯

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

专知

19+阅读 · 2020年8月31日

自然语言生成资源列表

自然语言生成资源列表

专知

17+阅读 · 2020年1月4日

一文看懂自然语言生成 - NLG（6个实现步骤+3个典型应用）

一文看懂自然语言生成 - NLG（6个实现步骤+3个典型应用）

AINLP

11+阅读 · 2019年8月11日

Bert 之后：预训练语言模型与自然语言生成

Bert 之后：预训练语言模型与自然语言生成

AINLP

16+阅读 · 2019年7月16日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

强化学习与文本生成

强化学习与文本生成

微信AI

41+阅读 · 2019年4月4日

最新论文解读 | 基于预训练自然语言生成的文本摘要方法

最新论文解读 | 基于预训练自然语言生成的文本摘要方法

微软研究院AI头条

57+阅读 · 2019年3月19日

微软最新论文解读 | 基于预训练自然语言生成的文本摘要方法

微软最新论文解读 | 基于预训练自然语言生成的文本摘要方法

PaperWeekly

14+阅读 · 2019年3月18日

博客 | 总结+paper分享|对话系统中的自然语言生成技术（NLG）

博客 | 总结+paper分享|对话系统中的自然语言生成技术（NLG）

AI研习社

16+阅读 · 2018年12月4日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

相关论文

Multi-Token Prediction via Self-Distillation

Arxiv

0+阅读 · 2月5日

Skin Tokens: A Learned Compact Representation for Unified Autoregressive Rigging

Arxiv

0+阅读 · 2月4日

Frontend Token Enhancement for Token-Based Speech Recognition

Arxiv

0+阅读 · 2月4日

LINA: Linear Autoregressive Image Generative Models with Continuous Tokens

Arxiv

0+阅读 · 1月30日

Token Caching for Diffusion Transformer Acceleration

Arxiv

0+阅读 · 1月27日

Token-Weighted Multi-Target Learning for Generative Recommenders with Curriculum Learning

Arxiv

0+阅读 · 1月25日

Token Maturation: Autoregressive Language Generation via Continuous Token Dynamics

Arxiv

0+阅读 · 1月21日

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

Arxiv

0+阅读 · 1月19日

Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding

Arxiv

0+阅读 · 1月18日

Decentralized Autoregressive Generation

Arxiv

0+阅读 · 1月13日

相关基金

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于格值逻辑的语言真值α-群锁语义归结自动推理研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于形态和多词的有限语料蒙汉互译调序优化方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

面向二进制程序的静态结构化符号执行与动态组合方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于发音特征的汉语语音识别分层解码方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

中文句子语义概念图自动构建方法及应用研究

国家自然科学基金

3+阅读 · 2014年12月31日

生命起源过程中“标签介导的遗传信息复制和表达的出现及演化”的计算机模拟研究

国家自然科学基金

0+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员