论文:Fractional State Space Transition for Long Sequence Modeling 作者:Ivan Kobyzev、Abbas Ghaddar、Ali Nasiri-Sarvi、Lifeng Shang、Yufei Cui 机构:华为诺亚方舟实验室,加拿大蒙特利尔研究中心 版本:arXiv:2609.36314v1,2026 年 9 月 28 日提交,PDF 共 28 页;论文页面标注 NeurIPS 2026 Oral 原文链接:论文页面|完整 PDF|网页版 代码链接:作者提供的代码仓库 导读:状态空间模型用固定大小的循环状态压缩历史,避免在解码时持续保存随序列增长的全部键值缓存。但高效压缩之后,过去的信息应该怎样衰减?如果遗忘过快,远处的信息难以保留;如果只增加状态容量,计算和存储又会增长。 本文介绍的 FRAC 从“记忆规律”而非单纯容量出发:用分数阶动力学提供长尾记忆先验,再用有限个不同时间尺度的指数模式近似,形成可并行训练、可循环解码的选择性状态空间层。其 13 亿参数语言模型在部分长上下文测试中取得优势,但并非所有任务、所有长度或所有速度指标都领先。 下文按原文六节正文展开,并整理附录中的实现、消融与局限。配图为原论文图表截图,图内标签保留原文,图题和解释为中文。特别注意:有限模式近似不等于无限时域的精确幂律记忆;128K 合成外推不等于 13 亿参数语言模型通过了 128K 自然语言测试。
自注意力在序列长度上具有二次计算结构,推动了状态空间模型、线性注意力和其他循环替代路线的发展。状态空间模型的关键优势是把历史压缩进有限维状态,但压缩后的记忆规律也成为架构的重要约束。 常见状态空间设计源于普通微分方程及其离散化,基础衰减模式是指数型:信息越久远,其影响按特定时间尺度减弱。多尺度、选择性门控和关联更新能够改善这一行为,但论文提出另一个问题:能否直接从更适合宽时间范围依赖的动力学出发? 分数阶微分方程用于描述异常扩散、黏弹性等具有历史依赖的现象,其解可以具有多项式长尾。困难在于,直接分数阶计算通常依赖整个历史,与固定状态递推不兼容。 FRAC 的路线是:分数阶记忆核 → 连续指数混合 → 有限指数模式库 → 选择性循环转移。 它保留一阶递推和并行扫描结构,同时引入跨多个数量级的时间尺度。这里改变的是长记忆归纳偏置,而不是声称指数模式本身不再使用,或所有传统状态空间模型都无法学习长程依赖。
普通线性系统可写成:h′(t)=−λh(t)+u(t),其中 λ>0,u(t) 为外部输入。无输入时,状态按 exp(−λt) 衰减,主要时间尺度约为 1/λ。 长记忆现象则要求过去事件在更宽的时间范围内持续发挥影响,不能只用单一衰减尺度描述。分数阶微积分允许非整数阶导数,以历史加权积分表达这种非局部时间依赖。
论文采用卡普托分数阶导数,令 0<α<1。它不是只计算当前瞬间变化,而是对过去的变化率积分,并以随时间间隔缓慢衰减的权重进行累积。将普通导数替换后,得到分数阶松弛方程:Dᵅh(t)=−λh(t)+u(t)。 α=1 时回到普通一阶系统;分数阶范围提供更广的历史依赖。直接数值求解往往需要保存或访问历史,故作者不把通用分数阶求解器直接放入模型,而是构造有限状态的近似表示。
普通系统由指数函数描述松弛,分数阶系统对应米塔格—莱弗勒函数。必须区分两个对象:齐次松弛核决定初始状态怎样衰减,脉冲响应核决定过去输入怎样影响当前状态。 当时间趋于无穷时,前者具有 t⁻ᵅ 量级的尾部,后者具有 t⁻⁽ᵅ⁺¹⁾ 量级的尾部,二者并不是同一个幂律。相关函数也不是在全部时间范围内都等于精确幂律。论文将其概括为长尾记忆,依据的是渐近性质,而非对每个时间点的简单幂律替换。
核心结构是:这两类分数阶核可以表示为非负指数衰减的连续混合。每个时间尺度 τ 对应 exp(−t/τ),不同尺度按相应非负密度加权。 这意味着分数阶长记忆可以由许多普通、快速或缓慢衰减的成分共同实现。连续混合仍然是无限维的,因此还不能直接作为固定大小循环层,下一步需要截断和离散近似。
作者在有限区间 [0,T] 上采用几何间隔的时间尺度 τₘ=τ₀qᵐ⁻¹,其中 q>1。对数尺度网格能用较少模式跨越多个数量级,近似连续混合。 原文定理给出两种不同误差保证:齐次核采用区间上的一致误差,脉冲响应核采用积分误差。后者在零点附近存在可积奇异性,不能不加说明地改写成同样的一致误差保证。两类系数使用共同时间尺度,并满足特定比例关系。 这一结果说明,针对选定有限时域和精度,可以找到有限模式库。它没有证明固定的 16 个模式可在任意长时间上保持任意精度,也没有直接对完整的输入依赖神经网络给出全局误差界。实际效果仍取决于模式数、覆盖范围和训练。
有限混合对应 M 个一阶状态,每个状态有自己的时间尺度:s′ₘ(t)=−sₘ(t)/τₘ+aₘu(t)。按适当系数读取这些状态,就可近似原分数阶系统。 原文命题表明:在固定参数、有限时域和有界输入等条件下,输出误差可由核近似误差、初始状态幅度及输入上界共同控制。物理直觉是短模式响应近期信息,长模式保留更久的历史,再将不同尺度组合起来。所有模式依旧使用普通一阶递推,长尾来自它们的组织与加权。
对每个词元,模型预测步长 Δₜ、分数阶控制 αₜ 和尺度控制 λₜ,并在该更新区间内将它们冻结。有效时间尺度为 τₘ/λₜ^(1/αₜ),保留因子为 ρₜ,ₘ=exp[−Δₜλₜ^(1/αₜ)/τₘ]。 在固定模式和零阶保持假设下,正文推导的精确输入系数为 (1−ρₜ,ₘ)/λₜ。但附录算法明确说明:全部实验实际采用 1−ρₜ,ₘ,去掉除以 λₜ 的项,以解耦时间尺度控制与写入幅度并改善稳定性。 λ 随输入变化时,不能将这两种形式笼统视为完全相同的精确离散化。 实际选择性递推可理解为:
读取先验受到分数阶核系数渐近规律启发;写入采用相同形式,是作者的架构选择,并非理论唯一规定。选择性层因此是由固定分数阶构造启发的推广,而不是逐词元精确求解一条原始分数阶方程。 将所有模式合在一起,更新仍是仿射递推。仿射变换能够组合,使训练和预填充支持分块并行扫描;解码只需上一时刻的模式状态。固定状态是相对序列长度而言,总开销仍随模式数、头数、特征维度和层数增长。
FRAC 层先归一化和投影,经过序列混合模块,再做门控归一化与输出投影。内部划分控制分支和内容分支:前者产生 Δ、α、λ,后者通过局部深度可分离因果卷积得到输入内容。 步长与尺度控制采用正值变换,分数阶控制限制在 0 与 1 之间。状态输出还加入可学习的直接通路 Duₜ,为局部信息提供不必完全依赖模式库的路径。 图1|左侧为模型层,右侧为序列混合模块。控制分支调节步长、分数阶与尺度,内容分支提供因果卷积特征,状态转移与直接通路共同形成输出。来源:原论文图1,PDF 第6页。
作者设计受控分类任务:在背景词元中插入稀疏的正负事件,根据过去事件按距离幂律加权后的总和符号预测标签。目标衰减指数为 0.1,任务有意检验重尾累积能力,而非代表所有自然语言依赖。 模型只有一层、约 20 万参数,训练长度为 512,测试延伸到 128K。附录报告十次运行的均值和标准差。在 512 长度上,FRAC 的 96.5% 低于 Mamba3 的 98.6% 和 GDN 的 98.5%;在 128K 时,FRAC 为 63.8%,GDN 为 58.4%,Mamba3 为 55.6%,Mamba2 为 51.3%,普通注意力为 50.0%。 FRAC 在较长长度上下降更慢,但所有模型都退化,128K 时也远未达到完美准确率。该实验支持目标记忆先验的长度外推价值,不能直接推出同样幅度的真实语言提升。 图2|约20万参数模型在长度512训练后进行外推测试。横轴为测试序列长度,纵轴为准确率;长序列上的较缓衰减体现该任务的重尾归纳偏置收益。来源:原论文图2,PDF 第7页。
MADLab 检验压缩、模糊上下文召回、记忆和选择性复制。各模型约 50 万参数,采用交替的序列混合与通道混合层,报告五次运行结果。 FRAC 平均为 75.4,Mamba3 为 74.8,GDN 为 74.3,Mamba2 为 73.8;其中模糊召回为 11.5,优于其余比较模型,但绝对值依然较低。普通与噪声上下文召回因各模型表现饱和,未在主表报告。结果说明新记忆结构没有明显损伤这些基础能力,不等于各类召回难题均已解决。
主要语言模型约 13 亿参数,从去重后的 FineWeb-Edu 采样 1000 亿词元从头预训练,使用 32K 词表和长度 4K 的打包序列。比较包括 Mamba2、GDN、Mamba3 的单输入单输出与多输入多输出变体,以及 Transformer。 模型采用共同的标准训练流程,但不同架构以各自配置调整层数,使参数量大体相当,不能描述成“所有模型层数和内部结构完全一致”。FRAC 使用 16 个模式,基础时间尺度从 1 到 2¹⁷,刻意覆盖超过 64K 评测长度的范围,并对部分控制量做裁剪以保持数值稳定。
模型在 4K 训练,检索测试长度从 1K 延伸至 64K。FRAC 在训练范围内与线性基线接近,在更长范围中多项结果下降更慢,但并非每个变体都领先:单个变体中 GDN 对重复背景的过滤有明显优势,64K 下 FRAC 在较难变体也接近低准确率。 图3|三种检索任务从1K评测到64K,模型的训练序列长度为4K。Transformer 在该设置中超出4K后的结果为零,不能推广为所有位置编码、长上下文训练或扩展方案下的 Transformer 都无法工作。来源:原论文图3,PDF 第8页。
LongBench 包含单文档问答、多文档问答、摘要、少样本任务与代码任务,共 14 项。FRAC 平均 17.9,高于 GDN 的 16.0、Transformer 的 14.7 和 Mamba3 单输入单输出变体的 14.4。与 GDN 的差值为 1.9 个平均得分点,不能写成相对提升仅1.9%。 FRAC 在 8 项任务上取得最高分,但不是全面占优:代码 LCC 为 11.0,低于 Transformer 的 26.0;部分多文档任务也落后。LongBench 中超过一半任务的平均输入长度低于 8K,因此其优势比受控大海捞针更温和。 图4|原文长上下文任务结果表,按五类任务组织。应同时看平均与具体任务,不将某一均值解释为通用能力全面超过其他架构。来源:原论文表2,PDF 第8页。
在短上下文语言理解与常识测试中,FRAC 平均 55.1,Transformer 和 Mamba3 多输入多输出变体均为 55.3,相差 0.2 个得分点;平均计算排除了两列困惑度。这支持“短上下文保持竞争力”,不支持“短任务普遍更好”。 真实召回与检索密集任务平均为 36.4,落后 Transformer 的 38.5 和 Mamba3 多输入多输出变体的 36.8,整体第三。虽然原基准面向长序列,本文实验按既有流程截断到 2K,因此主要验证短上下文召回,不能充当长上下文检索胜出的证据。
作者在 HG38 人类参考基因组上训练约 700 万参数的因果模型,用字符级序列预测比较 FRAC、GDN 和 Mamba3 单输入单输出变体。长度设置为 1K、4K、8K、16K、32K、64K。 FRAC 困惑度与基线相当或更低,长序列差距更明显。这里每个长度都采用相应训练与测试截断设置,属于随训练上下文长度变化的建模比较,不是把同一个1K训练模型直接外推到64K。困惑度结果也不等价于下游基因功能预测、诊断或生物机制发现。 图5|基因序列预测困惑度随训练长度变化,越低越好。各长度的训练和测试截断长度一致,区别于此前固定训练长度的外推实验。来源:原论文图4,PDF 第9页。
S4、对角状态空间模型及输入依赖动力学,建立了从连续系统到高效序列层的路线。FRAC 沿用这一视角,但以分数阶核和指数混合组织记忆。其差异在先验来源和时间尺度组织,而非否定一阶指数递推的计算价值。
Mamba 让转移与投影依赖输入,Mamba2 利用状态空间对偶实现高效计算,Mamba3 探索更有表达力的离散化和多输入多输出结构。FRAC 的多个模式是近似核时使用的时间尺度模式,不能与 Mamba3 的多输入多输出秩混为一谈。
保留网络、多种线性注意力和 Delta 规则模型,分别改善时间衰减、内容更新或关联检索;多记忆混合则通过路由提升容量。FRAC 主要改变时间记忆规律,与“更精确地更新内容”和“扩展容量”关注不同维度,具有结合空间,但仍需具体实验。
已有工作涉及神经分数阶方程、分数阶注意力、脉冲网络和生成过程。相关方法可能保留历史或依赖迭代求解。FRAC 的定位是构造适合解码器语言模型、固定状态缓存与并行扫描的有限实现,而不是首次在机器学习中使用分数阶数学。
论文说明,记忆怎样随时间衰减,是高效序列架构值得单独研究的变量。FRAC 将分数阶长记忆转化为可计算的多尺度循环层,在若干长上下文任务中取得优势,同时保留短任务竞争力。 更准确的结论是:具有理论动机的长尾先验,在当前规模和评测条件下改善了部分长度泛化与长文处理表现。 它不是无限容量记忆,也不是所有召回、代码、吞吐与语言能力上的统一替代方案。作者建议未来结合 Delta 规则式更新,以同时改善远程保留和关联检索精度。
附录证明了扩散表示、有限模式近似和固定连续系统的误差控制,并明确区分核的一致误差与积分误差。转移算法补充了读写投影、归一化和实际写入系数的选择。复现时应以附录算法为依据,而不能只从正文的精确零阶保持公式自行替换实现。
主配置中,FRAC 每层主要循环状态为16个头、16个模式、每头256个特征,即 65,536 个标量。对应配置的 Mamba2/3 为524,288个,GDN为294,912个,分别约为FRAC的8倍和4.5倍。 这里仅比较主要循环状态,排除短卷积缓冲和架构特有辅助缓存;也不是模型参数或全部显存的比例。它说明长程收益并非简单来自更大的主要循环状态,同时提醒“参数量相当”与“缓存容量相当”是不同比较条件。
作者用定制 Triton 内核实现控制量构建、分块扫描、跨块状态传递和读写融合,并用累计对数衰减之差处理块内数值稳定性。简单的对角模式更新不意味着实际实现可以忽略内存布局和融合开销。 在原文单卡、批量1的预填充测试中,FRAC 的16K吞吐为 77,490 词元/秒,Mamba3单输入单输出变体为74,314,Transformer为56,297。FRAC相对Transformer约为1.38倍,但1K和4K预填充仍由Transformer领先。 自回归解码中,FRAC为33词元/秒,Mamba2为34,Transformer在16K设置为62;4K训练吞吐中FRAC为241,598,Mamba2为278,620。因此只能说 FRAC 在该16K预填充设置下表现突出,不能宣称其训练、解码或所有长度都最快。序列更长时每秒词元数上升,也不等于处理整段提示的总延迟下降。 图6|原文吞吐表,单位为词元/秒,越高越好。预填充批量为1;Transformer 的解码列对应16K上下文;训练列采用论文的4K训练设置,指标与工作负载应分别比较。来源:原论文表8,PDF 第25页。
消融采用约3.9亿参数模型,在300亿词元、4K序列上训练,再评价16K文档困惑度。令 α=1、移除写入先验、取消归一化读写或删除直接通路,均使结果变差;无分数阶先验的纯多尺度库、自由学习时间尺度也落后于基线。这支持多个组件的组合价值,不是只要堆叠不同尺度就能获得同样效果。 16模式基线在三个文档集上的困惑度为47.2、28.4、11.3;8模式为51.4、33.9、14.5;32模式为47.9、29.1、10.6。增加模式不带来全面提升,作者报告32模式增加约5%参数、计算慢约7%,故选择16作为性能与开销折中。 图7|3.9亿参数模型的消融困惑度,越低越好。比较对象是同一研究设置中的组件替换,不能将其数值与13亿参数主实验直接横向比较。来源:原论文表9,PDF 第26页。 独立的核近似实验还报告8、16、32模式的平均最大绝对误差分别为1.34×10⁻³、6.82×10⁻⁴、6.45×10⁻⁴。该测试针对齐次核,在指定归一化时间区间内优化非负混合系数;这些数值不直接等于完整选择性网络的输出误差或任务准确率保证。
有限模式的质量取决于时间尺度是否覆盖任务依赖。超出覆盖范围,或者任务需要迅速遗忘短尾信息时,长记忆先验未必有优势。固定有限个正时间尺度的指数混合,也不能在无限远处继续保持精确幂律尾部。 计算开销随模式数增长,状态、读写与内核成本均需权衡;实验集中于长程依赖场景,视频、科学序列和智能体持久记忆仍是未来验证方向,而非已经完成的成果。更强记忆能力也不会自动解决隐私、偏见或不当生成风险,后续大规模应用仍需数据审查与适当防护。 从复现和后续研究看,应同时检查实际转移公式、时间尺度覆盖、关联检索能力和工作负载下的效率。这四个维度比单看“长记忆”或“线性复杂度”更能判断该架构是否适合具体任务。完整推导、配置和研究出处见文首论文与代码链接。