博士论文 | 把大语言模型推理看作统计决策:从测试时扩展到统计水印

导读

UC Berkeley 2026 年博士论文 Large Language Models as Statistical Decision-Makers at Inference Time 由 Baihe Huang 完成,导师为 Michael I. Jordan。论文的核心问题是:当大语言模型不再只是“输入一句话、输出一句话”的函数,而是在推理阶段进行采样、验证、自纠错、并行解码、工具化决策和水印检测时,我们该如何用统一理论理解这些过程? 作者给出的答案是:把 LLM 推理视为 统计决策过程。在这个视角下,测试时扩展、重复采样、Best-of-n、自纠错、扩散语言模型并行解码、统计水印、语义水印和 anytime-valid 检测,都可以被看作不确定性下的决策、检验和效率优化问题。 整篇论文沿两条主线展开。第一条是 scalability,研究如何让推理更高效、更可扩展:包括 test-time scaling 的样本复杂度、自纠错的表达能力,以及扩散语言模型中的 bits-to-rounds 解码理论和 ETE 算法。第二条是 provenance,研究如何为 LLM 输出建立来源证明:包括统计水印的假设检验理论、语义感知水印 SEAL,以及支持随时停止检测的 e-value 水印框架。 这篇博士论文的价值不只在于提出若干算法,而在于把“推理时发生的事情”从工程经验推向统计理论:什么方法需要多少样本,什么解码轮次是信息论瓶颈,什么水印检测是最优的,如何在质量、检测效率和篡改鲁棒性之间做可证明权衡。

论文信息

论文题目:Large Language Models as Statistical Decision-Makers at Inference Time 作者:Baihe Huang 机构:University of California, Berkeley, EECS 导师:Michael I. Jordan 技术报告编号:UCB/EECS-2026-232 论文链接:https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-232.pdf 关键词:大语言模型、推理时扩展、统计决策、扩散语言模型、并行解码、统计水印、SEAL、e-value、假设检验

1. 总体问题:LLM 推理已经不是一个静态函数

传统机器学习理论常把模型看作从输入到输出的函数。但现代 LLM 系统已经远远超出这一抽象:它们会生成长链式推理,会在推理时采样多个候选,会使用验证器选择答案,会基于反馈自纠错,也会在多轮交互和工具调用中逐步更新策略。 这带来两个挑战。第一,经典理论难以描述复杂推理流程。比如 self-consistency、Best-of-n、self-correction 都是在同一个模型上增加推理计算,但它们的统计效率并不一样。第二,LLM 生成文本越来越接近人类文本,内容溯源、水印检测、训练数据污染和学术诚信问题变得更关键,需要可证明的检测方法。 论文因此提出一个统一问题:如何为 LLM 推理的效率和负责任使用建立理论原则与实践方法?作者将推理期操作统一为统计决策:模型在不确定性下采样、估计、检验、选择、停止,并在推理过程中用额外信息改善决策。

2. 测试时扩展:Self-consistency、Best-of-n 与自纠错

第二章研究 test-time scaling 的两个基本问题:重复采样方法到底需要多少样本?Transformer 是否能在测试时通过自纠错真正提升能力? 在数学推理等任务中,self-consistency 会采样多个推理路径并选择最常见答案;Best-of-n 会采样多个候选并用验证器选择得分最高的答案;self-correction 则允许模型根据前一次回答和反馈继续生成新答案。三者都消耗额外推理计算,但统计性质差异很大。 论文给出一个样本复杂度分离结果:若正确答案概率与第二高概率答案之间的间隔为 gap,则 self-consistency 需要约 1/gap^2 级别样本,而 Best-of-n 只需要约 1/gap 级别样本。直观地说,投票法必须精确估计答案概率差异,而验证器选择只需要在候选中“碰到”正确答案并识别它。 更重要的是,自纠错并不是简单重复采样。论文从表达能力角度证明:带验证器反馈的 Transformer 可以模拟专家池上的在线学习,在测试时逐步识别哪个专家适合当前任务。这意味着一个统一 Transformer 可以在不知道任务身份的情况下,通过试错和反馈解决多任务问题。

实验也支持这一点。在 AIME 2024/2025 数学推理上,Best-of-n 用 4 个样本即可超过 self-consistency 的 64 个样本;self-correction 在若干模型上进一步显著提升表现。比如 Qwen3-1.7B 从 self-consistency 的 58.33% 提升到 self-correction 的 79.29%。

3. 扩散语言模型解码:从 bits 到 rounds

第三章转向扩散语言模型(DLM)的推理效率。与自回归模型逐 token 生成不同,DLM 可以通过 mask/unmask 机制并行生成多个 token,因此看起来天然适合快速解码。但并行解码有一个核心问题:同时采样的 token 条件独立,容易偏离真实联合分布。 已有方法通常优先解码高置信度 token,也就是“先填最确定的位置”。这在局部上合理,却可能造成信息论瓶颈:高置信度 token 每轮贡献的信息有限,导致需要更多轮才能完成高质量生成。 论文提出一个 bits-to-rounds 视角:解码轮数至少受“总信息量 / 每轮信息量”约束。如果一个算法每轮只解锁低信息量 token,那么即使并行度很高,也可能被轮数拖慢。 基于这一理论,作者提出 Explore-Then-Exploit(ETE)。ETE 先通过 fast block diffusion 扩展可解码区域,再在信息不足时对高信息 token 做有针对性的探索,例如用共享 KV cache 的 beam search 搜索关键位置;随后利用高置信度 token 做并行 exploitation。它不是盲目“先解确定 token”,而是有意识地把探索预算投向最能减少不确定性的地方。

实验显示,ETE 在 GSM8K、HumanEval、MATH、MMLU-Pro 等基准上取得更好的速度-精度前沿。在相同准确率下,ETE 的吞吐最高可提升 70%,并且在若干任务上也提升了峰值准确率。

这一章的核心启示是:并行解码不只是“每轮多填几个 token”,而是要优化每一轮获得的信息量。对扩散语言模型而言,推理效率问题可以被看成一个信息预算分配问题。

4. 统计水印:把内容溯源写成假设检验

论文后半部分转向 provenance,也就是如何判断一段文本是否来自某个 LLM 系统。统计水印的基本思想是在生成时嵌入某种统计信号,使持有密钥的检测器可以判断文本来源,而没有密钥的人难以察觉。 第四章把统计水印形式化为假设检验问题。水印模型生成文本 X,同时生成与 X 耦合的随机拒绝域 R。检测时,如果文本落入拒绝域,就拒绝“非水印来源”的零假设。这里要控制两个错误:Type I error 是把非水印文本误判为水印文本;Type II error 是水印文本未被检测出。

论文给出了若干统计极限结果。首先,在给定 Type I error 约束下,作者刻画了最优 Type II error,相当于回答“任何水印方法最多能做到多好”。其次,作者研究 model-agnostic 水印,也就是检测器不需要知道具体模型分布的场景,给出 minimax 意义下的最优误差。最后,论文分析 token complexity,说明在 i.i.d. 情况下达到固定错误率所需 token 数约为 log(1/h)/h,其中 h 是平均 token 熵。 这个结论很有解释力:文本越随机、熵越高,越容易嵌入和检测水印;文本越确定,水印空间越小,检测越难。统计水印不是魔法,它受限于生成分布本身的随机性。

5. SEAL:语义感知的统计水印

第五章把理论推向实践,提出 SEAL(Semantic-awarE speculAtive sampLing)。理论分析指出,水印检测能力取决于随机种子序列与生成输出序列之间耦合的紧密程度。很多已有方法使用固定种子分布,无法适配 LLM 动态变化的 next-token 概率,因此检测效率和篡改鲁棒性受限。 SEAL 的想法是使用一个公开 proposal LLM 提取最近 K 个 token 的语义信息,再通过哈希和压缩得到随机种子分布。之后,它用 speculative sampling 在随机种子分布和目标 LLM 的 next-token 分布之间构造最大耦合,从而在尽量不改变输出质量的情况下嵌入统计信号。

实验在 MarkMyWords 基准上比较 SEAL 与 Exponential、Inverse Transform、Binary、Distribution Shift 等基线。指标包括文本质量、检测所需 token 数,以及经过改写攻击后水印仍被检测出的比例。结果显示,SEAL 在高温度设置下具有更高检测效率,并在篡改鲁棒性上持续领先,尤其对 paraphrase attack 更稳。

SEAL 的关键意义在于,它不是把语义作为启发式补丁,而是把语义信息纳入随机种子构造,使实践算法更接近第四章给出的统计最优耦合思想。

6. Anytime-valid 水印:可以边读边停的检测

传统水印检测通常设定固定长度:等文本足够长后一次性计算 p-value。问题是,LLM 输出天然是序列式、变长的。如果检测器在 token 到来时反复查看 p-value 并提前停止,就会破坏 Type I error 保证,也就是更容易误报。 第六章提出 Anchored E-Watermarking,使用 e-value 和序贯假设检验处理这一问题。e-value 的优势是可以在任意停止时间保持有效性,因此检测器可以边读边积累证据,一旦证据足够强就提前停止,同时仍控制误报。 论文推导了 minimax optimal 的证据对数增长率,并给出期望检测时间的紧界。实验显示,在 MarkMyWords 顺序检测设置下,e-value 水印保持高文本质量,同时将检测所需 token 数降到 72.0;相比 SEAL 的 84.5 进一步减少约 15%,相比若干非锚定基线接近 2 倍效率提升。

这部分把统计水印从“固定长度检测”推进到“流式检测”。对于真实应用很重要:平台可能希望在生成内容尚未完全读完时就给出可靠判断,而不是等整篇文本结束。

7. 统一视角:推理即统计决策

整篇论文最值得强调的不是某个单点算法,而是统一视角。测试时扩展、并行解码和水印检测看似分属不同方向,但都可以写成统计决策问题。 在 test-time scaling 中,模型要在有限采样预算下选择答案,因此关键是样本复杂度和验证信号。在 DLM 解码中,模型要在有限解码轮数下恢复序列,因此关键是每轮获得多少信息。在统计水印中,检测器要在误报约束下判断文本来源,因此关键是 Type I/II error、token complexity 和停止规则。 这一视角让很多工程经验变得可解释。为什么 Best-of-n 常常比 self-consistency 更省样本?因为验证器将问题从概率估计变成候选识别。为什么高置信度优先的并行解码可能不够快?因为它每轮信息增益不足。为什么语义水印更抗改写?因为语义感知随机种子更能保持与输出的有效耦合。

8. 对研究和应用的启示

第一,推理时计算不是简单“多花 token”。不同推理策略的统计效率差异很大,未来 test-time scaling 需要更精细地分析样本、验证器和反馈之间的关系。 第二,LLM 自纠错的关键不只是让模型“再想一遍”,而是要有可用反馈。论文的理论和实验都说明,验证器反馈能让模型在推理时实现类似在线学习的行为。 第三,扩散语言模型的速度优势不能只靠并行度。高质量并行解码需要信息感知的调度策略,知道什么时候探索不确定位置,什么时候利用高置信度区域。 第四,水印检测必须同时考虑统计有效性和真实可用性。只追求低误报不够,还要关注 token 效率、文本质量、模型不可知性、改写攻击鲁棒性和流式检测有效性。 总体来看,这篇博士论文为 LLM 推理研究提供了一条非常清晰的路线:把推理期的复杂工程机制还原为统计决策问题,再从样本复杂度、信息论下界、假设检验和序贯检测中提炼可执行算法。随着 LLM 系统越来越依赖推理时计算和内容溯源,这类理论化框架会变得越来越重要。

专知便捷查看,访问下面网址或点击最底端“阅读原文”

https://www.zhuanzhiai.com/vip/6dc57ccbb59eddc9dea6b6f406d49630 更多AI资料教程请上专知网站 www.zhuanzhiai.com图片 点击“阅读原文

成为VIP会员查看完整内容
20

相关内容

博士论文是由攻读博士学位的研究生所撰写的学术论文。它要求作者在博士生导师的指导下,选择自己能够把握和驾驭的潜在的研究方向,开辟新的研究领域。由此可见,这就对作者提出了较高要求,它要求作者必须在本学科的专业领域具备大量的理论知识,并对所学专业的理论知识有相当深入的理解和思考,同时还要具有相当水平的独立科学研究能力,能够为在学科领域提出独创性的见解和有价值的科研成果。因而,较之学士论文、硕士论文,博士论文具有更高的学术价值,对学科的发展具有重要的推动作用。
【博士论文】《自然语言处理中的因果推理》
专知会员服务
26+阅读 · 2025年4月25日
【博士论文】异构协同模型推理
专知会员服务
34+阅读 · 2024年11月19日
【经典书】统计学中的因果推断,156页pdf
专知会员服务
99+阅读 · 2022年6月14日
基于深度元学习的因果推断新方法
图与推荐
12+阅读 · 2020年7月21日
论文浅尝 | 一种用于多关系问答的可解释推理网络
开放知识图谱
18+阅读 · 2019年5月21日
论文浅尝 | 推荐系统的可解释性浅谈
开放知识图谱
15+阅读 · 2018年11月27日
论文浅尝 | 用可微的逻辑规则学习完成知识库推理
开放知识图谱
14+阅读 · 2018年7月5日
【推荐】用Tensorflow理解LSTM
机器学习研究会
36+阅读 · 2017年9月11日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
26+阅读 · 2011年12月31日
国家自然科学基金
23+阅读 · 2008年12月31日
VIP会员
最新内容
《基于强化学习的自动化红队测试》
专知会员服务
3+阅读 · 7月23日
伊朗不对称防空战略的演进
专知会员服务
4+阅读 · 7月23日
对抗环境下超视距目标打击的情报支援
专知会员服务
10+阅读 · 7月22日
《无人机对海面作战影响评估》
专知会员服务
15+阅读 · 7月21日
印度精确打击与指挥架构的断层
专知会员服务
7+阅读 · 7月20日
相关基金
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
26+阅读 · 2011年12月31日
国家自然科学基金
23+阅读 · 2008年12月31日
微信扫码咨询专知VIP会员