大语言模型的推理能力正在从“更大模型”转向“更会思考”。当预训练规模律逐渐进入收益递减区间,测试时扩展成为提升推理能力的重要路径:不改变模型参数,而是在推理阶段投入更多计算,让模型生成、评估、回溯和选择更好的中间解。 这篇 EMNLP 2026 综述《When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models》提出一个核心视角:LLM 推理可以被看作对部分推理状态空间的搜索。Chain-of-Thought 让中间推理步骤显式化,但常见实现仍是单轨迹解码,一旦早期步骤出错就很难恢复。树搜索则维护多个候选分支,根据中间反馈重新分配计算,从而更适合长链推理、代码生成、智能体规划和自我改进。 论文系统梳理了从无信息搜索、启发式搜索到蒙特卡洛树搜索的演化,重点讨论 MCTS 在 LLM 推理中的统一形式、节点粒度、奖励设计、搜索控制、应用场景和实践取舍。作者还提出标准化计算报告协议,提醒研究者不能只比较准确率,还要把推理预算、评估器成本、验证成本和墙钟时间纳入同一分析框架。
论文开篇指出,LLM 领域的能力提升正在从训练时扩展走向测试时扩展。训练时扩展依靠更多参数、更多数据和更长训练时间;测试时扩展则固定模型先验,把更多计算花在每个具体问题上。对推理任务而言,这意味着模型不只是一次性输出答案,而是在中间状态空间中探索、评估和修正。 作者认为,树搜索是理解现代测试时推理的一条关键线索。CoT 展示了中间步骤的重要性,但单轨迹 CoT 仍像贪心路径:每一步都延续上一选择,缺少系统性回溯和分支比较。树搜索则把推理过程组织为状态、动作、转移和奖励,允许模型在多个候选路径之间动态分配预算。
论文的贡献包括三点。第一,提出统一形式,把搜索式推理拆成搜索机制、奖励或价值估计、转移动力学等组件。第二,建立组件化分类,梳理不同方法在搜索拓扑、评估信号和控制动态上的设计。第三,讨论计算报告与未来挑战,使树搜索方法的准确率、延迟和成本更可比较。 一个重要判断是,树搜索具有双重角色:它既是测试时优化器,可以在当前样本上提升输出质量;也是自我改进的数据生成器,可以把搜索发现的高质量推理轨迹蒸馏进训练数据或奖励模型,形成更持久的参数知识。
第二节回到经典 AI 搜索。许多推理问题都可以表示为在树或图上的搜索:根节点是初始问题,边代表一步操作或推理动作,节点代表部分解,目标是找到满足任务目标的路径。由于分支因子巨大,穷举通常不可行,因此搜索算法必须在探索成本和解质量之间取舍。
BFS 按层扩展,适合浅层目标但内存开销高;DFS 沿单一路径深入,内存低但容易走入错误分支;UCS 按累计成本扩展,适合有代价结构的问题。对 LLM 推理来说,无信息搜索提供了概念基线,但在开放语言空间中通常过于低效。
启发式搜索使用估计函数为节点排序。A* 将当前路径成本与剩余成本估计结合,优先探索更可能到达目标的节点。对应到 LLM 推理,启发式可以来自模型自评、过程奖励、外部验证器、相似案例或任务结构。问题在于,开放式推理很难设计稳定、跨领域的启发函数。
MCTS 通过选择、扩展、模拟和回传四个步骤平衡探索与利用。它不要求预先设计完美启发函数,而是通过采样和回传逐步估计节点价值。论文认为,这一特性使 MCTS 特别适合 LLM 推理:评估器可能噪声大,奖励可能稀疏,只有终局答案或执行结果才能可靠判断。
第三节是全文核心。作者将 LLM 推理中的 MCTS 统一表示为:给定问题,模型在由部分推理状态构成的树上搜索;每条边对应一次生成动作,例如生成下一步思路、代码块、检索动作或智能体操作;节点被奖励模型、验证器、执行环境或模型自评打分;搜索统计再反过来指导后续扩展。
在 LLM 场景中,节点可以有不同粒度。最细粒度是 token 或短片段,最常见的是推理步骤、思维片段、代码块或工具调用,最高层则可以是完整子任务或计划。粒度越细,控制越精细,但搜索树越大;粒度越粗,效率更高,但可能错过局部纠错机会。 论文强调,MCTS 不只是把经典算法搬到文本上。LLM 生成动作本身就是带概率的策略先验,评估器可能来自另一个模型、同一模型自评、程序执行结果、单元测试、数学验证或人类反馈。因此,MCTS 在 LLM 中的关键问题,是如何设计节点、扩展动作、奖励函数和回传规则。
评价函数决定搜索质量。论文区分过程奖励和结果奖励:过程奖励对每一步或中间状态打分,能提供密集指导;结果奖励只评价最终答案,通常更可靠但更稀疏。数学题可以用最终答案判断,代码任务可以用单元测试判断,而开放问答和智能体任务往往需要更复杂的评估器。 评价器架构也有两类:外部模型和自我评价。外部模型可以是专门训练的奖励模型、价值模型或偏好模型,质量更稳定但成本高;自我评价直接复用 LLM 本身,更轻量但可能继承模型偏差。部分方法还组合多个 critic,把过程质量、终局正确性、执行结果和代价约束合成为一个奖励。
LLM 推理中的 MCTS 常对经典流程做适配。选择阶段可以加入模型先验、UCB 变体或温度控制;扩展阶段可以生成多个候选、要求模型自我批判并重写,或调用工具产生新状态;回传阶段可以采用平均、最大值、加权平滑或成功率更新,以适配噪声奖励。 这些变化反映出 LLM 推理的特殊性:语言状态高度离散且组合爆炸,奖励常常延迟,模型生成有随机性,评估器成本不可忽略。因此,好的 MCTS 设计不是“搜索越深越好”,而是在节点粒度、采样宽度、评价频率和回传策略之间找到任务相关的平衡。
论文将 MCTS 应用分为两大类。第一是直接测试时增强:在推理阶段探索多个思路、代码块、检索路径或智能体行动,从而提升当前输出。典型场景包括数学推理、代码生成、软件工程、智能体规划、知识密集型问答和多模态推理。 第二是通过数据生成实现自我改进:MCTS 找到高质量轨迹后,将其用于微调、偏好学习、奖励模型训练或自训练。这使搜索不只是一次性计算开销,而可以沉淀为训练数据和更强模型。
作者给出面向任务的实践建议。数学与逻辑任务适合 trace-based 节点、过程奖励或最终奖励以及平均式回传;代码任务适合终局状态节点、执行验证和最大值回传;RAG 任务常用层级拓扑,把检索和推理分开;自主智能体任务则需要状态-动作树、复合奖励和规划式回传。 什么时候不该用树搜索也很重要。若任务很简单,额外搜索会过度思考;若奖励模型与最终正确性弱相关,搜索会放大伪信号;若验证成本占据大部分预算,探索深度会被压缩;若开放生成缺少可靠判据,树搜索的收益可能弱于轻量重排序或小规模自一致性。
第四节讨论 MCTS 之外的知情搜索。与 MCTS 通过采样逐步积累价值不同,知情搜索直接使用启发式函数引导节点选择。LLM 可以动态生成候选步骤并对其评分,也可以构造复合代价函数来估计当前路径进度和剩余难度。
Tree-of-Thoughts 是典型例子:模型先生成多个候选想法,再用模型评分这些中间状态,最后通过 BFS、DFS 或 beam search 保留更有前景的分支。这个范式简单直观,适合具备可解释中间步骤的问题。
另一类方法借鉴 A*,把已取得进展和到目标的剩余距离组合起来。过程奖励可以衡量当前步骤质量,统计一致性可以衡量多次生成是否稳定,记忆相似度可以参考高质量历史案例,学习到的价值函数则可以估计到目标的成本。
第五节指出,树搜索方法的跨论文比较非常困难。很多论文报告了 GSM8K、MATH、代码或智能体任务上的准确率提升,但其模型规模、采样次数、验证器成本、搜索深度、硬件平台和墙钟时间不同,导致简单横向比较并不公平。
作者提出标准化计算报告协议,用来描述每个实例的推理时成本。它建议把成本拆成策略模型调用、评价模型调用、验证或工具调用,以及墙钟时间等组成部分。这样,研究者不仅报告准确率,还能说明每一点提升花费了多少 token、多少模型调用和多少外部验证成本。 论文强调,这一协议不是新的排行榜指标,而是一种报告抽象。它的目的不是立刻给所有方法重新排名,而是让未来工作可以在更透明的预算条件下比较搜索深度、奖励质量、模型规模和最终性能之间的 trade-off。
第六节总结挑战与未来方向。树搜索确实能提升推理,但主要瓶颈集中在计算成本和奖励质量。相比贪心解码,树搜索需要更多模型调用、更多评估和更复杂的控制逻辑;若模型对简单问题过度搜索,反而会浪费预算甚至降低答案质量。
树搜索结构限制并行度,尤其在需要等待中间状态评价后才能继续扩展时,墙钟延迟会显著增加。未来方向包括动态预算、早停策略、分支剪枝、并行 rollouts、轻量评估器、短推理轨迹和任务自适应搜索深度。真正实用的系统需要根据问题难度分配计算,而不是对所有输入使用固定搜索预算。
奖励质量是树搜索成败的核心。数学和代码任务拥有较强终局验证,因此树搜索收益明显;开放问答、多模态推理和智能体规划则常缺少可靠奖励,容易出现评估器偏差、奖励欺骗和错误分支强化。未来需要更稳健的过程奖励、可校准验证器、多 critic 融合和对不确定性的显式建模。
论文最后强调,树搜索的长期价值不只是提升单次推理,而是连接测试时扩展与自我改进。搜索产生的高质量轨迹可以用于蒸馏,错误轨迹可以用于训练 critic,工具执行反馈可以转化为监督信号,多智能体探索可以为模型提供更丰富的数据。这意味着搜索既是推理算法,也是训练数据和奖励模型的生成机制。 总体来看,本文把 LLM 推理从“解码”重新定义为“实例级优化”。在这个视角下,模型规模只是先验能力,真正的推理表现还取决于搜索拓扑、评价信号、控制策略和计算预算。未来的大模型系统,很可能会把训练时能力、测试时搜索和持续自我改进更紧密地结合起来。