大模型正在从“训练一次、静态推理”走向“部署时持续改进”。传统范式中,模型参数在训练后固定,推理阶段只是把输入送入模型并得到输出。但越来越多研究显示,推理过程本身也可以成为动态过程:模型可以利用测试时反馈更新状态,也可以通过更多采样、搜索、验证、工具调用和外部资源来提升当前预测。 这篇综述《A Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference》提出“测试时智能”这一统一视角,用来连接测试时适应、测试时学习和测试时扩展等原本分散的研究方向。论文的核心判断是:未来 AI 系统的重要能力,不只是训练后拥有多强的静态知识,而是在部署中能否利用反馈、计算和环境交互不断改善行为。 全文围绕两条主轴展开:一是测试时学习,即利用测试时信号修改模型状态,例如归一化统计、提示、适配器、隐藏状态、外部记忆或部分参数;二是测试时扩展,即不必改变模型参数,而是在推理阶段投入更多计算或外部资源,例如长推理、多样采样、自一致性、搜索、工具使用、检索、验证器和多智能体协作。论文进一步讨论二者的交叉,并将其应用到视觉、生成模型、语言与多模态模型、具身智能、智能体和医疗等场景。
论文开篇指出,AI 系统在部署阶段自我改进的能力正变得越来越重要。过去的主流模型遵循“先训练、后推理”的静态路径:训练阶段吸收数据,推理阶段固定执行。这个范式非常成功,但在现实部署中存在明显限制:输入分布会变化,用户需求会变化,任务难度不均匀,系统还可能获得来自工具、环境或用户的新反馈。 作者认为,推理正在变成一个动态过程。模型可能需要利用无标签测试数据调整特征分布,利用输出置信度判断是否更新状态,调用外部知识或工具补齐信息,对难题分配更多计算,或者通过多轮验证改进答案。这些机制共同指向一种更宽的范式:系统在部署时不再只是执行固定函数,而是能够围绕当前输入、反馈和资源进行自我改进。
论文将传统静态系统与测试时智能系统进行了对比。传统系统中,输入经过预训练模型后直接产生固定行为;测试时智能系统则在推理阶段引入反馈回路。反馈可以指导测试时学习,让模型状态发生可写入更新;也可以指导测试时扩展,让系统在当前样本上投入更多计算、搜索或验证资源。 这种变化使“推理”从一次前向传播变成了一个包含探索、校正和资源分配的过程。尤其在大语言模型、多模态模型和智能体系统中,推理阶段已经常常包括检索、代码执行、工具调用、自我反思、多候选排序和多智能体协作。本文试图为这些现象提供统一概念框架。
论文梳理了 2020 到 2026 年间相关方法的发展。早期工作主要关注测试时适应,目标是在分布偏移下恢复源域性能,例如通过统计校准、熵最小化或自监督目标更新模型。随后,研究扩展到持续适应、个性化、外部记忆、提示更新和黑盒 API 适配。 与此同时,测试时扩展也快速发展。长链推理、Best-of-N 采样、自一致性、搜索式推理、工具调用、检索增强、验证器、奖励模型和多智能体协作,逐渐成为提升推理质量的重要路线。近两年还出现了学习与扩展的混合系统:额外计算不仅改善当前输出,还能生成可复用反馈,进一步更新模型状态。
第二节给出概念边界。作者将测试时智能定义为:模型或系统在主动部署过程中,利用测试时反馈进行状态更新或额外计算,从而改善当前或未来行为的能力。这个定义强调三点:发生在部署时,依赖测试时可获得的信息,改进体现在行为或预测质量上。
测试时智能不是一个单一算法,而是一组机制的统称。测试时适应主要解决分布偏移下的鲁棒性,通常是测试时学习的一个特例。测试时学习更宽,既可以服务于鲁棒性,也可以用于长期记忆、个性化、技能积累和递归自我改进。测试时扩展则强调在推理阶段投入更多计算或资源,不一定留下持久状态变化。 论文也区分了测试时智能与训练时摊销。若系统把部署阶段采集到的数据留到离线再训练,这不属于严格意义上的测试时智能;只有当改进在当前部署过程中发生,并直接影响当前实例、当前 episode 或后续部署流时,才属于本文讨论范围。
作者提出一个二维坐标来理解测试时智能:纵轴是模型状态是否更新,横轴是推理时计算是否增加。测试时学习位于“状态更新”区域,测试时扩展位于“额外计算”区域;二者交叉处则包含学习如何扩展、扩展如何产生学习信号,以及联合学习和扩展的系统。 这一区分很关键。测试时学习强调写入能力,例如更新提示、适配器、记忆或部分参数;测试时扩展强调计算能力,例如生成多个候选、做树搜索、调用工具或验证答案。真实系统往往需要二者结合:用更多计算获得更可靠反馈,再把反馈写入可复用状态。
第三节系统讨论测试时学习。它的核心问题是:在没有重新训练完整模型的情况下,如何利用测试阶段可获得的信号更新模型状态,使模型适应当前数据、当前用户或当前环境。可更新对象可以是输入、归一化统计、提示、适配器、隐藏状态、外部记忆,也可以是部分或全部参数。
测试时学习通常面对三类分布变化:输入分布变化、标签先验变化以及更复杂的复合变化。方法设计需要回答几个问题:测试时是否能访问源数据?更新是离线批处理还是在线流式?更新后状态是否持久?优化是否需要反向传播?反馈来自模型自身、数据结构、外部工具还是用户? 这些选择决定了方法的部署形态。源域可访问方法通常更稳,但隐私和工程限制更强;源域不可访问方法更实用,但自监督信号更容易噪声化。在线持续更新可以适应变化环境,却可能出现漂移和错误累积。黑盒方法适合商业 API,但能更新的状态通常只能是提示、检索缓存或外部记忆。
论文把测试时学习的反馈信号分为几类。第一是熵和置信度信号,用模型自身预测的不确定性指导更新;第二是一致性和增强信号,通过不同视角、扰动或增强后的输出一致性约束模型;第三是重建和自监督信号,例如从输入自身构造代理任务;第四是伪标签和自训练信号;第五是来自工具、环境或用户的外部反馈。 这些反馈各有风险。置信度可能过度自信,一致性可能强化错误,伪标签可能导致确认偏差,外部反馈则可能稀疏、延迟或带有噪声。因此,测试时学习不是简单“让模型边用边训”,而是要控制反馈可靠性、更新幅度和状态持久性。
测试时可更新对象构成了另一条分类轴。输入适应只改变输入或提示表示,风险较低但能力有限;部分参数更新可以调整归一化层、低秩适配器或少量模块,表达能力更强;辅助参数更新让模型在部署前预留可写入结构;全参数更新最灵活,但计算、稳定性和安全风险最大;外部记忆和缓存更新则适合个性化与长期经验积累。 论文强调,可写状态越强,收益和风险都越大。一个部署系统需要明确哪些状态可以被测试输入影响、更新是否可回滚、错误是否会跨样本累积,以及如何在稳定性和可塑性之间取得平衡。
测试时学习还需要考虑时间尺度。episodic 方法在一个样本或任务边界后重置更新状态,适合避免错误长期累积;continual 或 lifelong 方法保留更新状态,适合长期个性化、持续环境适应和技能积累,但会带来漂移、安全和遗忘风险。
测试时学习最早也最成熟的用途是模型适应。测试时训练通常在源训练阶段加入辅助任务,到测试时用无标签数据继续优化共享表示;完全测试时适应则不依赖源阶段准备,而是直接从测试输入中构造更新目标。前者信号更稳定,后者部署更灵活。 除适应外,论文还讨论了更广义的测试时学习:外部记忆用于存储用户偏好和历史经验,个性化方法根据用户反馈调整行为,自我改进系统则通过部署中的成功或失败信号不断积累能力。这些方向让测试时学习从“修复分布偏移”扩展为“形成持续能力”。
第四节讨论测试时扩展。与测试时学习不同,测试时扩展通常不修改预训练模型状态,而是通过增加推理时计算、搜索或外部资源来提升当前输出。它回答的是另一个问题:当输入更难、风险更高或答案空间更复杂时,系统能否临时投入更多资源获得更好结果?
论文总结了五类内部计算扩展方式。第一是更长推理和更深推理,例如延长思考链或使用递归深度。第二是 Best-of-N 和重复解码,生成多个候选后选择更好答案。第三是自一致性和共识,通过多条推理路径投票或聚合。第四是搜索式推理和规划,在树、图或中间状态空间中探索。第五是自适应计算和动态预算,把更多资源分配给更困难的输入。 这些方法的共同点是把推理从一次生成变成探索、验证和细化过程。它们在数学推理、代码生成、规划、问答和生成任务中都很有效,但也带来成本、延迟和选择器可靠性问题。更多计算并不必然更好,关键在于如何判断边际收益是否值得。
第二条路线是外部资源扩展,包括检索外部知识、调用工具或程序、使用验证器和重排序器,以及多智能体协作。检索可以弥补模型内部知识不足,工具调用可以获得精确计算或真实世界信息,验证器可以过滤错误输出,多智能体系统可以通过分工、辩论或协同探索提高质量。 但外部资源也会引入新的失败模式:检索结果可能不可靠,工具调用可能出错,验证器可能被误导,多智能体协作可能放大共识偏差或浪费计算。论文因此强调,测试时扩展应被看作资源编排问题,而不只是“多采样几次”。
测试时扩展能改善准确率、鲁棒性、复杂推理、规划质量和生成质量,也能让系统在不同难度输入上动态分配成本。然而,纯扩展存在明显上限。若基础模型缺少相关能力,单纯增加采样可能只是在错误空间中搜索;若验证器不可靠,更多候选会给选择带来更大负担;若成本预算不受控,系统难以部署在低延迟或高吞吐场景。 因此,论文认为测试时扩展需要与学习机制结合。扩展产生的候选、验证结果、失败轨迹和工具反馈,可以转化为可复用学习信号;学习又可以反过来控制何时扩展、扩展多少、调用什么工具和采用哪种推理策略。
第五节是全文的关键连接点。作者指出,测试时学习和测试时扩展不是两条割裂路线,而是可以相互促进。扩展可以为学习提供更强反馈,学习可以让扩展更高效、更自适应,二者结合则形成部署中的闭环自我改进系统。
扩展促进学习指利用额外推理计算生成可复用监督信号。例如,多次生成和自一致性可以产生伪标签,验证器和奖励模型可以筛选高质量样本,搜索过程可以产生中间状态和轨迹反馈。这些信号经过过滤和蒸馏后,可以更新模型、提示、记忆或策略。 这种路线的优势是能够把推理时探索转化为长期收益。缺点是如果候选生成或验证机制本身有偏,错误可能被写入模型状态,形成持续污染。因此,可靠反馈和安全写入是核心难题。
学习控制扩展则是让系统学会如何分配推理资源。不同输入难度不同,有些问题一次生成即可,有些需要长推理、检索、搜索或工具调用。若系统能学习预算分配、推理策略选择和工具调用策略,就可以在质量、延迟和成本之间取得更优平衡。 这类方法使测试时扩展从固定策略变成自适应策略。它不只是“永远多想一步”,而是判断什么时候需要多想、什么时候停止、什么时候换工具、什么时候请求外部反馈。
联合系统同时包含扩展和状态更新。典型例子包括测试时强化学习、自动生成监督信号、从部署反馈中更新策略、通过工具和环境交互持续改进智能体。它们最接近论文所说的自我改进测试时智能,因为系统在部署中既会探索,也会把有效反馈写入后续行为。
第六节把测试时智能放入多个应用领域。作者强调,测试时智能并不局限于大语言模型推理,它在视觉感知、生成模型、语言与多模态模型、具身智能、智能体系统、医疗和个性化 AI 中都有不同形态。
在视觉感知中,测试时适应常用于处理图像腐蚀、天气变化、跨域数据和开放世界变化。方法可以通过熵最小化、一致性约束、伪标签或提示更新来提高鲁棒性。生成模型中,测试时智能可用于图像修复、视频生成、三维重建和条件生成,通过推理时反馈修正退化、保持时序一致性或选择更优生成轨迹。
在语言和多模态模型中,测试时智能表现为长推理、自验证、检索增强、工具使用、提示更新、外部记忆和偏好适应。语言任务中的反馈可能来自最终答案、单元测试、数学验证、用户纠错或外部知识;多模态任务还包括跨模态对齐、空间关系、视觉定位和时序一致性。
具身智能中的测试时智能更具挑战,因为反馈常常延迟、动作相关且安全敏感。机器人需要在感知、场景理解、规划、动作和环境反馈之间形成闭环。测试时学习可以更新策略、记忆或技能,测试时扩展可以对候选计划进行搜索和验证。 智能体系统则把测试时智能推向更长流程:任务分解、工具调用、网页或代码环境交互、多智能体协作、反思和计划修订都发生在部署中。这里的关键问题是如何避免错误在长链路中累积,以及如何让经验沉淀为可复用能力。
医疗和个性化 AI 对测试时智能提出更高要求。一方面,系统需要适应不同患者、设备、医院和用户偏好;另一方面,错误更新可能带来严重后果。论文认为,这些场景必须同时关注性能、校准、可解释性、安全边界和人类监督。
第七节总结开放挑战。当前测试时智能仍面临多重现实问题:反馈信号可能噪声大或不可验证,状态更新可能引发漂移和遗忘,更多计算可能带来高延迟和高成本,黑盒商业模型限制参数和梯度访问,多模态和交互任务缺少统一评测。
论文特别强调安全性。测试输入不仅可能影响当前输出,还可能污染后续状态。如果攻击者操纵反馈、检索内容、工具结果或验证器,系统可能把错误写入记忆、提示或适配器。相比静态模型,具备持续改进能力的系统拥有更复杂的攻击面。 另一个挑战是评测。很多测试时学习工作只在合成腐蚀或窄域分布偏移上验证,很多测试时扩展工作只报告准确率提升而忽略延迟、内存、能耗、校准和稳定性。作者呼吁建立更贴近部署的 benchmark,统一比较反馈访问、测试时预算、状态持久性和安全约束。
论文列出了若干未来方向:面向长上下文记忆的测试时训练,对抗攻击下的安全测试时智能,黑盒适应,测试时智能扩散模型,人类交互式测试时智能,科学发现中的测试时智能,以及面向深度研究工作流的测试时智能。 这些方向共同指向一个目标:让 AI 系统在开放环境中既能持续改进,又能保持可控、可审计和资源高效。尤其是黑盒适应和人类交互式机制,可能成为真实产品中最先落地的形态,因为许多模型以 API 服务形式存在,用户无法访问内部参数,却仍希望系统能在会话、任务和长期使用中变得更贴合需求。
本文的结论非常明确:测试时智能提供了一种理解部署阶段自我改进 AI 系统的统一框架。测试时学习关注如何写入和保留新信息,测试时扩展关注如何在当前推理中投入更多计算和资源,二者交叉则形成更接近真实智能体的反馈闭环。
对研究者而言,这篇综述的重要价值在于统一术语和问题边界。测试时适应、长期记忆、推理时采样、工具调用、自验证和多智能体协作,过去往往属于不同社区;放在测试时智能框架下,它们都可以被看作“利用部署时反馈改善行为”的不同机制。 对产业实践而言,论文给出的提醒同样关键:自我改进能力不是免费午餐。系统需要知道哪些反馈可信、哪些状态可写、更新何时重置、计算预算如何控制、外部工具如何验证、以及错误如何回滚。未来真正可靠的 AI 系统,可能不是静态最强的模型,而是能在推理中审慎学习、合理扩展并持续校准自身行为的系统。