综述 | 超越文本思维链:自动驾驶中的动作扎根推理

论文首页与摘要。本文聚焦自动驾驶中的动作扎根推理,核心问题是如何让中间推理过程真正服务于连续、实时、安全的驾驶动作。

导读

大模型时代的“思维链”通常以文字呈现:模型把问题拆成若干自然语言步骤,再给出答案。但自动驾驶不是一道只需要文字答案的题。驾驶系统最终要输出车道级决策、轨迹、速度、转向或闭环控制;它面对的是动态交通参与者、地图约束、交通规则和安全风险。若推理链只是看起来合理,却不能与空间、时间和动作接口对齐,就很难成为可靠驾驶系统的一部分。 这篇综述《Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving》系统整理了自动驾驶中从“文本思维链”走向“动作扎根推理”的研究脉络。论文覆盖 171 篇相关工作,其中包括 130 篇方法论文,以及 41 篇基准、数据集、综述与分析工作。作者提出一个以“中间表征”为中心的分类框架,将现有方法归为语言表征、视觉空间表征、潜在动态表征和外部化表征四大类,并进一步细分为 13 个子类。 这篇综述的价值不在于简单罗列方法,而在于重新定义了自动驾驶推理应当关注的对象:不是模型能不能“说出推理”,而是它的推理中间态是否能被定位到场景、耦合到动作、接受验证,并在实时闭环中保持稳定。对于关注具身智能、视觉语言动作模型、世界模型和自动驾驶评估的读者,这是一篇很适合建立全局地图的论文。

Introduction | 引言

为什么驾驶推理不能停留在文字

传统思维链在数学、问答、代码等任务中取得了显著进展,因为这些任务的中间步骤和最终答案都可以自然地写成文本。但自动驾驶的输入与输出都更“物理”:输入是多视角图像、激光雷达、地图、交通规则、历史轨迹和环境状态;输出则是连续动作或可执行计划。语言解释可以帮助人理解模型意图,却不必然约束车辆真正怎么开。 论文指出,驾驶推理至少面临三重错位。第一是模态错位:文字链条很难完整表达三维空间关系、速度变化、遮挡、可行驶区域和交互博弈。第二是时间错位:驾驶决策必须在毫秒到秒级预算内完成,长篇推理可能带来延迟。第三是验证错位:一句解释“我会减速让行”听起来合理,但系统实际轨迹是否减速、是否留足安全距离、是否符合法规,需要通过动作和环境状态来验证。 因此,作者把研究对象从“是否生成推理文本”推进到“推理表征如何支撑动作”。所谓动作扎根推理,强调中间表征应当与场景结构、预测状态、规划变量或外部工具相连接,并最终影响驾驶动作。这也是本文分类体系的出发点。 动作扎根推理的四类中间表征。论文以显式到隐式、语言到动作的连续谱组织现有研究,强调推理表征必须与驾驶决策发生可追踪连接。

From Textual CoT to Action-Grounded Representations | 从文本思维链到动作扎根表征

三个关键变化

从通用大模型推理迁移到自动驾驶后,思维链的含义发生了变化。第一,推理不再只是显式文字。它可以是未来场景预测、占用表示、潜变量滚动、检索到的案例、地图规则、工具调用记录,甚至是多车协同消息。只要这些中间态影响最终驾驶动作,就可以被纳入动作扎根推理。 第二,推理需要服务于不同层级的驾驶任务。感知层面,系统要解释“哪里有行人、信号灯、道路边界”;预测层面,系统要判断“周围车辆和行人下一步可能怎么动”;规划层面,系统要决定“本车应该等待、变道、绕行还是继续前进”;控制层面,则要把计划落成连续轨迹或控制量。 第三,推理的好坏不能只看语言质量。自动驾驶中的推理应同时满足可解释性、动作有效性、安全性和实时性。一个解释越长,不一定越可靠;一个潜在动态表征不够可读,也不一定不可用。关键在于它是否捕捉了任务相关因果因素,并能在闭环中减少碰撞、违规和路线失败。 自动驾驶思维链的基础设施演进。研究路线从封闭大模型提示,逐步转向开源多模态模型、视觉语言动作模型、世界模型与强化学习对齐的推理系统。

认知目标的扩展

论文在附录中进一步总结了驾驶思维链的认知目标。早期工作主要让模型描述场景、回答驾驶问答,后来逐渐转向空间几何、风险评估、交通规则、反事实反思、未来世界建模和社会交互。这意味着“推理”不只是解释当前画面,而是要覆盖驾驶智能中的多个认知环节。 驾驶推理的九类认知目标。它们覆盖感知、预测、规划、安全、法规、因果反思、未来世界建模和多主体交互等核心能力。

Representation-Centered Taxonomy | 以表征为中心的分类

语言表征

语言表征是最接近传统思维链的一类,也是数量最多的一类。论文将其细分为描述式、程序式、反思式和压缩式。描述式方法把场景元素、风险和理由写成自然语言;程序式方法按阶段组织“感知-预测-规划”流程;反思式方法引入批评、修正或反事实检查;压缩式方法则试图降低推理长度,在必要时才展开文字推理。 语言表征的优势是可读、易监督、易与现有视觉语言模型接口结合。它适合训练解释、构建驾驶问答、生成规划理由,也便于人工审查。但其短板同样明显:语言链条可能与实际轨迹不一致,容易产生听起来正确的后验解释;同时,长文本推理会消耗推理时间,在高频闭环控制中未必可接受。

视觉空间表征

视觉空间表征试图把推理从“说出来”转向“指向哪里”。这一类方法通常通过区域、目标框、占用图、未来场景、视觉证据裁剪或空间问答,把模型注意到的对象与驾驶动作关联起来。它比纯文本更适合表达道路几何、相对位置、遮挡和交通参与者交互。 论文把视觉空间表征分为预测式与动作扎根式。预测式方法强调未来场景或环境状态,动作扎根式方法则把视觉证据直接穿插到决策链条中,例如检索或裁剪与当前动作相关的图像区域。它们提高了推理的可定位性,但也带来新问题:视觉证据是否真是模型决策依据,仍需更严格的因果验证。 四类表征及代表方法。表格展示了不同子类的中间产物、骨干模型、任务设置和论文内报告的效果证据。

潜在动态表征

潜在动态表征把推理放在隐空间或动态模型中。它不一定输出完整文字解释,而是通过潜在状态滚动、离散化状态令牌、优化式轨迹更新等方式模拟未来并改进动作。论文将其划分为滚动式、令牌化和优化式三类。 这类方法与世界模型、端到端规划和视觉语言动作模型关系密切。它的优势是更贴近连续控制和未来状态预测,适合闭环驾驶;不足是可解释性较弱,中间变量未必能被人直接理解。论文强调,潜在表征不是不透明就一定不可用,但必须建立与动作结果、场景因果和安全约束之间的验证通道。

外部化表征

外部化表征把推理的一部分放到模型外部,包括检索增强、知识扎根、工具调用和协同交互。检索增强方法利用历史驾驶经验或相似场景;知识扎根方法引入交通法规、地图、规则库或人类常识;工具介导方法让模型调用检测器、规划器、地图接口等外部模块;协同方法则考虑车与车、车与基础设施之间的信息交换。 这类方法的优点是能够补充模型参数中没有的上下文,增强可审计性,也更容易纳入现实系统已有模块。风险在于外部信息可能过时、冲突或错误,工具调用链条也会增加系统复杂性。真正可靠的外部化推理,需要同时管理信息来源、时效性、置信度和动作接口。 130 篇方法论文的完整分类。论文按主要中间推理表征组织方法,并统计各子类规模,显示语言表征仍占主导,但视觉空间、潜在动态和外部化路线正在快速扩展。

Cross-Category Analysis | 跨类别分析

四个转变

论文对不同类别进行了横向分析,并在附录中概括出四个重要转变。第一是基础设施转变:研究从调用封闭多模态模型,转向开源视觉语言模型、驾驶专用基础模型、视觉语言动作模型和世界模型。第二是认知目标转变:推理从解释场景,扩展到预测、风险、法规、因果反思和社会交互。 第三是动作输出转变。早期系统常输出元动作文本,例如“停车”“变道”“减速”;随后发展到路点、轨迹曲线、控制信号和闭环策略。动作越具体,越能检验推理是否真正影响驾驶,但也越要求表征与规划控制模块紧密对齐。 动作输出形式的演进。自动驾驶推理从高层动作文本逐渐走向路点、轨迹、控制量和闭环策略,评估标准也随之从语言正确性转向可执行性与安全性。 第四是部署转变。推理系统必须在不同时间预算下工作:快速反应路径强调低延迟;自适应路径在简单场景中少想、复杂场景中多想;完整推理路径则允许检索、工具调用或多步规划。论文认为,未来系统很可能采用“按需思考”的架构,而不是对所有场景使用固定长度推理。 三类部署策略。快速反应、自适应推理和完整外部化推理对应不同延迟预算,也对应不同安全冗余与可解释性需求。

动作耦合与可验证性

跨类别比较显示,语言表征最容易解释,潜在动态表征最贴近控制,外部化表征最便于接入知识和工具,视觉空间表征则位于可解释性与动作扎根之间。没有一种表征天然最优,关键是任务需求:驾驶问答需要语言和视觉证据,闭环规划需要动态表征,法规遵循需要知识扎根,多车交互则需要协同表征。 论文强调,未来研究应减少“解释与动作脱钩”。一个系统如果生成了漂亮的理由,但轨迹并未使用这些理由,它的推理就只是旁白。更强的研究范式应检查中间表征是否改变动作、是否能预测失败、是否能在干预后产生一致行为。

Evaluation Landscape | 评估图景

指标碎片化

当前自动驾驶推理评估高度碎片化。同一场景可以被用于语言推理、空间定位、轨迹评分和交互式闭环驾驶,但这些评估往往使用不同数据集、不同输入模态、不同动作接口和不同指标。语言问答看准确率,空间问答看位置关系,轨迹规划看碰撞率与轨迹误差,闭环驾驶看成功率、行驶分数和违规情况。 这种碎片化导致方法之间很难直接比较。某个模型在驾驶问答上表现好,不代表它能输出安全轨迹;某个规划器轨迹分数高,也不代表它具有可审计推理。论文建议未来报告更完整的计算预算、延迟、输入模态、动作接口和闭环设置,并建立跨表征的统一评估协议。 驾驶推理的碎片化评估。同一个交通场景可对应语言推理、空间定位、轨迹评分和交互驾驶四类评估范式,现有基准仍难形成统一可比的系统刻度。

闭环评估

作者特别强调闭环评估的重要性。开放环规划可以衡量模型对专家轨迹的拟合,但驾驶系统真正上线时会连续感知、决策、执行,再面对自己动作造成的新状态。许多错误只有在闭环中才会显现,例如保守停车导致任务失败,或者短期安全但长期路线不可达。 因此,动作扎根推理的评估应同时覆盖解释质量、空间定位、预测一致性、轨迹安全、规则遵循、闭环成功率和失败可诊断性。尤其对安全关键场景,评估不应只问“模型说得对不对”,还要问“它是否因此做得更对”。

Open Challenges | 开放挑战

表征特定验证

论文提出的第一个核心挑战是表征特定验证。不同表征需要不同验证方法:语言表征要验证理由与动作是否一致;视觉空间表征要验证区域和对象是否真的因果相关;潜在动态表征要验证隐状态是否捕捉未来演化;外部化表征要验证检索、知识和工具输出是否可靠。 这要求研究者从单一指标转向多层诊断。一个可行方向是引入干预式评估:修改中间表征、遮蔽关键对象、替换检索案例、扰动未来状态,然后观察动作是否按预期变化。只有当中间表征对动作具有稳定、可解释的影响,推理才算真正扎根。

实时性与安全

第二个挑战是实时性。自动驾驶系统无法无限推理,也不能在每个场景中使用昂贵的树搜索、检索或多模型协作。未来方法需要学会区分简单场景与复杂场景,把计算资源集中在遮挡、抢行、弱势交通参与者、规则冲突等高风险情形上。 第三个挑战是安全集成。动作扎根推理不应取代安全约束,而应与安全监控、形式化规则、冗余规划和异常检测协同工作。语言解释、视觉证据、潜在状态和外部知识都可能出错,系统级安全需要在这些表征之上建立故障检测、回退策略和人机审计机制。

Conclusion | 结论

关键启示

这篇综述给自动驾驶中的大模型推理划出了一条清晰主线:真正重要的不是模型能不能生成一段“像推理”的文字,而是中间推理表征能否进入驾驶系统的感知、预测、规划和控制链路。语言表征提供可解释接口,视觉空间表征提供场景定位,潜在动态表征连接未来演化,外部化表征接入经验、知识和工具。四者共同构成了自动驾驶动作扎根推理的研究版图。 从研究趋势看,自动驾驶推理正在从文本解释走向多模态、可执行、可验证的中间表征。下一阶段的关键问题,将是如何在真实闭环、安全约束和有限计算预算下,让推理既能被人理解,又能实实在在改善车辆行为。对自动驾驶和具身智能而言,这也是从“会说理由”迈向“会负责任地行动”的关键一步。

成为VIP会员查看完整内容
0
VIP会员
最新内容
分层反无人机系统发展新趋势
专知会员服务
8+阅读 · 9月3日
何为协作武器?
专知会员服务
10+阅读 · 9月1日
《理解认知战:超越信息》
专知会员服务
14+阅读 · 9月1日
美国战争部在GenAI.mil上推出OpenAI的ChatGPT Mil
专知会员服务
10+阅读 · 8月31日
人工智能赋能军事维护:重新定义国防战备
专知会员服务
5+阅读 · 8月31日
微信扫码咨询专知VIP会员