综述|端到端自动驾驶如何训练:数据、策略与平台的协同生态

论文:A Survey on End-to-End Autonomous Driving Training from the Perspectives of Data, Strategy, and Platform 作者:Chengkai Xu、Yiming Cui、Jiaqi Liu、Yicheng Guo、Cheng Qin、Geyuan Zhang、Xinwei Dong、Shiyu Fang、Peng Hang、Jian Sun 机构:同济大学交通学院、美国北卡罗来纳大学教堂山分校计算机科学系;通讯作者为 Peng Hang 版本:arXiv:2610.00926v1,2026 年 10 月 1 日提交,PDF 共 21 页;论文页面标注已被 IEEE Transactions on Intelligent Transportation Systems 接收 原文链接:论文页面|完整 PDF|期刊 DOI 项目链接:作者维护的文献仓库

导读:端到端自动驾驶能否可靠运行,不能只看网络结构或离线轨迹误差。模型是否见过关键交互?监督是否与规划和安全目标一致?仿真是否可信?每次更新能否复现、验证和回滚?这些问题共同决定训练出的能力能否转化为真实道路上的表现。 这篇综述提出“数据—策略—平台”三层框架:数据决定可学习的信息边界,策略决定怎样向驾驶目标优化,平台决定规模化训练和持续演化能否实现。其核心观点不是三条技术路线并列发展,而是让它们形成可追踪、可检验的闭环。 本文严格沿原文七节正文组织,保留各节主要层级,并使用六张原图及中文图解。原文的数据集、方法与产业对照表用于梳理设计角色,并非统一条件下的性能排行榜;文中的产业案例也基于公开资料,不能当作对企业内部系统的完整核验。

1 Introduction|引言

传统自动驾驶通常将感知、预测、规划和控制拆成模块。这有利于工程管理与解释,但接口之间可能积累误差,局部目标也未必与车辆最终行为一致。端到端学习通过统一、可联合优化的模型,将多模态输入与驾驶动作或轨迹联系起来,尝试缓解这种割裂。 然而,大模型本身不能补齐未覆盖的场景,也不能保证训练目标与道路安全一致。作者指出,训练生态至少需要三类支撑:足够覆盖且可治理的数据,使稀有关键事件有机会被学习;能够协调多目标、稳定长时域优化的策略;能够扩展计算、管理生命周期和持续更新的平台。 已有综述分别讨论数据集、感知、端到端架构、模仿学习或基础模型。本篇的区别是围绕训练生态分析它们的依赖关系:数据缺口会放大策略不稳定,复杂策略增加平台负担,平台效率又限制可以尝试的数据与方法规模。 图1|综述的七节结构与三层训练生态。数据层讨论来源、监督与治理;策略层比较经典学习和生成式范式;平台层涵盖训练、评测与云边协同;未来方向强调价值密度、基础能力和持续演化。来源:原论文图1,PDF 第2页。

2 End-to-End Autonomous Driving|端到端自动驾驶

2.1 发展与趋势

早期 ALVINN、DAVE-2 等工作验证了从观测到控制的学习式映射,但直接单网络设计容易受长尾场景和跨域变化影响。之后,模块化端到端方法在可微框架内保留中间表示,将感知、预测与规划联系起来。MP3、UniAD、DiffStack 是综述讨论的代表。 因此,端到端不必等于“完全没有中间结构”。关键在于目标和梯度能否贯穿决策链,而不是把所有模块都隐藏在一个无法检查的映射里。 进一步的发展包括语言与动作对齐、扩散轨迹生成和世界模型。LMDrive、OpenDriveVLA 等探索高层指令与驾驶行为的结合;DriveDreamer、GAIA 等提供未来场景生成与反事实构造。由此,训练从复制观察到的动作,扩展到表示多种未来、推断交互和适配新环境。 评测也由离线代理指标转向闭环任务:预测误差低,不代表车辆执行后能够稳定、安全地完成路线。闭环测试需要关注安全、舒适、合规和长期行为,而不仅是感知精度。

2.2 核心训练挑战

数据层受到长尾分布、高质量标注稀缺和虚实差异限制;策略层存在多任务冲突、收敛不稳定以及离线指标与实际行为脱节;平台层则面临吞吐、数据流水线、分布式计算与持续适配问题。 这些问题互相放大。例如,世界模型生成的错误交互可能污染策略训练,而平台若没有记录生成配置和数据版本,就难以定位退化原因。所谓系统级改进,不是把更大的数据、模型与集群拼接起来,而是使它们在同一目标与验证流程中保持一致。 图2|数据定义可学习的信息边界,策略组织可控的优化过程,平台提供可靠演化的基础。三层共同约束能力,但该图是概念框架,不是对性能上限的数值证明。来源:原论文图2,PDF 第3页。

3 Data Layer|数据层

3.1 来源与场景覆盖

场景不是一帧图像,而是在道路几何、参与者、规则和环境条件下持续一段时间的交通交互。训练价值也不应只按出现频次衡量,而要看它是否改变闭环规划、稳健性和泛化能力。 作者将来源组织为真实、虚拟和合成数据。真实数据来自车队、影子模式、路侧传感与众包车辆,提供自然交互和地区驾驶习惯,但成本高、关键事件难以按需采集。虚拟数据来自模拟器、三维重建或生成式环境,便于可控扰动和危险情境测试,却需要校准行为与动力学。经过筛选核验的合成样本则补充特定训练需求。 这些类别在技术来源上可能交叉,应关注其具体生成、核验与使用流程,而不是只凭“合成”或“真实”标签判断质量。视觉逼真不意味着交互真实,自动生成也不意味着标签已经可靠。 世界模型在这里承担数据引擎角色:生成罕见情况、重放失败、构造条件化未来或反事实场景。当其预测被用来评估动作、规划或优化策略时,它才进入策略层。两种角色相关,但验证要求不能混用。 原文表2将代表性数据集按规模和价值导向组织。其启发是从总帧数转向有效覆盖,不是说小数据集必然优于大数据集,也不是宣布某个数据集具有通用最高价值。

3.2 监督与标签对齐

监督把传感记录转化为可学习的行为与语义信号。人工标注精细但难扩展;预训练模型、跨模态融合和伪标签提高效率,却可能引入误配、噪声和时序漂移。 作者主张分层处理:对安全关键、罕见且高价值的场景投入精细标注与多模态对齐;对高频、低影响样本采用自动化或半监督流程,并保留必要质量检查。资源应由训练收益和目标相关性驱动,而不是优先标注最容易处理的样本。 稀有不等于高价值。 常见但模型反复犯错的交互也可能值得优先训练;稀有却与任务边界关系很弱的样本未必贡献大。数据价值需考虑当前模型、任务目标与可学习性。 图3|按场景稀有程度与模型对齐、相关性划分四类场景:常见或稀有都可能具有高价值或低价值。训练优先级不能只由稀有程度决定。来源:原论文图3,PDF 第5页。

3.3 数据估值与治理

综述将场景价值视为对模型当前能力边界的边际贡献,并给出风险、不确定性和分布距离的组合评分:V(s)=wᵣR(s)+wᵤU(s|θ)+w_dD(s|训练集)。风险反映安全关键性,不确定性反映模型知识不足,分布距离用于描述已有覆盖之外的情况。 这是组织场景筛选的参考框架,不是已经适用于全部驾驶任务的通用价值定律。权重、指标和阈值均需结合训练目标校准,高不确定性也不自动证明该样本可有效学习。 场景价值随模型更新而变化:旧难例可能变容易,新边界可能出现。因此数据引擎要持续重估,而不只是一次性挑选。治理还需记录来源、筛选、增删和适用范围,将数据版本与模型检查点建立明确关联。这样才能判断一次性能变化来自哪些场景,而不是只能归因于“又加了一批数据”。

4 Strategy Layer|策略层

4.1 模仿学习

模仿学习利用专家演示建立驾驶策略,行为克隆简单高效,逆强化学习与对抗模仿则从奖励或轨迹分布角度学习。其适合提供正常驾驶的快速初始化,但有三类限制:演示昂贵且可能次优;部署到专家未访问的状态会产生协变量偏移和误差累积;稀有高风险情境覆盖不足。 数据侧可通过视角变换、轨迹扰动和反事实构造扩展分布;算法侧以数据聚合让专家纠正模型访问的新状态,安全感知变体减少无必要干预;对抗式目标尝试匹配更整体的行为分布。世界模型还可提供额外回放,但生成质量需要单独检验。 作者更倾向将模仿学习定位为策略启动器,而非独立承担最终长期安全对齐。它与强化学习、生成式数据和闭环验证组合,才能更完整地处理分布偏移。

4.2 强化学习

强化学习通过交互反馈优化长期回报,适合调整难以完整写进标签的目标,例如安全间距、舒适性、效率和自然驾驶。综述强调其价值常在策略精炼,而非从零开始以真实道路试错。 主要挑战包括样本效率、探索风险、多目标奖励失配和跨域退化。单一标量奖励若表达不充分,可能产生代理目标投机;在模拟器中的收益也可能无法迁移到实际道路。 应对路线包括离线强化学习、模仿初始化后再精炼、潜在空间想象轨迹、约束和风险敏感优化。控制屏障函数或模型预测控制过滤器可限制不安全动作,偏好反馈和分层策略帮助协调多目标,领域随机化、课程与持续学习支持适配。 这些机制降低或管理风险,但不应被描述为自动获得完整安全保证。强化学习仍依赖可信评测环境、奖励验证和执行保护,尤其不能把不受约束的道路探索视为正常训练流程。

4.3 新兴生成式范式

**扩散策略

扩散模型通过逐步去噪生成动作或轨迹,能够表示多种合理行为,适合交互存在歧义、未来不唯一的场景。相比输出单一路径,它提供候选分布与不确定性表示。 代价是多步采样延迟和计算开销,还需满足车辆动力学、规划目标与硬约束。减少采样步数、引入引导及规划条件可以改善效率或可控性,却不能仅靠“候选多样”证明安全。作者将扩散策略优先定位为轨迹级候选生成与规划组件。

**多模态大语言模型

视觉语言与视觉语言动作模型将观测、指令、规则和动作联系起来,有助于场景语义、意图推断与跨任务迁移。感知—语言—动作配对训练、指令调优和偏好优化,尝试增强这些抽象层次之间的对齐。 限制在于时序一致性、低层动作落地、幻觉和实时性。语言解释流畅,不证明控制输出满足安全边界;显式推理步骤也要与观测和行为核查对应。综述建议其作为语义决策与协调模块,向下游规划器和控制器提供可检查的中间表示,而非无保护地直接控制车辆。

**世界模型

世界模型学习环境的潜在状态与演化,以模拟动作条件下的未来。它可以减少部分真实交互、补齐危险情境,并用于想象式模仿、强化学习和候选评估。 然而,长时域预测误差可能累积,虚构的环境状态会污染策略学习。核验重点应包括物理规则、因果交互和运动一致性,而不只是视频画面。利用真实反馈持续校准,是把世界模型从辅助生成器变成可靠训练工具的关键。 图4|上部为条件化去噪生成动作,中部为多模态语言输入到行为输出,下部为潜在状态编码、演化和解码。图示说明不同建模角色,不代表任一范式已经具备完整安全控制能力。来源:原论文图4,PDF 第7页。 原文表3比较五类范式的优势与瓶颈。更合理的阅读方式是确定组合角色:模仿提供初始化,强化学习对齐长期目标,扩散生成轨迹候选,大模型组织语义,世界模型提供想象与评估。它不是五种互斥路线,也不是以勾选数量判定最终胜者。

5 Platform Layer|平台层

5.1 分布式与并行训练

平台追求可扩展吞吐、通信计算重叠,以及长周期训练的稳定和复现。硬件增加不会自动带来线性加速,通信拓扑、激活和优化器状态、调度与数值行为都可能形成瓶颈。

**数据并行

各设备保留模型副本,处理不同数据后同步梯度。实现相对直接,但参数和优化器状态占用大,梯度同步依赖带宽。梯度累积、压缩及同步调度可以缓解部分开销。

**张量并行

将权重或算子拆到不同设备,缓解单卡存储限制并扩展矩阵运算。它需要频繁、细粒度通信,因此切分与网络拓扑不匹配时可能抵消收益,需结合算子融合和调度。

**流水线并行

按网络深度划分阶段,让微批次流经不同设备。主要问题是流水线空泡和阶段负载不均,改进依赖划分、微批调度及重计算,不能只以层数均分判断均衡。

**序列并行

沿词元或时间维度分担激活和长上下文计算,适合多模态、长时序训练。它可以缓解峰值内存,但增加边界与注意力相关通信,应与其他并行方式联合评估。

**专家并行

混合专家模型以稀疏路由激活部分专家,不同设备承载不同专家。有效容量增长不等于通信免费,全到全路由与负载均衡仍会影响吞吐。

**混合策略与选择

五种方式可组合,依据模型大小、序列长度、集群拓扑和稀疏结构平衡内存、带宽与计算。原文表4给出若干研究报告的训练硬件,它们是实验配置,不是最低需求,也不是相同条件下的成本测试,不能由此直接断言某范式必然更便宜或需求按某个规律增长。 云端大模型与车端算力之间还存在部署鸿沟,因此平台应同时支持蒸馏、量化与模型验证,而不只追求训练规模。

5.2 测试与评估

**仿真与闭环验证

可控模拟器允许重复危险、稀有或边界场景,降低部分试验成本,支持反事实扰动和回归检查。CARLA 等是综述讨论的代表,但仿真中的传感、参与者行为与真实环境存在差异,无法仅凭大量虚拟里程完成安全证明。

**真实环境与实时评估

真实测试检验动态交通和不可完全预设的人类行为,需要监测与保护。保护机制可能掩盖模型本身的弱点,因此应区分“模型成功完成”与“保护系统接管后避免失败”,通过虚实结合获取更清楚的能力证据。 作者按公开资料归纳两类产业倾向:一类重视仿真优先、可重复场景与部署前验证;另一类重视车队事件采集、数据反馈和快速迭代。两者可以结合,不能理解为企业内部技术路线已完全公开,或某一家无需另一类验证。

**指标与性能验证

感知准确率不足以覆盖驾驶目标。评测应同时关注碰撞、紧急操作、规则遵循、舒适性、效率和长期稳定,并通过高风险回放与条件变化检查行为。测试资源也需价值引导,避免以大量重复、低信息量场景代替有效覆盖。

5.3 云边协同与持续训练

车端承担事件触发采集和轻量预处理,云端承担训练与模型治理。这样可以响应地区、季节和环境变化,但持续更新并不意味着绕过验证直接部署。

**在线采集与边缘预处理

优先记录急刹、急转、近距离交互、异常让行和感知分歧等候选高价值片段。车端可做时间同步、基础校准、冗余过滤、压缩和必要脱敏,再按带宽与优先级上传;事件是否高价值还需云端与模型状态结合重估。

**异步更新与模型治理

数据流、训练流和部署流可以并行推进,但每个候选模型应绑定清晰的数据版本、配置和检查点,先进行离线与回放评测,再进入后续验证。可靠作业编排、资源调度和明确晋级标准,使迭代既高效又能解释。

**灰度发布与回滚

新模型先在受控范围验证,观察安全、交互和负载指标,再逐步扩展。发生退化时应能够切回稳定版本,并归档有关样本供定位。回滚是风险控制和治理能力,不是对未经验证更新的替代许可。 图5|事件数据采集、云端训练、异步更新和灰度发布的概念流程。图中包含联邦与分布式训练,不意味着所有云边系统都同时使用这两类机制。来源:原论文图5,PDF 第10页。

6 Open Challenges and Future Directions|开放挑战与未来方向

6.1 场景优先级与数据引擎:从规模到价值密度

当前瓶颈是价值评分难以自动化、采集冗余、标注时空对齐不足和版本记录碎片化。未来改进应让价值体系真正影响资源投入,而不是只给样本附加一个难度分数。

  • 构建可操作的价值体系。 综合风险、稀有程度、可学习性和覆盖缺口,形成可校准的优先级与处理层次。
  • 联合事件采集与可控合成。 用真实近失误事件触发反事实构造,保持语义与物理可信性,主要服务长尾补齐和稳健性增强。
  • 改进标注与对齐。 结合传感同步、几何校准、自动筛选、抽样检查和精细标注,提升有效监督密度,而非只提升处理帧数。
  • 加强版本治理。 清楚记录源数据、筛选规则、适用范围和增删依据,将其关联到模型版本与场景级结果,减少无法归因的重复训练。

这一路线的目标是提高边际训练收益,但仍需要闭环实验判断评分是否真的挑中了有价值的场景,不能用评分自身替代模型改进证据。

6.2 通用驾驶基础模型与区域适配

跨城市模型需要同时应对道路规则、标志、交互习惯和传感条件变化。基础能力应包括跨模态、跨时间表示,以及与规划和安全目标相容的学习,而非只扩大预训练模型规模。 作者提出三组方向。首先,通过统一表示、对比学习、领域适配与因果表征改善迁移;其次,以轻量适配层、提示调优或低秩更新减少区域定制负担;最后,用回放、蒸馏和正则抑制遗忘,监测新旧能力波动。 “强迁移、弱定制”是希望降低适配成本的方向,不代表所有地区已能零样本安全运行。何时需要完整重训练,何时只做小规模调整,仍缺明确且可验证的决策标准。新域进步也必须与旧域回归一起报告。

6.3 持续学习与训练运营:训练测试一体化

静态训练加一次评测,难以捕捉真实环境持续变化。作者设想由失败事件触发真实与可控生成数据,平台管理模型压缩与更新,策略通过适配与遗忘抑制持续演进。 图6|左侧是失败驱动的虚实数据融合,中间是仿真、蒸馏和云边协同,右侧是策略适配与能力保持。红色反馈连接数据更新、策略更新、评测和灰度部署,表示未来系统的组织框架,而不是某套产品的实证性能。来源:原论文图6,PDF 第13页。 落地有三项核心任务。统一数据—模型—评测谱系,记录每次更新所依赖的样本、配置、验证结果和部署范围;建立闭环指标体系,将稳定性、合理性、风险敏感度与高风险回放、反事实扰动结合;建立最小可复现闭环,从具体失败出发定位原因,以尽可能小而有效的数据增量完成修复,再通过标准化验证决定是否晋级。 最小闭环并不等于最少测试。其重点是问题可归因、流程可控制、资源可解释、收益可复现。需要保留足够回归验证与回滚机制,防止修复一个案例却损害其他已学习能力。

7 Conclusion|结论

综述的中心结论是:端到端自动驾驶的训练难题具有系统依赖性。数据决定能够看到什么,策略决定如何优化,平台决定优化和验证能否持续运行。单层突破无法自动补偿其他层的缺口。 未来更值得关注的是三种转变:从数据数量到有效价值,从任务拼接到可迁移的基础能力,从静态训练到可追踪的训练测试闭环。 模仿、强化、扩散、语义模型和世界模型各有角色,互补组合仍需以可信数据、明确指标和验证流程约束。 对研究者,三层框架有助于说明提升究竟来自新增场景、目标调整还是平台改进;对工程团队,它提供了围绕失败、验证、更新和回滚组织训练的思路。本文呈现的是研究综述与未来路线,不能把生成能力、离线分数或闭环示意直接等同于实际道路安全认证。完整研究出处与原文图表见文首链接。

成为VIP会员查看完整内容
0

相关内容

自动驾驶汽车,又称为无人驾驶汽车、电脑驾驶汽车或轮式移动机器人,是自动化载具的一种,具有传统汽车的运输能力。作为自动化载具,自动驾驶汽车不需要人为操作即能感测其环境及导航。完全的自动驾驶汽车仍未全面商用化,大多数均为原型机及展示系统,部分可靠技术才下放至商用车型,但有关于自驾车逐渐成为现实,已经引起了很多有关于道德的讨论。

知识荟萃

精品入门和进阶教程、论文和代码整理等

更多

查看相关VIP内容、论文、资讯等
端到端自动驾驶系统研究综述
专知会员服务
31+阅读 · 2024年11月29日
自动驾驶开源数据体系:现状与未来
专知会员服务
41+阅读 · 2024年1月28日
端到端自动驾驶:挑战与前沿
专知会员服务
55+阅读 · 2023年7月3日
自动驾驶技术解读——自动驾驶汽车决策控制系统
智能交通技术
30+阅读 · 2019年7月7日
自动驾驶车辆定位技术概述|厚势汽车
厚势
10+阅读 · 2019年5月16日
【综述】自动机器学习AutoML最新65页综述,带你了解最新进展
中国人工智能学会
48+阅读 · 2019年5月3日
【智能驾驶】97页PPT,读懂自动驾驶全产业链发展!
自动驾驶最新综述论文(31页PDF下载)
专知
120+阅读 · 2019年1月15日
李克强:智能车辆运动控制研究综述
厚势
21+阅读 · 2017年10月17日
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
VIP会员
最新内容
刚刚!Jev中文教程项目发布了
专知会员服务
0+阅读 · 今天12:14
《人工智能赋能的适应性多功能电磁战》
专知会员服务
12+阅读 · 9月29日
俄乌战场实验室:全面战争如何重塑现代作战
专知会员服务
8+阅读 · 9月29日
2026年美空军协会会议上的无人机系统趋势
专知会员服务
11+阅读 · 9月28日
反制无人机:乌克兰提供的五点启示
专知会员服务
16+阅读 · 9月23日
《各指挥层级均亟需红队能力》报告
专知会员服务
11+阅读 · 9月23日
相关VIP内容
相关基金
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
19+阅读 · 2012年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
微信扫码咨询专知VIP会员