**一句话结论:端到端(End-to-End)自动驾驶,就是把「感知 → 预测 → 规划 → 控制」这条各干各的模块化流水线,替换成一根从头到尾可微分的神经网络——传感器数据进,驾驶轨迹出,中间不再有人手写的规则。**它在 2023 年用一篇论文证明了学术可行性(UniAD,CVPR 2023 最佳论文),在 2024 年用一次工业级换代证明了量产可行性(特斯拉 FSD v12),此后成为行业主路线。但它的胜利不是「难题被解决」,而是「难题被换了」:从写规则的难题,换成了管数据、验证安全的难题。
先看它替掉了什么:模块化流水线的三宗罪
自动驾驶的经典架构是流水线:感知模块先把摄像头/雷达数据变成目标列表(那是一辆车、那是个行人),预测模块猜测它们下一步去哪,规划模块基于这些中间结果算出一条轨迹。每个模块单独开发、单独评测——听起来很工程化,问题也正在这里:
- 误差级联:感知漏一个目标,预测无从谈起,规划再聪明也是在错误的前提上做选择题。上游 1% 的错误到了下游可能放大成事故。
- 信息损失:每个模块的输出都是对世界的有损压缩——感知模块输出「一个 3D 框」,丢掉了框里的人是背对车流还是正要横穿的信息。信息每过一个接口就薄一层。
- 目标错位:流水线最大的病根——每个模块都在优化自己的指标,没人对「开得好不好」负责。感知最优(mAP 最高)不等于规划最优:对驾驶而言,看清 200 米外的静止路障,比精确框出旁边一辆无关车辆重要得多,但感知模块的评测指标分不出这个轻重。
flowchart TB
subgraph 模块化流水线
S1[传感器数据] --> P1[感知<br>各自训练、各自评测] --> P2[预测] --> P3[规划<br>手写规则 + 优化器] --> C1[控制]
end
subgraph 端到端
S2[传感器数据] --> E1[一根可微分网络<br>训练目标 = 最终驾驶表现] --> C2[轨迹 / 控制]
end
两个转折点:一篇论文、一次换代
UniAD(CVPR 2023 最佳论文,arXiv:2212.10156):上海 AI Lab OpenDriveLab 团队的《Planning-oriented Autonomous Driving》把整条流水线塞进一个可微分架构——检测、跟踪、建图、运动预测、占据预测、规划全部是网络内部的节点,用神经网络做接口,并让整个结构面向最终规划目标联合优化(论文标题里的 planning-oriented 就是这个意思)。它拿下 CVPR 2023 最佳论文——自动驾驶论文罕见地站上计算机视觉的领奖台,等于学界给这条路线盖了章。
特斯拉 FSD v12(2024 年大规模推送):工业界的转折点。特斯拉把据报道约 30 万行、手写的 C++ 驾驶规则代码替换成一根端到端神经网络,用车队回传的海量人类驾驶数据做模仿学习训练。此后主流智驾方案(小鹏、华为、理想等)在 2024 年起陆续转向端到端架构——2026 年的今天,谈「非端到端的量产智驾」已近乎过时;上文《Robotaxi 转折之年》里的无人出租车,跑的也都是这条技术路线的产物。
它怎么工作:把「开车」变成「预测下一帧人类会怎么开」
端到端网络的核心输入输出关系朴素得惊人:**输入多路摄像头(常配 BEV——鸟瞰图特征)与时序记忆,输出未来的自车轨迹。**训练数据是海量的人类驾驶片段(状态 → 人类实际操作),本质上是大号的模仿学习;再辅以闭环仿真与世界模型补开环训练的缺口。
这个范式成立的前提,是数据与算力都到了阈值:BEV 与 Transformer 让多传感器融合变成「喂 token」,车队量产出回传数据,GPU 集群跑得起亿级里程的训练。三个条件在 2023 年前后同时成熟——端到端不是突然聪明了,是终于喂得起了。
代价:三笔新账
- 可解释性:模块化时代,事故可以追责到「感知没看到」或「规划算错」;端到端把黑盒焊成了一个整体,中间没有任何人来背锅的接口。行业的应对不是退回去,而是发展安全案例(safety case)方法——用统计证据与运行设计域(ODD)约束来论证安全性,而不是逐模块解释。
- 验证困境:规则可以穷举审查,神经网络不能。驾驶是超长尾任务,安全的关键场景(corner case)恰恰是数据里最稀缺的——这就把竞争从「谁算法好」转移到了「谁的数据引擎好」(车队规模、影子模式、仿真合成能力)。
- 开环与闭环的鸿沟:模仿学习在「重放数据上打分」和「真实闭环里开车」之间有系统性偏差——模型复制的是人类动作的表象,未必复制意图,遇到训练分布外的场景就可能 confidently 错。这也是为什么世界模型与闭环仿真成了 2025~2026 年端到端公司的标配补丁(截至 2026-10 的行业动向)。
小结
端到端不是「更好的流水线」,而是换了问题的定义:从「把开车拆成几道工程题各自求解」,变成「让模型在海量人类驾驶数据里逼近驾驶这个分布」。它兑现了规模法则在驾驶域的承诺,也把行业的护城河从代码重写成了数据。判断一家智驾公司的成色,从此多了一条朴素标准:别只问算法多先进,先问它每天从车队里拿到多少里程的真实数据。
参考资料
- UniAD: Planning-oriented Autonomous Driving(arXiv:2212.10156)(CVPR 2023 最佳论文,端到端联合优化架构)
- 特斯拉 FSD v12 端到端换代(2024 年推送,约 30 万行 C++ 规则代码替换为神经网络,特斯拉工程师口径,经媒体广泛报道)
- Wu et al., 自动驾驶基础模型综述(2024,对端到端路线的学术梳理)
- CVPR 2023 Open Access:UniAD 会议论文(pp. 17853–17862)
读者留言
COMMENTS 暂无还没有留言,来说第一句?