← 返回科普书架
科技与产业 · 深入分析

自动驾驶技术路线的
演变与选择

从历史、分级与核心技术,理解今天的路线分歧与市场选择。

汽车在没有人操作方向盘的情况下穿过一座城市,已经不是只能在实验室里发生的事。但如果进一步追问:同一辆车能否驶入没去过的街区,遇到暴雨怎么办,摄像头坏了怎么办,乘客是否需要随时接管,以及一趟车究竟能不能赚钱,答案就会迅速变得复杂。当前证据更支持这样的判断:规模化的关键,是把驾驶能力、安全后备和日常运营接成可靠的完整系统。 自动驾驶最值得研究的地方,恰好在这些追问之间。

今天的争论经常被压缩成几个标签:车上要装多少感知设备、是否依赖预先准备的道路信息、怎样使用更强的学习算法。它们都重要,但各自只回答了一部分问题。要理解为什么有些企业选择轻量硬件,有些企业坚持多种传感器,有些企业先卖辅助功能,有些企业直接经营无人出租车,需要先看这项技术怎样从实验走向道路,又怎样被安全责任和商业条件重新塑造。

这份报告的主线因此从历史开始。我们先理解机器驾驶解决过什么问题,再用行业分级厘清“帮助人开车”和“由系统负责开车”的区别;之后观察不同玩家的目标,进入传感器与算法的技术分歧,最后把它们放回成本、安全和市场中检验。读到结尾时,重要的不只是记住某家公司采用什么方案,而是能够判断:一项新技术究竟改善了驾驶系统的哪一部分,它又把困难转移到了哪里。

CHAPTER 01

从让机器沿路走到让机器承担驾驶

早期突破解决了控制与感知的连接

让汽车保持一个速度,或者沿着给定方向转动,并不是自动驾驶最困难的部分。真正的难题是道路不会把完整答案交给机器:车道线可能消失,前方物体可能移动,驾驶者还必须在信息不完整时采取行动。早期研究于是逐渐分成两类任务。一类研究如何认识环境,另一类研究如何把环境判断转换成车辆动作。只有两者可靠地接起来,汽车才可能真正“自己开”。

1989年,卡内基梅隆大学的Dean Pomerleau发表了一个很有代表性的研究系统ALVINN。它把摄像头图像和激光测距信息交给神经网络,再由网络输出车辆应当行驶的方向。这里的“神经网络”并不是把人的大脑装进电脑,而是一种可通过训练调整大量参数的计算模型:输入是观察到的信息,输出是希望得到的结果,训练的作用是让二者之间的映射逐渐符合示范。ALVINN使用模拟道路图像训练,并在一定现场条件下实现了真实道路跟随。CMU,ALVINN论文记录,1989-12(来源,新窗口打开)。

这个例子有两层意义。首先,从数据中学习驾驶,远早于近年的人工智能热潮。其次,早期成功的任务范围很窄:沿路行驶不等于处理所有路口、行人和机械故障。当时有限的算力、传感器与数据,决定了研究者必须先挑选一个能够完成的子问题。后来自动驾驶规模化的很多争论,仍然围绕同一个问题展开:可以把多大的世界交给机器,又需要给它多少帮助和限制。

美国国防高级研究计划局DARPA的无人地面车辆挑战,让这些分散的能力开始接受整车检验。军方希望推动机器在危险环境中自主行进,赛事则把目标变成了一件可以明确判断成败的事:在没有人工驾驶干预的情况下完成规定路线。根据冠军团队的原始论文,2004年实际参赛的15支车队,没有一支完成全程的5%以上;到2005年,23支参赛车队中已有五支完成比赛,斯坦福大学团队的Stanley获胜。Thrun等,Journal of Field Robotics,2006,第2—4页(来源,新窗口打开)。

一年之间的跃迁,不意味着机器突然理解了全部交通规则,而是说明感知、定位、决策、控制和可靠性可以通过严密工程整合起来。“定位”回答车在哪里,“感知”回答周围有什么,“控制”则把期望动作转成方向盘和制动的实际操作。Stanley的成功既依赖算法,也依赖车辆改装、计算设备、测试组织和反复排查问题。把这些工作放在一起,才构成一个能连续运行数小时的系统。

比赛的边界同样重要。路线信息在赛前提供,车辆不必自己决定跨城市旅行怎么走;追越慢车时还有组织方的安排,不等于面对完全自由的社会交通。这些限制并不贬低成果,反而说明可靠性是怎样建立的:先知道任务允许发生什么,再证明系统能够处理它。后来行业把允许自动驾驶工作的道路、天气和速度条件正式写进产品定义,就是这一思路的延续。

城市交通让分工式系统成为主流

沙漠道路主要考验在哪里能走、怎样避开障碍;进入城市后,车辆必须理解其他参与者的行为。一个路口前面的汽车可能等待通行,也可能正在停车;左转时不能只确认当前没有车,还要判断对向来车会不会很快抵达。于是,“预测”成为独立任务:根据他人的位置、速度和场景,估计其可能的下一步;“规划”则在这些可能性中,为自己选择一条可行轨迹,也就是车辆接下来按什么路径和速度运动。

2007年赢得DARPA城市挑战的Boss系统,已经呈现出后来行业熟悉的结构。论文把规划分成三层:任务层选择街道,行为层处理换道、路口通行顺序和异常恢复,运动层计算怎样避开障碍并前进。Boss使用相机、雷达、激光和定位设备,开发过程尤其强调持续回归测试——每当修改软件,都重新检查过去已经解决的问题是否又出现。Urmson等,Boss原始论文记录,2008-06(来源,新窗口打开)。

这套“分工式”方法通常被称为模块化架构。它像一个职责清楚的团队:每个模块交付一个中间结果,下一个模块继续处理。优势很直接,工程师可以查出问题是来自识别、预测还是规划,也可以让不同团队各自改进。但它也埋下了后来的困难:中间结果可能丢失信息,各模块表现更好,也不一定让整辆车开得更好。后面的算法之争,正是从这些接口开始的。

从产业角度看,早期研究还塑造了两种不同的目标。汽车制造商可以先把有限能力卖给驾驶员,用于减轻疲劳、辅助停车或避免碰撞;另一批企业则希望真正替代驾驶员,提供可以独立运行的交通服务。两者可以共享算法,却需要不同的产品、安全和商业体系。它们不是简单的“先进与落后”,而是起点和承担任务的方式不同。

Google于2009年启动自动驾驶项目,后来形成Waymo。其官方历史记载,2015年的Firefly实验车辆没有传统方向盘和踏板;2018年推出Waymo One商业服务,2020年在限定区域向公众开放没有车内驾驶员的出行服务。这条路径从一开始就围绕“没有人随时替机器收拾局面”建设,因而特别重视专用设备、测试验证和运营管理。Waymo官方历史,2026-09-07读取(来源,新窗口打开)。

与此同时,从辅助功能进入市场的企业可以依靠量产车迅速获得用户和道路数据。每个车主日常行驶,都可能帮助发现系统不熟悉的场景;软件也可以持续更新。但这些里程中始终有驾驶员监督,因此它们与无人运行的经验不能直接等价。为了准确描述这种区别,行业需要一套共同语言,这便是自动驾驶分级真正要解决的问题。

CHAPTER 02

行业标准衡量的不是聪明程度

L0至L5描述人和系统怎样分工

人们常把L0到L5想成考试分数:数字越高,汽车在所有方面就越强。实际上,汽车工程专业组织SAE International制定的J3016这套常用分类,主要描述驾驶任务由谁承担、谁持续观察环境,以及系统不能继续工作时由谁处理。它不是一张综合算法能力榜,也不会单凭数字决定所有事故的法律责任。法律责任仍取决于适用法规、产品要求、具体行为和事故事实。

理解分级之前,可以把驾驶拆成两个部分。一部分是目的地层面的选择,例如今天要去哪里;另一部分是车辆在道路上实时行驶所需的工作,例如控制速度和方向、观察交通、判断风险并响应。标准讨论的重点是后者,通常称为“动态驾驶任务”。这个术语听起来复杂,直白地说就是持续把车开好所需的实时工作,而不只是握住方向盘。

L0至L5的任务分工

窄屏下可左右滑动表格

级别系统可以承担什么人仍须承担什么
L0 无持续驾驶自动化可以有警报或短暂安全干预,例如紧急制动持续完成驾驶任务;装有安全电子设备不代表已有持续自动驾驶
L1 驾驶辅助持续辅助横向或纵向控制中的一类,例如辅助转向或自适应巡航(根据前车调整车速)完成其余控制、观察道路并处理风险
L2 部分驾驶自动化同时辅助方向和速度控制持续监督环境及系统,随时准备介入
L3 有条件驾驶自动化在规定条件下完成动态驾驶任务不必一直监督道路,但必须保持能够响应接管请求的状态
L4 高度驾驶自动化在规定条件内完成驾驶及必要的后备处理不要求乘客作为即时接管的安全后备
L5 完全驾驶自动化在人类驾驶通常能够应对的道路和环境条件下完成驾驶,不受特定运行范围限制不需要承担驾驶或驾驶后备任务

表中的“横向”是控制车往左还是往右,“纵向”是控制快慢。因此,一辆能够同时跟车和保持车道的汽车,可能已经属于L2;但只要人仍须一直观察道路,它就没有因“可以松开双手”而变成L3。行业常见的L2+、L2++等,是对功能增强的表达,不是这套标准新增的正式级别。以上为SAE分级的通俗转述,具体产品还须依据所在地区的使用说明判断。SAE International,L0至L5官方说明图,2021(来源,新窗口打开);Mercedes-Benz USA,DRIVE PILOT说明,2026-09-07读取(来源,新窗口打开)。

L3和L4之间最关键的差别,也不在于一次路口能不能通过,而在于系统离开能力边界时怎么办。L3可以请求用户接管,因此产品必须考虑用户恢复驾驶的时间,以及接管请求怎样传达。L4则不能把乘客及时醒来、理解路况并采取动作当作必要条件:它必须具备合适的后备办法,例如在可行条件下安全减速停车,或依靠备用能力继续到适当位置。L5的要求更广,但也不意味着能够战胜任何物理灾害,或者必须驶过连人类车辆都无法通行的道路。

运行范围决定一个级别究竟意味着什么

一项自动驾驶功能允许工作的条件集合,叫作设计运行范围,英文缩写为ODD。它可以包括地理区域、道路类别、速度、天气、光照、交通和基础设施条件。这个概念是理解行业的关键:同样是L4,一辆限定园区低速运行的接驳车,与一辆能够在复杂市区运营的无人出租车,技术难度和市场价值可以差别很大。

反过来,一套L2城区辅助系统,可能在地理范围上比某个L3系统更广。前者能去很多地方,但驾驶员必须持续监督;后者能使用的路段少,却在启用时把更多驾驶工作交给了系统。二者卖的是不同的能力组合。把“能去多少地方”和“允许人放下多少驾驶任务”分开,很多看似矛盾的宣传就容易理解。

奔驰美国的DRIVE PILOT是一个清楚的例子。其公开说明把功能限定在加州和内华达部分预映射高速路,以及白天、晴朗天气、没有施工等条件下的拥堵交通,速度最高约40英里每小时,约64公里每小时。启用时,用户可以把视线转向允许的车内活动;收到接管请求后仍须恢复驾驶。若用户在最长十秒内没有响应,说明中规定车辆启动紧急停车程序。这十秒是该产品的安排,不是全球所有L3系统的统一规定。奔驰美国DRIVE PILOT产品与操作说明,2026-09-07读取(来源,新窗口打开)。

这也解释了为什么“某辆车发生事故时有没有开自动驾驶”是一个不够完整的问题。还需要知道启用了哪项功能、当时是否满足ODD、系统有没有发出接管请求、驾驶员是否履行了对应义务。监管中的测试许可、车辆准入和收费运营许可也不完全相同:允许开展测试,首先证明测试活动符合一定条件,并不自动意味着产品已被批准交付给所有消费者。

为了把这些要求组织成可以审查的材料,企业会建立安全论证,也常以英文Safety Case出现。它不是一份“我们认为安全”的声明,而是把安全目标、潜在危险、设计措施、验证方法和实际证据连接起来的一套论证。审查的重点应当是每个主张有没有足够证据,以及条件变化后这些证据是否仍适用。理解了分级、ODD和安全论证,才能进一步理解为什么不同公司即使都在开发自动驾驶,最终会走出不同路线。

CHAPTER 03

主要玩家首先选择了不同的产品

把行业地图画清楚,最好先问公司向谁交付什么,再问它用了什么模型。私家车厂商向车主销售车辆和功能,技术供应商向车企提供芯片、软件或整套系统,出行运营商则向乘客出售每一次运输服务。还有一些企业同时处在几个位置。它们可以采用相近技术,但收入来源、失败代价和数据获得方式都不同。

特斯拉代表了一种从量产车辆和软件迭代向更高自动化推进的路径。它把车辆、计算硬件、软件更新与数据流程尽量连接起来,并强调相机与神经网络。其FSD是Full Self-Driving的缩写,名称可以直译为“完全自动驾驶”,但判断产品不能依据名称:已核实的2025年第二季度公司文件仍把消费者功能称作FSD(Supervised),即需要主动监督,同时另行披露Austin初始Robotaxi服务。Robotaxi指没有传统人类司机承担驾驶任务的自动出租车服务;具体试运营阶段是否仍有安全人员,还必须逐项核实。Tesla,Q2 2025 Update,第3与8页(来源,新窗口打开)。

中国量产车市场中,小鹏、蔚来、理想等企业重视把驾驶软件与整车体验结合;比亚迪拥有更广的车型和价位覆盖,适合观察方案如何按产品层级配置。华为则体现了供应生态的另一种组织方式:能力通过合作车型落地,车企与技术提供方共同完成产品。这里的“自研”也不是所有零部件都自己生产,而是企业掌握哪些关键算法、系统接口、数据流程和迭代决定权。采购芯片与自研驾驶软件可以同时发生,使用外部方案也可以保留大量车型适配工作。

Mobileye是理解供应商路线的重要对象。它围绕视觉、专用计算芯片、道路信息和安全框架形成产品,面向不同自动化程度提供方案。NVIDIA的角色则更接近计算和开发平台:既提供车载计算,也提供训练、模拟和模型工具。它们的“客户数”不等于使用同一套完整自动驾驶软件的车型数,因为有的客户只采用计算平台,有的采用部分模块,有的采购更多系统能力。大众2025年与Mobileye、Valeo的合作公告,便明确区分了传感器、处理器、停车功能和驾驶软件的供应分工。Mobileye、Valeo与大众联合项目说明,2025-03-25(来源,新窗口打开)。

Waymo、百度Apollo Go、小马智行、文远知行等,是理解无人出行路径的重要对象。这些企业面对的核心任务,是让车辆在限定范围内持续提供服务,并处理乘客上下车、充电清洁、特殊路况和车辆受阻等现实问题。算法只是其中一部分。Uber一类出行平台又提供需求入口和市场调度,可以与自动驾驶企业合作,而不必由自己完成全部驾驶系统。Uber当前公开材料还把地图、远程支持、场站与保险安排列为服务能力,说明“驾驶员被替代”之后,出行运营本身仍然存在。Uber自动驾驶业务页面,2026-09-07读取(来源,新窗口打开)。

Aurora等自动驾驶货运企业则从运输经济性出发。它们看重较长运行时间和重复线路,希望把驾驶系统变成客户可以持续使用的运力。城市出租车必须频繁处理上下客与复杂街道,干线卡车可以先把任务集中到固定道路,但更高速度、更重车辆和更长制动距离又提出另一组要求。不同目标之间不存在一个可以直接套用的冠军榜。

这张产业地图给接下来的技术比较加上了必要背景。量产车需要控制每一辆车增加多少成本,运营车辆则可能为了提高可用时间而接受更昂贵的配置;供应商需要兼容多个品牌,自营车队可以保持更统一的设备。于是,关于传感器的选择,首先成为这些目标与约束最直观的体现。

CHAPTER 04

感知路线之争是信息与成本之间的取舍

相机 雷达和激光雷达各自看见什么

假设一辆车接近被大货车遮住一部分视线的路口,旁边还有施工标志。驾驶系统至少需要知道:信号灯是什么颜色,前方物体有多远,旁车是否向本车道移动,以及被遮挡区域可能出现什么。不同传感器提供的是不同类型的证据,不能仅按“谁的画面更漂亮”比较。

相机记录光形成的图像。它擅长提供颜色、文字、纹理和形状,因此能帮助识别红绿灯、道路标志和交警手势。器件相对容易规模化,也方便与车辆外形融合。但图像是三维世界的二维投影:同样大小的图像,可能来自近处小物体,也可能来自远处大物体。系统需要结合多台相机、连续视频、场景知识或学习模型估计空间关系。逆光、低照度、镜头脏污与遮挡会进一步增加困难。

毫米波雷达主动发射电磁波,再分析反射信号。它较擅长测距和测速,在部分低能见度环境中也能提供视觉难以获得的信息。这里的“毫米波”说的是电磁波的波长范围,而不是只能看毫米级目标。雷达也有自己的问题,例如分辨率限制,以及信号被建筑或金属表面多次反射形成的多径现象。一个被测到的回波,仍然需要解释它究竟来自哪里。

激光雷达同样主动发射信号,但使用激光测量空间。很多测量点组成“点云”,可以把周围物体的几何形状和距离表示出来。它与相机的重要区别是,能够提供不同于图像推断的距离证据;短板包括降雨、雾气、反射特性、遮挡、安装与清洁要求。装上激光雷达不等于已经理解场景,它仍然要和车辆运动、其他传感器及驾驶决策结合。Waymo与Mobileye的官方技术说明,分别体现了多种传感器互补和独立感知通道的设计思路。Waymo,2026-08-26(来源,新窗口打开);Mobileye,True Redundancy技术说明,2026-09-07读取(来源,新窗口打开)。

还要区分“互补”和“冗余”。相机读懂灯的颜色,激光雷达测出障碍距离,二者各做一部分工作,属于互补;如果一个通道失效,另一个仍能独立维持所需能力,才体现冗余。两台相同相机可能同时受到强光影响,两套算法也可能共同误解同一个场景,所以增加数量并不会自动得到独立后备。工程上真正要降低的是共同原因导致多个环节同时出错的风险。

纯视觉与融合路线都在转移困难

“纯视觉”通常指驾驶感知主要依靠相机;“视觉为主”则可能仍保留某些其他传感器,具体范围需要看产品。它吸引人的地方是减少设备、安装、标定和维修项目,并把更大比重交给软件学习。这里的标定,是确定传感器看到的方向、位置与车辆坐标怎样对应;少一个传感器,也就少一组需要长期保持正确的对应关系。

但省下的硬件工作可能转移成算法工作。系统需要从视频中更可靠地恢复距离、运动与不确定性,在难以成像的条件下决定继续行驶还是收缩使用范围。相机的信息丰富,并不表示每种风险所需的信息都能可靠获得。如果图像已经严重模糊,模型输出一个十分确定的距离,反而可能比承认不知道更危险。

多传感器融合路线接受更高的设备与系统复杂度,以获得更多物理信息渠道。“融合”意味着把不同来源的观察对齐,形成对同一环境的判断。它需要解决时间同步、空间标定、信息冲突和设备失效。车在高速行驶时,两个传感器记录的时间只差一点,目标位置就可能不再一致;如果未经处理就合并,更多信息也可能产生错误判断。

因此,路线之争不能被压成一边重视安全、一边只图便宜。两边都在选择哪里值得增加复杂度。特斯拉2025年第二季度文件认为相机、神经网络与全球车队数据有利于扩张和盈利;Waymo2026年8月的技术总结则认为,大规模安全无人驾驶需要相机、雷达和激光雷达互补。它们是明确存在的不同企业主张。目前取得的证据没有提供同一运行范围、同一无人条件、同一事故报告口径下的直接比较,因而不能从任何一家的立场推出普遍胜负。Tesla,Q2 2025 Update(来源,新窗口打开);Waymo,10 AI Lessons,2026-08-26(来源,新窗口打开)。

“人用眼睛也能开车”提供了一个研究方向,却不是相机系统足以达到任何安全目标的证明。机器的传感器、学习经验、执行延迟和失败方式都与人不同,人类现有事故水平也不是理想终点。同样,增加激光雷达只是增加了一类证据,并没有自动解决理解他人行为、选择合适动作和事故后处置的问题。真正值得比较的是完整系统中的增量效果。

高清地图和车路协同为车辆补充外部知识

传感器帮助车辆理解眼前,地图则提供对道路的预先知识。普通导航地图主要告诉车辆可以走哪些道路、如何到达目的地;高清地图可以进一步记录车道几何、道路边界和设施位置。这类预先信息称为“先验”:在看到当前情况之前,系统已经知道的一些事情。先验可以减少实时计算负担,也可能在现实改变后变得过时。

行业所谓“无图”,多数时候是减少对预先测绘高清地图的依赖,并不表示完全没有导航、定位、历史道路知识或在线建图。在线建图指车辆利用当前观察建立或更新局部道路结构。它把更多任务交给实时感知,因此有利于减少逐城测绘依赖,但也要求系统当场理解更复杂的环境。

回到那个施工路口:地图可能仍然标记原有车道,而锥桶已经把车流引向另一侧。成熟系统必须识别地图与现实冲突,而不是机械执行旧记录。Waymo在2026年把高清地图比作记忆,作为一种可持续更新的输入;奔驰美国L3则把预映射道路与可启用范围直接关联。前者强调信息价值,后者也体现了地图对验证与产品边界的作用。Waymo,2026-08-26(来源,新窗口打开);奔驰美国,2026-09-07读取(来源,新窗口打开)。

车路协同又把信息来源扩展到车辆之外。常见缩写V2X,指车辆与其他车辆、道路设施或网络交换信息。路侧摄像头也许能够看到被大货车遮住的行人,信号控制系统可以提供灯态,道路管理平台可以传达封闭信息。这些能力可以叠加在相机或多传感器系统上;至于车内采用什么算法处理这些信息,是下一层问题。

它的经济性高度依赖场景。在繁忙路口或固定园区,设备可以被很多车辆共同使用;在低密度道路上全面覆盖,建设和维护成本可能更难回收。系统还必须规定消息延迟、设备失修或断网时怎么办:如果路侧信息只是增强,车端应保留足够独立能力;如果它是运行的必要条件,就必须被写入ODD。这样才能看清“单车智能”与“车路协同”的真正差别:两者在系统边界和投入分配上不同,并不意味着其中一种完全不需要另一种能力。

到这里,我们已经知道车辆可以从哪些渠道获取信息。但同一套传感器,交给不同的软件,仍然可能产生完全不同的驾驶行为。接下来的争论因此转向:这些信息应当怎样被组织、学习和转成行动。

CHAPTER 05

从分工计算到共同学习

为什么识别更准不一定开得更好

传统模块化系统的魅力在于清晰。感知给出目标位置,预测给出可能轨迹,规划选择自己的轨迹,控制器把轨迹落实为方向和制动。“轨迹”不只是地图上的路线,而是包含时间的运动安排:车辆在接下来各个时刻应当位于哪里、以怎样的速度前进。控制器则需要考虑转向响应、轮胎与车辆动力学,把计划转换成可执行动作。

困难出现在这些环节的连接处。假如一个人正在推自行车横穿道路,感知模块把他简化为“自行车”,预测模块就可能套用骑行者的速度和行为模式。下游模块看到的是已经整理好的答案,可能不知道原始观察其实很含糊。更一般地说,中间表示既方便分工,也决定了哪些信息被保留、哪些被丢弃。

2018年Uber测试车在Tempe发生致命事故,美国国家运输安全委员会(NTSB)调查指出,系统在碰撞前5.6秒已经探测到目标,却没有正确分类为行人或预测其路径;制动设计及对安全操作员介入的依赖也是重要问题。这个案例说明,从“探测到物体”到“安全处理物体”之间还有很长距离。它不证明模块化必然失败,却清楚展示了只盯感知指标为什么不够。NTSB,Tempe事故调查,2019年结论(来源,新窗口打开)。

为了减少信息在接口中的损失,研究者开始把多个任务放到更统一的空间表达中。BEV是Bird’s-Eye View的缩写,即鸟瞰表示:把多台相机的观察转换到类似从空中俯视道路的统一坐标,便于理解不同目标之间的位置关系。占用表示则进一步问哪些空间被占据、哪些可能可以通行、哪些仍然不确定。面对路上掉落的床垫,车辆未必需要准确叫出物品名称,首先要知道那片空间不能穿过去。

BEVFormer在2022年使用时空Transformer从多相机学习鸟瞰特征。Transformer是一类利用“注意力”机制组合信息的模型,能够学习当前判断应该重点参考哪些位置或时刻;这里的时空结合,就是同时利用不同视角与连续帧。它展示了感知基准上的进步,但鸟瞰表示仍是信息处理方式,不是自动驾驶级别,也不能把论文中与某些激光雷达基线接近的结果外推成所有条件下的胜利。Li等,BEVFormer,2022-03-31,ECCV 2022(来源,新窗口打开)。

端到端把更多环节放到同一个目标下优化

端到端学习试图进一步改变训练目标。与各模块分别追求自身指标相比,它让更多环节围绕最终驾驶结果共同调整。例如,模型不只被要求画出准确的车道线,还要通过训练学会利用观察产生合适的行驶轨迹。端到端的“端”,可以是传感器到转向,也可以是传感器到轨迹;因此市场上的一段式、两段式、全栈端到端,并没有一个可以不看细节就直接对齐的含义。

NVIDIA在2016年的论文中,展示了从前向相机原始像素直接输出转向指令的做法。UniAD则在2022年底提出以规划为中心的统一框架,把多个驾驶任务放入一个网络,通过设计好的接口协同。二者都属于减少任务割裂的研究方向,结构却并不相同。UniAD保留任务设计和中间交互,说明端到端与人为结构可以共存,不能把它一概理解为没有任何分工的黑箱。Bojarski等,2016-04-25(来源,新窗口打开);Hu等,Planning-oriented Autonomous Driving,2023-03-23修订(来源,新窗口打开)。

最直观的训练方法是模仿学习:收集人类驾驶时看到什么、做了什么,让模型学习二者的关系。它适合吸收难以完整写成规则的行为,例如绕过临停车时应该留多少余量、怎样自然地跟随车流。但驾驶示范不一定都正确,同一场景也可能有多个合理动作。如果模型把从障碍左侧绕行与右侧绕行简单平均,得到的中间轨迹反而可能穿过障碍。

另一类问题叫分布偏移。训练时,模型大多看到人类驾驶员保持正常位置的画面;实际运行时,它自己的一个小误差可能让车进入少见位置,接下来看到的画面更陌生,再作出更差动作。这种连锁效应说明,预测一段好轨迹与真正沿着它安全驾驶并不等价。道路会对自车动作作出反应,系统也会不断改变自己面对的局面。

因此,端到端没有消除工程,只是改变了工程的重心。研究者需要选择高质量示范,处理罕见场景,设计训练目标,保留可观察的故障信息,并验证新版本有没有让旧问题复发。联合优化的潜力很大,但它是否优于某套模块化系统,最终仍需在相同任务和闭环条件下检验。

闭环训练和世界模型处理行动的后果

“闭环”是理解自动驾驶学习的另一个基础概念。如果只是播放一段录制视频,看系统预测的轨迹是否接近人类实际轨迹,这是开环评价:不管模型决定怎么开,画面里的其他人都按原录像继续行动。闭环评价则让系统动作真正影响后续环境,周围车辆也会作出反应,再让系统继续决策。它更接近实际驾驶,因为行动改变了下一时刻要解决的问题。

nuPlan研究在2021年提出闭环规划基准,指出仅靠开环轨迹误差不适合公平评价长期规划。所谓“基准”,是让不同研究方法在相同数据和评价规则下比较的公共测试环境。基准有助于判断算法进步,但其覆盖范围仍有限;在模拟中取得好成绩,不等于现实中的所有危险都已处理。Caesar等,nuPlan,2021-06-22,2022年修订(来源,新窗口打开)。

闭环环境也为强化学习提供了空间。模仿学习主要学习老师怎么做,强化学习则让系统尝试动作,再根据安全、守规、进度与舒适度获得反馈。问题在于这些目标需要被正确表达。只奖励速度可能鼓励抢行,过分惩罚任何风险又可能让车永远停着;如果模拟器中的其他车辆过度礼让,模型甚至会学会利用这种不真实的规律。

世界模型试图学习更丰富的环境演变规律:当前世界是什么样,如果自车采取某个动作,接下来可能怎样。它可以用来生成训练场景、预测周围参与者、比较候选动作或寻找罕见风险。单独出现频率很低、种类却非常多的特殊情况,常被称为长尾场景;普通路况积累再多,也未必覆盖这些各不相同的难题。对于自动驾驶,它不只是“生成看起来像真的视频”。踩下刹车必须合理改变运动,障碍物不能随意消失,其他人的反应也必须符合足够可信的交通和物理规律。

Wayve的GAIA-1技术报告在2023年展示了结合视频、文字与动作生成驾驶场景的世界模型。文远2026年中报也把GENESIS放在训练、验证和迭代工具中。这些材料支持世界模型已经进入重要研发链条,但并不证明模型生成的场景可以无条件替代现实测试。若驾驶模型和模拟环境使用相近的数据与假设,它们还可能共同遗漏一种风险,因此需要真实事故复现、独立评价和现场证据补充。Hu等,GAIA-1,2023-09-29(来源,新窗口打开);WeRide,2026-08-12(来源,新窗口打开)。

语言推理为什么要与快速控制配合

回到施工路口,车辆不但需要避开锥桶,还可能遇到交警挥手示意先行。单靠“这里有个人”的检测结果并不足够,系统还需要理解这个人在做什么、他的行为与交通灯谁更应该被遵从。这便是视觉语言模型受到关注的原因。视觉语言模型简称VLM,把图像信息与语言语义联系起来,适合利用更广泛的概念和场景知识。

视觉语言动作模型简称VLA,则进一步把理解连接到动作,例如生成车辆轨迹。它的吸引力是让系统面对不常见的情形时,不只寻找相似画面,还能利用场景关系进行判断。但模型能够说出合理解释,不保证解释忠实反映它作出动作的原因;语言层面的常识,也不自动等于精确空间判断和足够快的控制响应。

NVIDIA在2026年1月发布Alpamayo 1,描述其为100亿参数、从视频生成轨迹和推理过程的VLA。参数可以理解为训练后决定模型怎样计算的数值,更多参数通常意味着更大表达能力,也带来存储和计算负担。公告特别说明,这些模型主要作为可微调、可蒸馏的教师模型:先用能力较大的模型学习或生成训练信号,再把其中能力转移到更适合车内运行的模型。购买或下载研究模型,与得到可以直接量产的无人驾驶系统之间,仍有大量工作。NVIDIA,Alpamayo官方发布,2026-01-05(来源,新窗口打开)。

小鹏在2026年9月1日披露的第二代VLA新版本,也把重点放在时间上:更长的上下文记忆、对未来数秒的预测,以及边接收新信息边处理的流式推理。上下文记忆意味着决策不仅依靠当前一帧,还参考之前连续发生的事情;流式推理则试图减少等待完整输入处理完后再响应的延迟。官方提及30秒记忆、6秒预测和XOS 6.3.0在G9L首发,但这些仍应分别视作架构描述、企业指标与产品计划。文章里的“安全能力提升20倍”没有给出可与其他公司事故率直接对齐的定义,不能据此制作安全排名。小鹏,2026-09-01,活动日期2026-08-27(来源,新窗口打开)。

现实驾驶需要同时处理快与慢:前车突然刹车时,系统不能等待长篇推理;面对复杂施工指挥时,仅靠瞬间反应又可能不够。Waymo在2026年8月明确描述了快控制与慢推理配合的架构,并说明采用较少、较大的基础模型,却没有把全部工作合并成一个黑箱。所谓基础模型,是能够通过大规模训练形成较广泛能力,再适配多个相关任务的模型,并不意味着它已经不需要专业结构。Waymo,2026-08-26(来源,新窗口打开)。

Waymo还描述了独立车载验证层,检查候选轨迹是否违反物理约束或交通要求。Mobileye团队更早提出的RSS,则尝试把安全距离、危险状态和适当响应表达为可以分析的数学规则。RSS即Responsibility-Sensitive Safety,可译为责任敏感安全模型。它提供的是在明确假设下约束行为的办法,不是保证现实永远没有事故的魔法。把学习模型与安全约束组合起来,正在成为重要方向:模型负责提出更好的动作,其他机制负责阻止某些已知危险,但这些机制本身也需要验证。Shalev-Shwartz等,RSS论文,2017-08-21,2018年修订(来源,新窗口打开)。

至此可以看清,纯视觉、多传感器、端到端、VLA和世界模型不是五个互斥阵营。前两者讨论信息来自哪里,端到端讨论怎样联合学习,VLA讨论理解与动作的连接,世界模型讨论怎样表示和预测环境变化。它们能够在同一个系统里组合。真正的路线比较,必须进一步问这些组合在车上是否跑得动、在陌生环境是否可靠,以及它们是否值得付出相应成本。

CHAPTER 06

把路线放回完整车辆中比较

技术上限首先受信息与物理约束

一种路线能做到多好,至少取决于三个连续环节:是否观察到了关键事实,是否及时形成了正确判断,车辆是否还能执行这个判断。如果一个行人完全被遮住,系统不能无条件知道他准确站在哪里;如果刹车距离已经不够,计算出正确答案也不能让汽车违反物理规律。因此,成熟驾驶能力的一部分,是在看不清时主动减速,把未来风险保持在自己还能处理的范围内。

这让“技术上限”成为一个比模型规模更宽的问题。视觉路线可以通过更多样的数据、多帧信息和更强模型改善空间理解,但其可靠性仍受成像条件约束。多传感器路线增加了不同信息渠道,却需要保证这些渠道在关键时刻被正确融合。单凭理论可表达能力,很难给哪一条路线宣布绝对上限;更务实的比较是,在目标ODD内,哪一种配置更容易达到所需可靠性,又需要多少额外成本。

同时,云端训练用的计算集群与车内电脑承担不同任务。训练可以用较长时间调整模型,车内推理却要持续在功耗、散热和延迟限制下作出决策。“推理”在这里是运行训练好的模型得到输出,不一定意味着像人一样有意识地思考。常见的TOPS表示每秒万亿次运算的峰值规模,但不同精度、内存带宽、模型结构和实际利用率都会影响结果。因此,两个芯片TOPS接近,并不保证运行同一个驾驶任务的速度或可靠性相同。

这种差异也是教师模型、蒸馏和快慢架构出现的原因。大模型能提供更强学习能力,小模型负责在车上及时执行,专用安全机制处理某些边界。NVIDIA与Waymo的公开技术材料都体现了云端与车端能力分工。由此可以理解,未来的“更大模型”不必表现为每一辆车都装上最大电脑,可能体现为整个研发与部署体系更有效地分配计算。NVIDIA,2026-01-05(来源,新窗口打开);Waymo,2026-08-26(来源,新窗口打开)。

工程成熟度体现在失败以后怎么办

一辆车的正常运行演示,通常看不出硬件后备的质量。摄像头进水、供电中断、转向控制异常、计算机重启,都会迫使系统面对算法之外的问题。辅助驾驶可以要求驾驶员始终参与,但也不能把任何失效都突然扔给人;无人驾驶更需要在设计阶段考虑感知、计算、供电、制动和转向之间的故障传播。冗余并不是每个部件都机械地装两份,而是让关键故障不会导致无法接受的后果。

这里可以区分两类危险。一类来自“系统坏了”,例如传感器停止工作或计算输出错误;另一类来自“系统按设计运行,却没有足够能力”,例如在特殊光照下误判一个正常目标。前者通常归入功能安全问题,后者涉及预期功能本身的局限。软件没有崩溃,并不代表它理解了现实。这也是为什么只做电气与机械可靠性认证,不能替代驾驶能力验证;只看模型测试成绩,同样不能替代整车故障分析。

模块化架构比较容易定位单项故障,却可能有接口传播问题;端到端减少了某些手工接口,但故障原因可能隐藏在数据和模型内部。融合感知提供更多信息与后备机会,也增加了时间同步和冲突处理任务。于是,“工程成熟度”应理解为一家公司能否稳定地发现、复现、修复并防止问题,而不只是它采用了哪类网络。

软件升级还会放大这种要求。车机能够下载新功能,不表示早期车辆一定可以升级为更高自动化级别。如果最初的传感器覆盖、计算能力或转向制动后备不足,软件无法凭空补出缺失硬件。过去为了成本与车型开发周期作出的选择,可能在数年后变成升级边界。因此,消费者功能承诺与真实硬件能力之间的关系,也是技术路线的重要包袱。

泛化不是只有换一个城市

所谓泛化,是模型在没有被训练数据充分覆盖的情况下仍能合理工作。自动驾驶的泛化至少包含换城市、换天气、换交通规则、换车辆平台,以及自身动作偏离正常轨迹后的恢复。一个系统在中国多个城市运行得不错,不等于它已经掌握右侧驾驶与左侧驾驶的转换;在同一城市经历了很多晴天,也不等于充分学习了积雪、低太阳角度或特殊施工。

量产车数据的优势是范围广,专用无人车数据的优势则可能是传感器统一、记录完整,并直接暴露没有人即时接管时的真实问题。不能把所有公里当成同一种训练资源。大量普通高速行驶可能对某些能力贡献很大,却无法替代少量但关键的施工绕行和失败恢复案例。更不能把有人监督的总里程,与无人运行的安全证据放进同一分母。

真正重要的是数据闭环:发现有价值的问题,保留相关数据,生成可靠训练信号,更新模型,用独立方法检查,再受控部署并观察是否复发。“闭环”在这里描述研发持续改进过程,与前面的驾驶闭环评价相关但不完全相同。前者关心问题怎样推动下一个版本,后者关心一次驾驶动作怎样改变随后环境。

比亚迪当前技术页给出截至2026年5月28日的315万辅助驾驶车型保有量,以及每日超2亿公里“生成数据”的企业说法。它说明潜在数据规模,但没有自动证明所有视频都被上传、筛选并用于训练。Waymo公开的rider-only里程,则特指没有车内人类驾驶员的运行。规模、数据可用性与无人责任经验,是三个应分别观察的东西。比亚迪,四大领先技术页,2026-09-07读取(来源,新窗口打开);Waymo,Safety Impact,数据截至2026-03(来源,新窗口打开)。

安全证据必须保留比较条件

判断路线安全性时,最好先从事故后果开始,再回看系统用了什么方法。事故总数、轻微剐蹭、伤害事故、严重伤害、保险索赔和驾驶员接管,并不是同一个指标。接管可以是为了避免危险,也可以只是用户偏好或测试流程;一次接管也不等于如果无人介入就必然发生事故。用不同公司自行定义的接管次数排名,很容易制造没有实际意义的精确感。

本报告取得的较完整公开材料之一,是Waymo的安全影响页面。数据截至2026年3月,其披露2.206亿英里rider-only里程;与所采用的人类驾驶基准相比,严重伤害及以上碰撞减少94%,涉及气囊展开的碰撞减少82%,有伤害碰撞减少82%。这是值得重视的运营观察结果,但它首先支持的是特定系统在特定范围内的表现,不能直接证明每一种多传感器系统都能达到相同效果。Waymo,Safety Impact,2026-09-07读取(来源,新窗口打开)。

比较中的“基准”是作为参照的人类驾驶事故与里程数据。为了减少不公平,应尽量对齐地理分布、道路类型、车辆、天气和报告门槛。Waymo页面说明其当前统计主要针对地面道路,并讨论人类事故漏报与暴露数据不足等限制。暴露数据指车辆真正经历了多少某类风险环境,例如夜间行驶多少公里;缺少这一信息,就很难区分系统更安全与系统恰好运行在较容易条件下的影响。

置信区间则用于表达统计估计的不确定性。尤其严重事故本来就少,观察到零次事件也不等于真实风险为零;样本越少,判断通常越不稳定。即使有数亿公里,也仍要看它们是否覆盖想要评价的条件。Waymo2026年9月宣布更多城市开始服务,不意味着截至3月的安全样本已经验证了后来所有新城市。Waymo新城公告,2026-09-01(来源,新窗口打开)。

辅助驾驶还有一个容易忽略的人因问题:系统越顺滑,人越容易减少警觉,但罕见危险仍可能要求人迅速接管。NTSB对2018年Mountain View特斯拉事故的调查,把系统限制、驾驶员分心和过度依赖、驾驶参与监测不足等列入原因或促成因素。该事件不能不加限定地用于评价后来的软件版本,但说明“日常开得更像人”不必然等于人机合作整体风险更低。NTSB,Mountain View事故调查,2020年结论(来源,新窗口打开)。

因此,安全比较必须同时包含模型能力、车辆故障处理、人的行为与运营组织。远程支持也要说清楚:给车辆提供封路信息或解释特殊情况,与远端人员持续操纵方向和速度,是不同依赖关系。前者可以成为无人运营支持,后者把驾驶任务转移给网络和远程驾驶员。两种情况下都必须解释断网怎么办、每辆车需要多少人工,以及这些条件怎样计入安全与成本。

硬件便宜不等于一趟服务便宜

私家车与运营车对成本的理解不同。车主首先面对购车价格、功能订阅、保险、维修及使用便利;运营者则关心一辆车在全寿命内能完成多少付费运输。如果昂贵设备显著减少停运和救援,它可能在运营场景中划算;同样的设备装在低使用频率的私家车上,回收价值可能更难实现。

可以用一个纯说明性算例理解,数字不代表任何厂商真实报价。假设某项配置全寿命增加2万元成本,车辆最终完成40万付费公里,直接分摊是每公里0.05元;若只有4万付费公里,则是每公里0.5元。相同硬件的经济意义可以相差十倍。实际计算还需要考虑资金成本、维护和事故影响,不能只做简单除法就宣布盈利。

无人出租车的完整成本至少包括车辆与设备折旧、能源、清洁、充电场站、调度、远程与现场支持、保险、平台费用及持续研发。分母也应是实际付费公里,而不是所有行驶公里:去接客和回场的空驶会消耗能源,等待和维修会占用资产,却未必创造收入。去掉车内司机减少一项大支出,但没有让整个服务变成无需人员的纯软件业务。

视觉路线若能在同等安全和可用范围下降低设备与维护成本,经济优势会很明显;如果遇到难成像条件时必须大幅停运,或者需要更多后台与现场支持,部分节约就可能被抵消。多传感器路线同样要证明新增信息减少的风险与停运值得付费,而不是因为冗余有价值就可以无限增加配置。

文远2026年第二季度披露总收入2.317亿元、毛利率37.5%,同时经营费用为5.325亿元,并称较高毛利的乘用车方案和海外L4业务改善了收入结构。毛利是收入扣除相应直接成本后的结果,不等于已经覆盖全部研发与管理支出;集团毛利率也不能直接代表每个城市Robotaxi的完整利润。理解这些会计口径,才能看清“单车盈利”“业务盈利”和“公司盈利”的区别。WeRide,2026年第二季度及上半年业绩,2026-08-12(来源,新窗口打开)。

把这些维度合并后,路线的优势才能被放在正确条件下理解。下表是基于公开结构与商业条件的分析,不是统一道路测试得到的名次。同一企业可以同时采用其中几种组合。

完整系统中的路线取舍

窄屏下可左右滑动表格

实际路线最有价值的优势最难绕开的约束
视觉为主加学习模型的量产方案设备较少,量产数据面广,软硬件统一时容易复制成像和空间估计的不确定性;旧硬件边界;从监督驾驶转向无人后备需要重新证明
多传感器加学习模型的量产方案距离、速度、语义互补,可以按价位配置并整合底盘融合、标定、维修与车型组合复杂;增加设备不自动提高自动化级别
严格限定条件的L3在明确场景让用户移开视线,能以较小ODD组织验证实际可用时间有限,接管与状态沟通复杂,扩大条件仍需新证据
多传感器与专用运营体系的L4无人经验直接,车辆维护统一,安全与运营流程可复用新区域验证、车队资产、调度和现场恢复;地理扩张不只是复制软件
跨品牌的技术供应平台分摊芯片与工具链研发,让更多车企较快获得能力数据权限、责任接口、车型适配及客户更新节奏;技术供应不等于掌握全部运营反馈
干线货运或固定场景L4重复任务、高利用率和明确运输需求,有利于测算回报高速远距感知、重车制动和机械故障;末端交接、天气与货运流程同样关键

本报告据此形成的判断是:路线真正的技术优势,应当表现为在目标环境里更容易达到可靠性;真正的商业优势,则应当表现为交付这种可靠性所需的全成本更低。模型、传感器、地图和运营方式都是实现手段,任何一项单独领先,都不必然代表完整系统占优。

CHAPTER 07

市场选择的是可以交付的能力

量产车市场把技术变成产品分层

车主购买辅助驾驶,通常希望停车更容易、长途更轻松、通勤更顺畅,同时关心价格、维修和品牌信任。技术发布会能影响预期,却不等于有证据证明多数用户是因为偏爱某种网络结构而买车。市场真正检验的是日常体验,以及用户是否清楚知道什么情况下仍须监督。

比亚迪当前官方技术页同时列出天神之眼A三激光版、B激光版与C辅助驾驶系统,并新增“自动驾驶版L3/L4”类别。这说明其公开产品矩阵采用分层配置,不适合给整个集团贴一个固定传感器标签。它也体现制造规模的优势:不同价位承担不同设备成本,研发与供应链可以在更多车型上分摊。但新增产品类别并不等于具体车型已获准销售对应功能或开展收费无人运营,仍需要后续准入、交付和使用说明。比亚迪,技术矩阵页面,2026-09-07读取(来源,新窗口打开)。

小鹏最新材料则展示了另一种竞争重点:通过更长时间的信息、预测和推理改善驾驶体验,并把部分技术底座用于不同自动化目标。公司在2026年9月文章中提到广州主驾无安全员道路测试资格。这个消息说明开发进入新的验证阶段,但同源模型不代表量产辅助车已获得同样无人使用权限。软件能力、测试阶段和产品责任,必须继续分别观察。小鹏,2026-09-01(来源,新窗口打开)。

供应关系也比“买方案还是自研”更丰富。大众2024年与Mobileye的公告涉及高端车型L2/L3、基于ID. Buzz的L4项目以及当时对长期自研架构的安排;2025年又与Mobileye、Valeo合作面向MQB平台的辅助系统。MQB是大众用于多款量产车型的平台体系,这类项目对规模、采购和成熟交付尤其敏感。2025年公告明确强调软硬件采购整合、减少复杂度和保持成本竞争力,说明车企选择合作伙伴并不只看算法演示。Mobileye与大众,2024-03-20(来源,新窗口打开);大众、Valeo与Mobileye,2025-03-25(来源,新窗口打开)。

由此可以理解,一家车企完全可能在短期车型上采购成熟方案,在下一代平台保留更多自研;同一集团的不同区域也可能选择不同伙伴。改变供应商可能与更新速度、数据权限、平台成本和项目进度有关,不能仅因出现新合作,就断言旧算法失败。极氪与Mobileye在2022年提出面向2024年的消费者L4目标,原始目标能够核实;但其后全部车型的交付和合作变化,本次证据不足,不能据此编写一个已经得到证实的“技术淘汰”故事。Mobileye与极氪公告,2022-01-04(来源,新窗口打开)。

无人出行的规模必须拆成不同阶段

对Robotaxi,乘客购买的是在某个时间从某地到另一地的服务。因此,城市数、车辆数与实际可用性之间存在很大距离。一家公司可以在很多地方测试,却只在少数区域收费;车辆累计部署很多,也可能并非同时在线。只有明确服务区域、开放对象、时段和无人条件,规模数字才具有可比较意义。

Waymo于2026年9月1日宣布Denver、San Diego和Tampa迎来首批公众乘客,并称在14座城市提供全自动出行,同时表示将逐步扩大使用权限。正确理解是服务继续扩张,而不是14城任意人已经可以在所有街道随时叫车。新增城市仍需要本地验证、与应急人员合作及运营准备,即使底层模型可以复用,扩张也不是一次软件复制。Waymo,新三城公众乘坐公告,2026-09-01(来源,新窗口打开)。

文远2026年8月12日的业绩稿披露,截至7月底全球L4车队约3400辆,其中Robotaxi超过1800辆;第二季度国内每车日均完成订单超过21单。它同时披露业务扩展到超过60城、13国,但该口径包括不同业务及发展阶段,不能等同于这些地方都有面向所有公众的收费无人出租车。其更早的投资者主页仍显示40多城、12国,阅读时应优先看有日期的新披露,同时检查两个统计范围是否完全一致。WeRide,2026-08-12业绩稿(来源,新窗口打开);WeRide投资者主页,2026-09-07读取(来源,新窗口打开)。

文远与Uber、瑞士交通伙伴以及丹麦GreenMobility等的安排,还体现了出海的另一种方法:技术企业提供驾驶能力和经验,当地伙伴参与车辆、需求入口与运营。其中丹麦公众服务目标是2027年上半年,不能算作截至今天已经完成的业务。所谓轻资产,是某一主体少持有车辆或场站,并不是整个运输服务不需要这些资产;如果合作伙伴无法从分工中获得持续回报,这种扩张也难以维持。WeRide,2026-08-12(来源,新窗口打开)。

Mobileye在2026年6月宣布计划于2027年增加自营Robotaxi,准备约100辆初始车队,在成功运行后再寻求约五年扩至17000辆。公司强调这不取代现有供应商合作,而是为了获得直接运营经验、推动部署。这个变化很有解释力:供应平台可以分摊研发,但若缺少终端运营反馈,也可能需要向实际服务延伸;代价是增加资金与管理负担,并处理与客户的关系。公告中的车辆数仍是计划,不是当前存量。Mobileye,自营Robotaxi业务计划,2026-06-16(来源,新窗口打开)。

退出和收缩不总是技术被证明错误

福特退出Argo提供了一个可追溯的例子。其2022年年报明确表示,决定把资本开支从Argo开发的L4转向先进L2/L3,并讨论L4商业化需要的额外资本、时间与宏观因素。Argo无法吸引新投资,福特重新评估持续经营价值,最终计提27亿美元投资减值,并与大众启动退出联合开发的过程。减值是在账上确认投资价值减少,不等于当期再次支付同额现金。这些是公司对商业化和资本配置的判断,不是某个算法被数学上证明不可行。Ford,2022年报,2023年发布,正文第46页(来源,新窗口打开)。

Cruise的教训则突出安全治理。加州机动车辆管理局(DMV)于2023年10月24日暂停其部署与无安全员测试许可,依据包括车辆安全表现、安全信息失实以及不合理公共风险;声明同时明确不影响带安全驾驶员的测试许可。这个事件说明,即使算法能完成大多数日常驾驶,危险恢复行为、事故披露和组织决策仍可能决定业务能否继续。它不能被简化为激光雷达路线失败,也不能被写成当日永久禁止所有测试。California DMV,Cruise许可暂停声明,2023-10-24(来源,新窗口打开)。

货运企业选择收窄任务,则展示了另一种商业逻辑。Aurora在2026年7月宣布第二代无人卡车已上路,网络有10条无人路线,截至6月底接近44万无人英里。它强调硬件耐久、冗余改装和安全论证;年底1000辆年化改装能力是计划,客户500辆意向在风险说明中属于非约束谅解备忘录,即MOU,尚不能当作已经交付的订单。Aurora,2026-07-22(来源,新窗口打开)。

重复线路和高利用率有助于回收投入,但高速货运也必须处理更长制动距离、轮胎与挂车故障、道路碎片、侧风及末端交接。客户关心的不是模型是否像聊天机器人,而是运单能否按时完成、恶劣天气是否停运,以及异常后谁来接手。这把市场竞争重新带回一个朴素问题:企业能否把技术能力稳定地转化为客户愿意持续付款的服务。

CHAPTER 08

过去的积累将怎样塑造未来

最难复制的资产往往不在模型名称里

从历史到市场,可以看到每种早期选择都有双重后果。量产辅助驾驶带来广泛车辆、用户和数据,也带来旧硬件兼容及监督数据的边界;限定区域无人运营形成安全、地图与现场恢复经验,也带来扩城和资产投入;模块化让分工与追责清楚,却可能保留过多接口;端到端让任务共同学习,却提高了数据质量、评价与失败解释的要求。

这些不是永远不能改变的阵营。视觉企业可以增加某类传感器,多传感器企业可以引入更大模型,供应商可以参与运营,运营商也可以把部分资产与服务交给伙伴。真正难以迁移的是持续学习流程、验证能力、组织责任和客户关系。一次模型发布容易模仿,一套知道如何发现危险、证明修复并稳定交付的体系,更难在短时间复制。

本报告对2026—2031年的基准判断是,技术会继续融合,产品则继续分层。下面三条路径不是互斥的全球剧本,更像三个可以根据证据调整权重的情景。不同市场、车型和道路可能同时走在不同路径上,因此不为它们给出缺乏统计模型支持的精确概率。

第一条路径是模型与安全工程共同扩张

在这条路径中,量产辅助功能持续改善,部分L3扩大特定条件下的可用时间,L4逐城逐线扩张。基础模型、闭环模拟与数据评价在底层逐渐共享,但具体产品仍根据任务与责任选择不同传感器、后备与运营安排。它最接近当前可见材料呈现的方向:Waymo把大模型与独立安全检查结合,文远同时发展L2和L4业务,Mobileye保留供应并增加运营计划。Waymo,2026-08-26(来源,新窗口打开);WeRide,2026-08-12(来源,新窗口打开);Mobileye,2026-06-16(来源,新窗口打开)。

它能够持续的前提,是模型进步真的减少危险失败,车载计算和设备成本继续改善,监管允许依据证据扩展运行范围,客户需求又足以支付完整服务。最有价值的提前信号不是更多宣传城市,而是新城市准备更快、扩大天气和道路条件后风险仍稳定,以及车辆增长时后台与现场人员不必同比例增加。如果事故反复迫使大范围停运,或者收入增长主要依靠补贴和持续堆资产,这条路径就需要下调预期。

第二条路径是视觉为主的通用能力取得突破

如果大规模真实数据、时序模型、VLA与世界模型能够显著减少逐城适配,视觉为主的驾驶系统可能以较低设备成本获得更广的无人能力。这里的“通用”不是没有任何限制,而是面对新地点、新道路组合和新交互时,不再主要依赖大量人工定制。它有可能改变产业成本结构,也可能使更多量产平台获得更高自动化能力。

成立前提比发布一个大模型严格得多:必须在关键成像困难与故障场景下有可信后备,在多个新区域长期运行,并且证明较低硬件成本带来了真正较低的全成本。最强信号将是清楚的无人条件、跨地域付费服务、独立或可复现的事故比较,以及显著下降的本地工程投入。反过来,如果每次进城仍需长期修补、困难天气大量停运,或者一直只展示连续驾驶视频却不给无人暴露数据,那么模型的演示进步还没有转化为这条路径所需的产业突破。特斯拉的路线主张、小鹏的新模型和NVIDIA的开放工具使这一情景值得跟踪,但现有材料不足以宣布它已经完成。Tesla,Q2 2025 Update(来源,新窗口打开);小鹏,2026-09-01(来源,新窗口打开)。

第三条路径是价值集中到少数可持续场景

如果长尾风险下降慢于预期,保险、支持人员、资本或监管成本持续较高,广泛无人化就可能放缓。企业将资源集中到高需求城区、固定接驳、干线货运和能够销售的辅助功能,部分独立企业并入大型车企、平台或供应商。车路协同也可能更多服务于明确高价值路口与固定线路,而非成为所有道路上的统一前提。

这条路径的提前信号是扩城时间表收缩、合作意向迟迟不转为订单、企业减少披露实际付费无人服务,或日益依赖伙伴承担车辆资产。Argo的资本与商业化冲突说明这一风险真实存在,但收缩不等于技术停滞:更窄的任务范围可能形成健康业务,再为下一轮扩张提供收入。判断它是否发生,要看能够持续经营的场景有没有增加,而不是只数退出了多少家公司。Ford,2022年报(来源,新窗口打开)。

无论最后哪条路径更强,都可以用四个问题检验:系统是否在更大范围内有效工作,是否减少严重失败,是否清楚承担对应驾驶任务,以及交付这些结果的成本是否下降。它们把历史、技术、安全与市场连成了同一条逻辑。自动驾驶真正的进步,就发生在这四件事能够一起改善的时候。

SOURCES & LIMITS

来源与仍待确认的边界

本报告优先使用作者论文、监管调查、公司官方技术说明和财务披露。引用放在相关论述附近;其中企业对技术效果、市场前景和计划规模的描述,不视作独立验证。Ford年报通过第三方年报存档读取,引用的是公司原始文件。SAE分级使用官方公开说明图作通俗解释,没有宣称读取了其全部付费标准条款。

对当前市场的覆盖仍有几处实质限制。特斯拉2025年第二季度原始更新已经读取,美国证券交易委员会(SEC)索引也证实存在2026年7月23日提交的第二季度申报表(10-Q),但本次未成功取得对应全文。因此,截至2026年9月7日的完整Robotaxi车队、各城安全人员安排、收费开放范围和事故率暂未核实,不能把2025年的限制假定为今天仍未变化,也不能反向假定已全面取消。SEC,Tesla申报索引,2026-09-07读取(来源,新窗口打开)。

中国部分最新车型、采购关系和监管细项也未达到相同证据完整度。小鹏最新技术文章、比亚迪当前技术矩阵及文远年中业绩已有原文;华为ADS页面的首次采集与复读存在访问差异,其最新版本覆盖不进入定量判断。百度Apollo Go、小马智行、蔚来、理想及部分方案供应商的2026年完整数据,以及中国相关L3/L4标准条款与具体准入名单,仍待进一步核实。它们的重要性不因本次资料缺口而降低,本文也不以其他公司的数据代替。

几项足以改变路线判断的量化问题,目前仍缺乏统一证据:不同企业每个付费公里的完整成本、远程与现场支持人力、跨厂商同条件严重事故率,以及世界模型和VLA在独立闭环测试中的增量效果,均暂未核实。企业所谓单车盈利、内部安全提升倍数和模拟节约成本,应在公开分母、基线和计算方法后再比较。

对于路线变化,Ford退出Argo的原因与Cruise许可暂停有原始文件支持;极氪与Mobileye原先目标的后续完整兑现情况、GM对Cruise的全部后续整合安排,以及个别车企撤除某类传感器的真实决策原因,本次证据不足。它们被保留为待确认问题,而没有被加工成技术优胜劣汰的确定故事。

这些边界意味着,本报告更适合建立理解和判断自动驾驶路线的知识体系,而不是充当所有车型的实时采购清单。随着新的可靠证据出现,具体公司位置与情景权重应该更新;传感器、学习方法、运行条件、驾驶分工和全成本之间的关系,则可以继续作为评估新进展的框架。