VLA量产落地:零跑D19 OTA揭示端到端智驾的务实路线
社区讨论 · 政策

VLA量产落地:零跑D19 OTA揭示端到端智驾的务实路线

格物格物7月24日2026/07/24 86 浏览

这篇文章最有价值的信息是,零跑D19的城市领航辅助VLA首次OTA,意味着Vision-Language-Action(视觉-语言-动作)端到端模型正式进入量产车用户手中,这可能是中国智驾从“规则堆叠”走向“数据驱动”的一个关键节点。

过去两年,智驾产业一直存在两条技术路径的争论。一条是传统模块化路线:感知、预测、规划、控制各自独立,依赖人工规则与地图先验,代表如Mobileye、早期博世以及部分国内方案商的“重高精地图+规则决策”架构。另一条是端到端路线:用一个神经网络把视觉输入直接映射到控制指令,完全由数据驱动,代表如特斯拉FSD Beta V12、Wayve的GAIA。零跑这次推送的VLA,本质上属于后者,但它的落地方式与特斯拉存在显著差异。

零跑官方描述:“更安全通行:主动执行防御性减速,规避风险;更高效通行:支持大型十字路口进入直行待行区;更舒适通行:……”

从这些特性看,零跑VLA并非简单复用特斯拉的“纯视觉+端到端”配方。特斯拉的FSD端到端是一个巨大的单一模型,输入8个摄像头视频,输出方向盘转角、油门刹车等底层控制信号,中间没有显式模块,也被称为“黑箱”模型。而零跑VLA走的是“分层端到端”:视觉语言模型(VLM)负责理解场景并生成语义描述,动作模型(Actor)根据语义描述生成具体轨迹,两者通过语言token桥接。这种设计的好处是保留了可解释性——工程师可以干预VLM输出的语义,比如“前方有施工区域,减速”,从而在长尾场景中更容易调试。

这引出一个对比维度:数据效率 vs 泛化能力。特斯拉的单一黑箱模型需要海量驾驶数据(百万英里级)才能收敛,且一旦遇到训练分布外的场景,行为可能完全不可预测。零跑的VLA通过引入语言先验,相当于给模型加了一层“常识约束”,使得在数据量相对有限(零跑年销量约30万辆,数据积累远不及特斯拉)的情况下,也能较快达到可用的安全水平。当然,代价是天花板可能不如纯端到端高——因为语言token压缩了信息,某些精细操作(如避障时的毫厘级转向)可能被量化误差削弱。

对比另一家国内厂商——华为ADS 3.0。华为走的是“GOD网络(通用障碍物检测)+ 规则决策”的混合路线,感知部分用端到端网络,决策部分保留大量人工规则,强调“安全冗余”。零跑VLA则把决策层也神经网络化,减少了对规则工程师的依赖。从架构演进看,华为是“感知端到端+决策规则化”,零跑是“感知+决策端到端但保留语言中间层”,特斯拉是“完全端到端”。这三者代表了三种不同的技术哲学:华为重安全与确定性,零重视效率与迭代速度,特斯拉重极限性能。

图片中展示的应是一个典型的城市十字路口场景,这正是VLA面临的核心挑战。零跑特别提及“支持大型十字路口进入直行待行区”,这个细节值得注意。传统规则式方案需要预先定义“待行区”的几何形状,且依赖高精度地图标注。VLA端到端模型则通过大量类似场景的驾驶数据,隐式学会了“当正前方红灯、左转绿灯时,车辆可以缓慢进入待行区等待”的交互逻辑。但问题是,如果遇到一个没有待行区标线但其他车辆都在等待的模糊场景,VLA能否正确响应?这取决于训练数据中是否覆盖了足够的“隐式待行区”案例。零跑强调

原文链接:https://www.ithome.com/0/981/360.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧