昨晚的新闻像突然点亮的灯——小鹏宣布第二代VLA大模型迎来首次重大升级,9月就要推送。VLA其实就是小鹏的“视觉-语言-动作”智驾大模型。第一代已经够强,但这次升级不是小修小补,而是直接把从L2高阶智驾冲向L4终极形态。用他们的话说,就是从“缝合怪”变成了“超级智能体”。
第一代走的是三段式:视觉看到路况,转译成文字,再把文字变成刹车指令。中间多了个翻译官,延迟高达200ms。80公里/小时的情况下,这200ms等于4米的盲区。
第二代改成了端到端的架构,直接是“视觉+语言→动作”,省掉语言翻译这一步。决策延迟降到80ms以内,速度大约提升12倍。于是从“看见就要想”变成“看着、想着、就行动”。
这次升级最狠的,是给AI装上时间观念。过去的智驾像只记7秒的金鱼,每帧画面都是孤立的。新系统引入Infini-VLA长时序架构,能记住过去30秒的路况。演示里,前车要掉头,车身露出空位,旧系统可能直接钻过去,第二代却记得“前车正在掉头”,耐心等对方完成再走。
另外,X-Foresight世界模型首次上车,能预测未来6秒周边车辆和行人的行为轨迹——比如球滚出来可能带着小孩,提前减速。网友说这车开始“思考”了。
第一代的毛病是顿挫、重刹和急加速,这次都被大幅削弱。重刹减少99%,急加速减少98%,顿挫减少89%。从“新手司机”直接升级成“老司机”。
在通行效率上,第一代算是中规中矩,第二代综合提升23%,晚高峰提升28%。在广州的实测里,导航预计44分钟的路,第二代只走了43分钟,竟比人驾还快1分钟。
硬件层面,第一代用的是orin-x芯片,图像能力有限,对小路和乡村场景偏弱。第二代换上自研的图灵AI芯片,Ultra版3颗算力高达2250 TOPS,做到全场景无图通行——园区、乡村、无信号地库,一样稳。
定位方面,第一代是L2高阶智驾,第二代直接把L2到L4全栈能力打通。搭载第二代VLA的Robotaxi已经拿到广州主驾无安全员路测资质,同时通过蒸馏技术把能力下放到Max车型,让更多人能享受到顶级智驾。
从200ms到80ms,从20公里接管一次到150公里以上的接管,从有图到无图,从L2到L4——这已经不是升级,而是对智能驾驶的一次重新定义。9月就要推送,等着看的人,可能已经被改写。
也许你也该想想,你的下一辆车,什么时候会像它一样“思考”?