群发资讯网

小鹏第二代VLA升级,AI从理解空间到理解时间

8月27日,小鹏第二代VLA大模型这次升级,很多人第一眼看见的可能是版本号:XOS 6.3.0,G9L全球首发。 但真
8月27日,小鹏第二代VLA大模型这次升级,很多人第一眼看见的可能是版本号:XOS 6.3.0,G9L全球首发。

但真正值得琢磨的,不是这个版本号,而是它背后的那句话——AI开始理解时间了。
这句话听上去有点玄,像宣传词。可如果把它拆开看,就会发现这次升级的重点,确实不是“又认得更多东西了”,而是它终于开始把路上的事情,当成一段连续发生的过程来看。

以前很多智驾模型,像是在一帧一帧地看世界。车是车,人是人,路标是路标,识别没问题,反应也能做出来,但它对“接下来会发生什么”,未必真的有概念。你可以说它会算,但很难说它真的“懂”。
这次小鹏讲得最重的地方,是第二代VLA引入了Infini-VLA长时序架构,能记住前30秒的道路信息,再配合X-Foresight预测世界模型,去预判6秒内周边车辆和行人的动作。

别小看这30秒和6秒。
开车的人都知道,真正危险的时刻,往往不是你看不见的时候,而是你看见了,却来不及把前后关系串起来的时候。前车突然减速,旁车往里挤,行人从路边又折回来,很多事故或者惊吓,都是在几秒钟里发生的。人类司机之所以显得“会开车”,并不只是因为看得见,而是因为脑子里会自动补前因后果。

所以这次最有意思的,不是它能不能识别,而是它开始学会把“刚刚发生过什么”和“马上可能发生什么”连起来。
这个变化一旦成立,智驾的叙事就会变。

以前大家讨论智驾,喜欢盯着一个点:识别准不准。能不能看见红绿灯,能不能认出锥桶,能不能识别加塞车。现在开始往前走一步了,大家会问:你是不是只会反应,还是已经有了点判断能力?
这两个层次,差别很大。

因为一旦系统开始有了时序理解,它面对的就不再是“单次输入、单次输出”的动作题,而是一个持续变化的局面。路况不是静止图片,驾驶也不是答题。你今天能不能开得稳,很多时候不在于你认得多不多,而在于你能不能把变化提前想一拍。
当然,最容易被拿出来说的,还是安全。

小鹏这次给出的几个数字都很直接:端侧参数量扩大3.5倍,达到主流VLA的15倍以上;流式自回归推理让端到端响应速度提升300%;多维综合安全能力提升20倍。
这些数字放在发布场景里,确实很有冲击力。但普通人真正关心的,其实不是参数,而是场景。也就是:它到底能不能在我最怕的那些瞬间里,比我快半拍。

比如前车急刹,系统有没有犹豫;比如旁车强行加塞,它是“看见了再说”,还是已经提前预判;比如行人突然回头,它会不会像很多系统一样,先稳一下再处理。
这些细节,比“4D时空理解”更接近真实使用体验。

因为智驾发展到今天,大家其实已经不太想听纯概念了。听多了。谁都能说“更智能”“更安全”“更像人”,但最后还是要落到一个非常朴素的问题上:它在路上,到底像不像一个靠谱的人。
这次小鹏把重点放在“时间”上,我觉得方向是对的。

空间理解解决的是“看见什么”,时间理解解决的才是“事情怎么变”。前者像识字,后者像理解句子。你只认识每个字,不代表你真懂这句话什么意思。智驾也是一样,只会认物体,不代表它真的知道一辆车下一秒为什么会往左打一把,一名行人为什么会突然停住。
这其实就是从条件反射,往推理往前走了一步。
而这一步,恰恰是最难的。因为它不是把模型做得更热闹,而是把模型做得更像一个真正会等、会看、会判断的系统。它不一定立刻改变所有人的用车体验,但它至少说明,行业竞争已经开始从“谁识别得更全”转到“谁更懂路上的时间”了。
这比单纯堆参数,值得认真看一眼。
当然,话也不能说满。发布会上的能力,和真实道路上的长期表现,永远不是一回事。参数再漂亮,最后都要过路面这一关。能不能稳定,敢不敢放手,用户心里其实都很清楚。
所以我对这次升级的看法很简单:它未必已经把答案写完了,但它至少把问题问对了。
当一台车的AI开始理解时间,真正被重新定义的,可能不只是智驾本身。还有我们对“会开车”这件事的理解。
接下来,就看它在真实路上,能不能一直这么聪明。