在一次内部沟通会上,大众中国高层被问到最多的是什么?不是芯片,不是算力,也不是算法。答案是数据。
有媒体统计了群访过程中的关键词频次:“数据”被提及53次,“模型”34次,“芯片”27次,“算力”18次,“算法”仅5次。悬殊的差距,不是偶然。
这不仅仅是数据重要性的重申,更透露出一个信号:大众智驾研发的底层逻辑已经变了——从“数据堆砌”转向“数据精炼”。当很多车企还在比拼谁家路测车队跑得多、谁家云端存储堆得满时,大众已经开始追问一个更尖锐的问题:你手里的数据,到底有多少能用?
韩三楚在沟通会上说了一句很直白的话:“很多车企内部存在多套方案,多种架构,导致数据严重割裂。尽管车很多,但其实数据很难用得上。”
这句话点破了行业的一个通病。很多车企在智驾方案上“广撒网”,今天和这家供应商合作,明天和那家芯片厂签约,车是卖出去了,但不同方案的数据格式、采集标准、处理流程各自为政,数据进了云端就像进了迷宫——彼此不通,重复采集,算力资源大量浪费在数据清洗和适配上。
大众高层反复强调的“数据”,不是泛泛的原始数据,而是“有效数据”和“高价值数据”。酷睿程CTO黄畅给出了一组数据:完全依赖真实世界采集数据的传统方式,有效利用率往往不足5%。也就是说,车队跑了一百公里的路采数据,能真正用于模型训练的,可能只有五公里。
这就不难理解为什么“数据”被提及的次数远超其他关键词了。大众显然已经意识到,智驾竞赛的下半场,拼的不是谁的车多,而是谁的数据能被有效喂进模型里。
大众在华车型的智驾方案,用“混乱”来形容都不为过。
大众品牌燃油车搭载卓驭方案,大众安徽与众08是小鹏VLA方案,与众06和07是大众自研酷睿程方案,上汽大众部分ID. ERA产品搭载Momenta方案;奥迪方面,燃油车是华为乾坤智驾,AUDI品牌则用Momenta。合并Momenta这个同类项以后,还有五套智驾方案并行运转。
“简直就是辅助驾驶的多元宇宙。”曾有大众合资系人士如此形容。
多方案并行的后果,首先是数据孤岛。不同供应商的数据格式、采集标准、处理流程各不相同,各方案的数据无法互通,同一辆车在不同方案下采集的数据,进了云端后就像来自两个星球的语言。其次是效率低下,算法团队需要针对不同数据源反复适配,算力资源被大量消耗在数据对齐上。最致命的是价值流失——极端天气、城市复杂路口这类高价值场景,分散在不同的方案中,难以汇聚成高质量的训练集。
这其实是多数传统车企向智驾转型时的典型困境。只不过,大众率先意识到问题严重性,并开始动刀了。
大众的解法,是CEA架构。
作为大众与小鹏联合自研的电子电气架构,CEA的核心定位,就是把分散的传感器、计算单元、数据通道全部整合起来,实现数据从采集、传输到存储的标准化与归一化。用韩三楚的话说:“CEA的平台化可以为酷睿程提供充足的数据,这是特别关键的。”
具体怎么解决数据割裂?三个层面。
第一,数据归一。所有传感器数据通过CEA架构统一聚合,格式统一,彻底消除数据孤岛。不同车型、不同动力形式的数据,进了同一个管道,算法团队不必再为数据格式头疼。
第二,高效利用。CEA架构支持实时数据筛选与预处理,低价值数据被过滤掉,高价值数据优先传输至云端训练池。酷睿程的数据有效利用率已经验证超过60%——从行业平均不到5%到这个数字,差距是数量级的。
第三,反馈闭环。CEA架构可以反向将算法优化后的模型参数下发至车辆,形成“采集-训练-部署-验证”的完整闭环。车卖出去不是终点,而是数据飞轮的起点。
值得注意的是,CEA架构的车不只是纯电车型。按照规划,大众品牌旗下所有动力形式的车型——纯电、混动、增程甚至燃油——都会逐渐切换到CEA架构。2026年底到2027年初,CMP平台的车型陆续上市,出生即带CEA架构。2027年开始,主力燃油平台MQB的新车和改款车也逐渐搭载。这意味着,酷睿程智驾方案将进入体系化、规模化交付阶段。
面向L3级自动驾驶,大众的数据策略更加激进。
黄畅给出了一个明确的时间表:2028年初,L3开始应用于高速和快速路;2029年,L3级自动驾驶进入城区。留给大众完成部署的时间只有两年多。
但现实是,L3所需的测试里程大约是L2的100倍。如果完全依赖真实路采数据,成本和时间都不可承受。大众的应对策略,是在数据配比上做结构性调整——仿真数据占比超过90%,仅保留10%的真实数据。
很多人会问:仿真数据占比这么高,靠谱吗?
关键在于那10%的真实数据——它们不是用来凑数的,而是作为“锚点”存在。黄畅解释得很清楚:90%的仿真数据其实是从10%的真实数据里泛化出来的。如果没有真实数据作为锚点,仿真就失去了方向,不知道该往哪个方向生成什么样的数据。
这种策略构建了一个高效的数据飞轮:真实数据提取关键场景锚点→仿真大规模生成类似场景→模型训练→仿真验证→真实路测验证→反馈修正锚点→循环。用少量真实数据撬动海量仿真数据的价值,避免陷入“数据巨无霸”的陷阱。
再加上大众自研的GAIA 2.0世界模型和HyperSense基座大模型,这套数据体系正在从“成本中心”转化为“核心竞争力”。
说到底,大众这场数据战争的核心,不是技术问题,而是体系问题。
CEA架构解决了数据从哪里来、怎么统一的问题;仿真数据的策略解决了数据怎么用、怎么高效的问题;而酷睿程与地平线的深度绑定,则解决了芯片和算法如何与数据协同的问题。
大众需要做的,是把CEA架构的车型快速铺开,让数据飞轮真正转起来。有媒体参考2025年大众品牌在华200万辆的销量成绩,推测到2028年底或2029年,大众CEA平台和酷睿程方案的年出货量可能突破100万辆。如果真能实现,数据积累的速度将进入另一个量级。
这场数据战争的本质,从来不是谁的数据多,而是谁能让数据真正流动起来、用起来、循环起来。大众的选择,或许正在重新定义“数据为王”的含义——不是持有数据的能力,而是驾驭数据的能力。
在你看来,对于自动驾驶研发,真实数据和仿真数据哪个对最终的模型迭代贡献更大?