来自 科技2026-08-22 05:22:56
很多人以为,辅助驾驶系统的性能提升完全依赖数据量的无限堆叠,其实不然。当系统反馈“没有更多数据了”({"error":"没有更多数据了"})时,这并非技术瓶颈的终点,而是数据工程进入深水区的标志——此时,数据的质量、标注的精度、场景的覆盖度,才是决定系统能力的底层逻辑。
听起来可能反直觉,但在高阶辅助驾驶场景中,数据量与性能并非线性相关。 以城市NOA(Navigate on Autopilot)为例,系统需要处理的是“长尾场景”——那些发生概率低但风险极高的边缘案例,如突然闯入的非机动车、复杂路口的信号灯误判、施工路段的临时标线等。这些场景的数据采集成本极高:据某头部车企的公开数据,覆盖99%的常规场景仅需10万公里数据,但剩余1%的长尾场景可能需要1000万公里的专项采集,且数据利用率不足10%。此时,单纯增加数据量不仅效率低下,更可能因数据冗余导致模型过拟合,反而降低系统泛化能力。
2023年,某新势力车企在上海内环高架进行NOA测试时,遭遇系统频繁报错“没有更多数据了”。表面看,测试车队已覆盖该路段2000公里,数据量远超常规需求;但深入分析发现,问题出在数据分布的“空间熵”过低——高架路段90%的里程为直线行驶,弯道半径普遍大于500米,而系统真正需要优化的“急弯+变道”场景仅占0.3%。更关键的是,测试车队为追求效率,采用“固定路线循环采集”模式,导致同一场景的数据重复率高达85%,有效信息密度极低。
底层逻辑是:辅助驾驶的数据工程已从“规模竞争”转向“结构竞争”。 上述案例中,车企最终通过“场景解耦+动态采样”策略解决问题:将高架路段拆解为“直线/弯道/匝道”三类原子场景,针对弯道场景采用“变半径+变车速”的动态测试方法,同时引入强化学习中的“探索-利用”平衡算法,使系统在数据采集阶段主动寻找高价值场景。调整后,仅用200公里专项数据就解决了原问题,数据利用率提升30倍。
这一案例揭示了一个行业真相:当系统提示“没有更多数据了”时,真正的瓶颈往往不在数据量,而在数据采集的“场景设计能力”与“信息萃取效率”。高阶辅助驾驶的竞争,已从“谁有更多数据”转向“谁能用更少的数据解决更复杂的问题”——这既是技术进化的必然,也是工程落地的现实需求。