来自 科技2026-08-23 01:38:22
很多人以为,辅助驾驶系统的迭代速度与数据规模呈线性正相关——只要堆够里程、覆盖足够场景,模型就能无限逼近人类驾驶水平。其实不然。某头部车企的L4级系统在加州封闭测试场完成10万公里验证后,实际路测中仍频繁出现「未知场景」触发安全冗余机制的情况。底层逻辑是:真实道路场景的分布遵循长尾效应,90%的里程仅覆盖10%的典型工况,而剩余10%的极端场景却占据90%的事故风险权重。
2023年Q2,某新势力品牌在银川绕城高速部署了50辆测试车,目标采集西北地区特有的沙尘暴天气下的传感器数据。按赛制逻辑,团队预设了「能见度50米-200米」的分级采集策略,并配置了多模态传感器阵列。然而,实际运行3周后,系统仅触发2次有效数据采集——原因在于当地气象部门的历史数据显示,该路段近5年沙尘暴平均持续时间不足15分钟,且90%集中在凌晨2-4点。更反直觉的是,团队后续通过复盘发现:真正威胁系统安全的并非沙尘本身,而是沙尘过后附着在激光雷达表面的静电颗粒,这属于典型的「次生数据失效」场景。
数据荒的底层矛盾:质量与成本的博弈
听起来可能反直觉,但在辅助驾驶领域,「没有更多数据」往往是伪命题,真正的困境是「如何用有限成本获取有效数据」。以某Tier1供应商的视觉感知模块为例,其训练数据中70%来自仿真系统,20%来自结构化道路采集,仅10%来自非结构化场景。这种配比并非技术限制,而是成本约束——真实道路数据采集的成本是仿真数据的200倍,而1%的极端场景数据却需要消耗90%的标注资源。更棘手的是,部分场景(如山区隧道内突发团雾)的复现概率低于0.001%,按当前路测效率,需要连续采集1000年才能覆盖。
突围路径:从「规模驱动」到「价值驱动」
解决数据荒的关键,在于重构数据采集的底层逻辑。某头部企业的做法是:建立「场景-风险-成本」的三维评估模型,优先采集风险权重高且复现成本低的场景数据。例如,在长三角地区,团队发现「暴雨+高架桥接缝」的组合场景对摄像头水渍处理算法的挑战远大于单纯暴雨场景,且该场景在梅雨季的复现概率达30%。通过定向采集该场景数据,系统在该工况下的误检率下降了62%,而数据采集成本仅增加15%。这种「精准打击」策略的背后,是对数据价值的深度解构——不再追求「全」,而是追求「关键场景的全覆盖」。