BEV+Transformer时代,2D标注正在被3D标注取代?
如果两年前你问标注公司的老板最大的业务是什么,答案大概率是“2D框”和“2D语义分割”。但到了2026年,越来越多的自动驾驶团队开始明确要求:我们只收3D点云标注数据,2D标注作为辅助。这种变化不是突然发生的,而是BEV+Transformer技术路线的普及带来的必然结果。
从2D到BEV:标注需求的底层逻辑变了
传统的自动驾驶感知方案以2D目标检测为主——在图像平面上标出车辆、行人、车道线。标注员在单张图像上画框,模型学习的是“看到什么”,而不是“在哪里”。这种方案下,每张图像都需要独立标注,同一辆车在不同视角下要标多次,标注量巨大且一致性差。
BEV(Bird's Eye View,鸟瞰视角)+ Transformer技术路线改变了这一局面。方案将多个摄像头的2D图像特征统一投影到俯视图坐标系中,直接在鸟瞰空间内做检测和预测。这意味着,标注数据必须从2D图像空间转向3D空间——标的不再是“图像上的一个框”,而是“真实世界中的一个三维立方体”,包含长度、宽度、高度、朝向角、中心点坐标等完整参数。
3D标注的四大变化
第一,标注维度升级。2D标注只需要x、y、w、h四个参数,3D标注需要x、y、z、l、w、h、yaw七个参数,复杂度翻倍。标注一个3D框的时间大约是2D框的3-5倍。
第二,时序标注成为标配。BEV方案天然支持时序信息融合,训练数据也从单帧标注转向时序标注——同一个物体在连续20帧中的轨迹需要一致性标注,标注工具必须支持时序回放和插值。
第三,多模态融合标注需求爆发。摄像头+激光雷达+毫米波雷达的数据需要在同一坐标系下对齐标注。标注员需要同时理解视觉图像和3D点云,对技能要求大幅提升。
第四,corner case标注从“彩蛋”变“日常”。BEV方案对corner case的敏感度更高——奇怪的交通场景、罕见的路面物体、非常规的驾驶行为都需要专门采集和标注。有自动驾驶公司在2026年Q1的招标中明确要求提供至少500种corner case类型的数据。
标注公司如何应对?
对于中小型标注公司,转型并不容易。培养一个合格的3D标注员需要3-6个月,3D标注工具的采购成本也远高于2D工具。但转型已经不再是选择题:如果2026年还主力做2D标注,客户量会持续萎缩。
一些头部标注公司已经开始布局自动标注能力——用已有标注数据训练自动标注模型,先让AI标一遍,人工校验修正。这种方式号称能降低60%的人工标注量,但对数据引擎团队的要求更高。
可以预见的是,未来两年的标注行业会分化成两个阵营:能提供高质量3D/时序/多模态标注的公司,和困在2D低端市场的公司。门槛在提高,天花板也在提高。