BEV感知(Bird's Eye View Perception) 是自动驾驶领域的一项核心技术,指将车辆周身多个传感器(如摄像头、激光雷达)采集的数据,统一转换到一个以自车为中心的俯视坐标系中,构建一张全局、统一的环境地图。
在自动驾驶中,不同传感器“看”世界的方式完全不同:前视摄像头捕捉红绿灯和车道线,环视摄像头探测车身盲区,激光雷达用三维点云描绘障碍物形状。这些数据来自不同坐标系、格式各异,要让它们协同工作,就必须先“翻译”成一种通用语言。
BEV感知做的就是这件事。它提供了一个“上帝视角”,消除了传统前视视角下近大远小的透视失真,让所有物体保持绝对且一致的尺度,极大地方便了下游的决策和规划任务。
BEV感知经历了从几何方法到深度学习方法的技术演进:
1. 早期几何方法(IPM)
早期主要依赖逆透视映射(IPM),基于“地面是平坦的”假设将图像投影到俯视图。这种方法计算简单,但遇到上下坡或颠簸路面时误差会快速累积,因此有较大局限性。
2. 深度学习时代
LSS(Lift, Splat, Shoot):BEV感知的代表性方法之一,先将图像特征“提升”到3D空间,再“投射”到BEV平面上,实现了从图像到俯视图的端到端学习。
Transformer架构:BEVFormer是纯视觉路线的一个重要节点,它引入Transformer架构,通过预定义的BEV查询向量,直接从多摄像头图像中聚合空间和时间信息,生成统一的BEV特征图。BEVFormer在nuScenes数据集上取得了与激光雷达基线相当的成绩,证明了纯视觉方案的巨大潜力。
1. 多传感器融合的“统一空间”
BEV为多传感器提供了一个共享框架:摄像头提供红绿灯颜色、行人姿态等语义信息;激光雷达提供精确的几何形状;毫米波雷达提供速度信息。这些异构数据在BEV统一坐标系下被整合成一张包含位置、属性和动态信息的完整环境地图。
2. 任务协同与效率提升
统一的BEV表征是后续感知、预测和决策任务的“共同语言”。它支持多任务输出(如3D目标检测、地图分割、车道线检测等),通过共享主干特征减少重复计算,提高了量产部署效率。
3. 降低算力门槛
BEV感知正从高端走向普及,已有方案能在低至8TOPS的算力平台上实现BEV感知量产落地,为中低端车型提供高阶智驾能力铺平了道路。