自动驾驶决策系统是自动驾驶汽车的"大脑",它接感知系统传来的环境信息,判断当前该做什么,并规划出具体的行驶路线,然后交给控制系统去执行。
决策系统的工作通常分为几个层次,层层递进:
行为决策 (Behavior Decision):回答"当前该做什么"这个宏观问题。比如,是跟随前车,还是准备变道超车,亦或是让行?这个层面决定了车辆大致的驾驶策略。
运动规划 (Motion Planning):在行为决策确定后,规划出一条从当前位置到目标点的具体、安全、平滑的行驶轨迹。这条轨迹需要考虑到道路曲率、周围车辆的位置和速度,以及乘客的舒适度。
闭环控制 (Control):将规划好的路径转化为具体的、实时的方向盘转角、油门和刹车指令,并不断根据车辆实际运动状态进行修正,确保车辆"听话"地沿着规划轨迹行驶。
实现这套决策流程,主要有三种技术路线,各有优劣:
模块化系统 (Modular System):这是传统且广泛应用的方案,将行为决策、运动规划和控制等环节拆分成独立的模块,再由规则或模型串联起来。它可解释性强,每个环节出了什么问题都能追溯,便于调试;但模块间的误差可能会累积,导致整体性能下降。
端到端系统 (End-to-End System):这一路线试图用一个巨大的神经网络,直接从传感器输入(如摄像头图像)映射出驾驶指令(如方向盘角度)。它最大的优点是避免了级联误差,系统能全局优化,理论上性能上限更高。但它的"黑盒"特性让可解释性很差,人们难以理解它为什么做出某个决策,这在高安全要求领域是个重大风险。
基于优化的系统 (Optimization-based System):这是一种介于前两者之间的方案。它通过定义复杂的数学"代价函数"(Cost Function),将安全、效率、舒适等目标量化,然后通过求解这个函数的最优解来生成驾驶策略和轨迹。这种方法安全性可验证,行为可预测,因此被认为更适合大规模量产。其代表技术包括模型预测控制 (MPC) 和人工势场法 (APF)。
决策技术本身也在快速演进,主要趋势包括:
模仿学习与强化学习: 利用大量人类驾驶数据训练模型,让AI学习老司机的驾驶经验(模仿学习)。或者让AI与环境不断试错互动,从奖励和惩罚中自己摸索出最优策略(强化学习),同济大学的研究就展示了深度强化学习在决策规划中的应用潜力。
预测与决策的深度融合: 过去是先预测其他车辆会怎么走,再规划自己的路。现在趋势是将两者结合,变成一个更紧密的整体,像"任务统一型规划系统"(Task-Unified Planning System)那样,让预测也服务于最终的驾驶目标,显著提升避障等关键任务的完成度。
应对不确定性的决策: 复杂的真实路况充满不确定性,你并不知道旁边的车会不会突然变道。新技术像Hi-Drive采用的分层部分可观察马尔可夫决策过程 (POMDP),就试图在决策时就考虑到这种不确定性,做出更稳健的规划。
简单来说,自动驾驶决策系统正从规则驱动、可解释的模块化时代,迈向数据驱动、更智能,同时需要平衡安全性与性能的融合时代。