MoRAL:以紧凑VLM重构边缘自动驾驶决策,8GB GPU实现实时推理
针对自动驾驶边缘计算资源受限痛点,研究提出MoRAL框架,通过两阶段微调Cosmos-Reason2-2B模型,使其具备读取物理编码鸟瞰图(BEV)并进行驾驶决策的能力。该方法创新性地将激光雷达距离、物体类别及雷达速度编码为视觉特征,彻底摒弃了推理时的3D骨干网络。在nuScenes数据集上,MoRAL在七项关键驾驶任务中超越零样本8B基线,紧急制动召回率从10.8%跃升至47.8%,输出退化率大幅降低,且在8GB消费级GPU上达到42 tok/s的实时推理速度,为低成本自动驾驶落地提供了新范式。
在自动驾驶领域,将视觉语言模型(VLM)部署于安全关键的实时推理任务中,一直面临着模型体积与空间感知可靠性之间的巨大矛盾。传统的端到端方法往往依赖庞大的3D骨干网络来理解环境,这在资源受限的边缘计算设备上难以实现。本文提出的MoRAL框架旨在解决这一痛点,它通过一种创新的"传感器接地"策略,将复杂的物理空间信息直接编码为图像特征,从而让轻量级的VLM能够直接"阅读"环境状态。核心贡献在于提出了一种两阶段微调流水线,不仅教会模型理解鸟瞰图(BEV)中的物理编码,还赋予其基于这些信息进行多步逻辑推理的能力。这种方法摒弃了传统方法中对显式3D重建的依赖,转而利用输入图像的视觉表征来外部化空间感知,为紧凑型VLM在边缘端的落地提供了新的技术路径。MoRAL通过这种方式,在保持模型极小体积的同时,显著提升了其在复杂驾驶场景下的推理准确性和鲁棒性,为自动驾驶系统的轻量化部署奠定了坚实基础。在技术实现层面,MoRAL的核心创新在于对输入数据的重新定义与两阶段训练策略。首先,BEV图像被设计为一种物理编码的表示形式:激光雷达的度量距离被映射为颜色带,物体类别通过聚类形态进行编码,而雷达的多普勒速度则以方向性楔形叠加层的形式呈现。
这种设计将原本需要复杂神经网络提取的3D空间信息,直接转化为VLM可以理解的2D视觉特征,从而在推理阶段完全省去了3D骨干网络。训练过程分为两个阶段:第一阶段专注于视觉接地,在60,000条接地记录上微调视觉编码器,实验表明零样本基线无法解析BEV输出,证实了词汇表需要显式训练。第二阶段则聚焦于推理能力,使用Cosmos-Reason2-8B作为教师模型,生成了57,696条涵盖八种驾驶问题类型的思维链(Chain-of-Thought)记录。在此阶段,仅微调全模型的2.4%参数(52M),通过指令微调让Cosmos-Reason2-2B学会基于BEV视觉特征进行多步物理推理。这种参数高效微调策略既保留了预训练模型的语言能力,又注入了特定的驾驶推理逻辑。实验部分在nuScenes数据集的2,304帧保留数据上进行,评估由Gemma 4(31B)模型执行,并经过人工审查校准。结果显示,MoRAL在八种驾驶问题类型中的七种上均超越了零样本8B基线,尽管其参数量仅为后者的四分之一。特别是在需要结构化多步物理推理的问题类型上,MoRAL展现出显著优势。
具体指标方面,紧急制动的召回率从基线的10.8%大幅提升至47.8%,而模型输出的退化率则从94.1%急剧下降至20.8%。此外,效率评估显示,整个Pipeline无需量化即可在配备8GB显存的消费级GPU上以42 tok/s的速度运行,证明了其在边缘设备上的可行性。消融实验进一步验证了BEV物理编码和两阶段训练的重要性,缺少任一环节都会导致性能显著下降,尤其是视觉接地阶段的缺失会导致模型完全无法理解环境空间信息。MoRAL的研究对自动驾驶开源社区和工业落地具有深远意义。它证明了通过巧妙的数据表征和参数高效微调,紧凑型VLM可以在不牺牲太多性能的前提下,实现复杂的物理空间推理。这对于降低自动驾驶系统的硬件成本、推动边缘计算部署具有直接的商业价值。同时,该方法提出的传感器接地BEV表示和两阶段训练范式,为后续研究提供了可复现的基础框架,鼓励社区探索更多将物理先验融入VLM的可能性。在工业界,这种轻量级、高可靠性的推理方案有望加速L2+/L3级辅助驾驶系统的普及,特别是在对实时性和成本敏感的场景中。此外,MoRAL的成功也提示我们,未来VLM的发展不应仅追求参数规模的扩张,更应关注如何更有效地利用输入数据的结构化信息,以实现更高效、更可靠的智能决策。