TurboVLA:基於RTX 4090的即時32Hz視覺-語言-動作模型,顯存佔用不足1GB
傳統視覺-語言-動作(VLA)模型通常採用以大型語言模型(LLM)為中心的V→L→A路徑,導致每次策略呼叫時產生巨大的計算和記憶體開銷。本文提出TurboVLA,一種全新的VLA範式,將傳統路徑重構為直接的V+L→A映射。該方法獨立編碼視覺觀測和語言指令,通過輕量級雙向互動直接交換資訊,並由緊湊解碼器預測連續動作區塊。在LIBERO基準測試中,僅用0.2B參數、31.2毫秒推理延遲和0.9GB顯存(在消費級RTX 4090上),TurboVLA實現了97.7%的平均成功率,性能匹配或超越顯著更大的VLA策略。這一簡單設計為高效機器人操作提供了新視角。
在机器人操作领域,视觉-语言-动作(VLA)模型正逐渐成为连接感知与行动的核心桥梁,然而现有的主流架构往往受限于高昂的计算成本。传统方法普遍采用以大型语言模型(LLM)为中心的路径,即视觉观测首先被投影到LLM的表示空间,经过复杂的语义理解后,再解码为机器人动作。这种V→L→A的设计虽然有效,但在每次策略调用时都需要消耗大量的计算资源和内存,严重阻碍了其在实时控制场景中的应用。针对这一痛点,本研究提出了TurboVLA,旨在打破LLM作为感知与动作之间唯一中央接口的固有模式。TurboVLA的核心贡献在于提出了一种直接映射范式,将视觉和语言信息融合后直接生成动作,从而从根本上重构了VLA模型的信息流。这一创新不仅保留了多模态理解的灵活性,更显著降低了推理过程中的计算负担,为在资源受限的边缘设备上部署高性能机器人策略开辟了新的技术路径,使得高频实时控制成为可能。 从技术实现的角度来看,TurboVLA彻底摒弃了将LLM作为核心处理单元的传统架构,转而采用一种更为精简且高效的并行处理机制。具体而言,模型独立地对视觉观测图像和语言指令进行编码,生成各自的特征表示。随后,通过引入轻量级的双向视觉-语言交互模块,视觉特征与语言特征之间能够直接进行信息交换与融合,无需经过庞大的LLM中间层。这种设计使得任务条件化的表示能够直接从视觉和语言特征中构建出来,极大地简化了特征提取与融合的流程。在动作生成阶段,模型使用一个紧凑的解码器来预测连续的动作块(action chunks),而非依赖LLM自回归式的逐步生成。这种端到端的直接映射策略不仅减少了网络层级带来的延迟累积,还通过精简的参数结构降低了内存占用。整个架构避免了LLM中大量冗余的注意力计算,使得模型能够在保持对复杂指令理解能力的同时,实现极低延迟的动作输出,为实时机器人控制提供了坚实的技术基础。 为了验证TurboVLA的有效性,研究团队在LIBERO这一标准的机器人操作基准数据集上进行了广泛的实验评估。实验结果显示,TurboVLA在仅拥有0.2B参数量的情况下,在消费级硬件RTX 4090上实现了惊人的性能表现。具体而言,其推理延迟仅为31.2毫秒,对应32 Hz的控制频率,显存占用低至0.9 GB。在任务成功率方面,TurboVLA取得了97.7%的平均成功率,这一成绩不仅优于许多参数量大得多的现有VLA策略,甚至匹配或超越了部分最先进的方法。消融实验进一步揭示了轻量级双向交互模块和紧凑解码器对整体性能的关键作用,证明了去除LLM中间层并不会损害模型对视觉-语言对齐的理解能力,反而因减少了信息损耗和计算噪声而提升了效率。这些关键指标表明,TurboVLA在保持高精度的同时,成功实现了计算效率的质的飞跃,证明了在特定任务域中,专用的高效架构可以替代通用的庞大模型。 TurboVLA的提出对机器人学习社区及工业落地具有深远的意义。首先,它证明了在不依赖昂贵GPU集群和庞大参数量的情况下,依然可以实现高性能的实时机器人控制,这极大地降低了机器人算法部署的硬件门槛,使得在嵌入式设备或消费级硬件上运行复杂VLA策略成为现实。其次,这种V+L→A的直接映射范式为后续研究提供了新的思路,鼓励开发者探索更多去LLM化的、针对特定任务优化的轻量级架构,从而推动VLA模型向更高效、更实用的方向发展。对于工业界而言,TurboVLA的低显存占用和高推理速度使其在智能制造、仓储物流等需要实时响应的场景中具有巨大的应用潜力。此外,开源代码的发布将进一步促进社区对高效VLA架构的研究与改进,加速多模态机器人技术的普及与落地,为构建更加智能、高效的机器人系统奠定坚实基础。