TurboVLA:打破LLM瓶颈,基于RTX 4090实现32Hz实时控制的轻量化VLA新范式
传统视觉-语言-动作(VLA)模型依赖大型语言模型作为中枢,导致推理延迟高且显存占用巨大,难以满足实时机器人控制需求。TurboVLA提出了一种颠覆性的V+L→A直接映射架构,摒弃了冗长的中间语言生成过程。该模型仅用0.2B参数,在消费级RTX 4090上实现31.2毫秒延迟与不足1GB显存占用,却在LIBERO基准测试中达到97.7%的平均成功率,性能匹敌甚至超越参数量大得多的现有主流模型。这一突破证明了通过精简架构设计,可在极低资源消耗下实现高性能实时机器人操作,为具身智能的端侧部署开辟了新路径。
在机器人操作领域,视觉-语言-动作(VLA)模型正逐渐成为连接感知与行动的核心桥梁,然而现有的主流架构往往受限于高昂的计算成本。传统方法普遍采用以大型语言模型(LLM)为中心的路径,即视觉观测首先被投影到LLM的表示空间,经过复杂的语义理解后,再解码为机器人动作。这种V→L→A的设计虽然有效,但在每次策略调用时都需要消耗大量的计算资源和内存,严重阻碍了其在实时控制场景中的应用。针对这一痛点,本研究提出了TurboVLA,旨在打破LLM作为感知与动作之间唯一中央接口的固有模式。TurboVLA的核心贡献在于提出了一种直接映射范式,将视觉和语言信息融合后直接生成动作,从而从根本上重构了VLA模型的信息流。这一创新不仅保留了多模态理解的灵活性,更显著降低了推理过程中的计算负担,为在资源受限的边缘设备上部署高性能机器人策略开辟了新的技术路径,使得高频实时控制成为可能。 从技术实现的角度来看,TurboVLA彻底摒弃了将LLM作为核心处理单元的传统架构,转而采用一种更为精简且高效的并行处理机制。具体而言,模型独立地对视觉观测图像和语言指令进行编码,生成各自的特征表示。随后,通过引入轻量级的双向视觉-语言交互模块,视觉特征与语言特征之间能够直接进行信息交换与融合,无需经过庞大的LLM中间层。这种设计使得任务条件化的表示能够直接从视觉和语言特征中构建出来,极大地简化了特征提取与融合的流程。在动作生成阶段,模型使用一个紧凑的解码器来预测连续的动作块(action chunks),而非依赖LLM自回归式的逐步生成。这种端到端的直接映射策略不仅减少了网络层级带来的延迟累积,还通过精简的参数结构降低了内存占用。整个架构避免了LLM中大量冗余的注意力计算,使得模型能够在保持对复杂指令理解能力的同时,实现极低延迟的动作输出,为实时机器人控制提供了坚实的技术基础。 为了验证TurboVLA的有效性,研究团队在LIBERO这一标准的机器人操作基准数据集上进行了广泛的实验评估。实验结果显示,TurboVLA在仅拥有0.2B参数量的情况下,在消费级硬件RTX 4090上实现了惊人的性能表现。具体而言,其推理延迟仅为31.2毫秒,对应32 Hz的控制频率,显存占用低至0.9 GB。在任务成功率方面,TurboVLA取得了97.7%的平均成功率,这一成绩不仅优于许多参数量大得多的现有VLA策略,甚至匹配或超越了部分最先进的方法。消融实验进一步揭示了轻量级双向交互模块和紧凑解码器对整体性能的关键作用,证明了去除LLM中间层并不会损害模型对视觉-语言对齐的理解能力,反而因减少了信息损耗和计算噪声而提升了效率。这些关键指标表明,TurboVLA在保持高精度的同时,成功实现了计算效率的质的飞跃,证明了在特定任务域中,专用的高效架构可以替代通用的庞大模型。 TurboVLA的提出对机器人学习社区及工业落地具有深远的意义。首先,它证明了在不依赖昂贵GPU集群和庞大参数量的情况下,依然可以实现高性能的实时机器人控制,这极大地降低了机器人算法部署的硬件门槛,使得在嵌入式设备或消费级硬件上运行复杂VLA策略成为现实。其次,这种V+L→A的直接映射范式为后续研究提供了新的思路,鼓励开发者探索更多去LLM化的、针对特定任务优化的轻量级架构,从而推动VLA模型向更高效、更实用的方向发展。对于工业界而言,TurboVLA的低显存占用和高推理速度使其在智能制造、仓储物流等需要实时响应的场景中具有巨大的应用潜力。此外,开源代码的发布将进一步促进社区对高效VLA架构的研究与改进,加速多模态机器人技术的普及与落地,为构建更加智能、高效的机器人系统奠定坚实基础。