AI消息速览

TurboVLA:RTX 4090上32Hz实时运行的视觉-语言-行动模型

事件日期 2026-07-29 · 学术前沿 · 已接受

事件日期2026-07-29
信息日期2026-07-29
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:TurboVLA:RTX 4090上32Hz实时运行的视觉-语言-行动模型

一句话结论:TurboVLA提出了一种轻量级的视觉-语言-行动范式,通过直接构建 (V+L \to A) 映射替代传统的以大语言模型为中心的 (V \to L \to A) 路径,在消费级RTX 4090上实现31.2 ms推理延迟(约32 Hz)和<1 GB显存占用,且参数仅0.2B便在LIBERO上达到97.7%平均成功率。

事件概述或研究问题

  • 问题:现有视觉-语言-行动(VLA)模型普遍采用“以LLM为中心”的 (V \to L \to A) 架构,即先通过大语言模型融合视觉与语言信息,再解码为动作。该设计每次策略调用都带来巨大的计算和内存开销,难以在消费级硬件上实时运行。
  • 事件:作者提出TurboVLA,将路径重构为直接的 (V + L \to A) 映射,独立编码视觉和语言输入,通过轻量级双向视觉-语言交互直接传递信息,并用紧凑解码器预测连续动作块。

方法/产品要点

  • 架构革新:放弃LLM作为感知与动作的中央接口,转而采用独立编码器(视觉和语言)+ 轻量双向交互模块 + 紧凑动作解码器。
  • 关键设计:直接从视觉和语言特征构建任务条件表示,无需将视觉投影到LLM表示空间。
  • 推理效率:参数量仅0.2B,推理延迟31.2 ms(对应约32 Hz),推理显存0.9 GB,可在消费级RTX 4090上运行。
  • 测试环境:在LIBERO基准上评估。

主要结果或产业意义

  • 性能:在LIBERO上平均成功率97.7%,匹配或超越显著更大的VLA策略。
  • 效率对比:以0.2B参数量和极低资源消耗达到与大型模型相当的性能,证实了“简单+直接”设计的有效性。
  • 产业意义:为在算力受限的机器人场景(如边缘设备、家用机器人)部署实时VLA策略提供了可行方案,降低了VLA模型对高端硬件的依赖。

为什么重要

  • 打破LLM中心范式:此前VLA模型几乎都依赖大语言模型作为中间接口,TurboVLA证明了“直接映射”路径在效率与性能上的竞争力,可能推动VLA设计思路的转向。
  • 与已有脉络的关系:与已有的“CamVLA(固定相机视角鲁棒性)”和“MonoIR-RS(遥感适配)”不同,本文聚焦于从根本上降低VLA推理的计算和内存开销,是效率导向的架构创新,而非特定场景下的适配。同时补充了“实时低资源VLA”这一缺失的实证。
  • 开源贡献:代码已公开于GitHub,利于复现与后续改进。

局限与不确定性

  • 泛化性:目前仅在LIBERO单一基准上报告结果,在更多样化任务(如真实机器人操作、复杂长序列任务)上的表现待核实。
  • 场景限制:未说明对多机器人、多视角、动态环境等的适应能力。
  • 与LLM对比:未在大规模多模态理解任务上评估,其语言指令理解能力可能弱于LLM中心模型(论文未提及具体对比)。
  • 模型规模:0.2B参数是否意味着在复杂指令理解上存在瓶颈?材料未提供消融实验或定性分析。

可用于图书/PPT/简报的角度

  • 标题建议:“告别大模型:如何用0.2B参数实现97%+的机器人操作成功率”。
  • 对比图示:传统 (V \to L \to A) vs TurboVLA (V+L \to A) 架构对比图,突出计算路径简化与资源节省。
  • 数据亮点:一张消费级显卡上0.9 GB显存、32 Hz实时推理,可作为“低功耗机器人AI”的典型案例。
  • 启发:在具身智能领域,可以重新审视“是否所有任务都需要大语言模型作为中枢”,为轻量化机器人学习提供新思路。

原始材料

  • 英文标题:TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
  • 英文关键词:Vision-Language-Action, VLA, Real-Time, Robotic Manipulation, Lightweight
  • 来源:arXiv: 2607.27205v1, https://arxiv.org/abs/2607.27205v1 (2026-07-29), 作者:Hengyi Xie et al.
  • 代码仓库:https://github.com/H-EmbodVis/TurboVLA