AI消息速览

原生视频-动作预训练用于通用机器人控制

事件日期 2026-07-09 · 学术前沿 · 已接受

事件日期2026-07-09
信息日期2026-07-09
入库日期2026-07-12
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:原生视频-动作预训练用于通用机器人控制

  • 英文标题:Native Video-Action Pretraining for Generalizable Robot Control
  • 英文关键词:video-action foundation model, robot control, causal pretraining, sparse MoE, asynchronous inference, semantic visual-action tokenizer

一句话结论

LingBot-VA 2.0 是一个从头为具身智能构建的视频-动作基础模型,通过语义视觉-动作分词器、因果预训练、稀疏 MoE 骨干和增强异步推理四项核心设计,实现了在真实世界中复杂操作任务的少样本泛化。

事件概述或研究问题

现有的视频-动作模型多为数字内容创作的视频生成模型改造而来,这对物理环境本身并不适合。本文提出 LingBot-VA 2.0,旨在弥合这一差距,打造一个原生面向具身控制的视频-动作基础模型。

方法/产品要点

  1. 语义视觉-动作分词器:区别于传统的重构式 VAE,新分词器将视觉表示与语义和动作对齐,改进了后续策略学习中的指令跟随和动作精度。
  2. 因果预训练范式:考虑到时序动态的严格因果性,模型从零开始进行因果预训练,避免了从双向架构适配时的灾难性遗忘。
  3. 稀疏 MoE 骨干:采用稀疏混合专家架构,在不牺牲推理效率的前提下扩大模型容量,满足高频推理需求。
  4. 增强异步推理方案:在动作执行的同时并行预测未来潜在状态,并通过学习的前向动力学基于最新观测重新接地,实现实时闭环控制。

主要结果或产业意义

真实世界部署验证了 LingBot-VA 2.0 作为鲁棒基础模型的能力,在复杂操作任务上展现出少样本泛化能力。这表明从头设计的视频-动作预训练方法可能成为机器人控制领域的基础范式。

为什么重要

该工作直接挑战了“复用视频生成模型”的主流思路,提出了面向物理世界特性和实时控制需求的完整设计原则,为具身智能基础模型的发展提供了新方向。

局限与不确定性

原文摘要未明确讨论模型的局限、失败案例或在不同硬件/场景下的泛化边界。具体参数、训练数据规模、计算成本等信息待核实。

可用于图书/PPT/简报的角度

  • 机器人控制从“预训练-微调”到“原生预训练”的范式转变。
  • 因果预训练 vs. 双向预训练在时序任务中的对比。
  • 实时闭环控制的异步推理设计思路。
  • 稀疏 MoE 如何平衡模型规模与推理速度。

原始材料

  • 来源:arXiv 预印本,ID 2607.08639v1
  • 标题:Native Video-Action Pretraining for Generalizable Robot Control
  • 作者:Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu
  • 发布日期:2026-07-09
  • URL:https://arxiv.org/abs/2607.08639v1