AI消息速览

全球首个「具身原生」预训练模型 LingBot-VA 2.0 发布

事件日期 2026-07-10 · 产业观察 · 已接受

事件日期2026-07-10
信息日期2026-07-10
入库日期2026-07-10
通道产业观察
状态已接受
来源量子位

知识卡片:全球首个「具身原生」预训练模型 LingBot-VA 2.0 发布

一句话结论
蚂蚁灵波发布的 LingBot-VA 2.0 是全球首个从架构、数据到训练目标均为机器人量身定制的“具身原生”预训练 VA(Video-Action)基座模型,通过因果 DiT + 稀疏 MoE 实现 93.6% 双臂任务成功率与 225Hz 异步控制频率,让机器人学会“预判物理世界”而不是简单“看到就反应”。

事件概述或研究问题
传统机器人视觉-动作模型多基于通用视频生成模型改造(如从双向注意力改为因果),存在预训练知识被破坏、对物理动态预测能力弱等问题。蚂蚁灵波于 2026 年 7 月 10 日发布 LingBot-VA 2.0,从零开始采用因果架构训练,使模型天生具备“只能看过去、不能看未来”的时序约束,匹配机器人闭环控制的物理现实,并融合语义视觉-动作分词器、因果预训练、稀疏 MoE 和 Foresight Reasoning 异步推理四项核心技术。

方法/产品要点

  • 首个具身原生设计:模型架构、数据、训练目标均为机器人从头设计,而非对通用模型“手术式”改造。
  • 语义视觉-动作分词器:在像素重建基础上对齐冻结视觉基础模型的特征,同时通过隐动作模块(逆 + 正动力学模型)从无标注视频中提取动作监督信号。
  • 因果预训练:用因果 next-latent 预测目标在海量网络视频上自监督学习,天然匹配闭环控制时间结构。
  • 稀疏 MoE 主干:视频预测支路使用稀疏混合专家,总参数量约 13B,推理时仅激活约 1.9B;全模型训练参数量约 15.3B,推理每 token 激活约 2.5B。
  • Foresight Reasoning 异步推理:机器人执行当前动作时,模型并行预测下一步动作,并定期用真实观测校准,避免预测漂移。
  • 推理速度:经一致性蒸馏、低精度编译等优化后,单 chunk 推理耗时 142ms,异步控制频率最高 225Hz(baseline 为 965ms / 33Hz)。

主要结果或产业意义

  • 仿真基准 RoboTwin 2.0:Clean 93.8%、Randomized 93.4%、Avg 93.6%,全面超越第一代 LingBot-VA 及 π0.5、Motus 等基线。
  • 真实机器人任务:成功完成整理桌面(长程记忆)、传送带抓取(动态时间对齐)、抓薯片(精细操作)三类任务。
  • 训练效率:多步预测(MCP)辅助目标带来 2.3 倍训练加速,自研分词器相比通用 VAE 在 Easy/Hard 任务上分别提升 8.6/7.1 个百分点。
  • 产业意义:标志着机器人基模从“数字世界模型能力嫁接”转向“面向物理世界需求的原生设计”,与前期发布的 LingBot-Depth 2.0、LingBot-VLA 2.0、LingBot-Video 共同构成机器人大脑 2.0 完整链条。

为什么重要
该模型首次实现了机器人对物理演化的主动预判,而非被动反应。其“因果原生”思路解决了通用视频模型改造为机器人模型时知识丢失的痛点,同时通过稀疏 MoE 和异步推理在有限算力下达成高频闭环控制,为具身智能在工业、服务、家居等真实场景的落地提供了更可靠的基座。

局限与不确定性

  • 文章未提及模型在实际部署中对抗干扰、非结构化环境或极端光照等条件下的鲁棒性测试。
  • 训练数据量、具体网络视频来源及清洗策略未公开。
  • 双臂任务成功率 93.6% 基于仿真基准,真实场景中能否维持同等水平需更多验证。
  • Foresight Reasoning 异步机制在长时推理中如何避免累积误差尚待详细分析。
  • 推理速度 225Hz 为异步控制频率,实际端到端延迟(包含传感器、执行器等)未说明。

可用于图书/PPT/简报的角度

  • 技术突破:从“改造”到“原生”——机器人预训练模型的范式转变。
  • 产业趋势:机器人大脑 2.0 系列如何串联空间感知、动作执行、视频推理与预测控制。
  • 案例演示:冰球对战、整理桌面、传送带抓取、抓薯片等直观对比反应式 vs. 预判式控制。
  • 效率对比:通过消融实验展示自研分词器、MCP 带来的显著提升。
  • 对未来影响:当机器人学会预测物理世界,其应用场景可能从固定工位扩展到动态制造、仓储物流、家庭助理等。

原始材料

  • 文章标题:全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!
  • 来源:量子位(QbitAI),作者 十三 / 金磊,2026-07-10
  • URL:https://www.qbitai.com/2026/07/447627.html
  • 英文关键词:LingBot-VA 2.0, embodied intelligence, pretrained model, causal DiT, sparse MoE, Foresight Reasoning
  • 英文标题(建议):LingBot-VA 2.0: World's First Embodied-Native Pre-trained VA Foundation Model