知识卡片:行业首个具身原生世界动作模型——蚂蚁灵波发布 LingBot-VA 2.0
- 英文标题:LingBot-VA 2.0: Industry's First Embodied Native World Action Model
- 英文关键词:embodied AI, world model, action model, native architecture, causal prediction
- 原始来源:https://aiera.com.cn/2026/07/10/other/admin/103416/%e8%a1%8c%e4%b8%9a%e9%a6%96%e4%b8%aa%e5%85%b7%e8%ba%ab%e5%8e%9f%e7%94%9f%e4%b8%96%e7%95%8c%e5%8a%a8%e4%bd%9c%e6%a8%a1%e5%9e%8b%e6%9d%a5%e4%ba%86%ef%bc%81%e8%9a%82%e8%9a%81%e7%81%b5%e6%b3%a2%e5%8f%91
一句话结论
LingBot-VA 2.0 是业界首个从物理世界交互需求出发、原生设计的具身世界动作模型,通过自回归预训练和四大核心设计,在真机测试中实现了单卡 150 Hz 的实时推理效率,标志着机器人基础模型从“数字世界模型嫁接”向“面向物理世界原生设计”的关键转变。
事件概述
2026 年 7 月 10 日,蚂蚁灵波发布了业界首个具身原生世界动作模型 LingBot-VA 2.0。该模型不依赖外部拍摄设备即可完成与人类的多轮随机对打等复杂交互任务。此前,蚂蚁灵波已在同一周内连续发布和开源了多款模型(包括空间感知、多机控制、实时交互、视频生成等方向的模型),LingBot-VA 2.0 作为集大成者正式开启了具身原生新阶段。
方法/产品要点
- 原生架构:摒弃“基于数字世界模型微调”的主流路线,从动态建模、因果预测、实时执行等环境交互原始需求出发进行原生设计。
- 四大核心设计:
- 语义视觉-动作分词器:在视觉压缩中加入语义与动作信息的对齐,使模型更容易将“理解指令”转化为“完成动作”。
- 严格因果预训练范式:采用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。
- MoE(混合专家)架构:在不牺牲推理效率的前提下扩大模型容量。
- 增强异步推理机制:在执行动作的同时预测未来状态,并利用最新真实观测校正下一步决策,实现实时闭环控制。
主要结果
- 在真机测试中,机器人可完成与人类的多轮随机对打,不依赖任何外部拍摄设备。
- 针对行业普遍的具身世界模型执行效率低问题,LingBot-VA 2.0 实现了单卡 150 Hz 的实时推理效率。
为什么重要
- 行业主流路线依赖面向数字内容创作的视频生成模型,再微调适配机器人控制任务,但内容创作与机器人控制的目标不同(画质/创意 vs. 执行效率/预测合理性),强行微调会导致知识遗忘和泛化性下降。
- LingBot-VA 2.0 选择从头预训练的“更难的路”,为具身智能提供了一种更原生、更高效的路线选择,可能加速机器人从实验室走向产业场景。
局限与不确定性
- 材料未提及模型在多任务、复杂环境下的泛化能力上限,也未提供与其他主流方法的定量对比。
- “单卡 150 Hz”的具体硬件配置未说明(如 GPU 型号、精度等),需进一步确认。
- 真实产业场景中的长期稳定性和鲁棒性尚待验证。
可用于图书/PPT/简报的角度
- 技术路线对比:数字世界模型微调 vs. 物理世界原生设计——两种路线的本质差异与选择依据。
- 具身智能核心挑战:如何同时满足因果预测、实时闭环控制与高推理效率。
- 产业落地节奏:蚂蚁灵波以“全栈大脑 2.0”体系(空间感知、动作模型、世界模型、视频模型)覆盖具身智能细分能力,展示生态构建思路。
- WAIC 2026 看点:7 月 17–20 日上海世博展览馆现场体验。
原始材料
- 来源:AIERA(新智元),2026 年 7 月 10 日
- URL:https://aiera.com.cn/2026/07/10/other/admin/103416/%e8%a1%8c%e4%b8%9a%e9%a6%96%e4%b8%aa%e5%85%b7%e8%ba%ab%e5%8e%9f%e7%94%9f%e4%b8%96%e7%95%8c%e5%8a%a8%e4%bd%9c%e6%a8%a1%e5%9e%8b%e6%9d%a5%e4%ba%86%ef%bc%81%e8%9a%82%e8%9a%81%e7%81%b5%e6%b3%a2%e5%8f%91