AI消息速览

首个空间原生的具身视觉基模开源——机器人更会看我们的世界了

事件日期 2026-07-07 · 产业观察 · 已接受

事件日期2026-07-07
信息日期2026-07-07
入库日期2026-07-08
通道产业观察
状态已接受
来源量子位

知识卡片:首个空间原生的具身视觉基模开源——机器人更会看我们的世界了

一句话结论

蚂蚁灵波发布的LingBot-Vision和LingBot-Depth 2.0,首次从“边界”学习入手,使机器人在透明材质、小目标、远距离、弱光等复杂场景下的深度感知显著提升,并已开源模型权重和代码。

事件概述

蚂蚁灵波团队于2026年7月7日发布了LingBot-Vision(面向机器人真实任务的空间原生视觉基模)和LingBot-Depth 2.0(基于该基模的空间感知模型)。前者作为视觉底座,更重视几何结构与边界,后者将底座能力转化为更稳定的深度结果。研究团队开源了模型权重、代码和技术报告。

方法/产品要点

  • LingBot-Vision:约10亿参数级的ViT,采用自监督训练。核心创新是masked boundary modeling,通过教师模型在线发现边界token并强制学生模型学习这些高信息密度区域(boundary-forcing),同时引入分类化边界场表示和a-contrario检验以减少噪声误判。
  • LingBot-Depth 2.0:基于LingBot-Vision的深度补全模型,在12个深度补全benchmark上取得领先结果。
  • 蒸馏能力:0.3B学生模型在NYU-Depth v2上能达到与7B DINOv3相当的精度,参数量约少23倍,利于端侧部署。
  • 开源资源:模型权重(HuggingFace和ModelScope)、GitHub代码仓库、arXiv技术报告、项目主页。

主要结果或产业意义

  • NYU-Depth v2上取得所有对比模型中的最佳精度(包括7B DINOv3)。
  • 在透明/反光材质(如香槟塔)、小目标(如远距离网球)、复杂室内场景(玻璃门、窗帘、弱光)、杂乱遮挡等四类机器人视觉“噩梦”场景中,深度图边缘更清晰、轮廓更完整、破碎空洞更少。
  • 已通过奥比中光深度视觉实验室认证,双方围绕EGO-RGBD数采设备、SDK和一体化相机产品展开合作。
  • 可服务于移动机器人、机械臂、仓储物流、工业巡检、服务机器人、人形机器人、3D视觉设备、空间计算等领域。

为什么重要

具身智能进入真实世界时,视觉感知不稳会导致后续移动、避障、抓取全链条出错。传统视觉模型侧重语义理解,而机器人需要“空间常识”(边界、深度、几何关系)。LingBot-Vision从预训练阶段融入几何结构学习,与DINOv3等通用基础模型形成关键差异,且开源性降低了机器人企业和研究者的使用门槛,促使竞争向底层视觉底座延伸。

局限与不确定性

  • 视觉底座升级不会让机器人一夜之间无所不能,传感器差异、算力限制、场景泛化、控制精度和成本仍需继续打磨。
  • 文中未提及跨场景泛化测试的具体失败案例或局限性,需待用户自行验证模型在不同传感器/算力平台上的表现。

可用于图书/PPT/简报的角度

  • 技术切入:从“边界学习”引入具身视觉新范式,适合讲解自监督预训练与空间感知的结合。
  • 行业意义:机器人视觉从“看得见”到“看得准”的跃迁,可配合透明/小目标等失败 vs 成功对比图。
  • 开源生态:蚂蚁灵波开源策略如何降低具身智能研究门槛,加速硬件产品集成。
  • 对比分析:LingBot-Vision vs DINOv3 在空间任务上的精度与效率优势。

原始材料

  • URL: https://www.qbitai.com/2026/07/445230.html
  • 英文标题: LingBot-Vision & LingBot-Depth 2.0: First Spatial-Native Embodied Vision Foundation Model Open-Sourced
  • 英文关键词: embodied AI, robot vision, spatial-native, Ant Lingbo, depth estimation, open-source
  • 来源:量子位 / 蚂蚁灵波