知识卡片:LingBot-Vision——边界中心的稠密空间感知视觉基础模型
一句话结论
LingBot-Vision 是一个以边界为中心的自监督视觉基础模型,利用掩码边界建模(Masked Boundary Modeling)让边界表征从数据中自发涌现,并在无预训练骨干、无人工标注、无外部边缘检测器的条件下,在深度估计、语义分割、视频目标分割等稠密感知任务上取得领先结果;同时作为 LingBot-Depth 2.0 的编码器初始化,显著提升深度补全性能。
事件概述 / 研究问题
现代视觉基础模型往往优先保持语义不变性(semantic invariance),却牺牲了细节空间理解。LingBot-Vision 从“边界/形状不连续”入手研究视觉预训练,认为边界和形状不连续为感知几何属性提供关键线索。其核心是掩码边界建模:模型在预训练中在线学习亚像素(sub-pixel)边界表征,并把发现的边界承载 token 作为掩码目标,驱动稠密视觉 token 学习。
方法/产品要点
- 掩码边界建模:不使用预训练骨干、人工标注或外部边缘检测器,边界 token 从零开始涌现,紧密勾勒物体轮廓、胡须、电缆和屏幕边缘;每个 token 携带一个亚像素边界场。
- 边界忠实的稠密特征:将冻结 patch 特征的前三个 PCA 分量映射为 RGB,物体内部平滑,特征过渡精确落在物体轮廓上,没有逐 token 的斑点或块状噪声。
- 高分辨率特征推理:冻结特征可直接扩展到高分辨率(例如 4096 token 网格),仍能保持胡须、电缆、地板砖纹等细薄结构。
- 边界 token 的时间跟踪:仅用冻结特征的余弦相似度,无需微调和时间监督,即可跨帧跟踪静态结构和大姿态变化对象;在窗前猫的片段中,模型高亮的是玻璃上真实污渍而非伪影。
- 蒸馏模型族:ViT-g 教师蒸馏出 ViT-L/B/S 学生,每个部署预算下深度精度同类最佳;0.3B 的 ViT-L 学生以约 23 倍更少参数达到 7B DINOv3 的 NYUv2 深度 RMSE(0.310 vs 0.309)。
- 页面提供 Tech Report / Code / Hugging Face 入口,但具体开放范围和许可协议待核实。
主要结果
- 线性探测深度估计:NYUv2 RMSE 0.296,优于 7B 参数 DINOv3 的 0.309,且参数少约 7 倍。
- 线性探测语义分割:与蒸馏版 DINOv3 ViT-H+ 相当(Cityscapes 79.6,VOC12 87.5),且是用单一自监督目标从零预训练。
- 免训练视频目标分割:DAVIS-2017 J&F 70.0、YouTube-VOS 73.5,在所有非 DINOv3 模型中最佳,超过视频预训练的 V-JEPA 2.1。
- 支撑 LingBot-Depth 2.0:将编码器从 DINOv2 换成 LingBot-Vision(ViT-L 和 ViT-g),并把 RGB-D 训练语料从 3M 扩展到 150M 样本;同一管线在 block-masked DIODE-Indoor 上,ViT-L 的 RMSE 从 DINOv2 初始化的 0.152 降到 0.094,且随数据增长优势扩大。
- LingBot-Depth 2.0 在 14 个覆盖不同深度模式和相机类型的基准上领先,block-masked DIODE-Indoor RMSE 从 1.0 的 0.132 降至 0.062,并擅长透明物体捕获——这是主动深度传感的经典失败场景。
为什么重要
LingBot-Vision 提供了一个与“语义不变性优先”不同的视觉预训练路线:以边界/空间不连续为中心,用自监督方式学习稠密空间特征,且无需外部边缘检测器和额外标注。它直接服务物理智能所需的深度估计、分割、特征跟踪,并成为 LingBot-Depth 2.0 的性能提升关键。与已有卡片中的 LingBot-VA 2.0(世界动作模型)不同,本条是同一系列中的视觉基础模型/感知底座,属于增量信息;此前已知 LingBot-VA 2.0 在机器人动作侧取得突破,而 LingBot-Vision 支撑其稠密空间感知能力。
局限与不确定性
- 页面未明确给出模型发布时间和“LingBot-Vision 1.0”版本号,版本号待核实。
- 训练数据规模、计算资源、开源协议等未在材料中说明(仅有 Tech Report / Code / Hugging Face 入口,具体开放程度待核实)。
- 展示结果主要来自冻结特征线性探针或免训练评估,端到端微调后的表现未知。
- 并非所有规模/任务都全面领先:例如 ViT-S 学生 Cityscapes mIoU 为 64.34,低于 DINOv3 的 73.38;分类或部分分割指标上仍与 DINOv3 交错。
- 以上结果均来自项目页面自述,未经第三方同行评议或独立复现验证。
可用于图书/PPT/简报的角度
- 用“边界”作为视觉表征学习的核心线索,挑战“语义不变性高于空间细节”的主流做法。
- 从具身智能视角解释视觉基础模型:稠密空间感知比图像分类更能支撑物理世界交互。
- 效率叙事:1B 模型超越 7B 模型(NYUv2 深度),蒸馏学生以 23 倍更少参数追平 DINOv3,适合部署/端侧场景。
- 透明与反射物体深度补全:主动传感器失效时,基于学习的深度补全方案如何补位。
与既有脉络的关系
- 本条是 LingBot 系列在“视觉感知”方向的独立发布,区别于已有卡片中的 LingBot-VA 2.0(具身世界动作模型/VA 基座模型);LingBot-Vision 提供稠密空间特征,并能为 LingBot-Depth 2.0 提供编码器初始化。
- 由于源页面未出现“蚂蚁灵波”字样,本卡片的组织归属采用“Robbyant(LingBot 系列)”表述;与蚂蚁灵波的关系待核实(但结合已有卡片上下文推测为同一系列)。
原始材料
- 英文标题:LingBot‑Vision Vision Foundation Model - Robbyant
- 英文关键词:LingBot-Vision, Masked Boundary Modeling, Self-Supervised Vision Foundation Model, Dense Spatial Perception, Depth Completion
- 原始来源:https://technology.robbyant.com/lingbot-vision