知识卡片:HumanCLAW:视觉语言模型能否通过身体行动?
一句话结论:当前最先进的视觉语言模型(VLM)在需要通过物理身体完成长程导航-交互任务时表现极差(最高成功率仅16.8%),原因并非识别目标失败,而是缺乏“具身自我意识”——无法感知自身身体的位置、是否到达目标或是否撞到障碍物。
事件概述或研究问题:评估VLM是否具备通过物理身体执行行动的能力存在核心难点:任务失败时难以区分是模型决策错误还是底层运动控制(如失去平衡、跌倒)导致。为此,本研究提出HumanCLAW框架,将高层动作决策与低层运动执行解耦。
方法/产品要点:
- HumanCLAW框架:每步由现成VLM发出原子技能命令,该命令被翻译为亚秒级的连续全身运动片段,并实际执行于物理世界,包含重力、碰撞等真实物理后果。运动执行侧的干扰(平衡、电机误差)被排除,仅测量模型的“行动智能”——即每一步选择身体下一步应执行什么。
- 基于该框架构建HumanCLAW-Bench:包含41个室内场景下的1218个长程、以自我为中心的“寻找-导航-交互”情节。
- 测试了9个最先进的VLM(具体模型名称待核实)。
主要结果或产业意义:
- 所有测试模型均未通过该基准测试,最佳模型成功率仅16.8%。
- 核心瓶颈:并非识别目标失败,而是缺乏具身自我意识——模型会丢失自身身体的位置信息,无法判断是否到达目标或是否遇到障碍物。
为什么重要:这是首个将VLM的决策智能与运动执行解耦的评估框架,揭示了当前VLM在具身智能中的关键缺失(具身自我意识),而非单纯的视觉或语言理解能力不足。增量信息:与已有相关卡片(如失败归因研究)不同,该研究明确指出了“具身自我意识”这一新维度,而非仅区分感知或知识缺陷。
局限与不确定性:
- 论文正文未公开,具体使用的9个VLM模型列表待核实。
- 框架假设底层运动控制器完全可靠(排除电动机误差和平衡问题),但现实场景中执行侧仍可能引入未完全排除的误差。
- 仅在室内场景下的导航交互任务测试,泛化到室外或更复杂物理环境的能力待验证。
可用于图书/PPT/简报的角度:
- 具身智能评估中的“归因困境”及HumanCLAW的解耦思路。
- 当前VLM在具身任务中的核心短板并非视觉或语言,而是“身体感知”。
- 对比已有VLM失败类型研究(如“看不见vs不知道”),本工作新增了“不知道自己身体在哪”这一维度。
- 对机器人或具身智能产品设计启示:应显式建模自身位姿与状态记忆。
原始材料:
- 英文标题:HumanCLAW: Can Vision-Language Models Act Through a Body?
- 关键词:Vision-Language Model, Embodied AI, Evaluation Benchmark, Self-awareness
- 来源:arXiv:2607.27180v1 (https://arxiv.org/abs/2607.27180v1)