知识卡片:通过观看人类视频进行学习
一句话结论
Skild AI 提出,仅靠遥操作无法达到基础模型所需的数据规模,而通过观察人类视频进行学习(Learning by Watching)可以突破机器人领域的数据瓶颈,实现可扩展的任务学习。
事件概述或研究问题
机器人行业面临数据瓶颈:大型语言模型(LLM)依靠互联网文本数据蓬勃发展,但机器人领域缺乏类似的“Common Crawl”。当前主流策略是扩大遥操作(teleoperation)——由人类操作员手动引导机器人收集精确的力‑转矩序列。但遥操作存在两个致命缺陷:
- 多样性不足:遥操作受限于物理存在,数据大多来自实验室或已部署的特定环境,缺乏真实世界的无限多样性。
- 规模瓶颈:遥操作是实时的,即使全球劳动力 24/7 操作机器人,要收集达到 LLM 量级(数万亿 token)的数据在数学上不可行。
方法/产品要点
Skild AI 的解决方案是“通过观看学习”(Learning by Watching),核心思路:
- 数据来源:利用人类视频(egocentric 头戴摄像头视频、YouTube 教学视频等)作为“互联网规模”的机器人数据集——这种数据已经大量存在,只是并非原生机器人数据。
- 核心技术:全身体学习(Omni-bodied Learning),即模型具备跨形态(embodiment)的映射能力,能够将人类动作(如抓取)转换为机器人动作,从而直接从视频演示中学习新技能。
- 数据需求:仅需少量机器人数据(少于 1 小时)进行微调,即可让模型掌握通过观察视频学到的新技能。
主要结果或产业意义
Skild AI 声称该方法从根本上改变了机器人数据瓶颈问题,使基础模型的可扩展任务学习成为可能。它不依赖大量遥操作数据,而是利用已有的海量人类视频,降低了数据采集成本和物理限制。
为什么重要
- 解决了遥操作无法同时满足多样性和规模的矛盾。
- 模仿了生物智能的学习方式——人类通过观察学习,而非依赖精确的力/力矩指令。
- 为机器人基础模型提供了一条可扩展的数据路径,有望加速通用机器人的发展。
局限与不确定性
- 视频数据缺少力、转矩、触觉等底层信号(Missing Signals)。
- 人类与机器人的形态差异(Embodiment Gap)——人手、7 自由度工业臂、四足机器人等形态差异巨大,映射问题复杂。
- 文中未提供具体的实验验证结果或量化性能指标(待核实)。
- 该方法是否能在复杂、非结构化环境中稳定泛化尚未明确说明(待核实)。
可用于图书/PPT/简报的角度
- 行业痛点切入:对比 LLM 与机器人领域的数据获取差异,引出机器人数据瓶颈。
- 创新点:从“遥操作”转向“观察人类视频”,借鉴生物学习机制。
- 技术路线:跨形态学习 + 少量机器人微调的组合策略。
- 启示:机器人基础模型的数据来源不必局限于机器人自身数据,可充分利用互联网视频资源。
原始材料
- URL: https://www.skild.ai/blogs/learning-by-watching
- 英文标题: Learning by watching human videos
- 英文关键词: robotics, data bottleneck, observational learning, human videos, foundation model, teleoperation, omni‑bodied learning
- 发布日期: Jan 12, 2026 (by Skild AI Team)