AI消息速览

通过观看人类视频进行学习

事件日期 2026-07-08 · 产业观察 · 已接受

事件日期2026-07-08
信息日期2026-07-08
入库日期2026-07-08
通道产业观察
状态已接受
来源skild.ai

知识卡片:通过观看人类视频进行学习

一句话结论

Skild AI 提出,仅靠遥操作无法达到基础模型所需的数据规模,而通过观察人类视频进行学习(Learning by Watching)可以突破机器人领域的数据瓶颈,实现可扩展的任务学习。

事件概述或研究问题

机器人行业面临数据瓶颈:大型语言模型(LLM)依靠互联网文本数据蓬勃发展,但机器人领域缺乏类似的“Common Crawl”。当前主流策略是扩大遥操作(teleoperation)——由人类操作员手动引导机器人收集精确的力‑转矩序列。但遥操作存在两个致命缺陷:

  • 多样性不足:遥操作受限于物理存在,数据大多来自实验室或已部署的特定环境,缺乏真实世界的无限多样性。
  • 规模瓶颈:遥操作是实时的,即使全球劳动力 24/7 操作机器人,要收集达到 LLM 量级(数万亿 token)的数据在数学上不可行。

方法/产品要点

Skild AI 的解决方案是“通过观看学习”(Learning by Watching),核心思路:

  • 数据来源:利用人类视频(egocentric 头戴摄像头视频、YouTube 教学视频等)作为“互联网规模”的机器人数据集——这种数据已经大量存在,只是并非原生机器人数据。
  • 核心技术:全身体学习(Omni-bodied Learning),即模型具备跨形态(embodiment)的映射能力,能够将人类动作(如抓取)转换为机器人动作,从而直接从视频演示中学习新技能。
  • 数据需求:仅需少量机器人数据(少于 1 小时)进行微调,即可让模型掌握通过观察视频学到的新技能。

主要结果或产业意义

Skild AI 声称该方法从根本上改变了机器人数据瓶颈问题,使基础模型的可扩展任务学习成为可能。它不依赖大量遥操作数据,而是利用已有的海量人类视频,降低了数据采集成本和物理限制。

为什么重要

  • 解决了遥操作无法同时满足多样性和规模的矛盾。
  • 模仿了生物智能的学习方式——人类通过观察学习,而非依赖精确的力/力矩指令。
  • 为机器人基础模型提供了一条可扩展的数据路径,有望加速通用机器人的发展。

局限与不确定性

  • 视频数据缺少力、转矩、触觉等底层信号(Missing Signals)。
  • 人类与机器人的形态差异(Embodiment Gap)——人手、7 自由度工业臂、四足机器人等形态差异巨大,映射问题复杂。
  • 文中未提供具体的实验验证结果或量化性能指标(待核实)。
  • 该方法是否能在复杂、非结构化环境中稳定泛化尚未明确说明(待核实)。

可用于图书/PPT/简报的角度

  • 行业痛点切入:对比 LLM 与机器人领域的数据获取差异,引出机器人数据瓶颈。
  • 创新点:从“遥操作”转向“观察人类视频”,借鉴生物学习机制。
  • 技术路线:跨形态学习 + 少量机器人微调的组合策略。
  • 启示:机器人基础模型的数据来源不必局限于机器人自身数据,可充分利用互联网视频资源。

原始材料

  • URL: https://www.skild.ai/blogs/learning-by-watching
  • 英文标题: Learning by watching human videos
  • 英文关键词: robotics, data bottleneck, observational learning, human videos, foundation model, teleoperation, omni‑bodied learning
  • 发布日期: Jan 12, 2026 (by Skild AI Team)