AI消息速览

银河通用发布WAM-TTT——人类视频助机器人跨环境适配

事件日期 2026-07-17 · 产业观察 · 已接受

事件日期2026-07-17
信息日期2026-07-17
入库日期2026-07-17
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:银河通用发布WAM-TTT——人类视频助机器人跨环境适配

一句话结论

银河通用发布全球首个具身智能测试时后训练框架WAM-TTT,机器人仅需观看少量第一视角人类视频即可在新环境中适配,无需机器人轨迹数据或动作标注,跨环境表现保留率从约15%提升至约76%。

事件概述或研究问题

传统具身智能模型在部署到新环境时,通常需要大量特定场景的机器人示范数据或人工标注,成本高且泛化差。银河通用提出的WAM-TTT(Weights Adaptation via Masked Test-Time Training)框架,旨在让机器人通过观察人类视频实现快速跨环境适配,解决“零样本”迁移难题。

方法/产品要点

  • 测试时后训练框架:WAM-TTT在推理阶段通过自监督视频预测任务更新轻量级权重,基础模型全程冻结,避免灾难性遗忘。
  • 数据来源:仅需第一视角人类视频,无需机器人轨迹数据或动作标注。实验显示100条人类视频的价值接近100条机器人示范。
  • 效率与兼容性:适配过程快速,权重更新量轻量,基础模型参数保持不变。

主要结果或产业意义

  • 性能提升:跨环境表现保留率从约15%大幅提升至约76%,实现了“零遗忘”的跨环境适应。
  • 数据民主化:人类视频被验证为具身智能的“第二种数据”,大幅降低数据获取门槛,可能改变机器人学习的数据范式。
  • 产业加速:使机器人部署到新场景(如家庭、仓储、医疗)的成本和周期显著缩短,推动具身智能从实验室走向实际应用。

为什么重要

  • 首次将测试时训练(Test-Time Training)引入具身智能领域,并在真实场景中验证其有效性。
  • 相比既有方法依赖机器人示范数据,WAM-TTT利用海量易获取的人类视频,为具身智能的规模化训练提供了新路径。
  • 与同日发布的小米机器人基座模型(Xiaomi-Robotics-1)形成互补:小米侧重预训练Scaling,银河通用侧重测试时快速适应。

局限与不确定性

  • 材料未明确WAM-TTT在复杂动态环境(如密集人流、非结构化物体)下的鲁棒性。
  • 人类视频与机器人本体动作空间的对齐精度、大规模部署时的推理速度等细节待核实。
  • 长期连续任务中轻量权重的稳定性及遗忘风险尚未公开讨论。

可用于图书/PPT/简报的角度

  • 技术演进:从“预训练+微调”到“测试时后训练”,具身智能适应策略的范式转移。
  • 数据杠杆:人类视频为何能替代机器人轨迹——自监督视频预测的潜力。
  • 商业落地:面向服务机器人厂商,展示“开箱即用”的跨环境适配方案。
  • 对比分析:与同期小米机器人基座模型对比,讨论预训练Scaling vs. 测试时适应两种路线。

与既有脉络的关系

无直接关联。本条为具身智能领域新框架发布,与NIST AI RMF、AlphaEvolve、AlphaEarth Foundations主题无关。

原始材料

URL: https://m.sohu.com/a/1051238276_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=8