知识卡片:爻方智能与机器人大脑的“本体认知”
一句话结论:科大讯飞新成立的爻方智能指出,当前机器人“困在Demo”的根源在于机器人大脑缺乏“本体认知”——即模型不仅需预判外部世界,还要学会认识自身身体的能力边界;其提出的iFLYTEK-Embodied-Omni模型通过联合训练视频生成、逆运动学等任务,在零样本和长时序泛化任务上取得优于现有VLA和世界模型的结果。
事件概述:2026年7月WAIC前夕,科大讯飞投资成立安徽爻方智能科技有限公司,注册资本3亿元,由讯飞杰出科学家潘嘉带队,专攻机器人大脑。同期,团队联合中国科学技术大学、聆动通用发布技术报告iFLYTEK-Embodied-Omni。报告批评当前主流VLA(视觉-语言-动作)路线“不是终局”,而世界模型也存在误差累积和缺乏“本体认知”两个关键短板;提出将逆运动学作为训练任务,让模型通过预测自身关节运动来学会“认识自己”。
方法/产品要点:
- 双核大脑架构:在传统VLM之外引入VGM(视频生成模型)用于预测未来视觉状态,与AGM(动作生成模块)构成“大脑-小脑”实时协同,通过共享多模态自注意力机制交互,将串行预测-执行改为并行协同。
- 本体认知训练:不直接告诉模型关节角度,而是给定目标位置(终点),由模型自行推断逆运动学,实现“身体的直觉”——这是区别于英伟达DreamZero(将本体状态仅作为输入信号)的关键差异。
- 数据配比策略:训练数据中近一半(49.11%)为空间推理、感知与任务规划类“具身大脑数据”(含2D/3D轨迹、指向、任务规划等),而非一味追求真机数据;真机轨迹仅占26.88%,人类操作视频18.95%,通用VQA数据5.06%。
- 四阶段训练:VLM、VGM、AGM先各自预训练,最后联合微调对齐,避免不同模块互相干扰。
主要结果或产业意义:
- LIBERO-Plus零样本基准(七种环境扰动):平均成功率89.6%,超过当时最强VLA和WAM方法。
- RoboTwin 2.0双臂协同基准:标准与随机环境分别达93.68%和93.16%。
- 长时序任务(七步):随机环境下成绩更好,验证了“双核大脑”在复杂动态场景中的预判优势。
- 真机已验证(聆动通用此前自研模型),说明此路线可落地;剩下的只是将大脑替换为更强版本。
为什么重要:
- 重新定义了机器人大脑的核心缺失——不是缺乏数据或算力,而是缺乏对自身身体能力的认知,这为具身智能研究提供了新的突破方向。
- 提出“联合生成”理念(预测与动作同时学习),与英伟达最新DreamZero方向一致但具体实现不同(爻方将本体认知作为训练任务,英伟达作为输入条件),在技术路线上提供了差异化方案。
- 数据策略上反对“先量产再采集”的行业主流叙事,强调在跨过实用门槛前盲目铺货会造成用户流失,这一判断对具身智能产业化节奏有指导意义。
局限与不确定性:
- 论文发布于arXiv(2607.02542),但实际产品化进度和长期泛化能力还需更多公开验证。
- 数据配比的具体效果是否可迁移至其他机器人本体和场景,尚待独立复现。
- 公司刚刚成立,团队规模、商业化路径、与聆动通用的分工细节待进一步披露。
- “VLA不是终局”的论断目前仍为理论分析,尚无长期对比实验证明VLA无法通过增大模型或数据量突破天花板。
可用于图书/PPT/简报的角度:
- 标题角度:“大脑不认识自己——机器人智能化的最后一块拼图”
- 故事线:从WAIC展台慢吞吞的机器人切入→引出“不敢调快安全档”的行业痛点→介绍爻方智能的“本体认知”创新→对比英伟达等巨头的方案→阐述数据陷阱与产业节奏建议。
- 类比:好比羽毛球运动员不仅预判球路,还需知道自己能跳多高、手臂多长;具身智能需同时预测世界和认识自己。
- 数据可视化:四个数据来源的占比图、双核大脑架构图、逆运动学训练示意图。
英文标题:Why Robots Are Stuck in Demos? A Missing Ingredient: Embodied Self-Cognition
英文关键词:Embodied Intelligence; VLA; World Model; Proprioception; Self-Cognition; iFLYTEK-Embodied-Omni; 爻方智能; 具身大脑
原始材料:
- URL: https://www.qbitai.com/2026/07/457698.html
- 论文: https://arxiv.org/abs/2607.02542