知识卡片:3万小时触觉数据补齐具身智能“手感”
一句话结论:NeoteAI 与复旦大学联合发布 N0 系列三份技术报告,通过 3 万小时触觉交互数据、触觉预判 VLA 架构及触觉世界模型,将触觉从辅助模态提升为具身智能的核心基建,多项任务成功率较纯视觉方案提升超 30 个百分点,数据和模型均已开源。
事件概述或研究问题:具身智能在物理交互中常因缺乏触觉反馈而翻车(如插头插不进、抓取力道失控)。行业共识是:视觉可确认空间位置,但无法感知接触、滑移、夹力过载等物理状态,这成为阻碍机器人跨越“最后一厘米”的核心痛点。NeoteAI 与复旦大学可信具身智能研究院联合发布 N0 系列三份技术报告,旨在系统性地将触觉纳入具身智能底层架构。
方法/产品要点:
- N0-Foundation(数据底座):
- 构建 NeoData 数据集,包含超 3 万小时视觉-触觉交互操作数据、约 140 万条操作片段、33 亿个时间步、80 亿帧 RGB 与 100 亿帧触觉图像。
- 动用 Franka、Piper、UR5e 等 6 种机器人本体,覆盖 450 项真实长程任务,由 90 位操作员采集;已开源 5 千小时数据。
- 提出 NeoForce 统一表征模型,将不同触觉传感器(凝胶形变图、电容矩阵、六维力向量等)的“方言”转化为统一“触觉普通话”,实现跨设备数据融合。
- N0-VTLA(触觉预判 VLA):
- 核心创新:不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变(滑移、受力趋势),指导动作模块提前调整。
- 利用失败数据训练进度评估模型(结合部署后数据与 human in the loop),识别“退步”与“救场”行为,再通过离线强化学习实现自主进化。
- N0-TWAM(触觉世界模型):
- 采用混合专家架构,内置视频、触觉、动作三个异步专家网络(总参数量 72 亿,为全宽方案一半),同时预测未来的视频、触觉和动作三个耦合序列。
- 让机器人在动手前先在“想象”中推演操作视角和手感,解决现有世界模型缺乏触感信息导致的物理对齐难题。
主要结果或产业意义:
- N0-VTLA:插插头成功率 85%(视觉方案 60%);拔钥匙成功率 99%(视觉方案 35%)。在毛巾折叠、书包收纳、纸箱折叠等长程任务上,成功率分别从 50%/35%/20% 提升至 95%/80%/75%。
- N0-TWAM:仿真平均成功率 84.5%(最强基线世界模型为 36%);真机 8 项任务平均成功率 46.3%(LingBot-VA 为 21.9%)。消融实验确认去除未来/当前触觉预测均导致性能显著下降。
- 行业信号:触觉模态具备类似视觉的 Scaling 潜力;触觉可自然接入现有 VLA 架构;触觉在世界模型顶层设计中与视觉平起平坐。机器人认知范式正从“视觉驱动”向“视触融合”演进。
为什么重要:此前具身智能行业多聚焦视觉与大模型,触觉长期作为“小众研究方向”。本系列首次系统性地将触觉提升为“核心基建”,提供开源数据集、统一表征和两种可落地技术路线,有望推动具身智能跨越物理交互的最后一厘米。增量信息:与已有相关卡片(如 AlphaEvolve 侧重算法自动设计)不同,本卡片聚焦触觉模态在机器人物理交互中的关键作用,且数据和模型开源降低了行业门槛。
局限与不确定性:
- 真实场景下的大规模数据采集成本仍高(需专业操作员和多种机器人)。
- 跨本体泛化能力(当前数据集仅涉及 6 种本体)待验证。
- 推理实时性在复杂长程任务中可能面临挑战。
- 距离“随手一摸即知轻重”的通用具身智能仍有长路。
可用于图书/PPT/简报的角度:
- “机器人为何插不进插头?”——从触觉缺失看具身智能核心痛点。
- 从“看世界”到“摸世界”:触觉如何成为机器人新感官。
- 开源触觉数据集:加速行业落地的“公共基础设施”。
- 世界模型中的“触觉想象”:让机器人在动手前先“脑补”手感。
原始材料:
- 来源:量子位《3万小时触觉数据补齐具身智能“手感”!新智具身&复旦报告三连发》(2026-07-26)
- URL:https://www.qbitai.com/2026/07/460962.html
- 项目链接:https://research.neoteai.com
- 公司官网:https://www.neoteai.com
- 英文标题(待确认):30000 Hours of Tactile Data Complete Embodied Intelligence "Touch"(根据内容推断,原文未提供)
- 英文关键词:tactile data, embodied intelligence, NeoteAI, N0 series, VLA, world model, tactile predition