知识卡片:星尘智能发布Lumo‑2模型,公开20+家务真机演示
英文标题:Lumo‑2: The first implicit world‑action model for home scenarios from Xingchen Intelligence
英文关键词:agent, embodied intelligence, world model, home robotics, Lumo‑2
一句话结论
星尘智能推出第二代具身基座模型Lumo‑2,采用“先预测世界再生成动作”的隐式世界‑动作架构,在家庭场景中实现端到端推理速度比标准自回归提升2.71倍且不损失精度,并同步发布了具备长期语义记忆与多机调度能力的智能体Agent Philia。
事件概述
星尘智能于2026年7月发布第二代具身基座模型Lumo‑2,这是业内首个面向家庭场景的隐式世界‑动作模型。公司一口气公开了20多个真机演示视频,展示模型在家庭环境中的实际作业能力。同时,星尘智能还发布了智能体Agent Philia,提供长期语义记忆与多机调度功能,完善其“AI模型—具身OS—绳驱本体”三位一体全栈架构。
方法/产品要点
- 隐式世界‑动作模型:Lumo‑2不同于传统直接输出动作的范式,先预测世界状态变化再生成动作,使决策更符合物理规律。
- 三阶段渐进式跨模态对齐:通过逐步对齐视觉、语言与动作模态,提升多模态理解与动作生成的连贯性。
- 推理速度提升:端到端推理速度较标准自回归模型提升2.71倍,且精度不损失。
- 三位一体全栈架构:整合“AI模型—具身OS—绳驱本体”,形成从模型到操作系统再到机械本体的完整技术栈。
- Agent Philia:新增智能体,支持长期语义记忆(可记住历史交互与用户偏好)和多机调度(协调多个本体协作完成任务)。
主要结果或产业意义
- 一次性公开20+家务真机演示,覆盖多种家庭操作任务,展示模型在实际场景的可行性与鲁棒性。
- 推理速度的大幅提升降低了部署成本与延迟,为家庭服务机器人的实时响应奠定基础。
- 智能体Philia的长期语义记忆功能使机器人能够学习用户习惯、适应家庭变化,提升服务个性化水平。
- 三位一体全栈架构表明星尘智能在具身智能领域正从单一模型走向系统级产品。
为什么重要
- 这是具身智能少有的专门面向家庭场景的模型,且采用了显式的“世界预测+动作生成”范式的隐式版本,区别于传统VLA模型直接输出动作。
- 推理速度提升2.71倍且不损失精度,意味着模型可以在低成本边缘设备上运行,加速家庭机器人普及。
- Agent Philia的长期语义记忆与多机调度能力填补了业内家庭场景下机器人“认知‑协作”的空白,是具身智能体从单任务工具向自主家庭管家演进的关键一步。
局限与不确定性
- 20+真机演示的具体任务类型与成功率未在材料中详细说明,长期稳定性与泛化能力需进一步验证。
- “隐式世界‑动作模型”的技术细节(如世界模型的具体结构、训练数据规模)未公开,无法独立评估其创新程度。
- Agent Philia的长期语义记忆的实际存储容量、更新机制以及多机调度在复杂家庭环境中的鲁棒性尚待核实。
- 模型何时量产、价格以及是否开放给第三方开发者均待确认。
可用于图书/PPT/简报的角度
- 技术对比:与传统VLA模型(如RT‑2、pi0)的范式差异,突出“世界预测先于动作”的优势。
- 产业应用:家庭服务机器人从简单指令执行向主动感知与长周期记忆演进的案例。
- 系统架构:以“AI模型+具身OS+本体”的垂直整合为例,讲解具身智能体的全栈设计思路。
- 演示视频切入点:用20+家务视频展示技术成熟度,适合制作产品宣传或行业趋势报告的素材。
原始材料
- URL: https://m.sohu.com/a/1052230396_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=6
- 标题:腾讯研究院AI速递 20260720
- 第八条内容原文:
星尘智能发布Lumo‑2模型,公开20+家务真机演示
1.星尘智能发布第二代具身基座模型Lumo‑2,为业内首个面向家庭场景的隐式世界‑动作模型,一口气公开20多个真机视频;
2.采用先预测世界再生成动作的思路,三阶段渐进式跨模态对齐,端到端推理速度较标准自回归提升2.71倍且不损失精度;
3.主打"AI模型—具身OS—绳驱本体"三位一体全栈架构,同步发布智能体Agent Philia提供长期语义记忆与多机调度。