AI消息速览

SIMA 2——在虚拟3D世界中与您一起游玩、推理和学习的AI代理

事件日期 2025-11-13 · 产业观察 · 已接受

事件日期2025-11-13
信息日期2025-11-13
入库日期2026-07-08
通道产业观察
状态已接受
来源deepmind.google

知识卡片:SIMA 2——在虚拟3D世界中与您一起游玩、推理和学习的AI代理

一句话结论
SIMA 2 是 Google DeepMind 基于 Gemini 模型构建的通用 AI 代理,能够理解自然语言指令、进行复杂推理、与用户对话,并在多种 3D 虚拟世界中通过自我改进不断进步,标志着从专用指令跟随者向通用具身智能体的重要跨越。

事件概述或研究问题

  • 发布时间:2025 年 11 月 13 日(来源:官方博客)
  • 研究问题:如何让 AI 代理不仅能在虚拟环境中执行简单指令,还能像人类一样推理、协作并自主提升?
  • 前代基础:2024 年发布的 SIMA(Scalable Instructable Multiworld Agent)已能跟随超过 600 种语言指令(如“左转”“爬梯子”)在多种商业游戏中操作,但局限于指令-执行模式。

方法/产品要点

  • 核心技术:以 Gemini 模型作为代理核心,集成其强大的推理能力,使 SIMA 2 能理解用户的抽象目标、规划步骤并解释自身行为。
  • 训练数据:混合了人类演示视频(附语言标签)和 Gemini 生成的标签。
  • 操作方式:通过“查看”屏幕和使用虚拟键盘/鼠标进行导航,不依赖游戏底层接口。
  • 多模态理解:支持自然语言、表情符号、草图等多种输入形式;可理解不同语言。
  • 自我改进循环
    1. Gemini 提供初始任务和估计奖励。
    2. SIMA 2 通过试错收集经验,存入自生成经验库。
    3. 后期训练中利用这些经验迭代提升,无需额外人类数据。
  • 泛化能力:能将一个游戏中学到的概念(如“采矿”)迁移到另一个游戏中(如“收获”),并在从未见过的游戏(如 ASKA、MineDojo)中有效执行任务。
  • 与 Genie 3 结合:在 Genie 3 生成的即时 3D 世界中,SIMA 2 能适应新环境并执行有意义的目标操作。

主要结果或产业意义

  • 性能提升:在训练过的游戏以及从未见过的游戏中,SIMA 2 的任务完成率显著高于 SIMA 1,并大幅缩小了与人类玩家之间的差距(具体数值未公开,参见原文图表)。
  • 自我改进验证:经过自我改进后,SIMA 2 能在全新游戏(如 ASKA)及 Genie 3 环境中完成此前失败的任务,完全脱离人类演示数据。
  • 产业意义
    • 为人工智能通用智能(AGI)提供了一条可行路径——通过虚拟世界训练,统一多种专用能力为通用代理。
    • 对机器人技术有直接启示:导航、工具使用、协作等技能是物理世界具身智能的基础。

为什么重要

  • 技术突破:将世界级语言推理引擎 Gemini 与具身 AI 结合,首次实现了“推理-规划-执行-自我改进”的完整闭环。
  • 泛化能力:概念迁移与零样本适应能力接近人类认知,这是以往 AI 代理难以做到的。
  • 交互体验:用户与 SIMA 2 的互动更像与“有思想的伙伴”协作,而非指令-响应式操作。
  • 未来方向:为机器人、数字助理等物理世界的通用智能体提供了可缩放学习框架。

局限与不确定性

  • 长时域任务:仍难以处理需要大量多步推理和目标验证的复杂任务。
  • 记忆限制:为了保持低延迟交互,SIMA 2 只能使用有限的上下文窗口,交互记忆较短。
  • 精确操作:通过键盘和鼠标执行低级动作仍面临挑战,复杂 3D 场景的稳健视觉理解有待提升。
  • 研究性质:当前为研究项目,距离实际产品仍有距离(待核实具体商用时间表)。

可用于图书/PPT/简报的角度

  • 游戏中的 AI 伙伴:从“工具”到“搭档”的体验进化。
  • 通用具身智能的里程碑:虚拟世界如何成为 AGI 的“训练场”。
  • 自我改进 AI:无需人类干预的自学习范式。
  • 与 Genie 3 的组合:世界生成与智能体控制的协同未来。
  • 对机器人技术的启示:虚拟技能如何迁移到物理世界。

原始材料

  • 英文标题:SIMA 2: An Agent that Plays, Reasons, and Learns With You in Virtual 3D Worlds
  • 英文关键词:AI agent, embodied AI, Gemini, virtual worlds, gaming, self-improvement, generalization, DeepMind
  • 原始来源:https://deepmind.google/blog/sima-2-an-agent-that-plays-reasons-and-learns-with-you-in-virtual-3d-worlds