AI消息速览

Gemini Robotics — 谷歌DeepMind的下一代机器人AI模型

事件日期 2026-07-08 · 产业观察 · 已接受

事件日期2026-07-08
信息日期2026-07-08
入库日期2026-07-08
通道产业观察
状态已接受
来源deepmind.google

知识卡片:Gemini Robotics — 谷歌DeepMind的下一代机器人AI模型

一句话结论

Gemini Robotics 是谷歌DeepMind基于Gemini 2.0构建的模型系列,赋予机器人多模态推理、物理世界理解与自主行动能力,支持从感知到灵巧操作的广泛任务,并适配多种机器人形态。

事件概述

谷歌DeepMind推出名为 Gemini Robotics 的先进机器人AI模型系列,旨在让机器人“感知、推理、使用工具并与人类交互”。该系列包含两种关键模型:Vision-Language-Action (VLA) 模型 Gemini Robotics 1.5 和 Embodied Reasoning (ER) 模型 Gemini Robotics-ER 1.6。同时提供了可在机器人设备本地运行的 Gemini Robotics On-Device 版本以及配套的SDK。谷歌还宣布与Apptronik合作开发下一代人形机器人,并与超过60家受信任测试机构(包括Boston Dynamics、Agile Robots、Agility Robotics等)合作。

方法/产品要点

  • 双模型架构:VLA模型(Gemini Robotics 1.5)直接输出运动指令;ER模型(Gemini Robotics-ER 1.6)专注于高精度物理推理、复杂任务规划和逻辑决策。
  • 核心能力
    • 通用性(Generality):适应新情境,分解长期目标并应对意外问题。
    • 智能体性(Agentic):自主调用数字工具(如Google Search)获取信息并制定步骤计划。
    • 思考(Thinking):行动前推理,提升动作质量并通过自然语言透明化决策。
    • 交互性(Interactivity):理解日常指令,可随时被用户用自然语言重定向,适应环境变化。
    • 灵巧性(Dexterity):完成折纸、打包午餐、制作沙拉等精细操作。
    • 多形态适应(Multiple embodiments):单一模型可适配多种机器人平台,包括双臂静态平台(如ALOHA、Bi-arm Franka)和Apptronik的Apollo人形机器人。
  • 本地化部署:Gemini Robotics On-Device 版本专为在机器人设备上本地运行而优化,开发者可进一步定制。

主要结果或产业意义

  • 机器人能够处理未经过专门训练的多步骤复杂真实世界任务。
  • 通过跨不同形态机器人的学习迁移,加速模型泛化能力。
  • 与Apptronik等多家机器人头部企业合作,推动人形机器人等下一代产品落地。
  • 提供Google AI Studio接口、SDK以及Google DeepMind Accelerator初创加速计划,促进产业生态建设。

为什么重要

传统机器人模型往往针对单一任务或固定形态,Gemini Robotics通过统一的多模态推理框架,首次在单一模型中实现了跨形态、跨任务的通用物理智能。其“思考—行动”机制和自然语言可解释性降低了人机协作门槛,可能改变工业、服务及家庭机器人领域的开发范式。

局限与不确定性

  • 材料未提供具体性能指标(如成功率、延迟、能耗等),需进一步测试验证。
  • 未披露模型参数规模、训练数据来源及计算资源消耗。
  • 对复杂动态环境(如高随机性场景)的鲁棒性未被明确说明。
  • 安全与责任部分仅提及综合措施,未提供具体案例或第三方评估报告。

可用于图书/PPT/简报的角度

  • 技术突破:从感知+动作到“感知+推理+行动+交互”的AI机器人新范式。
  • 产业落地:多形态适配如何降低机器人开发成本与部署周期。
  • 人机协作:自然语言重定向与透明化决策对用户信任的提升。
  • 安全与治理:科技巨头在物理世界AI责任上的实践(可对比其他公司的立场)。

原始材料

  • 英文标题:Gemini Robotics
  • 英文关键词:Embodied reasoning, VLA (Vision-Language-Action), humanoid robots, multimodal AI, robot dexterity, Google DeepMind
  • 原始来源URL:https://deepmind.google/models/gemini-robotics