Gemini Robotics ER 2 登场:机器人 Agent 从单机演示迈向多机器人协作
Google 发布 Gemini Robotics ER 2 与 Robotics 2 系列,强调视频理解、工具编排、设备端运行和多机器人协作,Physical AI 进入执行闭环竞争。
背景:机器人 AI 从“会看会说”走向“会连续执行”
Google 在 2026 年 7 月 30 日介绍 Gemini Robotics ER 2,并称其面向机器人应用的视频理解、工具编排和多机器人协作。Google DeepMind 同日进一步披露 Gemini Robotics 2 系列,包括用于运动控制的 VLA 模型、负责规划的 ER 模型,以及可在设备端运行并快速适配新机器人形态的 On-Device 版本。
这组更新的核心,不只是把大模型接到机器人上,而是让模型在持续视频流、实时交互和多步骤任务里承担“高层大脑”:理解环境、制定计划、调用导航或机械臂接口,并在执行过程中根据进展调整下一步。
关键变化:物理世界的 Agent 开始补齐执行闭环
- 视频流成为反馈回路。 Gemini Robotics ER 2 可以结合连续视频判断任务进度,降低机器人执行到一半“卡住但不知道”的概率。
- 工具编排更贴近真实机器人。 开发者可以把 VLA 模型、导航 API 或机械臂控制接口声明为工具,由 ER 模型负责选择与调度。
- 多机器人协作进入产品叙事。 Google 提到共享空间中的多机器人协作,这意味着仓储、巡检、零售等场景会从单机演示转向流程级协同。
- 设备端模型降低部署门槛。 On-Device 版本强调本地运行和对新机器人形态的快速适配,对网络不稳定或隐私敏感场景尤其重要。
行业影响:Physical AI 的竞争焦点正在前移
过去机器人行业常把难点放在硬件、关节控制和专用数据集上。现在,基础模型厂商正在把“任务规划 + 感知反馈 + 工具调用”做成平台能力。对机器人公司而言,这可能缩短从原型到场景验证的周期;对云厂商而言,机器人正在成为多模态 API、低延迟流式接口和边缘推理的综合展示场。
但物理世界容错率低,安全评估、权限边界、紧急停止、远程接管和日志审计仍是商业部署的前置条件。尤其在公共空间或与人协作的场景里,AI 的可解释和可控性比“演示效果”更重要。
适合哪些人关注?
- 机器人、自动化、仓储和零售科技团队。
- 正在研究多模态 Agent、工具调用和边缘 AI 的开发者。
- 关注 Physical AI、具身智能和机器人平台化趋势的产品经理与投资人。