谷歌选择将赌注投在"大脑"上,而非仅仅是"本体"。这一战略转折点发生在7月30日,当天Google DeepMind推出了Gemini Robotics 2系列模型,意图为整个机器人行业设定操作系统的标准。谷歌DeepMind机器人高级总监Carolina Parada在官方博客的开篇写道:
"从脚到指尖——我们正在教会机器人智能地控制全身、精细灵巧操作,以及团队协作。"
谷歌X账号随后用更简洁的九字回应:"一个大脑。适用于任何机器人。"制造机器人的策略与创造"机器人之脑"的策略显然不同。不妨想象这样一个场景:特斯拉在弗里蒙特工厂让Optimus练习跑步,而Figure AI的BotQ工厂正以每小时一台的效率生产Figure 03……谷歌在此刻展示了三个模型,向行业发起了挑战:你的机器人,是否愿意采用我的系统?
### 谷歌的"机器人之脑"
Gemini Robotics 2实际上包含三个不同模型。首先是视觉-语言-动作模型(VLA),它能够将视觉和语言输入直接转化为电机指令。谷歌先前开发的模型仅能控制人形机器人上半身进行桌面操作,而Gemini Robotics 2则实现了更全面的控制,包括行走、下蹲、伸展和抓取,例如完成"将水壶放进底层柜子的绿色收纳箱"这类需要连续动作的任务。
其次是具身推理模型Gemini Robotics ER 2。该模型不直接控制电机,而是作为机器人的高级决策中心,负责观看视频、理解环境、规划多步任务,并将命令传递给底层的VLA模型。它能够调用包括谷歌搜索和用户自定义函数在内的工具,同时兼顾"思考下一步"与"执行当前动作"。特别值得注意的是,这是首次实现了多机器人实时协作,不同类型的机器人可以无缝沟通并分工合作,执行单个机器人无法完成的任务。
第三种是运行在机器人本地的轻量级VLA——Gemini Robotics On-Device 2。仅需几小时的数据训练,该模型就能适配全新的机器人主体。
这三个模型各司其职,分别负责动作、规划和部署,这一架构本身就在向竞争对手传递谷歌的竞争态度。
### 人形机器人赛道的垂直整合
整个行业几乎都在走同一条垂直整合的道路。Figure AI是这一趋势中最激进的代表。2024年发布Figure 02时,其内部还使用了OpenAI的模型,但到了2025年2月,公司直接宣布分手,转向自研Helix VLA模型。Figure 03于2025年10月问世,搭载了升级版的Helix系统。这家公司拥有从模型到执行器的全部核心技术,并在2025年9月完成了超过10亿美元的融资,估值飙升至390亿美元。
截至2026年4月,BotQ工厂已经生产了超过350台Figure 03,生产速度从每天1台提升至每小时1台,良率维持在80%以上。到2026年7月,Figure AI宣布完成了第1,000台Figure 03的下线。创始人Brett Adcock的目标是在四年内交付10万台机器人。
特斯拉Optimus则选择了不同的发展路径。它采用特斯拉自研的视觉AI系统与执行器,并在自家超级工厂中进行测试。2025年底,Optimus 2.5在弗里蒙特工厂完成首次测试,配备了一套拥有22个自由度的五指灵巧手。尽管马斯克最初计划在2026年第一季度推出三代Optimus,但实际宣布实现量产是在2026年4月23日的财报电话会上。公开销售预计将于2027年启动。到2026年下半年,









