刷题演练、话术包装以及资源置换屡见不鲜。定焦One(dingjiaoone)原创,作者王璐,编辑魏佳。具身智能赛道持续吸引资本关注的同时,各类相关榜单也应运而生。当“第一”几乎成为各家标配后,榜单的可信度究竟如何?
时值一个多月前,千寻智能就遭遇了尴尬处境。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位列“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道融资频率的新高。
但是,业界对评测数据的质疑几乎是次日就开始蔓延。有观察者指出,在310次评测记录中,有72%的分数源自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6也随之从榜单上除名。
尽管遭遇这一事件,但玩家们的热情并未消退。翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明等,几乎每一家头部公司都拥有一个“第一”,且这些“第一”的维度各不相同。
这一现象或许容易理解,具身智能目前技术路线还未统一、真机成功率大多处于五六成水平,外界想要判断一家公司的实力,很大程度上只能依靠榜单。可当发榜的既有高校、机构也有媒体,各家标准各不相同,有的还牵涉商单和利益关系时,榜单本身还能不能当尺子用,成了一个疑问。
一位关注具身赛道的投资人坦言,榜单更偏向市场行为,最多算是投资决策的参考,他对于千寻这件事并不意外。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但亦有投资人持不同意见,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。
当“第一”的数量超过了认真做机器人的公司数时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得参考?
01.技术路线尚未统一,先争一个“第一”
譬如,我们先来梳理目前市面上的榜单,建立起大致认知。据统计,目前具身智能的活跃榜单高达20余个。按评测内容,这些榜单可以分成三类。
VLA操作综合榜,考察机器人能否胜任实际工作,看的是任务成功率,代表榜单有RoboChallenge Table30、MolmoSpaces;
世界模型榜,考察的是脑内推演是否准确,测试模型对物理世界的推演,不测试机器人手脚是否灵活,代表榜单为World Arena和WorldModelBench;
专项基准榜,考察“极端情况下会不会暴露缺点”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表榜单有RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜覆盖不到的极端场景里,把模型的短板暴露出来。
需要指出的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能涵盖具身智能的全部能力。
有了这层框架,近半年具身基座模型的战报就能对应归类。如果把近两个月具身基座模型的战报汇总,可以得到一份相当庞大的名单。









