出品|虎嗅科技组
作者|陈伊凡、刘煊琦
编辑|苗正卿
头图|AI生成
2026年1月,硅谷的Skild AI公司在机器人大脑领域完成了14亿美元C轮融资,其估值也因此从几个月前的45亿美元急剧增长至超过140亿美元。这家公司一直未生产过任何机器人,也没有向任何工厂交付过一个机械臂,其核心竞争力在于提供一个特殊的模型。
媒体将此轮融资称作"2026年机器人行业中最早出现的百亿美元独角兽",这一称号的核心依据正是Skild AI专注于模型开发这一独特路径。一年之前,同样的策略让卢宗青在融资过程中承受了诸多质疑。这位来自北京大学计算机学院的副教授、国家级青年人才,在2025年创立了名为智在无界的具身智能公司,同样从事纯粹的模型业务。
在我们的几次交流后,美国当地时间7月28日,特朗普政府宣布了禁止进口中国新款机器人和电力逆变器的命令。前一天,智在无界发布了隐式触觉世界动作模型Being-H0.8,该模型基于50万小时的人类视频数据进行预训练,这一数据时长在当前全球具身模型中处于领先地位。投资人在与他交流时反复询问:“为什么选择不做硬件?”以及“为什么要用人类数据来训练模型?”这两个问题几乎占据了他2025年大部分的沟通时间。
当时,市场上像银河通用这类软硬一体公司正急于通过自研机器人冲击IPO,宇树科技更是凭借420亿元的估值成功上市。相比之下,只专注于开发"看不见"模型的智在无界在估值上显得较为尴尬。面对我的提问,卢宗青坦言,如果公司选择生产硬件,那么估值与纯软件业务之间将会出现云泥之别。但他强调,对于初创团队而言,同时负责模型和硬件的开发并非易事,他更希望专注于具身智能领域最核心也是最未被攻克的通用具身基础模型问题。
实际上,智在无界并非完全脱离硬件。去年年底,公司推出了一款桌面级别的灵巧手机械臂D1。据虎嗅独家消息,智在无界即将推出新版本的同类产品,主要面向科研和教育平台,用于具身智能的预训练。
至于为何选择第一人称视角的人类数据而非当时更流行的仿真和真机数据?这个决策的起点源于一次验证失败的经历。2023年,卢宗青在北大领导的多模态交互研究中心尝试让多模态模型在《荒野大镖客》等游戏中自主执行任务,结果发现模型连数字世界的交互都难以处理。2024年,团队转向真实机器人领域,进行了Being-0等早期尝试,但模型的表现仍未达到预期。真正的问题逐渐清晰:要训练一个能驱动机器人有效地与物理世界交互的模型,必须找到一条可行的规模化数据获取路线,而无论是仿真数据还是真机数据都存在局限性。
2023年底,卢宗青决定将赌注压在人类第一人称视频数据上。那一年,几乎没有人关注这一领域,直到2025年下半年,北美和国内行业才开始逐渐转向这一方向,并最终形成了共识。
智在无界的模型从2025年7月的H0(3000小时数据)迭代到2026年1月的H0.5(3.5万小时,支持跨本体控制30多种机器人),再到4月的H0.7(20万小时数据,采用latent world action model范式),端侧部署推理速度提升至30赫兹,接着便是最新的H0.8,基于50万小时人类第一人称数据构建。
支撑这一快速迭代的核心是一套从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施。这套体系不仅推动了规模化数据的持续积累和模型能力的不断提升,更为机器人开启了通往开放、复杂真实物理世界的大门。
卢宗青表示,Being-H0.8的发布标志着一个新的里程碑,这不仅是模型能力从视觉到触觉、从观察世界到理解交互的进化,更预示着一个能同时具备视觉理解、触觉交互、动作生成、世界预测、跨本体泛化的具身基础模型即将问世。
这部分工作虽然难以被投资人直接感知,但在卢宗青看来,这是公司真正的核心竞争力所在。卢宗青强调,中国和美国在具身智能领域本质上没有差距,因为双方都尚未找到一条能够真正突破瓶颈的数据获取和模型训练路线。








