洱海新闻

从会说话到“懂交互”,智元WITA-Omni登顶全球榜单

来源:洱海新闻 分类:科技
从会说话到“懂交互”,智元WITA-Omni登顶全球榜单

近日,DailyOmni榜单最新评测结果出炉,智元自主研发的具身原生全模态大模型WITA-Omni Preview以85.21分的高分夺得头筹,力压Gemini 3.1 Pro Preview、Qwen3.5-Omni-Plus、Doubao Seed 2.0 Lite、英伟达等国内外众多主流模型,更是在八项细分指标中占据六项第一的骄人战绩。

DailyOmni榜单有何特殊之处?

要明白这85.21分的分量,首先得了解DailyOmni究竟在测评什么。

业内普遍将这份榜单看作检验具身智能感知能力的权威标尺。之所以如此,与人形机器人在真实物理环境中的运作方式密切相关。当人形机器人穿梭于商场、展厅、地铁站时,面对的是充满"多人、开放、持续变化"特性的复杂场景。机器人需同步完成观察环境、接收声音、组织语言、配合动作表情等任务——更关键的是要实时判断:是否该作出回应、何时回应以及与谁交互。

常规AI大模型榜单主要侧重图文问答测试——给出图片并要求回答相关问题,更贴近线上内容消费场景。而DailyOmni的测试集则大量采用开放环境下的真实音视频材料,核心考察三项能力:能否准确将画面人物与其发声内容对应;能否厘清事件发展顺序;能否整合视听信息进行跨模态推理。

根据论文披露的数据,DailyOmni包含数百段真实日常场景短视频、上千道选择题,全面覆盖音视频对齐、上下文理解、事件序列、因果推理、跨模态一致性等六大核心任务。

从当前公布的榜单来看,闭源模型中Gemini 2.5 Flash得分为73.06%,开源模型里Qwen3.5-Omni-Plus为84.68%。此次WITA-Omni đạt thành tích 85.21%不仅超越了这些头部模型,还在八项细分指标中拿下六项桂冠。

三层架构,突破传统模块化局限

长期以来,人形机器人交互系统普遍采用模块化拼接设计:依次串联摄像头视觉模块、麦克风音频模块、对话大模型、运动控制模块,形成串行流水线作业。

机器人运作流程为"先分析画面→再转换音频文字→生成应答→最后输出动作表情",各步骤存在明显割裂,时常出现语音发出后动作才迟缓启动的状况,在多人场景中甚至无法有效锁定交互对象,导致适配真实环境的能力存在先天不足。

智元WITA-Omni的核心创新之处在于打破了"通用大模型外接机器人动作模块"的传统模式,首创面向具身场景的Thinker–Talker–Actor三层原生端到端架构。通过将肢体动作、面部表情提升至与语音文本同等的输出层级,实现所有模态共享统一认知表征与时间轴,达成感知、思考、表达的同步进行。

换言之,这并非简单将对话模型移植至机器人,而是将物理动作和表情提升为与语音并行的输出级别。三层架构的具体分工如下:

•Thinker(思考):作为多模态推理核心,将文本、图像、音频、音视频映射至统一表示空间,执行跨模态联合推理与高层交互决策;

•Talker(说):依据Thinker的隐状态参数,流式生成自然语音;

•Actor(动):由动作头与表情头构成,将机器人动作表情生成与语音同级别的输出。

基于这套架构,机器人能够实现"边观察、边思考、边说话、边行动"的同步运作,有效解决当前人形机器人交互僵硬、机械化的问题。

具身智能应用的关键节点

业内专家分析,智元在DailyOmni榜单上的重大突破,清晰揭示了具身智能产业下一阶段的竞争焦点——交互智能。

过去数年间,行业竞争重点主要聚焦于运动能力(速度、高度)和作业能力(负载、精度)。但当机器人真正步入商业服务、公共服务等与人高频互动的场景时,能否实现自然流畅且符合社交礼仪的交互,将成为决定其市场成败的关键因素。

相关推荐