智元全模态大模型登顶全球榜首,具身智能交互能力首次超越通用大厂
机器人与人自然交流的最大障碍,不在于单项AI能力的不足,而在于"看、听、说、动"始终跑在不同的时间轴上。近日,智元自研的具身原生全模态大模型WITA-Omni Preview在行业公认的DailyOmni榜单上以85.21分登顶,一举超越千问、Gemini、豆包和英伟达等通用大模型厂商的旗舰产品,八项细分指标中拿下六项第 一,打破了"通用大厂主导全模态"的行业惯性。
DailyOmni并非传统的图文理解测试。它大量采用真实开放环境下的音视频素材,核心考察的是模型在声画同时涌入时,能否准确判断谁在说话、哪件事先发生、该关注哪个细节——这正是人形机器人在嘈杂展厅、商场或家庭场景中与人交互所需要的核心感知能力。WITA-Omni在音视频对齐上拿到86.13分,事件时序判断84.64分,综合推理85.06分,在30秒和60秒长视频理解等长时序任务上建立了系统性的领先。
这份成绩单的意义超出了排名本身。智元是DailyOmni榜单上唯一一家以具身智能为主业的参赛者,而它的对手是千问、Gemini等拥有海量数据和算力资源的通用大模型厂商。一家机器人公司在全模态理解这个通用AI赛道上跑赢大厂,说明从机器人原生交互场景出发来设计模型架构,可能是一条比"先把通用模型做强大再适配机器人"更高效的路径。
Thinker-Talker-Actor:打破串行流水线
WITA-Omni的核心创新在于打破了传统机器人交互的串行流水线。过去,机器人交互需要依次经过语音识别、语义理解、回复生成、语音合成再到动作输出五个环节,每一步都有延迟和语义损耗。更致命的是,语音、表情和肢体动作各自独立生成,经常出现"嘴在笑手没动"或"话说完了表情才来"的割裂感。
WITA-Omni采用了一套名为Thinker-Talker-Actor的原生端到端架构。Thinker作为多模态推理中枢,将文本、图像、音频和音视频统一映射到同一表示空间进行跨模态联合推理;Talker以Thinker的推理结果为条件,流式生成自然语音;Actor则由动作头和表情头组成,驱动肢体动作与面部表情。三个模块在统一时间轴上同步推进,替代了"处理完一个再交给下一个"的传统模式。
这套架构的一个关键设计是跨流同步机制:Actor不仅接收Thinker的语义指令,还以Talker的音频隐变量为条件,使机器人的手势和表情能够实时感知语速、停顿、重音和情绪变化——意味着机器人可以边说边比划、语气加重时手势同步加强,理解与表达不再是两个割裂的阶段,而是同一个生成过程的不同维度。
千万小时数据+三阶段训练策略
模型性能的领先不仅来自架构创新,还依赖一套围绕具身交互深度定制的数据体系。在中训练阶段,智元使用了千万小时级多模态数据,其中音视频联合数据占四成、纯音频占三成、视觉与文本各占两成和一成,数据配比并非简单堆量,而是始终围绕"谁在说话、什么时候发生、声画如何对应"这三个具身交互的核心问题来设计。
公开数据远远不够——通用音视频数据缺少交互轮次、响应时机和动作表情的时序标注。智元为此自建了以人为中心的大规模全模态数据集,来源覆盖三类场景:带同步语音和动作标注的人机交互视频、机器人遥操作过程中的第 一人称传感器数据,以及通过半自动流水线将原始视频转化为带说话人、事件区间和指令标注的监督样本。这套数据让模型直接学习"什么时候该开口、对谁说、怎么配合动作",绕过了传统方案中多个模块靠人工规则拼接的环节。
后训练阶段,WITA-Omni采用了SFT监督微调、OPD同策略蒸馏和RL强化学习三阶段策略。OPD的巧妙之处在于让同一个模型同时扮演老师和学生——老师端获得额外的时间区间和目标对象等"特权信息"来生成高质量答案,再将能力蒸馏回不依赖特权信息的学生端。RL阶段则用GRPO算法重点优化交互决策,奖励信号覆盖"回答正确、时机匹配、对象选对、是否主动触发"等多个维度,让模型不仅知道答什么,还学会判断什么时候该说、什么时候该等。
语音交互登顶与"三智一体"落地
在语音交互这一同样关键的维度上,WITA-Omni的表现同样突出。在国际评测Artificial Analysis的Speech Arena所采用的Big Bench Audio(语音推理)和Full Duplex Bench(全双工对话)两个基准上,WITA-Omni均取得第 一,超越了GPT-Realtime等闭源商用模型。全双工对话要求模型同时听和说、实时判断语轮切换,是语音交互中公认的高难度环节,WITA-Omni在这项能力上的领先意味着它能在真实对话节奏中做到该说时说、该停时停、被打断后自然衔接,而不是像很多离线评测表现优秀的模型那样,一进入真实对话就暴露出停顿犹豫或插话混乱的问题。
WITA-Omni此次登顶,与智元此前的另一项成绩形成了呼应。不久前,智元自研的世界模型Genie Envisioner-Sim 2.0在WorldArena的"世界模型感知与动作响应"赛道拿下总分第 一。两次登顶分别对应机器人的两大核心能力——理解物理世界和与物理世界交互。在智元的战略版图中,运动智能提供物理载体的执行能力,作业智能让机器人自主完成劳动任务,交互智能则让机器人提供有温度的服务——三者共同构成了"三智一体"的技术底座。
2026年被行业视为具身智能从开发态迈向部署态的关键拐点。机器人开始走进产线、门店和家庭,真正创造生产力。在这个节点上,交互智能的质量直接决定了用户对机器人的接受度——用户不会关心模型有多少参数,但一定会感受到"这个机器人说话像不像人"。WITA-Omni的登顶,让智元在"既有本体、更有AI"这条路上,拿到了一个可验证的能力证明。