昆仑世界模型荣获全球榜单亚军、图像质量单项冠军
来源:北京亦庄 时间:2026.09.02

近日,具身智能领域的权威评测WorldArena 2.0 Track 1发布最新成绩,北京亦庄企业昆仑行机器人研发的昆仑世界模型GeWu,以69.58分的成绩,斩获图像质量(Image Quality)单项冠军,同时以65.91的综合得分,获得全球榜单亚军。

作为世界模型赛道的权威评测基准,WorldArena由国际顶尖高校及科研机构联合共建。WorldArena 2.0在1.0的基础上进一步构建全面基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的WorldArena Track 1赛道,聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的能力,突出模型在物理因果上的合理性。

昆仑行机器人致力于打造通用AI机器人,坚持“本体+大脑”双轮驱动,构建本体、数据、小脑、大脑、智能体五位一体的全栈自研体系。该企业将物理因果视为具身智能的第一性原理——不是模仿动作,而是理解世界。因此,物理因果也成为昆仑世界模型架构设计的基本原则。

不同于业内主流的按照“文本归文本、视觉归视觉、动作归动作”的模态拆分方式,昆仑世界模型按因果图中的角色语义,将模型拆为三座参数独立的Transformer塔(Tower)。通俗来说,就是让模型各层级分别负责实现“要做什么”“怎么做”和“做了之后会发生什么”。

此外,面对长时序视频生成的需求,昆仑行机器人研发团队将长视频拆分为多个片段逐段生成。为克服后续片段的上下文缺失挑战,昆仑世界模型还引入了仿生记忆采样策略——模仿人类记忆的衰减规律,近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留任务全局进度,最终让模型在所有生成阶段都能准确感知物理时间位置,并灵活控制动作节奏。

昆仑行机器人模型研发负责人郝志会博士表示:

“在研发昆仑世界模型过程中,我们反复验证了一个核心判断:世界模型的架构设计应当尊重物理世界的因果结构。目的驱动行动,行动产生结果,这条因果链不仅是人类理解物理世界的基本框架,也应当成为模型架构的第一性原理。接下来,研发团队将在更复杂的任务场景中持续验证和扩展模型能力,并将昆仑世界模型应用于行为规划和仿真强化,推动世界模型从视觉渲染器进化为真正的物理智能基座,加速通用AI机器人的落地应用。”


上一条
下一条