交互式世界模型长时评测基准发布设十五项指标揭示模型能力短板

交互式世界模型长时评测基准发布设十五项指标揭示模型能力短板

财π新闻 高德联合南京大学、清华大学、北京大学共同发布交互式世界模型评测基准WorldRoamBench,该基准包含1000余个长时漫游样例,覆盖第一与第三人称视角及室内、自然、城市等开放域场景,通过10至60秒连续交互模拟真实漫游体验,为交互式世界模型的长时交互能力评估搭建起全新的专业框架。

当前交互式世界模型领域发展迅速,各类前沿模型不断涌现,已经能够基于图像、文本或控制信号生成高质量动态场景,但在真实漫游任务的落地过程中,行业长期面临评测体系适配性不足的问题。过往多数评测方案的设计逻辑,大多聚焦5到10秒的短片段内容,或是仅设置有限轮次的交互环节,这类评测模式的局限性十分明显,很难充分暴露模型在分钟级长时交互过程中逐步显现的各类失效问题,包括长时运行过程中出现的画质崩坏、动作漏响应、物理规律失守等核心缺陷。很多时候,一段从整体轨迹上看似完整合理的漫游过程,背后可能隐藏着大量未被发现的问题,比如模型中途多次漏掉用户的操作指令、画面运行到一定时长后突然出现崩坏、生成内容完全违背基础物理规律,或是用户重访此前经过的场景时,场景结构已经发生完全不符合逻辑的变化。如果评测仅给出一个笼统的总分,模型出现失效的具体原因就会始终处于黑盒状态,行业无法精准定位模型的能力短板,也难以针对性开展技术优化。WorldRoamBench的推出,率先填补了长时交互系统评测领域的空白,打破了过往评测体系无法适配长时交互场景的行业瓶颈。

为了实现对交互式世界模型长时漫游能力的全面、精准评估,WorldRoamBench构建了一套覆盖动作、视觉、物理和记忆四个核心维度的完整评估体系,全体系共设置15个细分指标,每一个维度的评测设计都针对过往评测方案的盲区进行了针对性优化,确保能够穿透表层的正确结果,挖掘出模型运行过程中隐藏的各类问题。在动作维度的评测设计上,评测方案不再仅关注最终的整体动作轨迹是否符合预期,而是采用逐帧检查控制响应的方式,对模型每一次接收到用户操作指令后的反馈情况进行逐一核验,这种设计能够精准发现过往轨迹级评测完全无法识别的局部漏响应和方向错误问题。在实际的交互场景中,经常会出现这样的情况:用户全程输入前进指令,模型生成的最终整体轨迹看起来和预期基本一致,但在运行过程中却多次出现反向后退的错误响应,这类局部的动作遵循错误完全被最终的正确轨迹所掩盖,无法通过传统的轨迹对齐评测方式被发现。不同模型的动作幅度本身并不统一,单纯依靠轨迹级指标很容易掩盖局部的延迟、误响应和方向错误,而对于交互式世界模型的实际使用体验而言,重要的不只是最后模型将用户带到了哪个位置,更是每一次用户输入的操作指令都能得到及时、准确、连续的反馈,逐帧检查的评测方式完全贴合真实用户的实际交互体验,能够精准衡量模型的动作跟随能力。

在视觉维度的评测设计上,WorldRoamBench将评估重点放在长时生成过程中的画面漂移和结构坍塌问题上,不再局限于单帧画质和美学表现的简单打分,而是通过分段式的漂移指标设计,追踪长序列生成过程中出现的各类非单调退化现象,包括长时间生成过程中逐步出现的颜色变化、模糊累积、结构坍塌等问题,这类问题往往不会在生成序列的起始和结束对比中被发现,而是在序列运行到中段时逐步显现,传统的短片段评测完全无法捕捉这类长时视觉稳定性缺陷。很多模型在短时间生成的画面中能够保持极高的画质水平,但随着交互时长的不断增加,画面质量会出现不可逆的持续退化,最终出现完全崩坏的情况,这类问题在过往的短片段评测中几乎不会被暴露出来,而WorldRoamBench的长时视觉追踪设计,能够完整记录整个10至60秒交互过程中的视觉变化情况,精准定位画面开始出现漂移和退化的具体时间节点,量化评估模型的长时视觉稳定能力。

在物理维度的评测设计上,WorldRoamBench引入了可控性门控机制,通过这套机制可以清晰区分动作执行失败和物理规则失效两类不同的问题,避免两类问题相互干扰导致评测结果出现偏差。该维度的考察范围覆盖碰撞、穿模、形变、地形跟随、反射、阴影及3D一致性等各类与物理规律相关的现象,全面考察模型生成的虚拟世界是否符合基础物理运行逻辑。过往的评测方案中,经常会出现将模型没有正确响应用户操作导致的穿模现象,误判为模型物理能力不足的情况,可控性门控机制的引入彻底解决了这一问题,只有在模型准确执行了用户输入的动作指令的前提下,才会对后续生成内容的物理合理性进行评估,确保物理维度的评测结果完全反映模型本身的物理规律遵循能力,不会受到动作响应问题的干扰。

在记忆维度的评测设计上,WorldRoamBench采用3D点云重建的方式,对模型的视频幻觉率与场景结构保持能力进行量化评估,同时结合SAM2跟踪与视觉语言模型推理,全面评测场景结构、空间布局、主体外观与状态的保持能力。该维度的评测采用动作解耦的协议设计,避免动作变化对记忆能力评估产生干扰,重点考察模型在长时漫游过程中,是否能够始终记住此前生成的场景空间结构,不会出现后续生成的内容和此前的场景完全脱节的情况,也不会出现同一物体在不同时间段的外观、属性发生无理由突变的幻觉问题。很多模型在短时间的交互过程中能够保持场景的一致性,但随着漫游范围的不断扩大,很容易出现空间布局混乱、物体身份错乱的问题,记忆维度的评测能够精准量化这类问题的出现概率,衡量模型在长时交互过程中的长期记忆保持能力。

依托这套完整的四维评测体系,WorldRoamBench在1000余个开放世界长时样例中对多款主流交互式世界模型进行了统一测试,覆盖第一、第三人称视角及自然、城市、室内等多类场景,同时通过差异化的任务设计,进一步减少动作、物理和记忆不同维度之间的相互干扰,确保每一项评测结果都能精准反映模型对应维度的真实能力水平。最终的评测结果显示,目前行业内没有任何一款模型能够在所有维度上同时保持领先,不同模型在不同能力维度上各有优劣,视觉质量、动作可控性、物理一致性与记忆能力之间存在明显的阵营区分,没有出现能够覆盖所有能力要求的“全能冠军”级模型。从最终的榜单结果来看,在第一人称综合榜中,Genie3、Lyra2.0和HappyOyster分列前三,而在第三人称综合榜中,HappyOyster位列第一,Genie3紧随其后。但综合排名的结果并不能掩盖不同榜单模型存在的分项短板,几乎所有上榜的模型都存在明显的能力偏科情况,以Genie3为例,该模型在第一人称场景的记忆与物理表现均位居第一,但其动作遵循和视觉质量的排名仅分别为第八和第九,不同维度的能力表现存在十分显著的差距。

WorldRoamBench的推出,为整个交互式世界模型行业提供了统一的长时能力评估标尺,所有的评测过程和指标设计都完全围绕真实落地应用的实际需求展开,试图回答行业长期关注的核心问题:世界模型能否通过长时交互的终极考验,在持续的交互过程中始终遵循用户动作指令和基础物理规律,同时保持视觉内容的一致性与长期场景记忆能力。该基准已经完成对10余个前沿交互式世界模型的评测工作,评测范围全面覆盖开源模型与闭源产品,完整呈现出当前行业的整体能力分布情况,同时配套设置了公开积分榜,用于持续追踪不同模型在世界漫游任务中的能力进展,为行业的技术迭代提供公开、透明、可量化的参考依据。

(编辑:吕文)