World Labs发布全球首个多模态世界模型Atlas
科技专栏 2026-09-03 00:34
财π新闻 2026年9月2日,由李飞飞创立的World Labs正式发布全球首个多模态世界模型Atlas,该模型被业内称为全能世界模型,能够将数张原本毫不相干的照片拼接整合为连续的三维空间,生成分辨率达1440p的视频,同时具备按给定机位生成视频、依托少量照片完成场景重建等多项核心功能,标志着空间智能领域的技术探索迈出了关键一步。作为World Labs面向空间智能方向推出的核心成果,Atlas从底层架构到应用逻辑都与当前主流的生成类模型形成了明确区分,其技术路径的创新点覆盖了从数据输入到最终输出的全流程环节,为多个相关产业的技术升级提供了全新的可能性。
Atlas在底层架构层面采用了多模态自回归扩散Transformer架构,打破了传统模型以纯文本作为核心上下文的常规设计,转而将文字、图像、深度数据以及相机位姿全部统一纳入同一空间上下文当中,所有输入信息都会被锚定在三维空间的精确位置上,附带对应的相机位姿与深度信息,从训练的初始阶段就实现了多类数据的统一融合处理。这种架构设计既借鉴了大语言模型的KV Cache等推理优化机制,也保留了扩散模型的采样蒸馏与引导算法优势,能够在生成内容的过程中始终维持三维空间层面的几何一致性,不会出现不同视角下场景结构相互矛盾的问题。不同于传统子弹时间特效需要部署数十台甚至上百台相机组成庞大阵列才能实现的物理限制,Atlas仅需3到5台普通手机或者运动相机采集稀疏视角的画面,就可以通过模型自身的推理能力生成所有未被拍摄覆盖的区域,完整还原出连贯的空间效果,大幅降低了这类特效的实现门槛。
当前市场上主流的视频生成模型,大多依赖提示词在二维像素层面对运镜效果进行推演,用户只能通过“镜头推进”“向左平移”这类概略性的文字指令来间接控制画面生成,最终输出的内容往往难以完全匹配预期的镜头轨迹,也无法保证不同帧之间的空间逻辑连贯。而Atlas直接将摄影机位姿作为原生几何输入参数,用户可以直接设定虚拟摄影机的具体位置、角度以及完整的移动轨迹,在神经网络内部直接构建出具有连续性的三维世界,所有后续的视频生成都基于这个已经搭建完成的三维空间展开,而非在二维像素层面进行拼接推演。这种设计带来的直接效果是,摄影师在常规拍摄工作结束之后,不需要进行二次实地拍摄,就可以自由切换任意视角,凭空生成原始素材中完全不存在的俯瞰视角或者特定细节特写,实现了类似相关开放世界作品中事后进入凝固时空自由移动镜头的体验,整个过程不需要额外的物理拍摄设备介入,仅通过少量前期采集的素材就可以完成复杂的镜头效果创作。
在模型推断运行的过程中,Atlas除了能够输出常规的视频像素内容之外,还可以同步导出稠密深度图、三维点云以及3D Gaussian Splat数据,直接生成可以支持实时渲染的数字孪生空间,不需要再经过额外的格式转换或者二次建模处理。这一特性为具身智能和人形机器人领域提供了低成本、规模化的训练与评测环境,打通了从真实场景采集到仿真环境构建再到真实场景落地的完整闭环,有效解决了过往真实机器人训练过程中试错成本过高的行业瓶颈。此前为机器人建立真实场景的数字模型,通常需要使用激光雷达、深度摄影机等专业扫描设备,不仅采购成本高昂,数据采集的过程也十分耗时,而依托Atlas的能力,仅需要输入少量普通拍摄的照片,就可以快速重建出对应的三维空间,同时生成机器人沿不同路径移动时其传感器所能获取的拟真RGB影像以及深度数据,直接供给机器人的训练与测试环节使用,大幅降低了机器人仿真环境的搭建门槛。
在公开的测试数据表现上,Atlas在稀疏视角重建任务中表现突出,在DTU公开数据集上的重建误差为25.3‰,绝对相对误差为8.6,优于多个专门用于三维重建的开源模型,相关表现超过了Pi3X、VGGT-Ω 1B等多款主流专用模型。在官方展示的实际案例中,Atlas仅用2至25张地面拍摄的普通照片,就完成了斯坦福大学主方庭的三维重建工作,并且生成了对应的高空俯瞰飞行路径视频,完整还原了整个场景的空间结构细节。在人类评分偏好盲测中,Atlas的表现也全面领先多款主流生成模型,面对MiniMax H3的用户选择胜率达到75%,面对Gemini Omni Flash的胜率为81%,面对FLUX 3的胜率达到93%,面对Seedance 2.5的胜率更是达到94%,在视觉效果的一致性和真实度层面获得了更高的认可度。
除了核心的视频生成与三维重建能力之外,Atlas还支持依据文本生成图像以及360°全景图,兼顾了指令遵循的精度与视觉风格的多样性,能够跟随复杂的提示指令精准渲染指定文字内容,同时生成覆盖不同类型的丰富视觉风格,适配不同场景的创作需求。World Labs官方将Atlas定义为从头开始预训练的多模态模型,能够将多源输入统一转化为规范的3D视图,相关能力覆盖世界生成、重建和模拟的多个核心任务,其中相机控制生成功能支持1至6张输入图像生成最长1分钟、分辨率达1440p的视频,空间重建功能支持1到上百张输入图像生成新视角画面和显式三维输出,时空模拟功能支持从普通手机拍摄的视频中完成空间建模,实现视频的重新构图与机器人仿真工作流。
World Labs长期以来始终致力于探索空间智能领域,其核心目标是教会电脑理解三维空间中的物理规律与几何关系,推动将各类创作工作从沉重的物理设备限制中彻底解放出来的技术跃升。为了支撑相关技术的持续研发落地,公司已于2026年2月完成总额达10亿美元的新融资,又在同年7月完成了对机器人与仿真公司SceniX的收购,进一步补齐了在仿真领域的技术积累,为Atlas的后续迭代和落地应用打下了坚实基础。目前Atlas处于早期访问阶段,仅向部分合作伙伴开放使用权限,后续该模型将作为核心底层技术,驱动World Labs旗下Marble等相关产品的迭代升级,为影视特效创作、3D内容生成、游戏开发、AR/VR等多个领域提供底层技术支撑,改变传统依赖专业扫描设备的建模流程,进一步降低复杂运镜与特效制作的行业门槛。
(编辑:吕文)
快讯
- 三绿科技披露创业板IPO首轮问询回复 涉技术先进性及成长性等
- 大学新生消费趋于理性:推迟购数码设备且精打细算规划开支
- 拼多多(PDD)股价短期波动 战略落地与监管动态成关注焦点
- 大自然药业锚定银发经济赛道 将固本延龄丸列为战略大单品
- 南茂科技(IMOS)大幅上调资本开支,封测行业进入量价上行周期
- 宝尊电商(BZUN)Q2营收利润双增 2028年经营利润目标上调
- 信也科技(FINV)上半年营收34亿净利4.3亿 规模收缩下需盯紧股价与回购
- 陆金所控股(LU)港股复牌推进中 二季度亏损收窄成效待考
- 搜狐(SOHU.US)公布2026年Q2财报 三季度游戏收入指引大幅下滑
- 汽车之家(ATHM)抛4亿美元ADS回购方案 二季度营收同比回落

购物车