2026外滩大会探讨世界模型技术路径与商业化挑战
王俊勇 2026-09-13 00:38
财π新闻 世界模型正成为AI从虚拟走向物理世界的关键基础设施,通过理解物理规律、空间推理与动态交互,有望推动自动驾驶和通用机器人等具身智能的突破。目前英伟达、Meta、生数科技等企业纷纷布局,推出了Cosmos、代码世界模型、Motus2等产品与架构,加速技术演进。
世界模型是理解现实世界动态的生成式AI模型。它能基于文本、图像、视频和运动等输入数据,预测未来状态并生成虚拟世界视频,使AI具备空间想象和常识推演能力。这种能力是机器人在新场景中处理通用任务和理解物理世界的关键。世界模型填补的不只是生成高清画面的产品缺口,而是AI缺少物理推演、虚拟试错、行动规划能力带来的能力空窗。它带来最重要的时间价值,智能体不必全部在真实世界试错,可在内部虚拟世界完成海量推演、试错规划,降低实体环境下试错成本与风险。
当前技术路径以视频生成为主,但存在物理理解不足和商业化挑战。专家普遍认为视频生成不等于物理理解,模型在抓取结构化记忆和持续自我进化方面存在短板。此外物理AI容错率极低,商业闭环尚未打通。世界模型的发展路径可划分为生成模拟世界、实时空间交互、物理动作决策、自主世界智能体和多体世界组织者五个阶段。
目前世界模型尚未形成统一最优技术范式,产业内分化出六大主流技术方向,分别为JEPA架构、AI原生物理仿真、3D世界模型、视频生成式世界模型、基于强化学习的世界模型、面向反事实推理的世界模型。整体可以归纳为显式与隐式两大技术流派,路线取舍直接决定适配场景。一类是显式物理派,代表项目包含NVIDIA Cosmos、World Labs Marble、腾讯混元3D。该路线优先保证几何、力学结果精准,以仿真为核心。短期重点优化算力使用效率,中长期走向仿真加数据混合驱动模式,更适配智能驾驶、数字孪生等对物理精度要求高的场景。另一类是隐式学习派,Meta V-JEPA、Being-H系列、Dreamer系列属于该路线。不去硬编码物理公式,而是从海量真实世界数据中学习物理运行规律,更适配人形机器人这类复杂具身任务。不同路线各有长短,JEPA架构不追求像素级画面重建,重点学习世界表征预测;3D世界模型依托NeRF、3D高斯溅射构建空间几何表达;Dreamer源自基于模型强化学习,原生面向机器人控制;视频生成路线画面表现力突出,但物体交互、物理一致性仍然存在短板。没有一条路线能够通用于全部场景。仿真优先方案工业价值突出,但成本高;数据驱动隐式路线泛化能力强,却容易出现物理规则错乱。产业参与者需要根据自身场景做技术选型,而非单纯追逐某一类热点技术。
2026年1月6日,英伟达发布了Cosmos世界模型平台,旨在赋予机器人类似人类的推理与世界生成能力。Cosmos Reason拥有70亿参数,依托其记忆和对物理原理的理解,赋予机器人和AI智能体推理能力,使其能够作为规划模型,推断具身智能体接下来可能采取的步骤。Cosmos Reason模型专为物理AI应用和机器人设计,可用于数据策划、机器人规划和视频分析,Cosmos Reason能够使机器人和AI具身代理像人类一样推理,并在真实世界中采取行动。Cosmos Reason能够作为机器人的大脑,负责有意识、条理化的决策。2026年6月1日,英伟达在GTC台北主题演讲中正式发布Cosmos 3物理AI世界基础模型,该模型是一款全新且位居排行榜首位的开放物理AI基础模型,基于突破性的混合Transformer架构所构建,适用于物理AI推理、世界仿真和动作生成。Cosmos 3是全球首款完全开放的全模态模型,具备原生视觉推理和跨文本、图像、视频、环境音和动作的多模态生成功能,可用于前沿的合成数据生成和物理AI策略模型开发。该模型的混合Transformer架构将推理Transformer与专家生成Transformer相结合,从而使Cosmos 3能够在生成视频和动作轨迹前,完成对对象交互、运动及时空关系的解析。该模型在最大型的多模态物理AI数据集之一上进行训练,包括数十亿条文本、图像、视频、声音和动作轨迹样本,为开发者提供了强大的预训练基础,助力其以更少的数据和更低的训练成本。Cosmos 3覆盖云端到边缘全场景部署,可支撑机器人仿真训练、数字孪生、物理交互推理等多类任务,同时推出两个不同参数规模的版本,Cosmos 3 Nano拥有16B参数,适用于工作站推理,Cosmos 3 Super拥有64B参数,适用于数据中心部署。英伟达同时宣布成立NVIDIA Cosmos Coalition,这是世界模型构建者与AI开发者的全球协作组织,成员包括Agile Robots、Black Forest Labs、Generalist、LTX、Runway和Skild AI,旨在共同推动下一代世界模型发展。英伟达创始人兼首席执行官黄仁勋表示,得益于多模态推理语言、视觉和世界模型领域的多项突破,物理AI爆发的时代已近在眼前。Cosmos 3系列开放前沿全模态模型,助力开发者在构建机器人、智能汽车和视觉AI方面实现了代际飞跃,使其能够在物理世界中完成感知、推理、规划并采取行动。同期英伟达还推出NVIDIA Isaac GR00T人形机器人参考平台,整合宇树H2 Plus人形机器人、Sharpa五指灵巧手与Jetson Thor计算平台,配套完整开源软件栈,面向学术与产业开发者开放。2026年3月16日,英伟达发布全新NVIDIA Cosmos世界模型、NVIDIA Isaac仿真框架以及NVIDIA Isaac GR00T N系列模型,加速迈向智能机器人时代。全球物理AI领域的领导者,包括机器人大脑开发商、工业与手术机器人巨头、人形机器人先锋企业,如ABB Robotics、智元机器人、Agility、CMR Surgical、FANUC、Figure、Hexagon Robotics、KUKA、Medtronic、Skild AI、Universal Robots、World Labs及YASKAWA,正基于NVIDIA技术,大规模开发并部署物理AI。全球机器人装机量超200万台的FANUC、ABB Robotics、YASKAWA和KUKA正将NVIDIA Omniverse库与NVIDIA Isaac仿真框架集成至其虚拟调试解决方案中,旨在通过物理精度的数字孪生技术,开发并验证复杂的机器人应用乃至整条生产线。为了在生产线上实现高阶智能,这些企业正在将NVIDIA Jetson模块集成到其控制器中,以实现边缘端的实时AI推理。2026年6月,英伟达先后与SK海力士、LG集团、斗山集团等韩国企业深化合作,围绕机器人领域整合Isaac Sim仿真平台、Cosmos世界模型与Jetson边缘算力。
Meta首席AI科学家杨立昆一直对传统的生成式AI持保留态度,他认为预测每一个像素是低效的。他主导开发的世界模型如V-JEPA系列,主张AI应该学习世界的抽象表征,理解事物之间的因果逻辑,而不是死磕画面细节。最新发布的Meta V-JEPA 2,证明了AI可以在不生成具体像素的情况下,通过填空游戏来预测视频中缺失的部分。这种基于抽象掩码的训练方式,让模型学会了推理物体的运动轨迹和相互作用,而不是简单地记忆纹理。Meta正在构建一种分层的世界模型,让AI像人类一样进行层级规划。最新的实验显示,这种模型能够让机器人在面对从未见过的任务时,通过内在的逻辑推演找到解决方案,而不是依赖海量的训练数据。这一流派的目标是赋予AI常识,他们相信,只有当AI理解了世界的运作逻辑,才能真正实现自主智能,而不是做一个只会模仿的鹦鹉。
9月10日下午,在香港大学计算与数据科学学院主办、香港大学上海智能计算研究院协办的一场2026 Inclusion·外滩大会见解论坛上,来自高校与企业的嘉宾围绕世界模型的能力边界、技术路径及商业化挑战展开交流与探讨。香港大学计算与数据科学学院创始院长马毅在开幕演讲中表示,三维与四维世界感知和建模是计算机视觉领域的核心研究问题。如今的世界模型已超出传统三维重建、物体识别的范畴,指向机器人在开放物理环境中感知、认知、学习与价值创造全过程。生数科技联合创始人兼CEO骆怡航发表题为《在行动前,看见未来:从世界模型第一性原理出发》的主题演讲。他提出,界定世界模型核心能力的关键,在于能否形成理解、想象、行动的完整闭环。基于这一核心逻辑,生数科技提出通用世界模型从L1到L5的五级演进路线,依次为生成模拟世界、实时空间交互、物理动作决策、自主世界智能体、多体世界组织者。论坛现场,骆怡航正式发布面向机器人灵巧操作的自进化通用世界模型Motus2。他表示,灵巧操作是世界模型进入物理世界的严苛考验,Motus2探索的正是从L3在世界中行动走向L4自主世界智能体的关键跨越,让模型具备自主评估、改进行动的闭环能力。生数科技从视频生成模型Vidu起家,2026年把积累迁移到通用世界模型,提出MoT统一架构,将理解、预测、生成、行动塞进同一个基座。生数科技首席执行官骆怡航表示,如果要叫世界模型,它得配得上这个世界模型的称号,一定是要刻画人与世界的交互规律,同时能驱动人去跟数字世界和物理世界打交道的。
大晓机器人董事长、商汤科技联合创始人兼执行董事王晓刚介绍了开悟世界模型理解、生成、预测的一体化架构,通过理解模块判断环境与任务状态,通过生成模块推演不同动作的潜在后果,再通过预测模块支撑机器人实时控制,三种能力协同形成自我反馈闭环。大晓机器人把开悟世界模型3.1定义为端侧驱动本体的行动一体化世界模型,用混合Transformer把视觉、语言、力触、轨迹压进统一隐空间,直接奔着家庭、零售、酒店等真实场景而去。王晓刚直言,数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆真实损失。这意味着,必须在架构层面内建物理推演和因果推理能力。香港科技大学讲席教授、物理AI研究中心主任郭嵩提到,视频生成模型本质上是渲染器,能根据描述生成逼真画面,属于对物理世界的被动观察,但缺乏与环境的互动能力。具身智能要求模型不仅能模拟物理世界,更要能改变物理世界,即根据当前状态与目标状态,直接输出符合物理规律的动作,如速度、加速度、力反馈等。
世界模型最适合试错代价高和数据获取成本高的场景。在家庭环境中,任务多变需要模型快速适应,需求最强。在部分工业任务中,由于数据采集和环境重置成本高,世界模型能有效降本增效。对于普通抓取等低试错成本场景,未必需要高频调用。报告将世界模型落地场景归纳为四大方向,分别为具身人形机器人、自动驾驶、元宇宙数字世界、生命科学仿真。但从原型Demo走向真实业务落地,行业仍要直面若干共性工程难题,具身智能领域普遍缺少完整的端到端技术底座,高质量物理交互数据获取成本居高不下;世界模型推理算力开销大,模型向端侧硬件迁移落地难度高;Sim2Real虚实迁移鸿沟长期存在,仿真推演结果很难无损复现在真实硬件上;数字孪生赛道中,大量历史沉淀的2D空间数据难以快速转化为可用的三维表征资产。国内一批创业企业正针对上述痛点输出对应解法,部分企业完成世界动作模型预训练,成本远低于显式世界模型。同时迭代的Being-H-Flash版本完成端侧推理专项优化,适配多款国产算力硬件。围绕行业棘手的Sim2Real虚实迁移难题,机器科学RoboScience推出全栈自研RoboMirage物理仿真引擎,落地EaaS具身智能即服务模式,缩小仿真环境与真实物理世界之间的效果偏差。面向城市、工业数字孪生大量存量2D数据改造的现实需求,飞渡科技依托峥嵘大模型推进相关适配工作。
海外阵营路线分化明显,英伟达推出开源全模态Cosmos系列,主张用大规模视频数据为物理AI提供基础模型;DeepMind的Genie 3把可交互世界生成推向新高度;李飞飞创办的World Labs以Marble切入空间智能;特斯拉则优先把筹码压在机器人本体的行动能力上。而在主流的大模型与机器人公司之外,脑机接口企业正在开辟一条截然不同的路径。强脑科技这家最早以非侵入式脑机接口起家的公司,如今已经把触角伸向了具身智能。在WAIC现场,诸多媒体前去拍摄仿生手的使用,它形态逼真、手感与皮肤无异,甚至离开身体仍能实现远程操控。其原理是通过传感器捕捉大脑控制手指的信号,再转化为仿生手的动作指令。强脑科技内部人士透露,公司之所以从脑机接口延伸做机器手,是因为脑机只能做信号传输,没有落地反馈,但具身智能可以把反馈体现出来,这条从意念到动作再到反馈的闭环,恰恰为世界模型提供了一种全新的训练数据形态。
(编辑:吕文)
快讯
- 新韩金融(SHG.US)成韩首家接入Visa稳定币平台机构 股价收涨3.48%
- 瑞银高管警示市场波动风险 子公司瑞银基金拟关停业务
- 管理65亿美元资产 RBC BlueBay日本股票基金经理离任
- 黑石拟数倍扩容TPU采购 谷歌-C商业化路径再获确认
- 恒安国际(HEGIY)经营变量待观察 债务扩张引市场聚焦
- 亿航智能撤回6亿年度收入指引 股价较2021年高点累跌近96%
- 民生银行(CMAKY)上半年营收微增净利降8.62% 拟派中期分红超51亿
- 天演药业(ADAG)完成合作节点 确认到账200万美元合作资金
- 大新金融(00440.HK)敲定派息节奏 9月24日发放1.2港元中期股息
- 以太坊储备概念热度消退 聪链集团成交缩量流动性承压

购物车