具身智能产业竞争转向认知大脑,世界模型待解数据与成本瓶颈
科技专栏 2026-08-23 14:41
财π新闻 机器人产业发展至今,移动能力相关技术已经发展得较为成熟,当前行业面临的真正难点,集中在依赖手、眼、脑协同的复杂操作能力层面。从A点移动到B点的移动任务,与拧开一个瓶盖、处理各类复杂物体的操作任务,并不是同一类技术问题,后者最终需要依托手的灵巧性与触觉感知、眼的环境感知能力、脑的模型与数据持续迭代能力三者的深度协同才能完成。当机器人产业从“会动”的基础阶段逐步走向“能干活”的实用阶段,整个产业的竞争重心也开始从单纯的本体能力比拼,进入到对智能核心能力的争夺当中,世界模型正是在这样的产业发展背景下,被推到了技术研发与产业落地的前台位置。
世界模型的核心目标,是解决物理智能领域的核心问题,这一技术方向要求机器人不仅要具备足够的泛化能力,还要能够理解物理世界的底层逻辑,清晰理解任务本身的核心要求,以及自身做出的动作将如何改变周边环境,最终实现从简单的“会做”到理解“为什么这么做”的关键跨越。当前行业主流的模仿学习范式,过度依赖大量数据训练形成类似肌肉记忆的执行能力,缺乏对底层物理逻辑的深度理解,对应的泛化能力也存在明显短板,世界模型这一技术方向,正是为了突破模仿学习范式的这一核心限制而生。
当前机器人可以被训练完成越来越多不同类型的任务,但技能数量的增加,并不天然等同于机器人的智能水平得到了实质性提升。行业内相关从业者将当前物理智能面对的问题拆成了几个清晰的层面,首先是泛化能力层面,也就是当周边环境或者任务本身发生改变之后,机器人还能不能顺利完成同一件事;其次是对物理规律的深度理解能力;进一步延伸,则是机器人能否真正理解任务本身的核心目标。在过去依靠规则设定、固定路径规划或者模仿学习搭建的系统中,交互对象和任务边界都处于相对确定的状态,一旦周边环境稍有变化,甚至只是更换了机器人本体,原本已经训练完成的能力就可能直接失效。
以VLA为代表的以模仿学习为基础的技术范式,很大程度上依赖足够的数据量和合理的数据分布,才能形成类似“肌肉记忆”的执行能力,而对于物理世界底层逻辑的深度理解,以及由此产生的跨场景泛化能力,仍然面临诸多尚未突破的技术挑战。世界模型重新受到行业的高度重视,一个重要原因正是产业界希望突破模仿学习范式的这一核心限制。世界模型真正需要解决的问题,不光是提升机器人的泛化性,还包括推动机器人完成对物理世界本身的深度理解,就像人类完成各类操作的逻辑一样,人类不是单纯依靠重复训练学会做事情,而是以理解物理规律的方式去完成各类操作任务。
世界模型被行业视为物理智能的核心技术之一,机器人也被看作是人工智能进入物理世界的重要闭环场景。如果说过去机器人企业争夺的核心指标,是一台机器能够掌握多少种不同的动作,那么押注世界模型的技术路线,瞄准的是另一种完全不同的核心能力:机器人不仅要知道“怎么做”,还要清晰知晓自己做出的动作会怎样改变周边环境,并据此自主决定下一步的执行路径。这意味着下一阶段的产业竞争,未必只是机器人掌握的技能数量的简单增加,一个只能在预先设定的训练环境中完成固定任务的机器人,即使掌握再多的动作类型,也不意味着它已经获得了通用作业能力。
如果机器人真的要实现对物理世界的深度理解,它所依托的学习数据来源,是整个产业必须直面的核心问题。与大语言模型可以直接利用互联网长期积累的海量文本数据不同,具身智能相关的数据必须从真实的物理交互过程中产生。机器人完成拧一个瓶盖的简单动作,需要记录的信息可能不只是普通的视频内容,手在三维空间中的具体位置、物体状态的实时变化、接触过程中产生的力反馈,以及视觉和触觉信息能否在时间维度上实现准确对应,所有这些细节都会直接影响模型最终学习到的内容质量。
不同机器人本体的硬件差异,让数据相关的问题变得更加复杂。不同机器人使用的相机视场角、帧率、触觉设备配置都存在明显区别,如果A机器人采集的数据不能被B机器人直接使用,每家企业都必须围绕自己的设备重复完成数据采集和模型训练工作,数据规模的扩大并不必然带来单位采集成本的下降。因此具身智能当前阶段缺乏的不只是更多数量的数据,更缺乏标准化、可迁移的高质量数据。当前具身智能领域不同机器人本体硬件差异巨大,采集得到的数据难以跨设备直接使用,直接导致数据采集成本长期处于高昂状态。
视觉感知等硬件领域的企业,正从单纯售卖硬件产品的传统业务模式,向搭建数据基础设施的方向延伸,试图建立覆盖数据采集、统一接口与行业标准的长期业务黏性,不同市场主体之间围绕数据入口的争夺,正成为直接影响模型训练效率的关键因素。具身智能产业当前已经形成一套完整的全栈技术体系,覆盖环境感知、认知决策、运动执行、硬件载体与仿真数据支撑五大核心环节,构建起“感知-理解-规划-执行-反馈”的完整物理交互闭环,这也是人形机器人、工业通用智能体能够实现自主作业的底层基础。
感知层面,行业已经完成从被动图像采集向主动多模态感知的技术迭代,设备搭载RGB-D深度相机、激光雷达与4D毫米波雷达协同工作,依托神经辐射场、3D高斯溅射技术完成室内、工业场景的实时三维重建,纯视觉方案也借鉴自动驾驶感知逻辑,依靠多目相机实现无雷达环境建模,配合实例分割算法完成物体定位、材质识别。为满足精密操作的需求,六维力传感器与分布式柔性触觉阵列成为行业标配,能够捕捉抓取过程中的摩擦力、物体细微形变,并通过多源时序融合框架对齐视觉、触觉、惯性单元、音频多维度数据,缓解暗光、反光、物体遮挡带来的识别失效问题,为手眼协同作业提供毫米级的感知基准。
认知决策大模型是区分传统自动化设备与具身智能的核心分水岭,当前行业主流采用VLA模型搭配物理世界模型的双引擎架构,形成高层语义规划与实时动作生成协同运行的双系统。VLA端到端模型直接建立图像、自然语言指令与连续动作序列的映射关系,省去传统分层拆解流程,经过模型蒸馏、轻量化改造后,可在机器人端侧完成离线本地推理,摆脱云端网络延迟的限制。而物理世界模型内置完整的重力、摩擦、形变、碰撞动力学规则,能够在动作执行前虚拟推演行为结果,预判抓取失效、碰撞、物料倾倒等风险,缓解多步骤长时序任务逻辑断裂的问题。
在此基础上,行业配套搭建智能体规划框架,借助思维链拆解复杂工序,依靠短期交互记忆与长期场景知识库沉淀操作经验,结合MCP协议与技能插件体系实现跨场景能力复用,同时依托拖动示教、离线强化学习,仅需少量样本即可完成全新物料、全新产线的快速适配。运动控制体系采用分层混合架构,由大模型完成高层任务规划,底层伺服闭环系统保障毫秒级稳定执行,上层依靠全身协同算法统筹上肢抓取、下肢行走、机身转向全部动作,通过扩散策略生成平滑连续轨迹,内置动态避障、负重平衡优化逻辑,适配推车、装箱、上下楼梯等复合任务。底层则以阻抗控制、力矩闭环、模型预测控制为核心,控制频率最高可达千赫兹,搭配专属双足步态平衡算法实时补偿重心偏移,控制系统兜底消除大模型输出带来的动作抖动、定位偏移问题。
虚实迭代闭环已经成为标准化数据生产链路,物理环境中采集的真实交互数据回传仿真平台批量训练,优化后的动作策略再下发实体设备完成迭代,大幅降低真机测试的相关成本。当前相关核心硬件的成本已从早年十万元降至1500-2000元区间,4D毫米波雷达替代传统2D雷达,可精准识别障碍物高度、速度、横向运动趋势,解决雨天、逆光、夜间感知失效的难题。传感器同步实现毫秒级时序同步校准,行业标准要求多设备数据同步误差低于2ms,避免高速行驶下出现物体位置判定偏差,柔性遮光、防水镀膜工艺迭代,大幅提升硬件设备在复杂环境下的适应能力。
尽管资本市场对世界模型相关技术方向高度关注,但当前多数机器人应用的投资回报率仍未算平,在大量常规场景中,人工操作往往比机器人作业更具经济性。机器人产业的商业模式跑通正面临现实的死结,模型技术逐步成熟和整体使用成本可控,是机器人在真实场景实现大规模部署的核心前提,而真实场景运行过程中持续产生的各类交互数据,又能够反过来反哺模型的持续迭代,这一产业闭环能否持续正向运转,直接决定了世界模型相关技术能否顺利转化为实实在在的产业价值。
当前机器人距离真正稳定完成各类实际作业任务尚有明显距离,判断机器人实用能力的衡量标准,不在于它能够完成多少种单一动作的数量,而在于它能否在真实且持续变化的场景中,持续、稳定、经济地完成指定任务,并最终让客户愿意为其使用价值买单。国内机器人硬件产业链目前已无代际差距,多数产品只能在特定环境下完成演示,核心差距集中在“大脑”层面,对应的产业趋势是,具身智能领域的投资逻辑正从押注机器人本体,逐步转向押注具身智能核心大脑的技术研发与落地。
(编辑:曲昂)

购物车