大模型企业加速布局物理AI拓展产业落地新边界
刘轩宇 2026-08-13 00:59
财π新闻 人工智能技术经过多年的快速迭代,已经在数字世界中完成了多轮能力跃升,从早期的文本生成、图像识别,逐步拓展至多模态内容理解与创作,海量互联网数据的支撑让大模型在各类数字信息处理任务中展现出极强的泛化能力与跨任务迁移能力。但随着技术探索的不断深入,越来越多AI大模型企业开始将目光投向此前并未深度涉足的物理世界,主动调整技术研发与产业布局方向,向真实物理场景延伸自身的技术能力边界,这一趋势正在成为当前人工智能产业演进过程中最受关注的核心方向之一。
互联网上沉淀的海量文本、图片和视频信息,为大模型的前期训练提供了充足的数字素材支撑,却无法让模型真正学会在真实环境中完成感知、决策和行动的完整闭环。即便拥有全世界最大的语料库,也无法让AI真正理解什么是重力、摩擦力、惯性和空间关系,语料库记录的只是人类如何描述世界,而不是物体如何在世界中运动。物理常识在文本中天然稀缺,人们通常不会反复写下“杯子会掉下去”“轮子会滚动”“湿地会打滑”这类基础常识,这直接导致大型预训练模型在这类物理常识相关的任务上能力始终处于较低水平。多模态模型也没有彻底解决这个问题,相关测试数据显示,人类几乎一眼就能完成的深度、空间对应、多视角推理任务,GPT-4V的平均完成率只有51.26%,Gemini的完成率仅为45.72%,表现距离随机猜测并不远。另一项覆盖摩擦、密度、张力、弹性、运动、碰撞、投掷和流体等真实物理维度的测试进一步显示,在75个视觉语言模型、10002条测试样本的测试范围内,物理理解能力并不会随着模型大小、训练数据量或视频帧数的增加而稳定提升,这意味着AI即使读遍互联网上所有关于“重力”的文字内容,仍可能不知道一个球为什么不能凭空消失、为什么物体不能穿墙、为什么运动必须连续。
这种技术层面的局限性,最终直接体现为企业落地AI应用时最头疼的幻觉问题。在金融、医疗、工业等高容错成本场景中,大语言模型依然无法建立稳定可靠的物理因果推理能力,这也是许多企业级应用始终停留在辅助层,而无法成为核心决策系统的核心原因。从“语义理解”到“物理推理”之间存在的这道鸿沟,已经成为AI落地产业的第一拦路虎。如果AI要迈向更高水平的通用性,必须补上物理交互这一课,这也是行业内普遍提及的“物理AI”的核心内涵,即让AI以机器人或自主系统为载体,在实际物理环境中运行并执行任务。
回顾人工智能过去七十多年的发展历程,整个行业先后经历了四次技术浪潮,从最早的专家系统到统计学习,再到后来的深度学习和基础模型,整个演进过程可以看成在数据、算力和模型三个维度上的持续规模化。以基础模型为例,受益于互联网海量数据、自建工具训练和强化学习后训练的支撑,模型架构规模从百亿、千亿级别逐步拓展到万亿级别,当前基础模型在语言、语音、多模态等领域都取得了跨越式提升,体现出非常强的泛化能力和跨任务的迁移能力。但互联网数据始终是数字世界信息的载体,没办法让模型学习到如何真正交互和“驾驭”物理世界,面向更高水平通用性的人工智能,必须从数字世界走向物理世界,这一技术演进的必然性,推动大量AI大模型公司开始主动俯身向物理世界延伸。
物理AI的落地需要核心要素的全方位支撑,场景决定AI在何处发挥作用,数据决定AI的学习能力,硬件则是AI在物理世界的“手脚”,同时具备这些要素的企业,无论是拥有庞大配送网络的本地生活平台,还是掌握复杂供应链的零售基础设施,都正在成为这一赛道的核心参与者。相比此前的数字AI,物理AI对规模化提出了全新的要求,第一是需要做到物理数据规模化,物理AI不仅要从海量数据中学习通用常识知识,还要从蕴含着非常丰富的物理信息的真实世界数据中,学习物理规律和因果关系,比如三维空间结构、物理属性、运动轨迹等。第二是需要做到持续学习的规模化,AI需要在同真实世界交互的过程中不断获得反馈,进行持续进化、持续调优。第三是物理基础模型本身也要有新的进展,与数字AI不同,物理AI的特点是要对空间的理解重建,包括对物理规律的建模,对硬件的模拟、操作以及跨本体、跨任务和跨场景的泛化能力都要有很好的支持。最后是硬件协调需要规模化,不管是采集大量具身数据还是训练具身模型,最终把这些东西部署到本体上,都需要在机器人硬件和可穿戴设备上同步做到规模化的协同。原本适用于数字AI的规模化法则,在延伸到物理AI领域后,不能再只关注数据、模型与算力,还要把硬件规模化纳入其中,数据、模型、算力和硬件,将共同构成物理AI能力持续提升的四个维度。
当前大量AI大模型企业已经在物理AI赛道展开了不同方向的卡位布局,投资端的相关动作从2025年开始就持续推进,2025年5月起,京东先后投资了6家公司,覆盖人形整机、触觉感知、运动控制、具身模型等产业链环节,2026年6月,京东关联基金再次出手,参与通用具身智能机器人公司无界动力超2亿美元的天使轮融资,具身智能版图再度扩容。作为重资产运营的平台,物流、配送、仓储等环节具备AI深度改造的空间,使得京东既是技术的“试验场”,也是需求的提出者,2025年10月,京东物流宣布未来五年计划采购300万台机器人、100万台无人车和10万架无人机,从京东的视角来看,对这一领域的大举投资,本质上是在为自身的应用场景构建“护城河”,通过资本连接技术与生态,最终反哺其核心业务。
不同区域也在物理AI产业布局上形成了差异化的定位,无锡主攻量产、广州侧重场景应用、上海聚焦高端研发与核心技术突破,不同城市依托自身产业基础,共同推动物理AI产业生态的逐步完善。腾讯混元也凭借海量游戏数据切入世界模型研发赛道,将开放世界地图的建模周期从数月压到十几分钟,直接冲击游戏工业的传统生产模式。群核科技则作为底层的“卖水人”,从十余年家装软件中沉淀出数亿个物理正确的真实设计数据,为具身智能公司供给虚拟训练场。
当前物理AI的发展长期受到训练数据不足、仿真体系碎片化等因素制约,随着世界模型与高保真仿真平台不断成熟,机器人研发正逐步由依赖真实试错,转向“虚拟训练+真实验证”的新模式,有望进一步提升研发效率。随着人工智能加速向真实世界延伸,物理仿真、Sim2Real、训练平台及高质量合成训练数据等将成为支撑机器人、世界模型及各类智能体持续演进的重要底座。要建好世界模型与仿真平台,数据尤其是高质量的真实世界数据仍是关键,但与传统AI可以轻松从互联网抓取海量文本、图片不同,物理AI需要的是真实世界中机器人抓取、移动、交互过程中产生的动作数据,而这些数据,目前几乎没有现成的“数据库”可以直接使用。自动驾驶已经是一项高度复杂的工程,但机器人面对的是一个更加开放和复杂的物理世界,汽车主要面对道路交通环境,而机器人需要进入家庭、工厂、仓储、农业等不同场景,与大量物体、材料和设备发生持续交互。更大的挑战在于,目前机器人尚未形成大规模部署,行业难以像自动驾驶一样,依靠大量真机持续回流数据形成闭环,同时真机数据通常与特定机器人本体、传感器配置和任务流程深度绑定,硬件形态或任务需求发生变化后,历史数据的复用效率也会下降,因此物理AI需要由人类行为数据、仿真合成数据和真实部署反馈构成多层次数据供给,并通过工业级评测形成持续迭代闭环。
针对高质量物理数据获取的行业痛点,多家企业已经开始从不同路径布局,索辰科技将目光瞄准了机器人的“训练场”,2026年以来,该公司围绕“天工·开物”物理AI平台持续完善物理场景库,覆盖具身智能、低空经济、新能源、航空航天等多个领域,希望通过高保真物理仿真环境,让机器人能够在数字世界中完成大量训练,再迁移至真实世界,与此同时,该公司还在浙江嘉兴建设物理仿真实验基地,进一步完善虚拟训练能力,目前该公司物理AI业务已实现商业化收入,不过整体仍处于初级阶段。光轮智能则将自身的使用场景聚焦于“考场”测评,该公司推出工业级具身智能仿真评测平台RoboFinals,通过标准化任务、物理可信的仿真环境和可量化评价指标,对不同机器人本体、模型和版本进行统一验证,这套体系更强调可规模化、可复现和可诊断,既能够在统一任务和相同条件下比较不同模型,也能够识别模型的能力边界,并将评测结果持续反馈至数据生成和模型训练环节。也有企业选择从数据源头切入,上海觅蜂具身智能科技有限公司发布了轻量化多模态数据采集夹爪MEgoGripper及数据治理平台MEgoEngine,希望打通机器人数据从采集、治理到训练的完整链路,通过毫米级轨迹重建、多模态时间同步以及自动化数据治理,机器人每一次抓取、移动、操作都能够被完整记录,并进一步转换为模型可学习的数据。
云迹科技十多年积累了超11亿次真实交互数据,所有数据均已完成脱敏和合规处理,能够持续回流并不断加强机器人决策应变能力。与仿真生成的数据不同,这些真实交互数据中涵盖了人群偏好、交互过程、协作体验等高价值信息,经过训练、响应、反馈等自适应学习,这些数据最终沉淀到“人机共生世界价值模型”中,让机器人在面对复杂场景时理解更准确、逻辑更清晰、协同更顺畅。该团队尽可能将常见的数学求解逻辑为机器人建模出来,引导机器人在不同场景里选择适配模型进行最优求解,同时数据中原本涵盖的包括“满意度”“成功率”等实际价值指标得到了加固和增强,模型突出价值导向,在最优求解时,通行的“机器动作准确性”指标只是评估标准之一,体验、效率、安全、资源利用、商业收益等指标也被纳入其中,这让云迹机器人在应用中带来可量化的业务价值,提升了不同行业对机器人的接纳程度。
视启未来深耕视觉原生世界模型、攻坚物理AI核心技术,依托源自IDEA研究院的技术积淀,持续迭代DINO、GroundingDINO、DINO-X等行业标杆技术,构建起从“看见物体”到“理解物体”的完整技术能力栈,为视觉原生世界模型的研发、迭代与落地筑牢坚实的技术根基。该企业推出的EgoTwin技术,实现了人手3D对齐领域的关键技术突破,可精准还原人手的空间位置与动作交互细节,高效完成第一视角数据与机器人状态空间的统一对齐,相较传统真机遥操、UMI开发模式,EgoTwin大幅提升物理交互数据的规模化拓展效率,为物理AI商业化落地提供坚实的数据支撑。
英伟达创始人黄仁勋在相关行业大会上阐述物理AI的发展方向时特别强调,机器人产业已迎来属于自己的“ChatGPT时刻”,这一判断的背后是多项技术的共同成熟。随着仿真技术和合成数据的成熟,机器人开发将突破现实数据稀缺的瓶颈,从实验室快速走向规模化商业应用。英伟达构建了完整的三计算机系统,分别用于训练AI的计算机、运行推理的机器人计算机,以及用于模拟的Omniverse平台,其中模拟的Omniverse平台至关重要,它就像一个教AI理解物理世界的“模拟器”,能够生成逼真且符合物理规律的合成数据,通过这种模拟环境,AI能在虚拟世界中学习应对各种情况,包括那些在现实中罕见却危险的情景。
从技术验证到规模化商用,“物理AI”仍面临成本、可靠性与法规等多重挑战,但方向已经清晰,AI的下一步,将在真实的物理世界中展开。人工智能不再只是处理文字、图像、声音等数字信息,而是日益同机器设备、生产流程和现实环境深度融合,从“会说会写”迈向“能感知、会决策、可执行”,成为改造生产方式、重塑产业形态的重要力量。人工智能与实体产业融合涉及模型企业、硬件厂商、行业企业、科研机构等众多主体,单靠一家企业、一个学科,难以打通从技术研发到产业应用的完整链条,全行业正在逐步形成开源开放、合作共享的创新氛围,完善通用接口、数据规范、测试评价和安全标准,促进模型、数据、设备和应用协同发展,兼顾“自主可控”与“开放合作”,在物理AI这一新赛道,依托国内大市场与产业链优势构建生态,确保核心竞争力。
(编辑:胡中华)

购物车