光轮智能发布十万小时开源数据集与仿真评测平台构建具身智能落地闭环

光轮智能发布十万小时开源数据集与仿真评测平台构建具身智能落地闭环

财π新闻 2026世界机器人大会举办期间,光轮智能联合创始人兼总裁杨海波明确指出,机器人产业的发展阶段已经发生显著转变,正从过去侧重演示效果的表演属性,全面转向聚焦实际应用的实用属性,在这一产业转型的关键节点,场景理解能力与落地能力已经成为行业竞争的核心重心,而高质量的数据正是打通全场景落地闭环的核心关键支撑。从市场需求的实际变化来看,今年以来光轮智能承接的各类数据需求呈现出指数级跃升的态势,单笔订单的数据需求量已经从去年的数百至数千小时量级,直接跃升至今年的上百万小时级别,需求规模的大幅增长直观反映出具身智能产业对底层数据资源的迫切渴求。

杨海波进一步对比了不同人工智能技术路线的底层数据积累情况,大语言模型拥有互联网数十年发展沉淀的海量文本数据作为训练基础,自动驾驶领域也积累了百年道路测试的相关数据资源,唯独具身智能领域的预训练数据基础近乎处于空白状态,整个行业缺乏足够规模、足够质量的标准化数据供给,难以支撑具身大模型的快速迭代与落地应用。基于对行业发展趋势的判断,杨海波提出2026年将成为具身智能数据规模化的元年,整个产业的数据供给体系将在这一年迎来爆发式的扩容升级,为后续通用具身机器人的大规模落地筑牢底层根基。

在本届世界机器人大会的现场,光轮智能正式发布全球首个十万小时级全模态人类行为开源数据集EgoSuiteOpen100K,这一数据集的整体规模达到十万小时,覆盖7大类环境、128个细分场景以及15000余种真实任务,完全贴合具身机器人在各类真实场景下的作业需求。为了保证数据采集的全面性与精准度,该数据集采用头显加腕部双视角的采集方式,能够同时兼顾全局环境视野与手部精细操作的细节记录,同步输出手部、全身位姿以及事件级语义标注,彻底解决了普通单一视角数据无法完整还原人类操作逻辑的痛点,让机器人在训练过程中不仅能够学习到具体的动作执行方式,更能理解动作背后的决策逻辑与应变思路。

目前,该数据集的首批资源已经通过海外开源平台与国内AtomGit平台实现同步开源,面向所有学术研究机构与商业训练团队全面开放使用。光轮智能推出这一开源数据集的核心目标,是打破当前国内具身数据领域各自为战的行业格局,输出统一的数据采集、标注与格式范式,大幅降低中小研发团队获取高质量具身数据的入门门槛,推动整个行业逐步沉淀出被广泛认可的事实数据标准,避免不同团队各自采集的数据因口径不统一、格式不兼容而无法复用的资源浪费问题。

在发布开源数据集的基础上,光轮智能同时推出5年100亿小时数据共建计划,该计划将围绕数据标准统一、评测闭环搭建、模型协同设计三大核心方向,推动全行业共同参与建设开放共享的具身数据生态。其中开放数据标准环节将统一不同采集设备的数据模态、标注规则、时序组织与存储格式,让不同来源的数据具备跨设备、跨任务、跨模型复用的基础;评测驱动的数据闭环环节将从模型的实际失败案例中精准定位数据需求,定向生成和补采对应场景的训练数据,再通过标准化的基准评测持续检验模型的性能提升效果;数据与模型协同设计环节将共同优化仿真数据、第一视角人类数据、遥操作数据与评测数据等不同类型数据的组合方式,最大化各类数据的训练价值。

针对当前具身智能产业面临的核心落地痛点,杨海波明确指出,具身智能难以在产线和家庭现场开展高风险、高重复度的测试工作,一旦直接在真实作业场景中开展大量测试,不仅会产生极高的硬件损耗与场景搭建成本,还可能引发生产安全、人身安全等各类风险问题,基于这一行业现状,仿真是具身智能评测的最优解,能够在虚拟环境中实现无限次的重复测试,一秒钟切换任意场景组合,彻底突破真实场景搭建的成本与效率限制。

为了支撑高保真的具身智能仿真需求,光轮智能推出SimFoundry三位一体全栈自研仿真底座,这套底座通过物理求解、物理测量、资产生成的整套完整体系,能够精准复现磁吸、阻尼、线缆柔性形变、物体摩擦等现实世界中的各类复杂物理特征,确保仿真环境具备足够的物理真实性,让仿真环境中的测试结果能够高度映射真实物理世界的实际表现,避免出现仿真效果与真实场景严重脱节的“现实鸿沟”问题,保障在仿真环境中训练完成的机器人模型能够直接迁移到真实场景中稳定运行。

依托高保真的仿真底座能力,光轮智能进一步推出RoboFinals工业级仿真评测平台,补齐了具身智能产业从技术原型到规模化落地之间的中试验证短板。该平台能够将工业产线中的真实工艺约束完整转化为标准化的仿真任务,在虚拟环境中大规模测试不同本体、不同模型版本的实际表现,精准定位模型运行过程中出现的各类失败模式,反向指导后续的数据补采工作与模型迭代优化。这套评测体系的核心目的,不仅仅是简单判断机器人能否完成指定任务,更要精准找到模型的实际能力边界,为后续的迭代优化给出明确的方向指引,回答清楚机器人在多大成功率下能够稳定完成任务、什么条件会导致性能退化、退化边界在哪里、失败原因是什么、版本迭代后性能是否回归、仿真环境与真实现场之间存在多大偏差等一系列产业落地必须明确的核心问题。

在打通仿真训练与真机部署的链路环节,光轮智能同步发布RoboStack真实场景部署与反馈平台,这套平台完整打通了仿真训练、仿真评测、真机上岗、失败样本回流的全链路,构建起完整的产业迭代通道。当机器人在真实作业场景中运行时,出现的各类操作错误以及人工接管的相关案例都可以自动回传到整个数据体系中,技术人员可以针对性补充对应的训练素材,之后将更新后的模型放回仿真环境中开展复测验证,确认迭代效果达标之后再重新下发到真实场景中部署,由此形成Real2Sim2Real的持续学习闭环,让每一台上岗工作的机器人都可以反向为整个模型体系贡献自身积累的作业经验,实现全行业模型能力的共同提升。

这套持续迭代的逻辑具备极强的场景通用性,可以在工业制造、物流仓储、农业、医疗康养等多个不同的产业场景中实现复用,帮助不同领域的具身机器人在实际运行过程中不断积累经验、优化性能,逐步提升在复杂真实场景下的作业稳定性与泛化能力。在2026世界机器人大会举办期间,光轮智能已经与汽车、农业、工业等多个领域的头部企业完成签约,正式落地这套Real2Sim2Real持续学习闭环,推动相关产业的具身智能应用进入快速迭代的正向循环阶段,为具身智能技术在各个实体产业中的规模化落地提供完整的底层基础设施支撑。

(编辑:姜心源)