超70家训练场推动具身智能迈入数据基建阶段

超70家训练场推动具身智能迈入数据基建阶段

财π新闻 综合《上海证券报》2026年9月30日报道,截至2026年6月底,全国已建成启用超70家具身智能训练场,另有46家在建或规划中,覆盖18个省级行政区。这类作为具身智能产业关键基础设施的训练场,正在为机器人能力迭代提供核心的数据支撑,推动整个产业从本体研发阶段向数据驱动的应用落地阶段稳步过渡。

训练场数据生产形成完整闭环

具身智能训练场依托头环式采集设备、遥操作装备等专业工具,在1:1还原的家居、商超、工业等真实复刻场景中,完整记录人类示教动作与机器人的实际操作过程。数据生产的过程并非直接产出可用素材,采集员完成8小时的工作时长后,经过多轮质检环节,最终仅能留下3至4小时的有效数据,其余时段的内容会因场景布置、操作偏差等因素被筛除。

这些经过筛选的有效数据会直接投入机器人模型训练环节,训练完成后的模型会被重新部署到实体机器人上开展实际作业验证,验证过程中暴露的问题又会反向指导后续的数据补采工作,由此形成从数据采集、模型训练到真机验证的完整闭环。经过多轮反复练习形成稳定的数据记忆后,机器人完成物料分拣、产品装箱等常规任务的执行成功率可以达到95%以上,作业稳定性得到显著提升。

以北京人形机器人创新中心数据基地为例,该基地的年数据产能可达18万小时,其中七成以上的产能都用于服务行业客户,对外交付高质量的真机交互数据,为不同领域的具身智能研发需求提供支撑。这类专业数据基地的规模化运营,正在逐步补齐行业此前面临的高质量数据供给缺口。

多技术路线融合破解数据供给痛点

当前具身智能产业的数据供给环节,仍然面临真机交互数据采集门槛高、产出数据质量参差不齐、训练完成的模型场景泛化能力不足等多个核心痛点,这些问题直接制约了机器人从实验室场景走向真实复杂环境的效率。为了针对性破解这些痛点,行业内的企业正在同步推进三条技术路线的融合应用,构建更加完善的数据生产体系。

第一条路线是通过真机遥操作的方式,完整记录机器人与真实物理环境交互过程中产生的全量数据,这类数据的真实性最高,能够精准还原实际作业中的各类细节反馈。第二条路线是采用无本体人类示教的模式,不需要依托实体机器人本体,仅通过人类的动作演示就能完成数据采集,这种方式可以快速进入各类不同的真实环境开展作业,大幅拓展数据采集的覆盖范围。第三条路线是通过仿真合成数据的方式,在虚拟环境中构造出大量现实中难以复现的特殊场景,补充真实采集过程中难以覆盖的边缘案例数据。

目前行业内普遍采用的训练流程,是先使用仿真合成数据与无本体示教数据完成模型的基础训练,快速搭建起模型的基础能力框架,之后再使用真机采集得到的高质量交互数据进行针对性微调,这种组合模式能够在保障模型最终作业可靠性的前提下,大幅提升整体训练效率,平衡数据生产的成本与产出效果。

实景实训推动训练体系向真实世界延伸

在集中式训练场中完成基础训练的机器人,最终能力落地必须走入真实世界开展检验,仅在复刻场景中完成训练的模型,往往难以适配真实环境中存在的各类变量与突发状况。当前政府部门正在推动实景实训专项行动,明确要求相关主体丰富异常处置等真实场景下的数据采集,并且在实际环境中充分验证机器人的应用效果,确保训练出的模型能够适配真实作业需求。

为了响应这一要求,相关企业已经将上百套数据采集设备送入普通家庭、工业生产一线等各类真实环境中,在完全开放的真实场景下回收第一手的交互数据,这些数据包含了大量集中式复刻场景中无法覆盖的随机变量与特殊情况,能够有效填补此前训练数据的场景盲区。随着这类真实场景数据的持续回流,集中式训练场的迭代效率也将得到进一步提升。

按照当前的发展路径,未来集中式训练基地将逐步与分布在各个作业现场的实体机器人形成完整的协同体系,构建出端侧采集、集中迭代、再下放部署的正向循环。分布在不同场景中的机器人在实际作业过程中实时采集新数据,将数据回传到集中式基地完成统一的模型迭代优化,优化完成后的新版本模型再重新下发到各个端侧机器人完成部署更新,整个体系的运转效率将得到持续提升,为具身智能产业的规模化落地提供坚实支撑。

(编辑:杨学萍)