凌迪科技王振东:仿真如何破解具身智能数据难题,构建机器人训练闭环

编者按:本文整理自凌迪科技具身智能创新中心 CTO 王振东在星河频率线上沙龙中的分享,内容经星河频率编辑。

作者|张蓉

近两年,随着具身智能从实验室探索逐渐走向产业应用,机器人如何获得足够多、足够有效的训练数据,正在成为行业关注的重点。

从真机遥操作,到第一视角(Ego)数据,再到仿真生成数据,行业正在探索不同的数据获取路径,希望解决机器人训练中长期存在的数据瓶颈。

但与此同时,数据采集方式的快速增加,也带来了新的问题:如何将不同数据来源有效结合,形成更高效的训练方式

而当机器人真正进入家庭、工厂等复杂环境后,面对的问题不只是能不能完成一个动作,而是能否在不断变化的现实世界持续学习

比如,整理一件衣服、收纳一个物品、打开一个柜门,对于人类来说是再普通不过的日常操作,但对于机器人而言,需要理解物体属性、预测运动变化,并根据反馈不断调整动作

这些能力的获得,需要大量真实世界交互经验。然而,真实数据采集往往面临成本高、效率低、场景难以复现等问题。

这也意味着,仅依靠真实数据采集,在成本、规模和长尾场景覆盖方面仍面临一定限制。

仿真,则提供了一种新的可能:通过构建接近真实世界的虚拟环境,让机器人在低成本条件下获得更多交互经验,突破现实数据采集的限制。。

前不久,苏度科技在世界人工智能大会(WAIC)上展示的具身智能仿真相关技术受到关注,虚拟环境如何帮助机器人训练和测试,成为行业讨论的热点。

目前,仿真正在逐渐从单一的数据生成工具,发展为连接数据获取、模型训练、能力评测与真机部署的重要基础设施,推动具身智能形成更加完整的训练闭环。

机器人想真正干活,首先要学会理解现实世界

具身智能的核心目标,是让拥有物理实体的机器人能够真正参与真实世界的工作

相较于主要执行预设程序的传统自动化设备,具身机器人更强调对环境变化的感知、决策与适应能力

例如,一个机器人完成「把衣服放进洗衣机」这一任务,并不是简单完成一次抓取,而是需要识别衣物位置、规划抓取方式、控制机械臂轨迹,并根据接触反馈不断调整动作。

整个过程涉及感知、决策和执行多个环节

近年来,大语言模型的发展,让人工智能拥有了更强的理解和推理能力。

ChatGPT、DeepSeek 等大模型擅长语言理解、逻辑推理,但始终局限在数字空间,无法触摸、交互、改造物理世界。

而具身智能的目标,是让人工智能从数字空间进入物理空间,让机器人不仅能理解,还能与世界产生交互

目前行业中较为主流的技术路线之一是 VLA,简单来说,就是机器人通过视觉输入获取环境信息,再结合大模型进行决策,最终生成具体动作。

然而,VLA 模型能力的提升仍需要较大规模、多样化的操作数据支撑。

在数据获取层面,目前行业主要依赖三类数据:

真机采集数据: 通过遥操作控制实体机器人完成任务,并记录视频、运动轨迹等数据,再用于模型训练。这类数据真实性较高,但采集成本较大,需要搭建专业场地,并依靠机器人反复执行任务。面对复杂场景时,大量长尾任务很难通过真实采集覆盖。

经授权的视频与 Ego 视角数据:行业正在研究经合法授权的公开视频及第一视角(Ego-centric)人类操作数据在机器人学习中的应用价值。这类数据覆盖面较广,但通常缺少精准的机器运动轨迹与接触过程中的力反馈,难以直接支撑复杂操作训练。

仿真合成数据与虚拟训练场:在虚拟空间搭建数字环境,支持机器人开展模仿学习与强化学习。作为真实数据的补充,仿真有助于扩展训练规模,并生成不同场景下的训练数据。

但与此同时,仿真训练仍面临 Sim2Real Gap(仿真到现实鸿沟)这一核心挑战。

由于虚拟环境与真实世界在物理规则、视觉效果等方面存在差异,模型迁移到真机后可能出现性能下降。

整体来看,具身智能的发展需要多种数据路线协同推进

真实数据保证可靠性,仿真数据提升训练规模,开放数据扩展学习范围,共同推动机器人适应更加复杂的现实环境。

相比于结构化的工业环境,家庭场景更加复杂。

机器人可能需要同时面对衣物、毛巾、水杯、塑料袋、家具等各种不同材质和形态的物体。

对于机器人来说,看似普通的收纳、整理、清洁等日常工作,往往包含大量非标准化操作,这意味着训练模型需要覆盖远比工业场景更丰富的数据。

因此,如何低成本、高效率地获取训练数据,成为具身智能进一步发展的关键问题。这也正是仿真技术受到关注的根本原因。

仿真不只是制造数据,它正在补齐现实数据短板

很多人提到机器人仿真,第一反应是一种廉价的、快速生成大量训练数据的方式。

但对于机器人而言,仿真的价值远不止如此。更重要的一点是,它能够解决真实世界无法采集、不敢试错、难以泛化的核心痛点

例如,在真实环境中训练机器人完成复杂工业任务,需要搭建完整生产线;训练机器人适应农业、户外等场景,也很难直接建立大量采集环境。

这些场景不是没有需求,而是现实条件限制了数据获取

围绕这一方向,凌迪科技推出 SynReal World 产品线,将过去多年积累的柔性物理仿真能力应用到具身智能领域,尝试构建适用于机器人训练的高真实度虚拟环境。

它的核心思路并不是简单搭建一个 3D 场景,而是先建立一个高真实度、可交互、可泛化的物理虚拟训练场

针对行业面临的底层瓶颈,凌迪科技将柔性物理仿真领域的积累引入训练场景,形成了包括仿真引擎、数字资产和训练环境在内的技术体系。

其中,SynReal Sim SDK 是凌迪科技自主研发的通用物理仿真引擎,围绕高保真、高效率和无穿透等核心能力展开建设。

它可支持刚性物体、柔性物体及流体等不同对象的模拟,为机器人训练提供更丰富的交互反馈。

尤其对于柔性物体而言,这种能力更加关键。

在 NVIDIA Newton 开源大会上,官方展示了宇树机器人完成皮衣穿戴等柔性物体交互案例,体现出柔性仿真对于复杂操作训练的重要价值。

除了仿真引擎,资产构建也是具身智能训练中的关键环节。

机器人需要大量不同物体进行训练,而传统三维资产制作周期长,很难满足大规模训练需求,是公认的一大难题。

针对传统 3D 资产制作效率较低的问题,凌迪科技构建了 SynReal Asset 体系,积累了超过十万个高精度的服装和面料数字资产,为柔性物体仿真提供基础支撑。

不同于以视觉呈现为主的普通三维模型,这些资产还可配置弹性、重量、摩擦力等物理参数,并针对仿真场景进行算法优化,为相关训练与研究提供支持。

同时,SynReal World 还提供并行训练环境,可支持多个仿真任务异步运行,为 AI 模型开展批量模拟训练并生成训练数据

相较于真机采集,仿真环境更便于调整参数、复制和改变场景,有助于扩展训练数据的规模与多样性

现实中,如果改变机器人任务,需要重新布置场地、调整设备,成本非常高。

而在仿真环境中,只需要修改模型参数,就可以快速生成新的训练条件。

例如,银河通用机器人在柔性物体操作任务中,就利用仿真环境帮助机器人掌握复杂操作能力。

像盘核桃、叠衣服这样的日常操作,对于机器人而言却涉及物理形变、接触关系以及力度控制等复杂问题,需要大量交互数据支撑。

为了解决这类复杂操作中的训练难题,银河通用与凌迪科技展开合作,在虚拟环境中模拟不同物体状态、操作条件和交互过程,让机器人可以在低成本条件下进行大量训练和试错,再结合真实环境数据不断优化。

因此,仿真不仅可以补充数据数量,还可覆盖部分现实条件下难以获得的数据

目前行业对于真实数据和仿真数据的比例,并没有统一答案。有些团队采用较高比例真实数据结合少量仿真数据,也有团队探索大规模仿真训练路线。

但从实际落地来看,纯仿真训练的机器人仍然需要在真实环境中进行微调。原因在于,即使仿真环境高度接近现实,虚拟世界和真实世界之间仍然存在差异。

跨越 Sim2Real Gap:机器人需要怎样的交互真实

仿真真正落地到机器人训练,最大的挑战不是简单复制一个视觉上相似的世界,而是解决 Sim2Real Gap(仿真-现实鸿沟)。

一个仿真平台,不仅要做到视觉真实,更要做到物理交互真实

人类完成抓取、折叠、收纳等动作,不仅靠视觉判断位置,更依赖重量、摩擦力、受力反馈、物体形变的综合感知。

机器人如果无法理解这些物理关系,即使视觉识别准确,也可能无法完成稳定操作。

尤其是在柔性物体领域,这一问题更加明显。

衣服、毛巾、塑料袋等物体会发生持续形变,与机器人交互时状态不断变化。区别于刚体的核心特征,是持续动态形变

在与机器人交互的过程中,形态、褶皱、受力状态实时变化,极大提升了机器人的感知、预测与控制难度。

例如叠衣服,看似简单,但机器人需要判断衣服当前形态、预测下一步变化,并控制力度完成折叠。

这也是为什么柔性物体操作,一直被认为是具身智能落地中的难点之一。

仿真并非现实世界的完全复制,而是对真实物理规律的近似还原。

基础物理规律可以保持较高一致性,但环境参数的细微差异,仍可能影响机器人在真实场景中的表现。

因此,缩小 Sim2Real Gap 并不是单纯提高仿真精度,而是需要让虚拟训练与真实交互形成持续反馈。

基于此,凌迪科技正在构建「真采+仿真」的多维数据采集体系,通过真实数据与仿真数据协同,为机器人训练提供支持。

通过快速搭建虚拟场景,并依托高效仿真引擎,同时支持真实素材采集与虚拟场景生成两种数据获取方式,为机器人训练提供更加丰富、真实的数据来源。

真实数据负责提供机器人与现实世界交互的基础经验,而仿真环境则负责扩大训练规模,让机器人能够在更多场景和任务条件下进行学习。

通过不同维度的数据采集方式,凌迪希望覆盖机器人从基础移动、简单操作,到柔性物体处理等更加复杂任务的数据需求

相比单纯依靠真实采集,这种「真实数据提供经验、仿真环境扩大规模」的方式,有助于减少部分重复采集,并覆盖更多现实世界难以重复构建的任务场景。

这种方式并不是替代真实训练,而是扩大机器人的学习范围

当然,缩小 Sim2Real Gap 并不是一次性解决的问题。

仿真环境仍然需要通过域迁移、强化学习和真机微调等方式持续优化,让机器人在虚拟世界中学习的能力,逐渐迁移到真实环境中。

从训练工具到协同支撑,仿真助力具身智能训练闭环

随着技术发展,仿真不仅是单一的数据生成工具,也能成为连接数据、训练、能力评测和真机部署的完整体系。

在这一体系中,数据生成和模型训练只是第一步。

目前,仿真已成为机器人训练的重要工具。公开研究和行业案例显示,包括宇树 G1 在内的机器人平台可在虚拟环境中开展运动控制训练,再将相关策略迁移至真实机器人进行验证。

但拥有数据后,如何有效评估模型性能?这也是仿真能力从训练环节进一步延伸的重要一步。

过去,机器人测试往往依赖真实环境,不同机器人面对的任务、设备和环境条件往往并不相同,很难进行统一比较。

凌迪科技正在探索面向不同应用场景的仿真测评方法,为相关场景设置核心任务与多维评价指标

例如,在工业场景中,机器人完成线缆装配不仅要看任务成功率,还需要评估操作过程中是否造成线缆损伤;

在服务场景中,则需要综合判断动作准确性、人机安全距离等因素。

通过将多个维度纳入评价体系,机器人能力不再只是简单的完成或失败,而能够更加全面地反映其在真实任务中的表现。

除了测评,仿真也正在从研发环节走向实际产业应用。

针对服饰等柔性物体操作难题,凌迪科技利用柔性物理仿真能力,帮助机器人在虚拟环境中学习复杂操作,为柔性制造场景中的自动化应用提供支持。

这意味着,仿真的价值已经不只是帮助机器人生成训练数据,而是在推动机器人从实验室走向真实产业场景

目前,仿真不会完全取代真实数据。真实环境中的交互数据,仍然是机器人能力验证的重要基础。

未来更现实的发展路径,是让二者形成互补:利用仿真提供规模化训练能力,用真实数据完成最终适配

当虚拟世界与现实世界之间的鸿沟不断缩小,机器人距离真正走进家庭、工厂和更多应用场景,也会越来越近。

对于具身智能而言,竞争已经不只是硬件性能的竞争。

谁能够建立更高效的数据获取方式、更可靠的训练体系,谁才更可能推动机器人从会展示走向会工作。

而仿真,正在成为连接算法、数据与现实世界的重要支撑。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。