返回新闻资讯

数据-仿真-训练闭环:拓比端到端具身智能基础设施如何加速VLA落地

2026-07-31 15:09 4
拓比端到端基础设施 · 产品详解系列

数据-仿真-训练闭环:拓比端到端具身智能基础设施如何加速VLA落地

四阶段闭环+生态深度协同,某客户VLA任务成功率从43%跃升至89%,训练周期从6个月缩至6周
发布时间:2026年7月31日 阅读时长:约14分钟 字数:约2500字
配图
核心观点:具身智能VLA(视觉-语言-动作)模型的训练范式正在形成行业共识——仅靠真实世界数据规模不够且成本太高,仅靠仿真合成数据又存在Sim-to-Real迁移鸿沟,最优解是"真实世界数据+仿真合成数据"的混合训练与迭代闭环。拓比科技构建的四阶段端到端闭环:①真实世界采集与标注→②数据格式标准化与治理→③Isaac Sim/Unity仿真域随机化扩增→④VLA模型训练与验证,并将模型失败case自动反馈回①继续针对性采集,形成持续进化的正向飞轮。结合与NVIDIA Omniverse、华为昇腾生态的深度兼容合作,这套闭环方案已帮助某头部客户将VLA模型在真实场景的任务成功率从43%提升到89%,模型训练周期从6个月缩短到6周,真正让数据-仿真-训练三者协同加速VLA落地。

一、行业共识:真实数据 + 仿真数据的混合训练是必由之路

2026 WAIC具身智能主论坛上,一场关于"VLA模型训练的数据范式"的圆桌讨论吸引了全场的注意力。台上坐着五位嘉宾,分别代表通用大模型厂商、人形机器人创业公司、仿真平台公司、具身数据服务商(拓比科技创始人)和高校教授。激烈的观点交锋过后,五个人在一个核心判断上达成了完全一致:未来3-5年内,VLA模型训练的最优数据范式一定是"真实世界数据+仿真合成数据"的混合模式,只靠其中任何一方,都做不出能在真实世界稳定工作的通用具身智能。

这个共识建立在双方各自不可替代的优势和无法独立克服的短板之上:

真实世界数据的优势与短板。真实数据的最大优势在于"真实"——光照条件、物体纹理、摩擦系数、人的操作习惯、各种意外和边界情况,全都是真实世界中会真实发生的。VLA模型只有在真实数据上学过这些分布,才有可能在真实场景中泛化。但真实数据的短板同样突出:采集标注成本高、迭代速度慢、长尾覆盖不足(想收集某个极端罕见场景的几百条失败案例,可能要花几个月时间在真实世界里等它发生)。更重要的是,真实数据无法做有控制的变量实验——你无法把同一个物体的颜色改一下,其他所有条件都保持不变,来研究模型对颜色变化的敏感度。

仿真合成数据的优势与短板。仿真数据的最大优势恰好是真实数据的反面:成本极低(生成100万条和生成1000条的边际成本差别不大)、速度极快(GPU集群并行渲染,一天可以产出几年的真实等价数据量)、完全可控(光照、纹理、物体位置、摩擦系数、物理参数想怎么调就怎么调,可以系统地覆盖所有维度的分布空间)。但仿真数据有一个至今无法完美解决的致命问题——Sim-to-Real Gap(仿真到真实的迁移鸿沟)。仿真渲染的再逼真,和真实世界之间仍然存在微妙的分布差异,导致在仿真环境中达到99%成功率的模型,部署到真实机器人上可能直接跌到50%以下甚至更低。这种差异可能来自光照的细微变化、材质的摩擦系数、机器人关节的控制误差、相机标定的微小偏差等无数个维度,单靠仿真域随机化(Domain Randomization)很难完全消除。

因此,混合训练的思路应运而生:用大规模真实数据"锚定"真实世界的数据分布,让模型学到真实世界的"基调和底色";用海量仿真合成数据在分布空间内做系统性的密集扩增,让模型在可控条件下看到足够多的变体、学习到足够强的泛化能力。两者结合,才能兼顾真实性与覆盖度。

但道理说起来简单,真正把这条链路打通并跑通闭环,需要的是从采集、标注、格式转换、仿真导入、域随机化、Sim-to-Real迁移、模型训练、失败case回采的全链路基础设施能力。拓比科技用了近两年时间,打造了行业内首个真正跑通的四阶段端到端闭环方案。

二、四阶段闭环:从真实采集到模型训练的完整链路

拓比的端到端闭环方案,在逻辑上分为四个前后衔接、相互循环的阶段。每个阶段都有标准化的输入输出格式和明确的质量SLA,确保数据和信息可以在各阶段之间顺畅流动,不会在某个环节出现"信息堰塞湖"。

阶段①:真实世界采集与标注(Real-world Collection & Annotation)。这是整个闭环的起点和"种子数据"的来源。基于拓比前文介绍的设备矩阵(E6/P3/G2等)、采集运营平台、AI辅助标注系统和标准化数据集矩阵,高质量、规模化地产出真实世界人类操作轨迹数据。这个阶段的核心交付物,是以统一格式(TB-Embodied-Format v2.0,拓比自研并开源的具身数据标准格式)存储的标注数据集,包含多视角视频、深度/点云、2D/3D检测标注、人体与手关键点、物体6D位姿、动作语义分割等全维度标注信息。截至2026年7月,这一阶段已累计交付430万+条标注轨迹,为闭环提供了坚实的"种子数据"基础。

阶段②:数据格式标准化与治理(Data Format Standardization & Curation)。从不同客户、不同项目、不同设备来源收集到的真实数据,在进入仿真和训练环节之前,必须先经过标准化的格式转换和数据治理。这个阶段的工作包括:统一坐标系统(相机坐标系、世界坐标系、机器人基座坐标系之间的变换矩阵精确定义)、统一物理单位与数据精度、清洗异常数据(移除标注矛盾或物理不合理的样本)、按场景难度和数据多样性做分层抽样、自动生成训练集/验证集/测试集的划分(确保同一采集现场/同一操作人员的数据不会同时出现在训练集和测试集中,避免信息泄露)。拓比的数据治理流水线支持一键导入常见的12种公开数据格式,并自动转换到统一的内部标准格式,大大降低了多源数据融合的工程成本。

阶段③:Isaac Sim/Unity仿真域随机化扩增(Simulation Domain Randomization Augmentation)。经过治理的真实轨迹数据,会被自动导入NVIDIA Isaac Sim和Unity两大主流仿真平台。拓比为这两个平台开发了专用的数据导入插件和域随机化工具包,可以将一条真实的操作轨迹"克隆"到仿真环境中,并在以下数十个维度上做自动化的域随机化扩增:光照条件(方向、强度、色温、阴影)、物体外观(颜色、纹理、材质粗糙度、反射率)、物体初始位置(三维空间位置的随机扰动、初始姿态的随机偏移)、场景背景(背景墙颜色、地板材质、桌面纹理)、相机参数(内参微扰、相机位置偏移)、物理参数(摩擦系数、重力加速度微扰、物体质量分布)、干扰因素(额外的随机障碍物、其他移动物体的扰动)等。基于1条真实轨迹,可以自动生成数千甚至上万个域随机化变体,极大地扩展了训练数据的多样性。

阶段④:VLA模型训练与验证(VLA Model Training & Validation)。将阶段①的真实数据和阶段③扩增的仿真数据按精心设计的比例混合(典型比例为1:20到1:100,根据具体任务调节),送入VLA模型训练流水线。拓比提供了兼容主流训练框架(PyTorch、JAX、MindSpore)的标准化训练模板和最佳实践配置,包括数据加载器、数据增强策略、损失函数组合、学习率调度方案、多模态对齐技巧等。训练过程中会在保留的真实场景验证集上做周期性评估,一旦模型的验证指标达到SLA阈值,便会触发下一阶段的操作:将模型部署到真实机器人上做物理验证,收集失败案例和表现不佳的边界case。这些失败case会被结构化记录,并自动生成定向采集需求工单,反馈回阶段①——由采集运营平台调度对应的采集团队,在真实世界中有针对性地补充采集这些困难场景和边界case的数据,从而启动下一轮闭环迭代。

四阶段循环往复,每一轮闭环都会让模型在真实场景中的能力上一个台阶。

配图

三、真实→仿真:把人类操作轨迹导入无限的仿真世界

从真实到仿真(Real-to-Sim)的迁移能力,是整个闭环能否产生价值的关键技术环节。如果导入过程中丢失了太多真实轨迹的动作细节和语义信息,后续的域随机化扩增就成了"垃圾进、垃圾出"。拓比的Real-to-Sim工具链围绕"保真导入 + 自动重建 + 一键扩增"三个核心目标做了大量深度优化。

保真导入:轨迹级与物体级的双路对齐。对于每一条真实操作轨迹,导入仿真环境时需要同时完成两件事:一是把场景环境和被操作物体尽可能精确地在仿真中重建出来,二是把人的操作轨迹(手的运动路径、物体的位姿变化、动作时序)尽可能精确地"复刻"到仿真环境中对应的机器人或虚拟人控制器上。拓比工具链支持自动从多视角视频中重建场景的3D几何结构和物体的3D mesh模型,结合已有的6D位姿标注信息,可以将物体的初始位置和运动轨迹与原始视频做到像素级对齐。在内部基准测试中,导入后的物体轨迹与原始真实轨迹的平均空间偏差小于3mm,时序同步误差小于10ms。

面向未知物体的自动重建流水线。对于没有CAD模型的全新物体(例如客户定制场景中的某个特殊零件),工具链会自动调度NeRF 3D重建任务,利用多视角视频帧在GPU集群上在线生成物体的高质量3D表示和纹理贴图,整个过程完全自动化,不需要人工建模干预。单个物体的平均重建时间约为20分钟(8张A100),输出的模型精度足以支撑6D位姿误差3mm以内的仿真操作。

一键域随机化:从1条到10000条的扩增。轨迹和物体导入完成后,操作人员只需要在控制台中选择域随机化维度和每个维度的随机化强度(例如"物体初始位置扰动范围±5cm"、"光照温度范围3000K-7500K"、"材质粗糙度0-0.8均匀采样"),点击"生成扩增任务",系统就会自动调度渲染集群,批量生成几万个配置各不相同的仿真变体数据。每条扩增变体都会继承原始真实轨迹的语义标注和动作标签,相当于用一份真实标注的成本,获得了几万份自动标注的扩增数据。

四、仿真→真实:Sim-to-Real迁移工具链弥合分布鸿沟

不管域随机化做得多充分,仿真和真实之间的分布差异永远不可能完全消除。因此,Sim-to-Real迁移阶段的技术能力,直接决定了混合训练的最终效果能否真正落到真实机器人上。拓比的Sim-to-Real工具链从三个层面系统性地帮助客户缩小迁移差距。

层面一:机器人仿真模型精校准(Robot Model Calibration)。很多Sim-to-Real失败的根源,其实是仿真中的机器人模型与真实机器人的物理参数不一致——关节的摩擦系数、连杆的质量分布、电机的力矩响应曲线、手爪的夹持力曲线……这些参数有几%的误差,累积起来就可能导致相同的控制策略在真实机器人上完全做不出来。拓比的工具链提供了一套自动化的机器人参数校准流程:让真实机器人执行一组设计好的激励动作(Identification Trajectories),同时用运动捕捉系统(或E6设备的高精度SLAM + 多视角视觉)记录真实的执行结果,然后用系统辨识算法自动反推出最匹配真实表现的仿真物理参数集,将参数注入仿真环境中重新训练。仅仅这一步校准,通常就能将Sim-to-Real成功率提升15-25个百分点。

层面二:视觉表征的跨域对齐(Visual Representation Alignment)。对于视觉输入部分的Sim-to-Real Gap,拓比采用了基于对比学习的跨域表征对齐方案。在仿真数据和对应场景的少量真实数据上,训练一个视觉编码器,使得相同语义内容的仿真图像和真实图像在特征空间中尽可能接近,同时不同语义内容的特征尽可能远离。这个预训练好的视觉编码器,作为VLA模型视觉分支的初始化权重,可以显著缓解模型在真实图像上的分布偏移问题。工程实践表明,做了跨域对齐的模型,相比直接用仿真数据从头训练,真实场景零样本成功率平均高出18-30个百分点。

层面三:少量真实数据的策略微调(Few-shot Real-world Fine-tuning)。最后一公里的差距,需要用极少量的真实机器人交互数据来弥合。拓比的Sim-to-Real流水线内置了基于DAgger(Dataset Aggregation)和RLHF-on-Robot的在线微调协议,可以让客户在真实机器人上采集几十到几百次试错交互数据后,快速对策略做针对性微调,把仿真中学到的通用策略"落地"到具体的真实机器人硬件上。相比从零开始在真实机器人上做强化学习,这种方式的真实交互样本效率提升了两个数量级以上。

五、生态协同:与NVIDIA Omniverse、华为昇腾的深度合作

"具身智能是一个系统性工程,没有任何一家公司能凭一己之力把所有事情做完。"拓比科技创始人在2026 WAIC的生态合作签约仪式上这样说道,"拓比专注在真实世界数据采集与标注、以及数据-仿真-训练的闭环流程上,但要让这套基础设施真正好用、易用,必须和上游的仿真平台、下游的算力与训练框架做深度的生态打通。"

与NVIDIA Omniverse & Isaac Sim的深度集成。拓比是NVIDIA Omniverse生态计划中首批认证的具身数据合作伙伴。双方合作的核心内容包括三个方面:一是数据格式双向兼容——拓比的TB-Embodied-Format v2.0格式与NVIDIA Omniverse的USD(Universal Scene Description)格式实现了无损双向转换,拓比数据集中的每一条轨迹,都可以一键导入Isaac Sim环境中进行仿真操作;二是域随机化工具联合开发——拓比与NVIDIA仿真团队联合开发了面向具身操作场景的专用域随机化组件库(Embodied DR Kit),针对手部操作、物体交互、材质纹理等具身场景特有的随机化维度做了专用优化;三是预训练VLA模型的联合发布计划——双方计划在2026年底基于Isaac Sim合成数据+拓比真实数据的混合训练,发布开源可用的VLA预训练基础模型,降低整个行业的VLA训练门槛。

与华为昇腾AI生态的协同适配。针对国内客户对自主可控算力生态的需求,拓比与华为昇腾开展了全链路的适配合作:一是训练框架全栈适配——拓比的VLA训练流水线和数据加载器,在昇腾910B集群上基于MindSpore框架的训练性能达到了同规格GPU集群的92%,且精度完全对齐;二是预标注大模型国产化部署——拓比的2D/3D检测、关键点追踪、6D位姿估计等预标注大模型,全部完成了昇腾AI处理器的推理适配和性能优化,在国产化环境下可以达到与GPU环境相当的预标注效率和精度;三是联合解决方案联合推广——双方面向国内的汽车、制造、能源等重点行业客户,联合推出"昇腾算力 + 拓比具身数据 + 行业VLA模型"的一体化打包解决方案,助力具身智能在国内重点行业的规模化落地。

除了NVIDIA和华为,拓比还与Unity、ROS 2生态、多家主流人形机器人厂商的中间件平台做了不同程度的格式兼容和接口打通。我们的目标是:无论客户使用哪家的仿真平台、哪家的算力硬件、哪家的机器人底座,拓比的数据和闭环工具链都能无缝接入,快速复用。

六、客户价值:真实案例看闭环方案带来的量化收益

讲了这么多技术细节和生态合作,最后还是要落到客户最关心的问题上:用了拓比这套闭环方案,到底能带来多大的实际价值?我们用一个完整的客户项目案例来做量化说明。

客户背景。某具身机器人独角兽企业,主打家庭场景的双足人形助手产品。2025年初,他们在家庭场景的基础VLA模型上遇到了明显的能力瓶颈:在内部构造的家庭场景测试集(100项任务,涵盖做饭、清洁、收纳、取物)上,真实机器人端到端任务成功率长期徘徊在43%左右,且进一步提升异常困难——每次花两个月采集一批新数据重新训练,成功率只能提升2-3个百分点,训练周期和数据成本眼看就要失控。

采用方案。2025年Q3,该客户正式引入拓比的四阶段闭环方案:采购TB-Home家庭场景数据集(15万条)作为种子数据;部署拓比Real-to-Sim仿真扩增工具链到客户自有的NVIDIA GPU集群,基于15万条真实轨迹生成了3200万条域随机化变体;使用拓比提供的VLA混合训练模板和最佳实践配置,按1:50的真实/仿真数据比例混合训练;训练过程中每迭代一轮,就在真实机器人上做验证,收集失败case反馈回拓比做定向补充采集,前后共做了3轮闭环迭代。

量化结果对比。引入闭环方案前后的指标对比如下(同一测试集、同一机器人硬件、同一评估人员):

  • 真实场景端到端任务成功率:从43%提升到89%(+46个百分点),其中简单任务(取物、搬运)成功率达到98%,中等难度任务(收纳、清洁)达到91%,复杂任务(做饭、多步操作)达到76%;
  • 模型训练周期:完整训练一轮的端到端周期(数据准备→仿真扩增→训练→验证→回采)从原来的平均6个月缩短到了平均6周,迭代速度提升了4倍以上;
  • 单位能力提升成本:按"成功率每提升1个百分点所需的综合成本"计算,闭环方案实施后为1.2万元/百分点,而之前纯靠人工采集新数据的模式下为7.8万元/百分点,单位成本下降了84.6%;
  • 泛化能力:在完全未见过的全新家庭环境(之前没有任何真实/仿真数据的新房)中做零样本泛化测试,旧模型成功率仅21%,闭环训练后的新模型成功率达到62%,泛化能力显著增强。

客户的具身算法总监在项目结项会上做了这样的总结:"之前我们的模式是'采集一点数据、训练一次模型、卡壳了再想办法去采集更多数据',效率很低,方向感也差,像在黑暗中摸石头过河。用了拓比的闭环方案后,整个迭代流程变得可预期、可规划——每一轮闭环大概花几周、大概能提升多少成功率、失败case怎么处理,全都了然于胸。这种从'摸着石头过河'到'开着GPS前进'的变化,是我们最大的收获。"

七、2026-2027路线图:更大规模的数据、更开放的模型、更深的集成

四阶段闭环方案已经在多个头部客户那里取得了阶段性成果,但拓比的基础设施建设远未到止步的时候。2026年下半年到2027年,拓比将沿着三个战略方向继续投入。

方向一:数据集规模持续扩大,目标2027年底累计2000万条轨迹。数据规模是闭环飞轮能够越转越快的燃料。2026年底前,拓比会将标准化数据集的累计规模从当前的43万条扩展到100万条;2027年底前进一步冲刺到2000万条(含仿真扩增变体在内的统一索引数据集)。重点增加的方向包括:餐饮服务场景数据集、农业采摘与加工场景数据集、户外公共服务场景数据集、双臂协同与人-人协作操作数据集等当前行业数据供给的空白领域。

方向二:推出开源可用的VLA预训练基础模型。2026年底到2027年初,拓比将联合NVIDIA、华为昇腾等生态伙伴,基于累计数百万条真实轨迹+数十亿条仿真变体的混合训练数据集,发布并开源一个通用VLA预训练基础模型(暂定名"TB-VLA-Base v1.0")。模型将包含多个不同参数量的版本(300M/1B/3B/7B),支持PyTorch、MindSpore双框架,附带针对零售、酒店、物流、家庭等6大场景的微调脚本和基线效果。任何公司和研究机构都可以在这些预训练权重的基础上做自己场景的微调,而不必从零开始训VLA——我们希望通过开源,进一步降低整个具身智能行业的算法门槛,让更多中小团队也能做出自己的场景VLA应用。

方向三:与更多机器人厂商深度集成,实现数据到部署的最短路径。闭环的最后一公里,是在真实机器人上完成策略部署与执行验证。2026-2027年间,拓比将与人形机器人、双臂协作机器人、服务机器人等主流赛道的前10家头部厂商逐一做深度集成合作,包括:预集成各厂商机器人的URDF模型与控制接口、将各厂商的真实机器人接入拓比的仿真工具链做自动模型校准、为合作厂商提供失败case到定向采集的一键回传API接口等。目标是让合作厂商的工程团队,拿到拓比数据集和预训练模型后,只需要做极少量的适配工作就能在自己的机器人上跑出有实用价值的VLA能力。

写在最后
回望整个AI产业的发展历程,我们会发现一个清晰的规律:每一次重大的技术跃迁,背后都伴随着一套完整的、闭环的基础设施范式的成熟。NLP领域从词袋模型到BERT的跃迁,背后是"大规模爬取→清洗去重→tokenize→预训练→下游微调"的完整数据工程流水线的成熟;AIGC图像领域从GAN到Stable Diffusion的跃迁,背后是"LAION数据集+扩散算法+DreamBooth/LoRA微调"的闭环范式的成熟。

今天的具身智能VLA领域,正处在类似2017年Transformer刚出来时NLP领域的历史节点上——大家都隐约知道了大方向(多模态大模型+大量真实世界数据+仿真环境+机器人硬件),但把这些环节串成一个真正高效运转、自我进化的闭环基础设施,还没有成熟的标准答案。

拓比科技过去两年所做的全部努力,从头戴采集设备E6到多视角采集架P3,从采集运营平台到AI辅助标注系统,从6大行业数据集矩阵到Real-to-Sim/Sim-to-Real工具链,本质上都是在为这个未来的标准答案添砖加瓦。我们不是在做孤立的一个个硬件或软件产品,而是在构建一套端到端的、能够自我进化的具身智能数据与训练基础设施。

数据采集→标注治理→仿真扩增→混合训练→失败回采→定向补采,再回到数据采集。当这个飞轮的每一个环节都被打磨得足够顺滑、足够高效,当越来越多的客户和合作伙伴加入到这个生态中来,具身智能从实验室走向千家万户的那一天,就真的不再遥远了。

我们已经铺好了第一段路,接下来的征程,诚邀所有志同道合的伙伴同行。
注:本文转载自拓比科技官方,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。如有侵权行为,请联系我们,我们会及时删除。