返回新闻资讯

AI辅助标注与预标注系统:把标注成本从"千元每条"降到"百元级"

2026-07-31 15:07 3
拓比数据平台 · 产品详解系列

AI辅助标注与预标注系统:把标注成本从"千元每条"降到"百元级"

三级标注体系+自研预标注大模型,效率提升6-8倍,成本降至行业平均的1/7
发布时间:2026年7月31日 阅读时长:约14分钟 字数:约2500字
配图
核心观点:在具身数据的整体成本构成中,标注环节通常占比超过60%,是当之无愧的"成本大头"。传统纯人工标注一条包含多视角视频、手部关键点、物体6D位姿、动作语义分割的复杂操作轨迹,行业平均成本在1200-1800元之间,交付周期长达2-3周。拓比通过"AI预标注→标注员复核校正→专家质检抽审"的三级标注体系,结合自研的2D/3D检测大模型、多视角人体姿态与手关键点追踪算法、6D位姿估计引擎,实现了80-90%标注工作的自动化完成。实际项目数据表明,拓比将复杂轨迹的标注成本从行业平均的~1500元/条降低到~200元/条,交付周期压缩到2-3天,且标注一致性和准确率显著优于纯人工方案。

一、标注:具身数据成本中最大的那块蛋糕

"我们上一个5000条轨迹的数据集项目,总预算的68%花在了标注上。"2026 WAIC具身智能数据工作坊上,一位头部大模型公司的数据集负责人分享了这样一组数字,"采集花了不到三分之一,存储、传输、质检、管理加起来不到10%,剩下的大头全是标注。而且越复杂的场景,标注的占比越高——医疗和工业场景的标注占比甚至能超过80%。"

为什么具身数据的标注这么贵?要回答这个问题,首先需要理解具身数据的标注究竟有多复杂。与传统图像识别或视频理解任务相比,具身智能VLA模型训练所需的标注维度要丰富得多:

  • 多视角2D检测与跟踪:一台E6头戴设备就有6路相机,每帧都需要标注出画面中的物体(bounding box + 类别 + instance ID),还需要跨帧、跨视角做关联跟踪,确保同一个物体在不同视角和不同时间帧中的ID保持一致;
  • 3D点云检测与分割:对于配有深度传感器的采集设备,还需要在3D点云上标注出物体的三维包围盒、语义分割掩码,这比2D标注的工作量大了一个数量级;
  • 人体与手关键点:VLA模型要理解人类的操作意图,就需要精准追踪21个手部关键点(每只手21个,双手42个)和17个全身关键点的连续变化轨迹,关键点位置的误差必须控制在几个像素以内;
  • 物体6D位姿:被操作物体的三维位置(XYZ)和三维旋转(roll/pitch/yaw)需要逐帧标注,6个自由度的精确标注需要标注员从多个视角反复比对,极其耗时;
  • 动作语义分割:一条几分钟的操作轨迹,需要切分成"伸手→抓取→移动→放置→调整"等原子操作片段,每个片段还要贴上语义标签(如"抓取矿泉水瓶"、"放置到货架第二层")。

把这些维度叠加起来,一条5分钟的零售理货操作轨迹,纯人工标注的平均工时在8-12小时之间。按标注员的人力成本折算,一条轨迹的标注费用轻松突破1000元。而复杂的医疗手术操作或精密工业装配场景,标注工时甚至能达到20-30小时/条,单条标注成本超过3000元。

更头疼的是,纯人工标注不仅慢、贵,而且质量不稳定。不同标注员对"什么算抓取的开始"、"什么算放置的结束"的定义理解不一致,同一个标注员在不同时间段的标注精度也有波动。有研究表明,纯人工标注的关键点误差方差是AI辅助标注的2.3倍,一致性(inter-annotator agreement)仅为0.71,远低于工业应用要求的0.9以上。

拓比科技的标注技术团队,从2024年Q3开始启动AI辅助标注系统的研发。他们的目标非常明确:不是用AI完全取代人,而是用AI做80-90%的"笨活"和"累活",让人只做最有价值的10-20%的判断和校正工作。

二、三级标注体系:AI预标注 → 人工复核 → 专家质检

拓比的标注生产流程采用严格的三级梯队结构,每一级都有明确的职责边界、质量标准和时间SLA,确保最终交付的标注数据既高效又可靠。

第一级:AI预标注(Automated Pre-annotation)。通过质检的原始数据进入标注流水线后,第一步不是分配给标注员,而是送入AI预标注集群。这个集群由128张A100 GPU组成,运行拓比自研的多个预标注大模型:2D/3D物体检测模型、人体与手关键点追踪模型、6D位姿估计模型、动作分割模型等。数据在集群中经过全自动流水线处理,通常在几小时内就能完成全部自动化标注,输出初版的标注结果。这个阶段完成了大约80-90%的"体力活"——把大量重复、机械的像素级、帧级标注工作交给了AI。

第二级:标注员复核校正(Human Review & Correction)。AI预标注的结果会以可视化的形式呈现在拓比自研的人机协同标注界面上,分配给经过专业培训的标注员进行复核。标注员不需要从零开始画框、标点、拉线,只需要逐一检查AI的结果:把漏标的物体补上,把位置不准确的关键点拖到正确位置,把分类错误的语义标签改正。根据拓比的运营数据,AI预标注的准确率在大多数场景下可以达到80-90%,标注员通常只需要修正10-20%的内容,一条5分钟轨迹的平均复核时间从原来的8-12小时缩短到了1-1.5小时。

第三级:专家质检抽审(Expert QA Sampling Audit)。标注员复核完成后的数据并不会直接交付,而是进入专家质检环节。拓比建立了分级抽样机制:新标注员的前50条数据实行100%全检,资深标注员的数据按15-20%的比例抽检,高价值/高难度任务(医疗、工业)的抽检比例提升到30-50%。质检团队由具有计算机视觉或机器人学背景的资深专家组成,他们不仅检查标注的准确性,更关注标注的语义一致性和逻辑合理性——比如"伸手到抓取"的时间间隔是否合理、物体被抓起后位置的连续变化是否符合物理规律。

三级体系的配合,使得拓比在标注速度、标注成本、标注质量三个维度上找到了最优平衡点。

配图

三、自研2D/3D检测大模型:3000+物体与80+手势的自动识别

AI预标注效果的好坏,首先取决于检测模型的"眼力"够不够好。拓比基于超过430万条已采集的具身轨迹数据,训练了专门面向Egocentric(第一视角)操作场景的2D/3D检测大模型。

为什么需要专门训练"Egocentric检测模型",而不是直接用公开的通用检测模型?这里面有一个经常被忽视的关键差异:通用检测模型的训练数据大多来自互联网上的第三方视角图片,相机位置高、画面稳定、物体完整居中;而Egocentric视角的画面,是佩戴在人头上的相机拍摄的,画面抖动大、物体经常被手遮挡、视角变化剧烈、很多物体只露出局部——这些特征导致通用检测模型在Egocentric数据上的表现会大打折扣,mAP(平均精度均值)往往下降20-30个百分点。

拓比的检测大模型,专门针对Egocentric场景做了一系列优化:

  • 训练数据层面:使用了超过1.2亿帧已标注的Egocentric操作画面,覆盖零售、酒店、物流、医疗、工业、家庭6大场景,3000+常见物体类别(从矿泉水瓶、零食包装这类日用品,到手术器械、电子元器件这类专业物品);
  • 模型架构层面:在主流检测架构(Transformer-based)的基础上,增加了时序上下文模块和遮挡推理模块,利用前后帧的信息推断当前帧中被遮挡物体的位置,显著提升了被手遮挡物体的检测召回率;
  • 多视角融合层面:利用E6设备6路相机的多视角信息,通过跨视角几何约束来校正单视角检测中的误检和漏检,将整体mAP提升了8.7个百分点。

手势识别方面,模型可以自动区分80+种常见手势类型,包括抓取类(捏取、抓握、托举)、操作类(旋转、按压、拨动、撕扯)、交互类(递接、摆放、展示)等,覆盖了绝大多数日常操作场景中的手势形态。在2D标注任务上,拓比检测模型的综合指标表现如下:物体检测mAP@0.5为94.3%,物体跟踪MOTA为91.6%,手势分类top-1准确率为96.2%——这些指标均显著优于公开的通用检测模型。

四、人体姿态与手关键点检测:多视角下的21+17关键点追踪

在具身智能的VLA模型训练中,"人类的手是怎么动的"是最核心、最有价值的信号之一——这也是标注中最耗时、最容易出错的环节。纯人工标注手部关键点时,标注员需要在每一帧的每只手上精准标注21个关键点(手腕、手掌、四指的三个关节、拇指的两个关节等),双手就是42个点,一条5分钟30fps的视频有9000帧,纯手工标注的工作量可想而知。

拓比的人体姿态与手关键点追踪模型,基于多视角视觉信息融合技术,实现了高精度、高鲁棒性的全自动关键点标注。模型的核心能力包括:

21个手部关键点的连续追踪。模型不仅能识别静止状态下手部关键点的位置,更重要的是能在连续视频帧中保持关键点的稳定追踪——即使手在快速运动、被物体部分遮挡、或者从一个视角移动到另一个视角,追踪都不会丢失或跳变。针对快速抓握这类高动态动作,模型通过光流预测和时序平滑模块,将快速运动帧的关键点误差控制在3.2像素以内(3840×2160分辨率下)。

17个全身关键点的姿态估计。除了手部,全身的姿态信息同样重要——人的身体朝向、手臂挥动轨迹、躯干弯曲角度等,都是理解操作意图的重要线索。拓比模型支持COCO格式的17个全身关键点(鼻子、眼睛、耳朵、肩膀、手肘、手腕、髋部、膝盖、脚踝)的自动检测与追踪,与手部关键点的追踪结果做融合和骨骼约束校正,确保全身关键点之间的空间关系符合人体工学约束。

多视角融合与3D关键点重建。对于有多视角数据的采集任务(P3多视角固定架的3-8路相机,或多个E6佩戴者协作的场景),模型可以利用多视角之间的几何约束,将2D关键点反投影到3D空间,直接输出3D坐标形式的关键点轨迹——这一步如果用纯人工完成,工作量至少是2D标注的3倍以上。

在拓比内部的基准测试中,手部关键点检测的PCK@20(预测点与标注点距离在20像素以内的比例)达到了97.1%,全身关键点的PCK@50为98.4%。这意味着标注员在复核关键点标注时,绝大多数时候只需要用肉眼快速扫一遍,不需要做任何调整。

五、6D位姿估计:被操作物体的6自由度轨迹自动还原

当机器人需要复现人类的操作动作时,它不仅需要知道"手在哪个位置",更需要知道"被操作的物体在什么位置、什么姿态,以及它是怎么被一步步移动的"。这就要求对被操作物体进行6D位姿(6D Pose)的逐帧标注——3个维度的平移(XYZ坐标)加上3个维度的旋转(俯仰角、偏航角、翻滚角)。

6D位姿标注的难度在于,旋转参数的微小误差(比如几度的偏差)就可能导致机器人执行时完全放错物体方向。纯人工标注6D位姿时,标注员需要借助3D交互界面反复调整视角和参数,一个物体的一帧6D位姿标注平均需要40-60秒,一条轨迹中如果有10个被操作物体,总工时轻松超过10小时。

拓比自研的6D位姿估计引擎,通过以下技术链路实现了高质量的自动化位姿标注:

物体模板对齐 + 多视角几何约束。对于数据集中出现的常见物体,引擎会预先获取或重建其高精度3D模型(CAD模型或多视角重建模型)。在每帧视频中,引擎通过2D检测框定位物体后,会将3D模板与多视角图像中的物体轮廓、纹理进行对齐,结合相机内外参数和已知的视角几何关系,解算出物体的6D位姿初值。

时序平滑与物理一致性约束。单帧解算的位姿可能会有抖动和跳变,引擎通过时序滤波模块(结合物体运动学模型和人手-物体交互约束),对整条轨迹的位姿序列进行平滑优化。优化时会引入物理合理性检查——比如物体的运动轨迹不能有突然的、不符合物理惯性的位置跳变,物体被手抓住后与手的相对运动轨迹应该保持稳定。

无CAD模型物体的位姿估计。对于没有现成3D模型的新物体,引擎可以利用一段视频中的多视角信息,通过NeRF(神经辐射场)或SDF(有符号距离场)技术在线重建一个轻量化的3D表示,再基于这个表示进行位姿追踪——精度虽然比有CAD模型的情况略低,但仍然可以达到85%以上的人工水平,满足大多数场景的需求。

在有精确CAD模型的情况下,拓比6D位姿估计引擎的平均平移误差为1.8mm,平均旋转误差为2.3度;在无CAD模型的情况下,平移误差约为4.5mm,旋转误差约为5.7度——这些精度指标在实际项目中经过客户验证,完全满足VLA模型训练的要求。

六、人机协同标注界面:让标注员只做最有价值的事

"AI预标注做得再好,最后那10-20%的人工校正效率,还是取决于标注工具好不好用。"拓比标注产品经理在一次内部分享中这样总结,"工具设计的核心理念,是让标注员的手尽量不离开键盘,让每一次点击都产生最大的校正价值,让繁琐的重复操作尽可能被快捷键和自动化操作替代。"

拓比自研的人机协同标注界面,围绕AI预标注结果的复核校正场景做了大量深度优化:

  • 可视化叠加显示:AI生成的标注结果(检测框、关键点、位姿坐标系、动作分割条等)以半透明彩色叠加在原始视频画面上,标注员一眼就能看出哪里对哪里错——红色高亮表示AI置信度低、建议重点检查的区域,绿色表示高置信度、基本不需要看的区域;
  • 批量校正与智能插值:如果某段时间内物体的检测框持续偏移,标注员只需要在这段的第一帧和最后一帧各校正一次,系统会自动通过贝塞尔插值或光流对齐补全中间所有帧的校正值——100帧的校正工作从逐帧调整变成了两次点击;
  • 快捷键操作全覆盖:几乎所有操作都有对应的快捷键,从帧的前进后退、播放速度切换,到标签的快速选择、关键点的位置微调,熟练的标注员可以全程不用碰鼠标;
  • 多视角联动:对于多视角数据,6路视频画面同步播放、同步跳转,在一个视角做的校正会自动投影到其他所有视角,标注员不需要在多个窗口间来回切换;
  • 3D交互便捷化:6D位姿的校正支持"2D画面拖拽+参数滑杆微调"两种模式,标注员既可以在画面上直观地拖动物体的3D包围盒,也可以通过精确的数值滑杆微调旋转角度。

工具层面的优化叠加AI预标注的能力,最终反映在效率指标上非常可观:以一条典型的5分钟零售理货轨迹为例,纯人工标注需要8-12人时,拓比的AI辅助标注只需要1-1.2人时,综合效率提升了6-8倍。对于流程更标准化的家庭清洁类轨迹,效率提升甚至可以达到10倍以上。

七、真实成本数据:从1500元/条到200元/条的跨越

聊了这么多技术细节,最后落到客户最关心的问题上:这套系统究竟能帮客户省多少钱?

我们用一个真实项目案例来说明。2026年Q1,某头部大模型公司委托拓比采集并标注10000条零售理货操作轨迹,要求包含6路视频、2D/3D物体检测与跟踪、双手关键点、被操作商品6D位姿、动作语义分割等全部标注维度。作为对比,该客户上一年同期曾向另一家传统数据服务商采购过类似规格的3000条数据。

两组数据的对比如下:

  • 传统服务商(上一年项目):单条标注成本约1480元,3000条标注总费用444万元;平均交付周期19天/批,总历时55天;客户方验收时发现的标注错误率为4.7%,经过两轮返工后最终交付。
  • 拓比科技(2026年Q1项目):单条标注综合成本约198元,10000条标注总费用198万元(不到传统方案的一半,数据量却是3倍多);平均交付周期2.5天/批,10000条数据分4批在14天内全部交付;客户方验收的标注错误率为0.42%,未返工直接通过。

客户在项目复盘报告中写道:"标注成本下降到原来的1/7.5,交付速度提升了4倍,标注质量反而显著提升。这不仅是费用的节省,更重要的是我们VLA模型的迭代周期从两个月缩短到了两周,这带来的商业价值远远超过了数据采购成本本身。"

需要说明的是,上述198元/条是包含AI算力成本、标注员人力成本、专家质检成本、平台管理成本在内的全口径综合成本。不同场景由于复杂度不同,具体的成本数字会有一定波动:家庭和零售场景通常在150-250元/条,物流和酒店场景在200-350元/条,医疗和工业等复杂场景在300-600元/条。但无论哪个场景,与传统纯人工标注相比,都有5-10倍的成本降幅。

写在最后
标注成本的居高不下,是近两年阻碍具身智能VLA模型规模化训练的核心瓶颈之一。当训练一个像样的VLA模型需要几十万甚至上百万条轨迹的时候,如果每条的标注成本上千元,仅标注费用就会是天文数字——这会把绝大多数创业公司和研究机构挡在门外。

拓比AI辅助标注系统的核心价值,在于用"AI做主体、人做裁判"的人机协同模式,把具身标注的成本曲线从"指数级上升"拉回了"近似线性增长"的轨道。当单条复杂轨迹的标注成本从1500元降到200元,当10000条数据的交付周期从两个月缩短到两周,VLA模型训练的门槛就实实在在地降低了一个数量级。

更重要的是,这套系统的能力还在持续进化。随着标注数据越来越多,预标注模型的准确率会越来越高,需要人工校正的比例会越来越低——这是一个正向飞轮:标注质量更好→模型训练更好→预标注更准→标注成本更低→能采集和标注更多的数据。我们相信,在这个飞轮的推动下,具身标注的成本还将继续下探,终将降到让"海量轨迹训练VLA"不再是少数巨头的特权,而是整个行业都能享受到的基础设施。
注:本文转载自拓比科技官方,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。如有侵权行为,请联系我们,我们会及时删除。