具身智能数据集
EgoSuite 第一视角人类行为数据集
100,000+ 小时第一视角长视频 · 头部 IMU 200Hz · 凝视点与手部关键点标注 · VLA 模型预训练
小时视频100,000+
IMU 采样200Hz
手部关键帧21 点
日常/厨房/办公/零售/户外5 大场景
交付格式LeRobot 3.0
100,000+ 小时第一视角长视频 · 头部 IMU 200Hz · 凝视点与手部关键点标注 · VLA 模型预训练
| 数据集名称 | EgoSuite 第一视角人类行为数据集 |
| 数据总量 | 100,000+ 小时 |
| 数据类型 | RGB-D 视频、IMU 200Hz、眼动 gaze、手部 21 关键点、自然语言指令 |
| 视频规格 | 1920×1080 @ 30 FPS |
| 交付格式 | LeRobot 3.0 / RLDS / HDF5 / JSON 元数据 |
| 授权方式 | 授权数据或项目定制 |
每份数据包含完整的结构化字段,覆盖从基础元数据到专业分析的全部需求。
| 字段类别 | 典型字段 |
|---|---|
| Ego-centric 视频 | 视频文件、帧率、分辨率、录制时长、相机标定参数、曝光与白平衡、FOV 160° |
| 头部姿态与 IMU | 200Hz 加速度计、陀螺仪、磁场计、头部朝向四元数、时间戳对齐 |
| 凝视与手部关键点 | 2D/3D gaze 点、左右手 21 关键点、手势分类、操作对象边界框、接触状态 |
| 动作与场景标注 | 动作片段起止时间、场景标签、任务目标、自然语言指令、失败/成功标记、操作对象状态转移 |
| 元数据与合规 | 设备型号、采集者角色、隐私脱敏标识、授权范围、数据版本 |
以下为脱敏后的结构化 JSON 样例,展示典型数据格式。
{
"episode_id": "EGO-2026-0089123",
"scene": "kitchen_morning",
"duration_sec": 1847,
"video": {"path": "video_0089123.mp4", "fps": 30, "resolution": [1920, 1080]},
"imu": {"path": "imu_0089123.csv", "sample_rate_hz": 200, "axes": ["acc_x","acc_y","acc_z","gyro_x","gyro_y","gyro_z"]},
"gaze": {"timestamps": [0.033, 0.066], "points_2d": [[512, 384], [520, 390]]},
"hand_keypoints": {"left": [[x,y,v], ...], "right": [[x,y,v], ...]},
"actions": [
{"start": 12.5, "end": 18.2, "label": "open_fridge", "object": "fridge", "success": true}
],
"nl_instruction": "从冰箱里取出牛奶并倒入杯中"
}大规模 ego-centric 视频与自然语言指令对齐,训练视觉-语言-动作基础模型。
人类第一视角操作片段为机械臂/人形机器人提供跨本体动作示范。
连续长视频与多模态信号构建可预测的人类日常活动世界模型。
支持未来动作预测、Procedure Learning、对象交互检测等基准任务。
凝视与手势数据训练头戴设备的意图识别与手势交互模型。
家庭场景长视频支持老年人起居监测与智能助手决策。
长沙朗慧信息科技有限公司 DataAssetsAPI 平台,致力于为 AI 企业、科研机构提供高质量、合规的数据资产。支持按维度、按数量规模灵活组合。
数据样本预览 · 定制化数据方案 · 专业技术支持