具身智能数据集生态深度普查报告
- 检索完成日期:2026-08-27(报告日期 2026-08-28)
- 方法:对每个数据集实查其 HuggingFace 数据卡、官方网站或 GitHub 仓库(本文所有"已核实"字样均指从官方页面原文直接确认;WebFetch 全域被网络策略阻断,改用 webReader 抓取官方页面全文)。规模与统计以官方页面/论文口径为准,第三方口径单独标注。
- 覆盖:20 个数据集/数据族,含海外通用真机操作、第一人称人类视频、合成/仿真、国内厂商与社区生态五大类。
- 局限声明:部分许可原文未能逐字核实(DROID 官方页、GR00T 数据集、WIYH、SynGrasp-1B、FMB、DexMV),正文中以"待核实"标注,不作商用决策依据。
0. 一页结论
- 许可是这条赛道最大的分水岭。同为"开源",BridgeData V2 是 CC BY 4.0(可商用、可再分发),而 AgiBot World 是 CC BY-NC-SA 4.0(禁商用+相同共享)、Ego4D 是 CC BY-NC 4.0(禁商用)。把 NC 数据混进商用训练管线是合规事故,不是技术问题。
- 规模竞赛已进入"十万小时"量级:光轮 EgoSuite-Open100K(100,000 小时第一人称)> AgiBot World 全量(100k+ 轨迹/300h+,Beta 宣称 ~1M 轨迹)> DROID(76k 轨迹/350h)> RoboMIND(107k 轨迹,2.0 版 310k+)> OXE(1M+ 轨迹聚合)。
- 格式已收敛出双标准:Google 系遗产 RLDS/TFDS(OXE、DROID)正在被 LeRobotDataset v3.0(Parquet+MP4、Hub 可流式)取代;光轮进一步用 LeRobot v3 + MCAP 双格式发布,是新发布数据集的参考范式。
- 采集规范共识:多相机(1 全局/过肩 + 腕部,厂商级 8 相机+深度)+ 相机内外参标定随包 + 纳秒级时间戳 + 脱敏管线 + 语言指令标注。这五件套是我们垂域数据产品可以直接对标的最低标准。
- 商业模式三极:智元(NC 开源换生态)、光轮(明示"学术+商业训练可用"+gated 引流)、京东 robotdata(按原子任务 SKU 付费交易,如"用干布整理纸巾盒表面 78GB")。我们垂域业务天然属于第三极,合规管线应对标光轮。
1. 海外通用真机操作数据集
1.1 Open X-Embodiment(OXE / RT-X 数据池)
- 规模:1M+ 真机轨迹,22 种本体(单臂/双臂/四足等),21 家机构联合,527 项技能(160,266 个任务)。论文口径为聚合 60 个数据集(来自 34 个实验室),社区镜像与 issue 显示清单已增长至约 70 个,成员许可以官方 spreadsheet 为准。
- 本体/相机:22 种本体各异(WidowX、Franka、Kuka、xArm 等),相机配置随成员数据集。
- 格式:RLDS/TFDS episode 格式(TensorFlow 生态),经 gsutil 从 gs://gresearch/robotics 等 GCS bucket 下载,或 tfds.builder_from_directory 直读。社区镜像:HF jxu124/OpenX-Embodiment。
- 许可(已核实,来自官方 GitHub README):仓库软件 Apache-2.0,其余材料 CC-BY 4.0;但约 60-70 个成员数据集各自许可不一,无统一商用授权,商用需逐个核对(第三方 particula.tech 分析确认论文无许可章节,许可记录在 spreadsheet)。
- 获取难度:开放(gsutil 直下,部分成员 bucket 偶有缺失,issue 记录过"55 个只能下到 27 个"的时段)。
- 质量口碑:VLA 模型预训练的事实标准数据池(RT-X、OpenVLA、pi0 均用),但成员间质量、频率、相机配置高度不均,通常需要重加权/过滤。
- 链接:https://github.com/google-deepmind/open_x_embodiment | https://robotics-transformer-x.github.io | https://huggingface.co/datasets/jxu124/OpenX-Embodiment
1.2 OXE 成员:Fractal(Google 厨房数据)与 RT-1/Kitchen
- 规模:fractal20220817_data 约 73.5k 轨迹(第三方统计口径);RT-1 训练用厨房任务演示为 OXE 的重要成员。均为 Google 内部 Everyday Robots 数据,仅通过 OXE 渠道发布,不单独提供。
- 本体/相机:Everyday Robots 移动操作机器人,多相机(含高处/宽视角)。
- 格式:RLDS/TFDS,随 OXE 分发。
- 许可:随 OXE 伞状条款;商用需按成员条目核对。
- 获取难度:开放(经 OXE),体量大、下载耗时。
- 质量口碑:RT-1/RT-2 的原始训练数据,指令标注质量高,是 OXE 内最常被单独引用的成员。
- 注意混淆点:OXE 里的"Fractal"与 Stanford/Berkeley 的 FMB(Functional Manipulation Benchmark,见 1.7)是两回事,后者是独立公开基准。
- 链接:https://github.com/google-deepmind/open_x_embodiment(成员清单 spreadsheet)
1.3 BridgeData V2
- 规模(已核实,官网原文):60,096 条轨迹 = 50,365 条遥操作演示 + 9,731 条脚本 rollout;24 个环境、13 项技能。
- 本体/相机(已核实):WidowX 250 6DoF 低成本臂;VR 遥操作,5Hz,平均 38 步/轨迹;1 个固定过肩 RGBD + 2 个随机位姿 RGB + 1 个腕部 RGB,均 640x480;JPEG 直接下载。
- 格式:原生图像/npz 自研打包;NVIDIA 提供 LeRobot v3 重排版 nvidia/BridgeData2_LeRobot_v3。
- 许可(已核实,官网原文):"All data is provided under the Creative Commons Attribution 4.0 International License"——CC BY 4.0,可商用、可再分发(需署名),是大规模真机数据里许可最干净的之一。
- 获取难度:开放,直链下载。
- 质量口碑:低成本臂+遥操作范式的事实基准,BC/RT-X 类模型标配训练集;规模适中但许可友好度第一梯队。
- 链接:https://rail-berkeley.github.io/bridgedata/ | https://huggingface.co/datasets/nvidia/BridgeData2_LeRobot_v3
1.4 DROID
- 规模:76,000 条轨迹 / 350 小时;86 个任务、564 个场景。
- 本体/相机:Franka Panda;12 个月、50 名采集员、13 家机构、3 大洲分布式采集;3 台 ZED 双目相机(2 外部 + 1 腕部)。
- 格式:TFDS/RLDS + HF 仓库(droid-dataset/droid);NVIDIA 提供 Cosmos3-DROID 镜像。
- 许可(待核实):多个第三方索引(TrueLabel 等)称 CC BY 4.0;官方站点 droid-dataset.github.io 在本次抓取中网络失败,未能逐字核对原文。商用前请以官方页/HF 卡为准。
- 获取难度:开放(HF + RLDS)。
- 质量口碑:场景/操作员多样性标杆,DROID benchmark 是 VLA 泛化评测标准之一;因分布式采集,质量方差略大但生态价值高。
- 链接:https://droid-dataset.github.io | https://huggingface.co/datasets/droid-dataset/droid | https://huggingface.co/datasets/nvidia/Cosmos3-DROID
1.5 RoboMIND(北京人形机器人创新中心 X-Humanoid)
- 规模(已核实,HF 数据卡原文):v1.2 共 107,265 条轨迹(52,926 Franka + 19,152 天工 Tien Kung 人形 + 10,629 AgileX Cobot Magic V2 双臂 + 25,170 UR-5e);479 个任务、96 个物体类、38 项技能、5 大场景。v1.0 为 55k/279 任务。RoboMIND 2.0 扩至 310k+ 双臂轨迹(arXiv:2512.24653,ModelScope 分发)。
- 本体/相机:四种本体;目录按本体+相机数组织(如 h5_franka_1rgb 等);已知坑:部分本体图像为 BGR 通道序。
- 格式:HDF5(trajectory.hdf5,含本体状态与动作);v1.2 增帧级语言标注。
- 许可(已核实):Apache-2.0,但 HF 上为 gated——需同意使用条款后获取。
- 获取难度:gated(轻审核,同意条款即得)。HF 下载量 200 万+。
- 质量口碑:国内机构数据里许可最规范的开源真机集,RSS 2025;多本体(含人形)是其独特卖点。
- 链接:https://huggingface.co/datasets/x-humanoid-robomind/RoboMIND
1.6 ALOHA / Mobile ALOHA
- 规模:原始 ALOHA(CoRL 2023,Zhao 等):每任务 50 条演示的仿真+真机小集;Mobile ALOHA:810 条演示(约 1,130+ episodes)、7 个移动操作任务。体量小但复现极广。
- 本体/相机:ALOHA 双臂 14DoF(2x6 关节 + 2 夹爪);4 相机(1 高位 + 2 腕部 + 可选);Mobile ALOHA 加移动底盘。LeRobot 官方重排版(已核实 lerobot/aloha_mobile_cabinet:85 episodes、127,500 帧、50fps、cam_high + 左右腕 3 相机、AV1 编码、Parquet v3.0 结构)。
- 格式:原始发布为图像+HDF5(Google Drive);社区/官方 LeRobot v3 版本为标准入手机型。
- 许可:代码 MIT(tonyzhaozh/act、MarkFzp/act-plus-plus,已核实);原始数据经 Google Drive 发布、许可未明示;HF 镜像 sumo43/mobile-aloha(111GB)自标 MIT。
- 获取难度:开放(GDrive/HF 镜像,原始链接偶有失效)。
- 质量口碑:双臂模仿学习(ACT、diffusion policy)的标准入门基准;数据规模小,主要价值在范式而非预训练。
- 链接:https://github.com/tonyzhaozh/aloha | https://github.com/MarkFzp/mobile-aloha | https://huggingface.co/datasets/lerobot/aloha_mobile_cabinet
1.7 FMB(Functional Manipulation Benchmark)
- 规模(已核实,官网原文):22,550 条轨迹,两类任务:单物体多阶段装配(54 种装配物 + 3 种板)与多物体多阶段装配;轨迹时长 20-40 秒(单物体)至 100 秒以上(多物体)。
- 本体/相机:Franka Panda;2 个全局视角 + 2 个腕部视角,每视角 RGB + 深度图。
- 格式:自研打包 + 全部物体 3D 可打印(CAD 公开),可复现工作区。
- 许可(待核实):官网未明示数据许可,见其 dataset 页与 rail-berkeley/fmb 仓库。
- 获取难度:开放(项目页链接下载)。
- 质量口碑:接触富集、多阶段长时序精细操作的代表集;轨迹被切分为 primitives(grasp、place on fixture、regrasp、rotate、move to board、insert),是动作切片标注的样板。
- 链接:https://functional-manipulation-benchmark.github.io/ | https://github.com/rail-berkeley/fmb
1.8 NVIDIA GR00T N1 数据族(真机+人类视频+合成混合)
- 规模:GR00T N1 模型卡口径约 96 万条 episodes 混合数据(真机遥操作 + 人类视频 + DreamData 合成)。后训练集 nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim(已核实数据卡):双臂 9k + 人形桌面 240k + 降采样 24k + 单臂厨房 72k + Unitree G1 102 ≈ 34.5 万条仿真轨迹,按任务名分目录。
- 本体/相机:Franka(单/双臂)、GR1 人形(含腰)、Unitree G1;仿真多相机。
- 格式:LeRobot 兼容格式,HF 直下(huggingface-cli --include 子集下载);月下载 146.9 万次。
- 许可(待核实):HF 页未展示许可标签;第三方索引(datasets.bot)称 CC-BY-4.0。NVIDIA docs 有 models-and-datasets 许可清单页,商用前以该清单为准。
- 获取难度:开放。
- 质量口碑:合成数据(DreamData/DreamGen:Cosmos 世界模型从单图+语言生成轨迹)路线的代表;配合 GR00T-Dreams 蓝图可低成本扩充垂域轨迹。
- 链接:https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim | https://huggingface.co/nvidia/GR00T-N1-2B
1.9 RoboTwin 2.0(清华+上海AI Lab+SJTU+HKU)
- 规模:50 个双臂任务、147 类 731 个物体(RoboTwin-OD 资产库)、5 种本体、SAPIEN 引擎、10 万+条预采集仿真轨迹。
- 格式:仿真管线开源,HF sdvkasc/robotwin。
- 许可:代码 MIT(已核实 GitHub)。数据集许可随仓库。
- 获取难度:开放。
- 质量口碑:双臂仿真+评测一体化的标杆(1.0 为 CVPR 2025 Highlight,2.0 为 ICML 2026);合成资产质量高,常被用来做合成预训练+真机微调。
- 链接:https://robotwin-platform.github.io | https://github.com/TianxingChen/RoboTwin
1.10 LIBERO(附带条目,与本项目记忆相关)
- 规模:130 个任务的 lifelong 评测套件(5 个子套件)。
- 许可:第三方对比页称 MIT;但本项目记忆库明确记录过"LIBERO 许可冲突"问题(其资产链依赖 robosuite/MuJoCo 及部分物体资产来源混杂)。商用前必须复核资产链,此条以项目记忆的保留意见为准。
- 链接:https://github.com/Lifelong-Robot-Learning/LIBERO
2. 第一人称/人类视频数据集
2.1 EgoSuite-Open100K(光轮智能 Lightwheel,2026-08-21 发布)
- 规模(已核实,官网+HF):100,000 小时第一人称人体数据;15,000+ 任务、15,000+ 采集场景;7 大环境类(家庭/酒店餐饮/零售/运动/物流仓储/办公/工业)、128 个场景类型、18 个任务大类。
- 产品线(已核实):EgoStandard 90,000h 头视角(EgoStand 80,000h 含手部 21 关节位姿;EgoStand-body 10,000h 加全身姿态)+ EgoPro(EgoStandard 基础上加腕部相机);事件级语义三层标注作为免费附加层。
- 采集(已核实):数万人规模分布式采集队伍;脱敏管线(人脸/车牌模糊 + 人工复核)+ 知情同意流程。
- 格式(已核实):LeRobot v3 + MCAP 双格式,HuggingFace Hub 可流式加载;经 HF Buckets 分发。
- 许可(已核实,原文):"open for academic research and commercial training"——明确允许商业训练用途;gated 申请(约 2-3 个工作日人工审核)。
- 获取难度:gated(审核制)。
- 质量口碑:目前第一人称具身数据规模与工程化程度的第一名;商用许可明示是其对 Ego4D 的核心差异化。
- 链接:https://lightwheel.ai/media/egosuite-open100k | https://huggingface.co/datasets/LightwheelAI/EgoStandard
2.2 Ego4D(Meta)
- 规模(已核实,官网):3,670 小时第一人称视频;923 名参与者、74 个地点。TPAMI 2025。
- 格式:自研打包(视频+五感元数据+标注),注册后下载。
- 许可(已核实):CC BY-NC 4.0——禁商用;需注册同意条款。
- 获取难度:注册 + 审批。
- 质量口碑:egocentric 视觉理解的奠基数据集(引用极高),但许可最严格之一,具身操作公司只能用于研究。
- 链接:https://ego4d-data.org
2.3 EgoDex(NVIDIA,附带条目)
- 规模:829 小时自我中心桌面双手操作,带 3D 手部跟踪标注;CVPR 2025。
- 许可:开源(MIT 口径,第三方)。
- 链接:https://ego-exo4d.github.io/egodex/
2.4 LAPA(Latent Action Pretraining,ICLR 2025)
- 定位(已核实,GitHub):不是独立数据集,而是"无动作标签视频预训练 VLA"的配方——VQ-VAE 从人类操作视频学习潜在动作(空间 8^4 离散码本),在 OXE 上以潜在动作替代真值动作做大规模预训练,再在少量真机数据上微调;预训练数据效率提升约 30 倍。
- 数据:基于 something-something v2 结构的人类操作视频 + OXE(各自守原许可)。
- 许可(已核实):代码与权重 MIT。
- 获取难度:开放(代码);训练数据需自备/守上游许可。
- 质量口碑:CoRL 2024 LangRob Workshop 最佳论文 → ICLR 2025;"人类视频当免费操作数据"路线的代表工作。
- 链接:https://github.com/LatentActionPretraining/LAPA
2.5 DexMV(用户清单中"DexMVC"的实际所指)
- 说明:检索"DexMVC"无结果;对应学术史实为 DexMV(ECCV 2022,Qin 等,NYU/UCSD/PKU)。
- 规模(已核实,项目页):15 个灵巧手任务(倒水、放置入容器、搬运重定向等,页面含 pour/place inside/relocate 三类主任务族);人类手部动捕 + 3D 手物位姿估计,重定向到多指机器手(Shadow Hand 等)。
- 格式:dexmv-sim 仿真环境与演示数据开源。
- 许可(待核实):项目页未明示数据许可。
- 质量口碑:人类视频→灵巧手操作重定向的早期奠基工作;其"人类动捕转机器手演示"管线是垂域灵巧手数据的参考。
- 链接:https://yzqin.github.io/dexmv/ | https://github.com/yzqin/dexmv-sim
3. 国内厂商数据集(2025-2026 新发布为主)
3.1 AgiBot World(智元)
- 规模(已核实,HF 数据卡+官网):全量宣称 100,000+ 轨迹、100 台机器人、300h+;Alpha 子集修订后 36 个任务、595.31h(初版 474.12h);Beta 宣称 ~1M 轨迹;2026 版(agibot-world.cn)转向 100% 真实商业/家居场景,2000 平方米场地、217 任务、3000+ 物件。
- 本体/相机(已核实):精灵 G2 移动双臂 + 6DoF 灵巧手 + 视触觉传感器;8 相机 + 深度。
- 格式(已核实):目录结构 = task_info json(action_config 原子动作切片 + key_frame 关键帧 + 语言指令)/ observations(深度 PNG + 视频)/ parameters(相机内外参标定)/ proprio_stats.h5(纳秒时间戳;state/action 层级:双臂 14DoF + 腰 2DoF + 头 2DoF + 末端 6DoF);官方提供转 LeRobot v2.0 脚本。
- 许可(已核实,原文):"AgiBot World COMMUNITY LICENSE AGREEMENT",数据与代码 CC BY-NC-SA 4.0——禁商用、衍生须相同方式共享;gated(需同意条款并留联系方式)。
- 获取难度:gated。HF 月下载 14,244。
- 质量口碑:国产真机数据规模与标注深度第一梯队,采集工程(多本体、灵巧手、视触觉)最完整;但 NC-SA 许可决定了它只能用于研究/生态,不能进商用产品。
- 链接:https://huggingface.co/datasets/agibot-world/AgiBotWorld-Alpha | https://www.agibot-world.cn
3.2 京东 robotdata(京东云具身数据交易平台)
- 定位(已核实,实抓市场页):不是开源数据集,而是数据交易 marketplace——按"原子任务"粒度上架数据 SKU。实抓样例(2026-04 上架):「用干布整理纸巾盒表面」78GB、「用小碟子摆放待客糖果」143GB、「用手叠短裤」46GB、「整理辣椒油瓶归位」等,均以家政/家庭服务类目组织,按 GB 定价交易。
- 配套(已核实,新闻口径):2026-04-17 发布"采、存、标、训、评、仿、测"全链路具身数据基础设施 + 自研超高清采集终端 JoyEgoCam + 具身大模型;另有数据采集中心与开源数据集计划。
- 格式:未公开(交易后交付)。
- 许可:按单交易授权(D 类),无开放许可。
- 获取难度:商业合作/付费。
- 质量口碑:国内"数据即商品"路线的代表,SKU 颗粒度(原子任务+物体+容器+表面)与我们垂域任务设计高度同构,值得持续跟踪其定价与交付格式。
- 链接:https://robotdata.jdcloud.com/market
3.3 银河通用 SynGrasp-1B / GraspVLA
- 规模(已核实):SynGrasp-1B 十亿帧合成抓取数据,240 个物体类、10,000+ 物体;光线追踪渲染 + 物理仿真 + 域随机化。HF 公开仓 vegebirrd/SynGrasp-1B 实抓:24,099 条视频行、总大小 4.91TB(即公开部分为全量的抽样子集),月下载 209。
- 用途:GraspVLA(arXiv:2505.03233,银河通用+BAAI+北大+港大,2025-05)——全球首个纯合成数据预训练的端到端抓取大模型,真机泛化到透明/反光物体。
- 格式:视频行为主的合成轨迹。
- 许可(待核实):HF 页无数据卡、无许可标注。
- 获取难度:开放下载(HF)。
- 质量口碑:纯合成预训练路线的国内代表;合成数据绕开真机采集成本与隐私问题,但 sim-to-real 依赖域随机化功底。
- 链接:https://huggingface.co/datasets/vegebirrd/SynGrasp-1B | https://github.com/PKU-EPIC/GraspVLA
3.4 它石智航 WIYH(Wish It Were Human)
- 规模(已核实,HF+官网+arXiv 2512.24310):1,000+ 小时、100,000+ 条真实人类操作视频、40+ 任务类型、100+ 人类技能;总体量约 36.5TB;2025-12-26 开源,自称全球首个大规模真实 VLTA(Vision-Language-Tactile-Action)数据集。
- 采集(已核实):Human-centric 范式——自研同步采集套件(RGB + 力触觉 + 手指关节位姿 + 末端轨迹),人类直接执行任务而非遥操作。
- 标注(已核实,HF worldcode JSON 规范):subtasks(子任务描述+时间戳区间+帧区间)、camera_calibration(逐相机内参/畸变/模型)、frames(逐帧 images、chest_poses、ego_poses、hand_states 手部状态);标注体系覆盖标定/深度/动作/指令/思维链 CoT/掩码/触觉。
- 格式:worldcode JSON + 图像序列 + HDF5 位姿(自研结构)。
- 许可(待核实):HF 页未标注许可标签;使用条款在官网 wiyh.tars-ai.com,商用前需联系确认。
- 获取难度:HF 开放下载(tars-robotics/WIYH,月下载 25,411)。
- 质量口碑:触觉+动作+语言的模态完整度全球独一档;2026-03 又发 OmniVTA 世界模型与 OmniViTac 数据集,是国内 human-centric 路线的旗舰。
- 链接:https://huggingface.co/datasets/tars-robotics/WIYH | https://wiyh.tars-ai.com
3.5 LeRobot 社区数据生态(HuggingFace)
- 规模(已核实):HF 上 1300+ 个 LeRobot 格式数据集;SO-100/SO-101 开源臂数量最多;community_dataset_v3 聚合 791 个数据集、46 种机器人本体。
- 格式(已核实,以 lerobot/aloha_mobile_cabinet 为例):LeRobotDataset v3.0 = meta/info.json(codebase_version v3.0、robot_type、fps、total_episodes)+ data/chunk-XXX Parquet(observation.state/effort、action、episode_index、timestamp)+ videos/ MP4(AV1/yuv420p、fps 50);Hub 支持流式加载与 Dataset Viewer。
- 许可:逐仓各自(多数 CC 系列/MIT,质量参差)。
- 质量口碑:草根长尾生态——单仓小,但聚合后覆盖本体广,是新格式事实标准的证据。
- 链接:https://huggingface.co/lerobot | https://github.com/huggingface/lerobot
4. 许可友好度 x 规模矩阵
许可等级定义: - A = 标准开放许可(CC BY 4.0 / Apache-2.0 / MIT),可商用、可再分发(CC BY 需署名;再分发不得变更许可) - B = 可用但有条件(gated 审核 / 成员各自许可 / 页面未标注许可,需个案确认) - C = 禁商用(CC BY-NC / NC-SA),只能研究用途,不能进商用产品,NC-SA 还要求衍生同样开放 - D = 纯商业交易(按单授权,无开放许可)
| 数据集 | 规模(轨迹/时长) | 许可 | 等级 | 可商用 | 可再分发 | 获取 |
|---|---|---|---|---|---|---|
| BridgeData V2 | 60,096 轨迹 | CC BY 4.0(原文核实) | A | 是 | 是(署名) | 开放直下 |
| RoboTwin 2.0 | 100k+ 仿真轨迹 | 代码 MIT | A | 是(代码) | 是(代码) | 开放 |
| LAPA | 配方(用 OXE+SSv2) | 代码/权重 MIT | A | 是(代码) | 是(代码) | 开放 |
| RoboMIND | 107k 轨迹(2.0: 310k+) | Apache-2.0 + gated | A- | 是 | 是 | gated 轻审核 |
| DROID | 76k 轨迹 / 350h | CC BY 4.0(第三方口径,待核实) | A- | 大概率是 | 大概率是 | 开放 |
| ALOHA / Mobile ALOHA | 810 演示(Mobile) | 代码 MIT;数据未明示 | B | 代码可 | 代码可 | GDrive/HF |
| GR00T X-Embodiment Sim | ~345k 仿真轨迹 | 页面未标注(第三方称 CC BY 4.0) | B | 待核实 | 待核实 | 开放 |
| FMB | 22,550 轨迹 | 未标注 | B | 待核实 | 待核实 | 开放 |
| EgoDex | 829h | MIT(第三方) | A- | 是 | 是 | 开放 |
| OXE 总集 | 1M+ 轨迹 / 22 本体 | 伞 Apache+CC-BY,成员各自 | B | 逐成员核对 | 逐成员核对 | 开放 |
| Fractal/RT-1(OXE 成员) | ~73.5k 轨迹 | 随 OXE | B | 随 OXE | 随 OXE | 随 OXE |
| LIBERO | 130 任务 | MIT(第三方)+ 资产链冲突记录 | B | 存疑 | 存疑 | 开放 |
| EgoSuite-Open100K | 100,000 小时 | 明示"学术+商业训练可用"+gated | B+ | 是(训练) | 条款内 | gated 审核 |
| WIYH(它石智航) | 1,000+h / 100k+ 视频 / 36.5TB | HF 未标注,官网条款 | B- | 待确认 | 待确认 | 开放下载 |
| SynGrasp-1B(银河通用) | 10 亿帧合成(公开 24,099 条/4.91TB) | 无数据卡、未标注 | B- | 待确认 | 待确认 | 开放 |
| AgiBot World(智元) | 100k+ 轨迹 / 300h+(Beta ~1M) | CC BY-NC-SA 4.0 + Community License | C | 否 | 否(NC-SA) | gated |
| Ego4D | 3,670h | CC BY-NC 4.0 | C | 否 | 否(NC) | 注册审批 |
| 京东 robotdata | 按任务 SKU(单 SKU 46-143GB 级) | 按单交易授权 | D | 付费后是 | 否 | 商业合作 |
矩阵读法: - "规模大且许可友好"的只有 BridgeData V2(60k 轨迹级)与 RoboMIND(Apache-2.0);上到"十万小时"量级后全部落入 B(gated/未标注)或 C(NC)。 - 光轮 EgoSuite 是唯一在超大规模上明示"商业训练可用"的玩家——它的 gated 审核本质是商业获客漏斗。 - NC 许可(智元/Ego4D)可以安全用于研究与模型选型对照,但绝不可作为商用训练数据来源;同理不可将其转卖或混入交付数据。
5. 对智涌飞轮垂域数据业务的可借鉴点
5.1 采集规范(对标五件套)
- 相机配置共识:学术级 = 1 全局/过肩 + 腕部(Bridge/DROID/ALOHA/FMB 均如此);厂商级 = 6-8 相机 + 深度 + 视触觉(AgiBot);第一人称级 = 头 + 腕双相机(光轮 EgoPro)。我们首垂域最低配建议:1 固定全局 + 1 腕部/桌面特写,预留深度位。
- 标定随包:AgiBot 每条数据带 parameters(相机内外参);WIYH worldcode JSON 内逐相机 intrinsic/distortion/camera_model。我们每份交付 manifest 应附标定文件与采集几何图——这与本仓"最小投影+签名回执"契约天然契合。
- 时间戳纪律:AgiBot proprio_stats.h5 用纳秒时间戳做多源对齐;WIYH 逐帧 timestamp + 位姿。多相机/多传感不同步是数据废品的首要原因。
- 频率与单位显式化:Bridge 标注 5Hz;LeRobot meta/info.json 强制 fps 字段。交付物必须写明控制频率、关节单位、夹爪归一化口径(RoboMIND 的 BGR 坑说明连头部大厂都会踩格式坑)。
- 脱敏管线:光轮"人脸/车牌模糊 + 人工复核 + 知情同意"是可对标的行业标准动作,与本仓数据安全规则(不入 Git 原始媒体/采集者身份/同意书)形成采集端-仓储端闭环。
5.2 任务设计(SKU 化与三层类目)
- 原子任务 SKU 化:京东的命名法——「用干布+整理+纸巾盒表面」「用小碟子+摆放+待客糖果」= 工具/动作/物体(+容器/表面) 的组合,直接决定了数据集颗粒度与定价单位。我们首垂域 7 字段的任务定义可按此结构化。
- 三层类目树:光轮 环境(7)→场景类型(128)→任务大类(18)→任务(15,000+);Bridge 24 环境/13 技能;RoboMIND 479 任务/38 技能/96 物体类。建议我们的垂域清单采用 场景→任务→原子技能 三层,技能层控制在 10-40 个以便统计与质检。
- 长轨迹切原子段:FMB 把 20-100 秒轨迹切成 grasp/regrasp/rotate/insert 等原语;AgiBot 用 action_config + key_frame 做同样的事。众包采集按原子段验收,比按整轨迹验收更可控——这直接可用于我们的 QC 规则与结算语义。
5.3 标注体系(最小标注集 + 增值层)
- 最小标注集(每轨迹必备):语言指令(Bridge/RT-1 逐轨迹,RoboMIND v1.2 到帧级)+ 成功/失败标记 + 关键帧 + 相机标定。
- 增值层一:手部/人体状态——光轮手部 21 关节位姿 + 全身姿态;DexMV 的手物位姿。垂域为手部操作时这是溢价点。
- 增值层二:多模态——WIYH 的力触觉 + CoT(思维链)标注开创了"教机器人为什么这么做"的标注维度。
- 增值层三:事件级语义——光轮的三层事件标注作为"免费附加层"送,实为获客策略;我们可把基础标注打进交付价、高级标注(帧级语言/CoT/触觉)作为可选 SKU。
- 结构借鉴:WIYH 的 worldcode JSON(subtasks 带时间戳+帧双区间、逐帧 hand_states)是可以直接参考的交付 schema。
5.4 许可与合规策略
- 交付默认商用友好:凡是开放样例/能力展示数据,用 CC BY 4.0 或自定"允许训练"条款(学光轮明示"commercial training"),避免学智元 NC-SA 把商业客户挡在门外。
- 客户专属数据走交易授权(京东模式):按单授权 + 禁再分发 + 禁转卖写进条款;我们的 Platform 适配器(manifest/签名/审计)正好承载授权与溯源。
- 训练侧合规红线:商用模型训练数据白名单只收 A/A- 级(Bridge、RoboMIND、DROID 核实后、EgoSuite 条款内);AgiBot/Ego4D 只做研究对照;OXE 成员逐个核对 spreadsheet 后才可用。
- gated 机制即商务漏斗:AgiBot(同意+联系方式)、RoboMIND(同意条款)、光轮(2-3 天审核)都把"开放下载"改造成"留资+条款确认"。我们发布垂域样例集时可复用此模式。
5.5 格式选择
- 主格式 LeRobotDataset v3.0(Parquet+MP4/AV1、Hub 可流式、社区 1300+ 数据集生态);工程侧附 MCAP 双发(光轮范式)。
- 本体状态/触觉等低维时序可 HDF5(AgiBot/ALOHA 惯例),但需在 manifest 写明层级与单位。
- 交付附转换脚本(AgiBot 提供→LeRobot 转换、NVIDIA 提供 BridgeData2→LeRobot v3 重排版),降低客户接入成本即降低交付摩擦。
6. 待核实清单(下一轮收口项)
- DROID 官方许可原文(droid-dataset.github.io 本次抓取网络失败;HF droid-dataset/droid 数据卡需复核)。
- GR00T 系数据集许可(以 NVIDIA docs 的 models-and-datasets 许可清单为准)。
- WIYH 使用条款原文(官网 wiyh.tars-ai.com)。
- SynGrasp-1B 全量发布口径与许可(HF 公开仓仅 24,099/4.91TB 且无卡)。
- FMB、DexMV 数据许可原文。
- LIBERO 资产链许可冲突的最终结论(项目记忆已有记录,商用前必查)。
7. 主要来源索引
- OXE:https://github.com/google-deepmind/open_x_embodiment 、https://robotics-transformer-x.github.io
- BridgeData V2:https://rail-berkeley.github.io/bridgedata/
- DROID:https://droid-dataset.github.io
- RoboMIND:https://huggingface.co/datasets/x-humanoid-robomind/RoboMIND
- AgiBot World:https://huggingface.co/datasets/agibot-world/AgiBotWorld-Alpha 、https://www.agibot-world.cn
- ALOHA/Mobile ALOHA:https://github.com/tonyzhaozh/aloha 、https://github.com/MarkFzp/mobile-aloha 、https://huggingface.co/datasets/lerobot/aloha_mobile_cabinet
- FMB:https://functional-manipulation-benchmark.github.io/
- GR00T:https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim
- RoboTwin 2.0:https://robotwin-platform.github.io
- EgoSuite-Open100K:https://lightwheel.ai/media/egosuite-open100k 、https://huggingface.co/datasets/LightwheelAI/EgoStandard
- Ego4D:https://ego4d-data.org
- LAPA:https://github.com/LatentActionPretraining/LAPA
- DexMV:https://yzqin.github.io/dexmv/
- WIYH:https://huggingface.co/datasets/tars-robotics/WIYH 、https://wiyh.tars-ai.com
- SynGrasp-1B:https://huggingface.co/datasets/vegebirrd/SynGrasp-1B
- 京东 robotdata:https://robotdata.jdcloud.com/market
- LeRobot:https://github.com/huggingface/lerobot