数据效用计量 · D/T/C/L
四个维度加权计量一批数据对机器人训练的效用。判定规则与权重在协议 v1 中预先冻结(先定规则、再看结果),修改必须另版留痕——客户拿到的每个分数都能对回判据。
T 可训性 权重 40%n=2 CONFIRMED
核心已验证:主实验同量对照各 50 条——垂域精选 86% vs 通用 0%;同预算严格对照差距 81pp(预注册裁决 CONFIRMED);跨种子:两个完整对照种子 81%/71%,第三种子 A 轨 80%(无 B 组对照)——这就是我们收费依据的核心。结果基于仿真基准(LIBERO),真实场景迁移以 POC 验证为准
D 多样性 权重 25%待首批自采
多场景/多对象/多光照覆盖度——设备在途,首批自采数据到达后开始实测
C 一致性 权重 15%待首批自采
多采集者同任务的一致率——试点期 2+ 采集者并行样本产出后实测
L 合规 权重 20%工具就绪
人脸检出/黑帧/冻帧判据已实装;自动脱敏管线落地中;未脱敏数据一票否决
展开查看协议 v1
效用计量协议 v1 · 冻结版(2026-09-01 预注册锁版)
冻结声明:本文件指标定义与权重自 commit 之时起锁定。任何修改必须:①新建 v1.x 文件(本文件不改一字); ②写明修改理由+影响范围;③在出具的每份计量报告中标注所用协议版本。 这是"中立性"的产品化——计量局自己先被规则锁死,客户才能信这把秤。 上游设计:docs/research/2026-08-29-master-roadmap-v2.0.md §4.3。
0. 适用范围
凡我方出具的《数据效用计量报告》(P1 产品线)与按效结算合同(P2/P4)中的效用计价,均按本协议口径执行。 不适用的情形:客户自带计量口径时,以合同另行约定为准,但报告中必须并列给出本协议口径读数作参照。
1. 四项指标定义(锁定)
1.1 多样性密度 D(Diversity)
| 项 | 定义 |
|---|---|
| 口径 | 每千小时数据中:独特任务数 / 独特操作物体数 / 独特环境数 |
| 计数规则 | "独特"以任务包定义冻结时的枚举清单为准;同义词归并表随报告附录交付 |
| 参照系 | Figure 官方口径(373 任务 / 1146 物体 / 116 环境)直接可比 |
| 数据源 | 采集 manifest(每条轨迹的任务标签+物体标签+环境 ID),不接受自报 |
1.2 可训性 T(Trainability)
| 项 | 定义 |
|---|---|
| 口径 | 固定基座(pi0.5,版本随报告锁定)+ 固定步数(2000 步)+ 固定评测套(LIBERO 任务族 10 任务 × 10 episodes)下,该数据带来的成功率增量 Δpp = 训后成功率 − 同条件空白/通用对照成功率 |
| 判定门 | Δpp ≥ 20pp 判定"显著可训";< 20pp 如实报告数值,不做定性美化 |
| 复现要求 | 同一数据包两次独立种子复跑,两次 Δpp 均报告,取低值入报告 |
| 阳性对照 | 每次评测附带开源配方校准跑(当前参照 62%),防止基座/环境漂移误判 |
| 方法学证据 | seed1/2/3 对照链(runtime/selfproof-seed*.json + docs/evidence/) |
1.3 一致性 C(Consistency)
| 项 | 定义 |
|---|---|
| 口径 | 同一任务跨采集者轨迹的动作分布 KL 距离均值 + 时长变异系数 + 视角方差 |
| 用途 | 防"一人千条"伪多样性:单采集者占比 >50% 的数据包,C 值旁强制标注集中度警告 |
| 阈值 | 本版不设合格线,只报数值+分布图;阈值待首批真实数据校准后入 v1.1 |
1.4 合规分 L(Legality)
| 项 | 定义 |
|---|---|
| 口径 | 人脸单独同意覆盖率(%)+ 脱敏完整性抽检通过率(5% 抽检)+ 来源可追溯链完整度(每条轨迹可回溯到采集者授权记录的比率) |
| 红线 | 任一项 <100% 的数据条不得入付费交付;L 不合格的包整体标注"仅可内部研发用" |
| 法源 | 个保法第 29 条(敏感个人信息单独同意)+ 人脸信息处理规定 |
1.5 综合效用 U
U = 加权合成,默认权重 D 25% / T 40% / C 15% / L 20%;买方可按任务类型申请调权, 调权后的权重必须写入报告首页(权重即立场,立场必须可见)。L 任一子项触发红线时 U 强制为 0(一票否决)。
2. 报告产出规格(锁定)
每份报告必含:①协议版本号 ②四项指标原始值+计算过程摘要 ③所用数据包 sha256 manifest ④复现实验的 watchdog 日志哈希 ⑤局限性声明(基座单一口径/仿真基准/种子数)⑥独立读回指引(客户如何复算)。
3. 已知局限(冻结版如实声明)
- T 指标当前仅在 LIBERO 仿真基准上验证,真机基准的 T 口径为 v1.1 待办;
- C 指标无阈值,仅提供数值;
- n=2(seed3 结果出来后更新为 n=3 或按判定门降级)——样本量局限必须在报告首页声明;
- 多样性 D 的枚举清单按任务包冻结,跨任务包比较时需注明清单差异。
4. 版本历史
| 版本 | 日期 | 变更 |
|---|---|---|
| v1 | 2026-09-01 | 首版冻结(roadmap §4.3 设计落字) |
— flywheel 框 · 冻结于首份客户报告出具前