智涌飞轮

具身数据 · 采集 × 效用计量 × 独立验证合作洽谈工作台登录

← 返回证据库

Ego DataLift M1 合成实验聚合证据

结论

冻结的 M1 合成实验结论为 no_gain。两次正式运行的规范化报告哈希完全一致, reproducible=true,且没有运行错误。这意味着当前 treatment 没有同时满足 macro-F1 和 时间边界 F1 严格正增益条件;不意味着真实 Ego 数据没有价值。

指标 Control Treatment Delta
Macro-F1 0.901764 0.658270 -0.243494
Boundary-F1(±2 frames) 0.725664 0.494845 -0.230819

冻结实验

项目
Owner commit 5d3b600ad6171aa8675456e7467f7da218bc36ee
数据 nautilus-synthetic-ego-microset-v1
数据范围 48 episodes;36 train / 12 test
帧数 2,304 train / 768 test
Seed 20260811
Pairing 同源、同切分、同特征、同模型配置
模型 numpy-softmax-linear-probe-v1
成功规则 两项 delta 均严格大于 0
Promotion human_review_only
两次耗时 4,334 ms / 4,115 ms

分类别结果

类别 Control F1 Treatment F1 主要 treatment 计数
idle 0.928962 0.934066 TP 85 / FP 12 / FN 0
reach 0.958580 0.892405 TP 141 / FP 0 / FN 34
grasp 0.784091 0.000000 TP 0 / FP 17 / FN 69
transport 0.886179 0.764881 TP 257 / FP 158 / FN 0
release 0.951009 0.700000 TP 98 / FP 0 / FN 84

边界评测共有 48 个真值边界。Control 预测 65 个、匹配 41 个;Treatment 预测 49 个、 匹配 24 个。最明显的退化是 treatment 未识别任何 grasp 真阳性,同时将大量帧归入 transport,并漏掉较多 release 帧。这是下一阶段需要提出新假设并预注册验证的失败模式, 不能回头修改 M1 指标或任务来制造增益。

独立读回

独立读回重新生成并核对了 source content 与 evaluator truth commitments,复算了 config、 ordered split、model config、metric evidence、规范化报告、raw report、artifact manifest 和 audit summary 哈希。两次运行的 arms、聚合指标和规范化报告完全一致。

审计项 哈希
Audit summary sha256:f803b9f39db691a4efd39960768eefbb89e1d977d28a9919f00e3e38d9adaad0
Normalized report sha256:168fb994cc1df6f27b3620ab17bd66c5367a04bb6401788a9a2b13365f6664db
Source content sha256:3c26d0b5309d61b949540cd064a8d432e3a91452a68a1fa2d46535538e4fdff1
Evaluator truth sha256:8b83edc4f7a7f1f812a1f2773f6d22d3e1c0a8d9d7c2444a1de511d4e17fe213
Config sha256:45168815e65bac143a3078c06fcb67ac68bf4f51c2ad301ac7444cf87b91389e
Ordered split sha256:1e959904542f9ef4585a01f40c6deb7f5a3ae9f859224da76e9dfb4b58f2e58b
Model config sha256:40d459b304023b20b330059a3cc380eae90925e2d9912189c79d8e68505a9e45

完整聚合指标和审计哈希保存在同名 JSON 文件中。Git 不保存运行目录、逐帧数据、隐藏标签、 绝对路径或原始图像。

权利与边界