押注报告:ego 采集 vs UMI 采集(2026-08-28 首发 · 2026-08-31 深度版修订)
唯一版本(SSOT)。2026-08-31 修订补技术证据链、训练有效性数据、风险矩阵与反方立场; 首发浓缩版见 git 历史。所有论断附可追溯出处。
一句话结论
不是二选一:UMI 押近期(能直接训策略、能签合同收钱),ego 押远期(世界模型与仿真 RL 的养料)。 P3 已定的 60/25 混编(UMI 60%/ego 25%/遥操 15%)维持不变——但必须清楚为什么、 两边各自的"命门"是什么、以及何时调权。
打个比方
- ego(头戴/手机第一视角)= 眼睛。记录你怎么看、怎么伸手,信息最全 (画面+头姿+手部姿态),但没有"机器人的手"——人手五指 ≠ 机器人夹爪 1 个开合度, 翻译有损,业内叫 "retargeting debt"(重定向债)。
- UMI(手持夹具)= 替身手。夹具与机器人末端执行器同构:位置 6DoF+夹爪开合, 录下的每条轨迹本身就是机器人动作——零翻译损耗,直接进训练管线。
眼睛看得全,替身手学得快。
一、两条链路的技术解剖
UMI 链路(Stanford, RSS 2024 最佳系统论文提名, arXiv:2402.10329, 被引 722+)
手持夹具(3D打印 BOM≈$73) + GoPro(155°鱼眼) + 内置 IMU
→ ORB-SLAM3 视觉惯性 SLAM 求解 6DoF 轨迹
→ ArUco 码标定夹爪开合
→ 相对轨迹表示 + 推理期延迟匹配(latency matching)
→ Diffusion Policy 直接训练 → 部署到任意同构末端
精度与有效性(论文实测): - SLAM 全局轨迹误差:6.1mm 位置 / 3.5° 旋转(alphaxiv 收录的论文数据) - 杯子操作数据集训练的 Diffusion Policy 泛化到极端分布外物体(拿铁倒水、 动态杯子排列),主作者程驰(Cheng Chi)自述多数任务成功率 70-90% - 数据采集速度比传统遥操作快 3 倍以上(同场景杯子排列任务) - 生态爆发:Mobile UMI(四类长程家务任务平均 83.8% 成功率, alphaXiv 2605.20894)、 UMI on Legs(全身移动操作抓/推/抛全 >70%)、RDT2(用 UMI 数据实现零样本跨本体 泛化,叠衣服成功率超 pi0.5 达 40 个百分点)、OneTwoVLA(每物体 UMI 采 50 条 demo 共 200 条)
命门(作者自认+后续论文批评,都有出处): 1. ORB-SLAM3 是"管线最脆弱的部分"——作者在官方 GitHub 原话。运动模糊、 无纹理表面会跟踪失败(ORB-SLAM3 只能靠 IMU 短时兜底) 2. UMI-3D(arXiv:2604.14089)点名批评:单目视觉 SLAM 易受遮挡、动态场景、 跟踪失败影响,导致数据采集天然偏向"对视觉 SLAM 友好的场景"—— 这是样本偏差的结构性风险 3. 手腕相机盲区:贴近/位于夹爪手指后方的物体对腕摄不可见(程驰公开承认) 4. 布料类双臂任务(挂衬衫)策略"经常抓漏一边"(论文 v3 自述失败案例) 5. 缓解路线已出现:FastUMI(硬件无关变体,去 GoPro 依赖降脆弱性)、 SLAM 失败重采机制——说明脆弱性可运营化缓解,不是死穴
ego 链路(Apple EgoDex / Figure Go-Big / HumanEgo 一线)
头戴(Vision Pro/ARKit 或手机)+第一视角视频流
→ 3D 手部+上肢姿态估计(EgoDex: 1080p 30Hz 配对骨骼数据)
→ 【重定向:人手→机器人末端,有损翻译】 ← 此步未成熟
→ 观测语料直接可用(世界模型/预训练/评测);动作语料需过重定向
规模证据(ego 阵营的底气): - EgoDex(Apple, arXiv:2505.11709):829 小时 30fps、约 9000 万帧、 Vision Pro ARKit 采集、开源——最大灵巧操作 egocentric 数据集 - Figure Project Go-Big:Helix 仅在 egocentric 人类视频上训练后, 人形机器人即可在杂乱真实环境中导航——纯观测数据驱动的里程碑 - Figure 数据管道规模口径:手机采集,产能随人口走(此前尽调口径:每秒收 30 分钟视频)
命门( ego 阵营自己承认的): 1. 重定向债:HumanEgo(2025 末-2026 初零样本 egocentric 学习代表作)结论原话—— "把人手映射到特定二指/灵巧夹爪时,仔细的动作空间重定向仍然关键"。 DexCap 教科书章节直接造词:"DexCap Frees the Hand and Adds Retargeting Debt" 2. 重定向目标该怎么定(关键目标分析, arXiv:2506.09384)2025 年还在"分析哪些目标重要" 的阶段——离"成熟可用"有距离 3. DexUMI(用人的手直接当接口的新硬件路线)的出现本身说明:业界在绕开 "人手→夹爪翻译"这条有损路 4. 隐私合规:第一视角视频天然携带路人/环境/人脸,商用需额外脱敏管线
二、六维对比(谁赢看用途)
| 维度 | UMI | ego(EgoKit/光轮系) | 判定 |
|---|---|---|---|
| 信息本质 | 动作真值(6DoF+开合,=机器人动作空间) | 观测真值(视觉+人体姿态,≠动作空间) | 看用途 |
| 训策略 | 直接可训(行业 70-90%;我方 Bridge 带动作 81%) | 需重定向(有损,业内承认未成熟) | UMI |
| 训世界模型/评测 | 弱(腕摄视角单一、场景窄) | 强(EgoDex/Figure Go-Big 证明观测语料价值) | ego |
| 单终端成本 | ≈¥2,700/手(BOM $73+GoPro $298,全国产可替代) | ≈¥6,100/人(PICO 4 Ultra ¥4,999+EgoKit $151) | UMI |
| 数据质量风险 | SLAM 跟踪失败面(反光/无纹理/快动作)+盲区 | 姿态估计噪声+隐私脱敏负担 | 各有命门 |
| 生态成熟度 | 转换器/变体/跨本体先例密集(FastUMI/RDT2) | EgoDex 开源+Figure 闭源管道;adapter 需自写 | UMI |
三、训练有效性:证据对证据
| 证据 | 数值 | 来源 |
|---|---|---|
| UMI 行业任务成功率 | 70-90%(多数任务) | 程驰公开口径 + 论文 20 episodes/task |
| 我方垂域带动作数据训 pi0.5 | 81%(seed1→seed2 Ap 组 71%) | 本仓 seed2 预注册实证(n=2 CONFIRMED) |
| 我方通用无动作数据训 pi0.5 | 0%(10 任务全零) | 同上——动作真值是垂域策略的命门 |
| Mobile UMI | 83.8%(长程家务) | alphaXiv 2605.20894 |
| UMI 采集效率 | 比遥操快 3x+ | arXiv:2402.10329 |
| ego 直接训策略 | 无公开垂域成功案例(重定向未闭环) | 本调研 2026-08-31 检索 |
| ego 观测语料价值 | 829h/9000 万帧开源即成基准;Go-Big 纯视频→导航 | Apple ML / Figure 官方 |
解读:这不是"谁数据好"之争,是数据类型与训练目标匹配度之争。 训策略(近期收入)必须动作真值;训世界模型/评测/预训练(远期账户)观测语料足够。
四、行业四方实况(2026-08-31 增补版)
- Figure:全押 ego(手机管道)+Go-Big 纯 egocentric 预训练——因为瓶颈是 规模与多样性,且云端有重定向/仿真放大能力。他们买得起"先收观测、后解翻译"。
- Apple(新增第六方视角):EgoDex 829h 直接开源——通用 ego 语料正在快速贬值, 自采通用 ego 的商业窗口在关闭;垂域 ego(商超/药店第一视角)仍是空白但购买方未现。
- 光轮智能:BP 明列 ego 方案为主打,同一页也列 UMI;EgoSuite 数据主要喂 "世界模型环境生成+任务补齐"(BP 第 31 页),不是直接训策略——头部玩家也是混编。
- 京东 robotdata:UMI 独立成四大采集类之一——国内交易平台已把 UMI 当一等公民。
- Galbot 银河通用(新增):智慧药房近 100 站、累计 30 万+订单、零售任务 99.97% 成功率——但范式是仿真合成为主+少量真机对齐,不是大规模真人采集。 对照意义:垂域商用交付"动作数据"不是唯一路径,我们与它是互补位而非竞争位 (它需要垂域真值数据供应商的时点还在后段)。
- 松灵机器人(新增):直接以商品形式售卖"真机数据、UMI 与 Ego 数据解决方案"—— 采集工具链已商品化,进入门槛进一步降低,差异化只剩垂域场景与运营网络。
五、成本经济学(v1 保留+单位账)
| 方案 | 终端成本 | 折旧口径 | 对 250-500 元/h 售价 |
|---|---|---|---|
| UMI(A 层 60%) | ≈¥2,700/手(含备件 ¥4,500/人) | ÷500h 寿命 = ¥5.4/h | 全成本 ≈45 元/h → 毛利率 82-91% |
| ego(B 层 25%) | ≈¥6,100/人 | ÷1000h ≈ ¥6/h | 同量级,但动作数据当前不可售(重定向债) |
| 遥操站(C 层 15%) | ≈¥1.2-1.5 万/站 | 按站时产折算 | lerobot 原生 v2.1,on-robot 迁移率锚点 |
一句话:UMI 的成本结构是唯一能把价格打进买方采购区间(500-1,000 元/h) 还保住 80%+ 毛利的方案——这就是"押近期"的经济学。
六、风险矩阵(新增)
| 风险 | 归属 | 概率 | 影响 | 缓解 |
|---|---|---|---|---|
| SLAM 跟踪失败(反光/无纹理/快动作) | UMI | 中(商超货架纹理丰富属友好环境) | 该段数据报废重采 | 采集 SOP 标注避坑区(玻璃柜/冰柜);FastUMI 类变体跟进 |
| 数据场景偏向性(SLAM 友好偏差) | UMI | 中-高 | 覆盖面失真 | 每 SOP 强制包含 1-2 个"困难场景"配额 |
| 手腕盲区漏拍关键交互 | UMI | 低-中 | 单条 demo 质量降 | 双机位试点(腕摄+侧摄)已在 v0.2 转换器支持范围 |
| 重定向债长期不还清 | ego | 高(业内公开承认) | ego 动作数据持续不可售 | ego 定位锁死"观测语料账户",不赌重定向 |
| 通用 ego 语料贬值(EgoDex 开源冲击) | ego | 已发生 | 自采通用 ego 价值归零 | ego 采集只做垂域+客制,不做通用池 |
| 隐私合规(第一视角路人/人脸) | ego | 中 | 商用交付风险 | 脱敏管线列入 P1 前置项 |
| 接口被 DexUMI 类新硬件替代 | UMI | 低-中(灵巧手场景) | 硬件换代 | 数据格式与硬件解耦(lerobot 格式),换接口不换数据 |
七、反方立场:四问四答(新增,对立面真诚)
Q1:UMI 那么好,为什么 Figure 全押 ego? 答:因为 Figure 的瓶颈是规模与多样性(数据管道随人口走),且 Helix 阶段吃的是 观测数据(导航/预训练),动作翻译可以后置到云端慢慢解。小团队没有"后置"的资本 ——我们要用数据直接换合同,必须选可立即训练的类型。战略位置不同,选择必然不同。
Q2:EgoDex 都开源 829 小时了,ego 数据还有商业价值吗? 答:通用 ego 语料的商业窗口确实在关闭(这正是我们把 ego 压到 25% 的原因之一)。 但垂域第一视角(商超拣选/药店理货)没有开源版本,且世界模型买方要的是 多样性格证而非时长。价值在"垂域+格证",不在"通用+规模"。
Q3:UMI 的 SLAM 脆弱性会不会让数据质量不可控? 答:会,但可控。作者自认脆弱+UMI-3D 批评属实;缓解是运营手段:采集 SOP 避坑 (商超主场景纹理丰富属 SLAM 友好)+ 转换器 v0 落地时做 SLAM 成功率门槛 (低于阈值自动重采)+ 每批困难场景配额防覆盖面偏差。把风险做成质检规则, 而不是假装它不存在。
Q4:如果重定向明天突破了呢? 答:那是利好不是威胁。ego 加仓触发器本来就挂着(世界模型线启动/重定向成熟); 且届时 ego 增量收益建立在已铺开的 25% 仓位上,切换成本≈0。混编的价值正是 不赌单边。真正的威胁是反向的:如果垂域 UMI 数据出现竞品供给, 60% 仓位的先发网络是我们唯一的护城河——所以网络要快。
八、判决与调权触发器(维持+情景化)
维持 P3 混编(12×UMI + 5×PICO×EgoKit + 2×SO-101),两押注两账户:
| 押注 | 账户 | 目的 | 调权触发器 |
|---|---|---|---|
| UMI 为主(近期钱) | Phase 2 商用账户 | 垂域商用合同(要的是能跑的策略) | 首垂域合同落地 → UMI 60%→70% |
| ego 为辅(远期权) | 世界模型账户 | L1 世界模型语料+仿真 RL 养料 | 世界模型线立项(G5.2)或重定向成熟 → ego 加仓;通用池走外购(Open100K 已获 10 万小时访问权)不自采 |
情景决策树: - 首垂域合同 3 个月内落地 → UMI 加到 70%,遥操站减到 10%(交付优先) - 世界模型类买方出现(计量报告钩子转化) → ego 25%→35%,上脱敏管线 - 重定向零样本方案成熟(HumanEgo 类落地工业) → 重新评估 ego 自采经济性,可能回调 - UMI 接口换代(DexUMI 类普及到夹爪) → 换硬件不换数据,lerobot 格式保护存量
反直觉但重要:ego 数据我们不需要自己规模化采集——光轮 Open100K(10 万小时 商用许可已批)+京东集市就是"外购 ego 池";而垂域带动作真值(商超拣选 UMI) 市场上就是空白——这才是 20 人网络的独特价值。自采押别人没有的(垂域 UMI), 外购别人有的(ego 规模)。
九、与用户终局的衔接
采集→垂域世界模型→仿真 RL→反哺采集的闭环里:UMI 提供动作真值与物理交互信号 (RL 奖励塑形锚点),ego 提供环境与语义多样性(世界模型养料)——终局两者都要, 但起点必须是 UMI:没有近期商用收入,就没有走到终局的现金流。
参考来源(2026-08-31 实查)
- UMI 原文与项目页:arXiv:2402.10329 · umi-gripper.github.io · real-stanford/universal_manipulation_interface(ORB-SLAM3 脆弱性作者自认)
- UMI-3D 批评:arXiv:2604.14089 | FastUMI:fastumi.com
- Mobile UMI:alphaXiv 2605.20894 | RDT2 中文综述:CSDN v_July_v 157913014 | OneTwoVLA:arXiv:2505.11917
- EgoDex:arXiv:2505.11709 · machinelearning.apple.com/research/egodex · github.com/apple/ml-egodex
- Figure Project Go-Big:figure.ai/news/project-go-big
- HumanEgo(重定向仍关键):junfanzhu98/X 2068605511549743127 | 重定向目标分析:arXiv:2506.09384 | DexCap 重定向债:large-data-manipulation.pages.dev ch07
- Galbot 部署:ncsti.gov.cn 2025-05-28 · 中国经济网 2026-03-19 | 松灵数采商品化:AgileX 官网
- 仓内底稿:docs/research/2026-08-28-p1~p6(38 次实查)· seed2 预注册实证 · 光轮 BP 尽调