行业情报五条:数据管线十三工序 / NeuroVLA / PointDiT / TouchTronix / Video ICL 与 Imitator Game
2026-09-05 深夜 · 五条外部情报交叉分析。前三条为公众号文章全文已读; PointDiT/TouchTronix 经 web 搜证核实(项目页/arXiv/官网/商店页)。 结论:无一条改变现有拍板;多条强化既有判断;ICL 一条进"秤量程扩展"候选池。
情报一:《一条具身智能数据,要过多少关才能喂给模型》——对我们定位的第三方背书
来源:公众号"木牛流马之辈",十三道工序 + 八层技术栈全景文。
逐条映射(文中观点 → 与我们业务的关系)
| 文中观点 | 与我们的关系 |
|---|---|
| "质量评分:数据不是越多越好,有效数据才是——每条轨迹打分,高分保留低分降权" | 这就是我们的效用计量秤(D/L/C/T)。行业文把"逐条打分"列为十三道标准工序之一 = 需求真实存在;但市面无独立的、可复现的第三方评分服务——正是我们填的空 |
| "真壁垒在前端数据入口和数据引擎,不在 tokenizer 和 trainer(已开源商品化)" | 与"凭什么是我们"同构:壁垒=采集入口(劳动力网络)+数据引擎(判据/校准飞轮)。我们不碰模型层是对的 |
| 八层三档:硬件级(时间同步/标定/采集设备)买不到必须自建;工程级可自研;tokenizer/trainer 已商品化 | 对设备商成立;对我们硬件级=采购品(Orbbec 路线 B),工程级=自研区(verify_pack/判据库/效用报告正是这一档)。印证"无硬件包袱"轻 |
| 时间同步三层:软同步增强可达 ±0.5-1ms(MCU 时钟线性回归校准) | 判据母版 A 层"毫秒时间戳"门槛的工程可行性背书 |
| 手部:MediaPipe+HaMeR+MANO,第一视角检出率 75.6%→93.1% | 映射层③点序考证有了具体参照:对 MANO 21 关节惯例比对 |
| 双目深度误差:30cm→0.3mm,120cm→4.5mm(误差随距离平方涨) | 判据 A 层"对齐锚点"的量化参考值(机器人操作区间恰落毫米级) |
| "SLAM 位姿和手部位姿是锚点/真值;处理管线从视频逆向出的深度位姿只是伪标签。采集端不提供毫米级真值,训练天花板就上不去" | 行业共识背书我们卖的东西:我们 EGO 采集端输出=设备级位姿锚点,不是伪标签。这也是对 PointDiT 类工具的定位约束(见情报三) |
| MCAP 采集→自动标注→转 LeRobot 训练;三种封装各司其职 | 与我们管道完全同构(MCAP→mcap2lerobot→LeRobot 成品),路线是行业主流非偏门 |
| 轨迹切分带任务/成败元信息;数据增强不能破坏物理一致性 | 我们 manifest 语义已有前者;后者是 QC 红线逻辑(改图像不改坐标=错误数据) |
一句话判断
这篇文章等于替我们写了一半《凭什么是我们》:十三道工序里我们卡位"质量评分+数据入口",八层里我们占"工程级自研"档。无行动项,可直接引用作对外叙事素材(需按对外口径自查后使用)。
情报二:智源大会 NeuroVLA(智平方郭彦东)——P3 判断强化而非扰动
来源:公众号"具身智能之心"智源大会报道。
- "世界模型不是 VLA 的竞争路线,而是 VLA 体系里的空间感知组成部分"——与我们 9/2 P3 拍板(π0.5 技能层+Cosmos 世界模型层两层栈)同向,口径不用改。
- "当下世界模型本质是大数据喂出来的,不是物理规律驱动"——与"校准飞轮"逻辑同构:数据积累即壁垒。
- "WM 的终极用处是生成行动,不是生成视频"——印证 P3"验证器先行"(用 WM 做便宜验证器,比生成视频更贴行动回路)。
- "用 WM 补 corner case(桌子边缘样本)"——头部玩家用 WM 补采样盲区 → 真人采集永远覆盖不全 → 补出来的数据同样需要验证 → 秤的价值加固。这是对"合成数据谨慎"立场的最好对照案例。
- 类脑三级架构(皮层语义规划/小脑高频协调/脊髓毫秒反射,抖动 -75%、20ms 反射)——记录备查,离我们数据业务远,无行动项。
情报三:PointDiT(已核实)——3D 工具库候选,不立即投入
来源核实:项目页 · arXiv:2607.02515 · OpenReview
核实结果(用户摘要基本准确,两处修正):
| 摘要说法 | 核实 |
|---|---|
| Google / ETH / 图宾根 | ✅ 属实,另含 Microsoft/TUM/KE:SAI;一作 Haofei Xu,10 作者含 Marc Pollefeys/Andreas Geiger/Federico Tombari |
| ICML 2026 | ✅ |
| 代码开源 | ✅ github.com/google-research/pointdit(Google Research 组织下;license 待查) |
| 预训练权重放出 | ⚠️ 项目页未见 HuggingFace 权重链接,仅 Code 链接——权重是否随仓库发布待查 GitHub |
| 训练评测流程开源 | ⚠️ 待查仓库内容 |
| 单步扩散出稠密 3D 点图 | ✅ 像素空间 DiT:带噪点图 patch(XYZ 替代 RGB)+冻结 DINOv3 图像 token→纯 ViT 一步去噪出点图;无 VAE、从零训练;多步采样可锐化 |
对我们的定位:
- 它是伪标签工具,不是真值来源。 情报一的行业共识直接给出定位约束:"处理管线从视频逆向的深度位姿只是伪标签"——PointDiT 从 EGO 单帧恢复的 3D 点图属这一类,不能替代采集端设备级位姿锚点(我们卖的就是锚点)。
- 候选用途(触发才做,现在不装):
- 映射层辅助:手 21 点 3D 位姿已有,点图补场景几何 → 手-物空间关系推理;
- QC 维度候选:场景 3D 一致性/几何畸变检测(D 指标增密);
- P3 世界模型的 3D 先验工具。
- 触发条件:P3 启动,或出现 3D 质检客户需求。映射层 v0(纯几何降维,见 301 维破译文档)不需要它。
情报四:TouchTronix FusionX Pro(已核实)——设备候选池"触觉变体"条目
来源核实:官网 · RCSV 商店页 · LinkedIn · HuggingFace 样本数据集 touchtronix/FusionX-Multimodal-Sample-Data-V2
核实规格:TouchTronix Robotics(创始人 Jun Liu,加州),"Data Factory"可穿戴多模态采集方案。FusionX Pro 套装=触觉数据手套×1 对(每只 132 触觉像素:每指 12+掌 72;5 弯曲传感器;力感知)+主动双目立体相机(头戴/胸戴)+Intel Mini PC;遥操作时手套 200Hz 记手部状态+第一视角相机;跨模态对齐演示 1748 帧;Mountain View 有现货。
对我们的判断:
- 形态印证:双目头戴相机+手部高频位姿——与我们 Orbbec EGO 采集形态同构,可穿戴第一视角多模态采集再获行业印证。
- 竞合定性:设备商,非竞争者。 他们卖设备+样本数据(八层里的"硬件级"玩家);我们运营劳动力网络+验证(场景与劳动力层)——互为上下游。与 Orbbec 同列设备池。
- 触觉模态增量信号:我们 EGO 数据无触觉维度。若出现精细操作客户(液体容器类,恰是其演示场景),触觉手套是数据产品可加的溢价维度——但judge 依据=客户需求出现,不预投。
- 与 9/2 设备拍板关系:Orbbec 路线 B 主力地位不动;TouchTronix 记入设备候选池"触觉变体"条目,无价格与成熟度尽调前不评估切换。
情报五:Video ICL 浪潮与 The Imitator Game——今天分量最重的一条,直接命中我们数据资产形态
来源:公众号"具身智能之心"《Ego火了之后,具身开始卷 in-context learning 了,但它的评测该怎么弄?》, 涉及 The Imitator Game(港大+忆生科技+复旦+浙大,马毅/杨言超指导)、 GEN-1.5(Generalist)、S1(Skild AI)、HOST(arXiv:2607.20033)、Zero-WAM(arXiv:2608.26103)。
文章要点
- 人类视频正在从"训练数据"变成"部署时理解新任务的接口":GEN-1.5 把 3-12 秒 demonstration 当 physical prompt 不更新参数直接试新任务;Skild S1 用视频指定任务跑 10 分钟长程任务; HOST 报告平均 29 秒人类视频习得新技能(novel-task 62% 成功率)。"我不解释了,我做一遍给你看。"
- The Imitator Game = human-to-robot imitation benchmark,核心创新是把"模仿"从动作复现 扩展到 intent-level,按 demonstration 场景与执行场景的变化程度分 L0-L3: L0 同场景行为复现 / L1 空间变化 / L2 物体实例变化 / L3 功能与操作方式变化 (泡茶例:同位置茶包→挪位置→换散茶→没茶了用抹茶粉+搅拌棒完成同层目的)。
- IG-10K 数据集:20,000+ 人类-机器人配对数据(11.7K 真实+10K 仿真)、200+ L0-L3 任务变种、340+ 可操作物体;**统一 LeRobot-0.5.0 格式,多视角 RGB-D + 3D MANO hand pose
- semantic mask + 分层语言标注;ManiSkill3/SAPIEN 仿真;文章原话:"数据'多'并不是重点, 'pairing'才是**"。
- 九基线含 π0.5(另有 ACT/Diffusion Policy/VQ-BeT/XSkill/UniSkill/GR00T-N1.6/RDT-1B/ OpenVLA-oft)+ leaderboard + Imitator Arena 人类主观评测。
- 第一轮三趋势:①human video 是值得继续的 task specification;②paired human-robot pretraining 有 scaling 潜力;③L3 意图迁移当前模型明显下降——最开放的能力空间。
- 行业转向:从"一个模型会多少任务"到"一个机器人多快学会新任务"。
与我们的关系(四层)
- 我们数据形态正踩在学术标配资产的正中。 IG-10K 人类侧标配=第一视角视频+3D MANO hand pose+LeRobot 格式——与我们的 EGO 采集(第一视角双目+21 点手部位姿+LeRobot 转换管线) 同构。顺带再次印证 301 维 21 点组=MANO 惯例推断(映射层③考证参照又加一条)。
- π0.5 是 IG-10K 基线之一——我们秤的基准模型与该 benchmark 直接重叠,未来 T 槽读数 与 Imitator Game 评测有同模型家族的可比性基础。
- 人类视频价值的第二条增长曲线。 第一条=fine-tuning 语料(我们秤现在的 T 口径: π0.5+LIBERO Δpp);第二条=ICL demonstration prompt("这段人类视频当 context 能教出什么")。 若 ICL 路线成立:真人 EGO 数据稀缺性上升——合成数据替代不了"真实人类演示分布", 供给侧故事更硬;数据买方的质量定义也会多一维"demonstration 质量"(意图清晰/可迁移层级)。
- 对秤与判据库的远期含义:
- 秤的量程扩展候选新增一条:ICL/demonstration 质量口径(触发=客户需求,或 ICL 成为 主流评测范式)——与 Isaac Lab 候选并列,不动现有 LIBERO 冻结口径(ADR-0008);
- 判据库远期语义候选:L0-L3 分级可作批次"demonstration 适用层级"标注框架;
- 配对采集形态候选:IG-10K 证明 ICL 评测刚需是 paired human-robot data——若出现此类 客户,"人类示范+机器人执行对照"是采集业务新形态(远期记录,不预投)。
冷静边界
学术 benchmark,不是买家;发布团队在招合作伙伴——属于生态观察与关系候选,不构成近期行动。 本条全部记为"量程扩展候选",与"先被买过再谈底座"的顺序链纪律一致。
汇总:五条情报 → 行动项(全部低优先/触发制)
| # | 行动 | 触发条件 |
|---|---|---|
| 1 | 映射层③点序考证对 MANO 21 关节惯例 | 无(本来就在计划内,情报一给了参照) |
| 2 | 双目深度误差量化值(0.3mm@30cm/4.5mm@120cm)作判据 A 层对齐锚点参考数值 | 判据 A 层下次修订时吸收 |
| 3 | PointDiT 入工具库候选 | P3 启动或 3D 质检需求 |
| 4 | TouchTronix 记设备候选池触觉变体 | 精细操作客户出现时询价 |
| 5 | 十三道工序/八层三档框架作对外叙事引用素材 | 下次对外文案时(过对外自查) |
| 6 | 秤量程扩展候选+1:ICL/demonstration 质量口径(与 Isaac Lab 候选并列记录) | 客户需求或 ICL 成为主流评测范式 |
| 7 | 判据库远期语义候选:L0-L3 模仿分级作批次标注框架 | 判据库语义扩展时吸收 |
| 8 | Imitator Game 团队(招合作伙伴)记生态关系候选 | 有学术合作契机时接触 |