把行业的计量单位,
从「小时」改写成「合格小时」
国曙的人力与政府资源 × 我方 AI 裁判链与培训体系 —— 业内唯一「可复现验收、按合格小时计费」的数采供应商;裁判规则库以独立品牌沉淀,不焊死单一渠道。
本轮新增(7/21 · 先看这两块)
pass@5=5/5 · repeat=100% · E-D=96%。作用:证明一条样板可以复跑、审计、回流;不是规模化承诺。 ② Paris HTML 实时生成导览 Demo
已并入外发能力册。作用:解释“输入需求 → 生成交互页面”,后续可替换成基地参观导览页和审计报告动态页。
市场关键数字
每个数字至少两路信源交叉;点其他标签页看出处上下文。
六大市场真需求(全部有证据,非叙事)
缺口 >99%;XDOF/光轮/Bessemer 三重印证付费真实。
"一周采集大半是废数据";过滤最差 10-20% demo 反而提升策略性能(ICLR 2025)。
行业原话:"采集员动作不合格,谁来判断,谁来承担成本?" 合同级验收条款范本不存在;episode 级自动 QC 无商用。
头部工厂 3 天速成上岗、中介层层转包;订单班公开案例为零 = 先发空位。
YD/T 6770-2026(基准测试方法)2026-06-01 实施,实施一个半月尚无认证名单 = 预测试/认证服务窗口。
要失败样本+评估 ground truth,不是通用轨迹;Cosmos 3 全开源后"真采数据 provenance 验证"成新需求。
飞轮(每圈都要外部验证信号,防剧场化)
收敛判据(出现任一 = 该圈闭合):① 首单付费 ② 验收报告写进买卖合同作付款依据 ③ 证书被第二家雇主认可 ④ 标准文件引用我们的方法。连续两圈无信号 = 诚实复盘方向。
当前状态(2026-07-21)
- QC 裁判 v0 已建成:7 条规则(时长/丢帧/停滞/平滑度/成败标签/关节越限/夹爪活动),15 项测试全绿,判定确定性可复现 —— 本页「SOP·质检·DEMO」有交互演示。
- 两份真实数据审计报告已产出(7/17):① pusht(206 条)按官方成功判据 0 条可结算(判据过严,最好 0.94<0.95)、商业口径 44.2%;② aloha_static_coffee(50 条 ALOHA 真机)严格口径 0 条可结算(数据集根本没有成败标注列)、质量口径 98%。双数据集同一结论:行业缺的不是数据质量,是验收基础设施——判据、标签、合同。这一页就是我们全部生意的论证。
- pilot_day3_core_v1 单样板闭环已接入:pass@5=5/5、repeat=100%、E-D 轨迹一致率 96%。这只证明最小闭环可复跑,不触发扩量;扩量必须等客户 spec 和书面反馈。
- 页面结构已恢复 Fable5 基线:/embodied/ = 内部作战地图;/embodied/public/ = 唯一外发能力册;/embodied/team/ = 团队工作台。新增内容进入插槽,不再另起分叉;旧 /partner/ 只做 301 兼容跳转。
- 商务弹药包已备:致智元/觅蜂一页纸 + 致灵心巧手一页纸 + spec 问询清单 + 真实审计报告(可外发)。
- 等两家 spec(用户线):智元/觅蜂、灵心巧手,谁先给规格先做谁的样板包;硬件以销定产。
- AI 侧排队:飞书 ERP(FDE S1-S3 引擎换内容)→ 培训考核系统。
- 五目无感穿戴设备:Phase 2+ 路线图项,先设备定义文档,找 ODM,不自建电子研发。
玩家格局(2026-07 · 谁在做什么)
| 玩家 | 路线 | 最新动态 | 与数采的关系 |
|---|---|---|---|
| NVIDIA Cosmos 3 | 开放 omnimodel(推理+生成+动作) | 2026-06-01 全开源(16B/64B),20 万亿 token 训练,成立 Cosmos Coalition(Agile Robots/Generalist/Skild/Runway) | 合成数据管线全开源化 → 真采数据的相对价值向"合成做不出的部分"集中 |
| Google Genie 3 | 文本→可交互 3D 世界 | 24fps/720p 实时;SIMA 2 在其中自我改进 | agent 训练课程定位,暂不直接买机器人数据 |
| Meta V-JEPA 2 | 非生成潜空间 | 100 万 h 网络视频 + 仅 62h 机器人数据零样本操作;规划快 30× | 证明少量高质量真机数据的杠杆极大 |
| 1X / Tesla / Wayve | 世界模型做训练+评估 | 1X:14B 模型 + ~400h 真机;GAIA-3 定位转向评估 | 评估用 ground-truth 真机 rollout = 新品类买方 |
| OpenAI Sora | — | app 与 API 已先后关停(算力成本倒挂),暂退出 | 反面教材:世界模型烧钱,数据供给方现金流反而稳 |
| 腾讯 HY-World 2.0 | 开源 3D 世界全家桶 | 2026-04 开源(Pano/Nav/Stereo/Mirror),与阿里 HappyOyster 同日对撞发布 | 国内世界模型竞赛白热化 = 训练数据需求走高 |
| 字节 | 秘密行军 | 世界模型列 2026 AI 战略第一命题,目标年底全球 SOTA,无公开发布 | 潜在超级买方(短视频数据基因,缺物理交互数据) |
| 阿里 / 高德 | 物理交互预测 | ABot-PhysWorld 登顶 WorldArena(滑动/倾倒/堆叠/流体);RynnWorld 后续无公开信息 | RynnWorld-Teleop 曾证明:300 合成+300 真实,成功率 42.9%→62.9% —— 合成放大真实 |
| 极佳 GigaAI / 智元 | 世界模型+数据集 | GigaWorld-1/GigaBrain-0(10 亿 Pre-B);智元 AGIBOT WORLD 二期含失败样本 | 智元自己开源失败数据集 = 失败样本需求被头部确认 |
三种用法的实用化程度(我们的评估)
操作域告诫(学界):"世界模型尚不能忠实还原物理交互" —— 评估永远需要真机 ground truth 校准,这正是真机数据商的长期饭票。
放大器 vs 天花板:双面证据与盯梢指标
- DreamGen:1 任务遥操种子 → 78 万条合成轨迹,GR00T N1.5 学会 22 个新行为 —— 但种子与评估都要真机。
- RynnWorld-Teleop:合成+真实混合把成功率 42.9%→62.9%,合成放大真实而非替代。
- "预训练基本全用真实数据,100 万小时前看不到大规模采用仿真的必要性"(每经/财联社 2026)。
- EgoScale(NVIDIA 2026-02):2 万 h 动作标注人类视频预训练 VLA,任务完成率 +54%,证明 log-linear scaling law —— 人类视频是数据金矿,我们五目设备愿景的最硬论据。
- Stanford AI Index 2026:仿真操控 89.4% → 真实家庭 12%(sim-to-real 未解 = 护城河还在)。
- Sergey Levine:"仿真/人类视频是叉勺(spork),真机数据不可替代"。
- 盯梢指标:① Cosmos Coalition 成员的真机数据用量 ② 1X/Tesla 的真实/合成配比 ③ 光轮"仿真:真机 100:1 微调上产线"案例是否扩散。
- 任一指标显示真机需求断崖 → 触发路线复盘(裁判/评估线不受影响,受影响的是采集产能扩张节奏)。
对我们生意的四条精准含义
世界模型压价的是"通用轨迹";它同时制造了新问题——合成数据混入真采数据集,买方需要 provenance 验证(这条轨迹是真机采的吗?)。这项能力进裁判清单,规则形态与现有 7 条规则同构。
裁判天然产出"带失败模式标签的废品"(7 类失败分类),这正是世界模型训练要的失败样本(溢价 1.5×)。别人的废品是成本,我们的废品是 SKU。
GAIA-3/RoboChallenge 都在说同一件事:评估必须真机。给世界模型厂供"评估用 ground-truth 校准集"= 轨 B 远期最高毛利品类,规格定义现在就可以进规则库。
2 万小时 egocentric + 动作标注 → +54%,且 MANUS 手套 21 关键点→22-DoF 重定向已跑通 —— 五目无感设备(头戴+吊坠+手环+UWB+自标注)的输出格式对齐 EgoScale 管线,数据可直接进主流 VLA 预训练。Phase 2+ 定义文档的技术锚。
"实时生成 HTML 导览"那类 demo 是怎么实现的(二轮溯源已修正方向)
- 实现方式(Google Research 官方披露):模型直接流式生成完整 HTML/CSS/JS → 浏览器沙箱 iframe 渲染;交互性来自生成出来的 JS 本身;"继续探索"= 每次新意图触发一轮新生成,状态保存在会话上下文里。外加三件套:工具访问(搜图/搜索)、精调 system prompt、HTML 纠错后处理。
- 我们完全可以在自有服务器复刻(不碰红线):FastAPI 后端持 API key → 调 Claude 流式生成 → SSE 推给前端 sandboxed iframe 渐进渲染,2-3 秒见首屏;设计系统写进 system prompt 并用 prompt caching。成本量级:一页 8-20K token ≈ $0.1-0.4/次(Sonnet 档),demo 日均百次 = 个位数美元。
- 贴我们生意的用法(比复刻巴黎导览更值钱):①「基地参观导览页」——客户来访前输入其公司与关注点,现场生成个性化参观动线+能力展示页;②「审计报告动态页」——后端出真实 verdict JSON(防幻觉:模型只排版不编数),LLM 现场生成可交互报告页。已并入唯一外发能力册:/embodied/public/ 顶部「输入即生成」面板与「Paris HTML 实时生成导览 Demo」(规则引擎实时装配真实数据,诚实标注;LLM 撰写版架构就绪;原 /genui/ 与 /partner/ 都只做跳转,不再分叉)。
- 档位对照(保留首轮结论作参照):视频流世界模型(Odyssey-2/Genie 3/RTFM)= 服务端 H100 自回归视频、$1-2/用户小时,那是另一个赛道;我们的沙盘 DEMO(档位 0)+ 生成式 UI 复刻(档位 A,零 GPU)才是现在该做的。
上下游链路(点节点看拆解)
钱从右往左流,数据从左往右流。琥珀色 = 已对接/自有资产。
上游 · 硬件与设备供给
中游 · 数采生产(我们在这里)
下游 · 买方
三方都需要、都不做、都替代不了;不碰硬件、不碰劳务差价、不碰仿真引擎。与"独立验证优于自报"的全部肌肉记忆同构。
钱怎么流:成本→售价的利差结构(2026-06 一手口径)
七条采集技术路线:成本 × 质量 × 产能
气泡大小 = 产能(条/h);琥珀描边 = 我们的选型。悬停看数据。
路线明细(点行展开短板与判断 · 点表头排序)
| 路线 | 代表方案 | 成本 ▾ | 产能(条/h) ▾ | 质量口径 |
|---|---|---|---|---|
| 主从臂遥操作 主力 | ARX L5 ¥2.98万/台 · ALOHA2 · GELLO <$5k | 高 | 10-30 | 质量之王,ACT 成功率比 VR 高 ~20% |
| 短板:贵、操作员疲劳→质量衰减(公认痛点);单任务 500-1000 条 demo 后边际价值锐减 → 排产要多任务轮换。我们的双臂标准工位方案 ¥10-13 万(ARX L5×2+主从+3相机),比松灵整包省一半。2026 变量:policy-assisted teleop(策略处理简单段、人只接管难段)人力降 5-10× —— 人产数据变少,每条数据的验证权重变大 = 裁判价值上升。 | ||||
| 手持数采(UMI 系) 扩量 | FastUMI <0.6元/条 · 松灵 Pika Pro(±1.5mm/120Hz) | 最低 | 20-60 | 速度 5×,可多人分发 |
| 短板:缺物理接地/力觉,同等成功率有时需 >5× episode。2026-03 鹿明 AWE 发"全家桶":FastUMI Pro/Ego(无需建图第一人称)/Touch(触觉)/Go + 数据市场,即将上京东;2026 年内目标百万小时产能。用途:培训班学员练手 + 低价品类扩量,全部过裁判再交付。 | ||||
| 第一视角人类视频 愿景地基 | Apple EgoDex 829h · Aria Gen 2(A2PD 已放出)· MEgo View 7摄 | 低 | 高(在岗即采) | 1h ≈ 1h 遥操作策略贡献;log-linear scaling |
| EgoScale(NVIDIA 2026-02):20,854 小时动作标注 ego 视频预训练 VLA,22-DoF 灵巧手任务完成率 +54%,one-shot 泛化;手部动作 21 关键点(MANUS 手套)重定向机器人关节。五目无感穿戴设备(头戴+吊坠+手环装饰品级 + UWB + 自标注 + 跨本体)公开调研未见先例,输出格式对齐 EgoScale 管线即可直接进主流 VLA 预训练。Phase 2+:设备定义文档 → ODM。 | ||||
| VR 遥操作 | Quest3 $499 / Vision Pro + OpenTeleVision(开源栈) | 中 | 10-25 | 可远程,精度低于主从 |
| 备选:远程众包场景才用;XDOF/Adamo(sub-40ms)证明远程遥操在跑通,但延迟≥300ms 判无效是硬门。 | ||||
| 外骨骼 | 智元 A2 · 傅利叶 | 最高 | 5-15 | 全身、retarget 损失小 |
| 不进 Phase 0/1:单价最高,只在客户 spec 明确要全身数据时按单配置。傅利叶 2026 重心已转养老陪护(GR-3),数采服务无更新。 | ||||
| 仿真合成 | Isaac(GR00T 真机 88h + 仿真 78 万条)· Genesis · Genie Sim 3.0 | 边际≈0 | ∞ | manipulation 落地率低(89.4%→12%) |
| 不做(光轮+NVIDIA 已卡位;智元 Genie Sim 3.0 已开源 LLM 驱动仿真+断点续采)。但"仿真数据的真机校验/物理有效性验证"玩家少、技术含量高 —— 是轨 B 裁判服务的远期品类。 | ||||
| 真机部署回流 | AgiBot LWD · Figure · Tesla | 前期重 | 随部署量 | policy-assisted teleop 人力降 5-10× |
| 跟踪项:等我们有稳定基地后,承接买方"部署回流数据的第三方质检"是自然延伸。 | ||||
2026 上半年前沿速报(二轮调研 · 每条带信源)
"策略处理简单子任务+人只接管难段"列 2026 三大方向之首,人类演示需求降 5-10×(EVS 2026 指南;学术源头 PATO)。含义:人产数据变少 → 每条数据的验证/评分权重变大,裁判价值上升。
LLM 驱动开源仿真 + 低延迟遥操 + 自动标注 + 任务失败断点续采;数采单机日 1000 条口径。走蜂巢就要对齐它的工具链。
Pro/Ego(无需建图第一人称)/Touch(触觉)/Go + 数据市场,上京东零售;2026 目标百万小时产能。UMI 不带力触觉将失去差异化;"采集方自建交易层"趋势下,裁判中立性反而稀缺。
2 万 h 动作标注 ego 视频,VLA 任务完成率 +54%,log-linear scaling —— 2026 上半年最硬的"人类视频=数据金矿"证据,五目设备愿景的技术锚。
具身感知估值最高;OmniSharing DB 全模态数据平台已上线但定价不透明 —— 触觉数据质量/对齐的验收标准完全空白,裁判可先占;PX-3AX 消费级(199 元档)可做灵巧手 SKU 低成本触觉通道。
LeRobot v3 正式论文(2026-02)+ BEHAVIOR challenge 3.27TB 数据集直接采用 = 事实标准坐实;YD/T 6770-2026 已实施但尚无首批通过名单 = 预测试/认证服务窗口正开;RoboChallenge 立场:"数字孪生无法复现真实,真机评测必需"。裁判工具链原生支持 LeRobot v3 + 报告对齐 YD/T 6770 口径。
选型结论(Phase 0 已拍板)
LeRobot SO-101 双工位:1 周打通"采集→格式→训练→回放"全链路,零风险练兵。
ARX L5×2 + 主从 + 3 相机 + 工作站;对标智元 Genie Studio 单机日数百-1000 条口径。spec 到手才下单(以销定产)。
单条 <0.6 元、5 倍速;培训班毕业生人手一套;力觉短板品类不接。
格式基座:LeRobotDataset v3(Parquet+视频,chunk 化流式训练)为事实标准;RLDS 有开源双向转换;可视化 Rerun(开源)。人形整机晚买(价格下行中)。
对手拆解(向每家学一招)
② 渠道自有:国曙的人/分支/政府关系是自己的,不用冷启动。
③ 培训基建现成:fde.nautilus.social 培训链 + 飞书 S1-S3 派活-QC-结算引擎,换内容即用。
④ 文化同构:"独立验证优于自报"是全部肌肉记忆,恰是行业验收纠纷("谁来判断,谁来承担成本?")的答案。
生态位地图:利润在哪层,谁挤谁
| 层 | 玩家 | 利润与议价权 | 与我们的关系 |
|---|---|---|---|
| 标准+工具+治理(平台派) | 觅蜂 · 光轮(评测) | 利润与定价权集中层 | 做它的最优供给方(蜂巢),同时在验收环节保住独立性 |
| 仿真+评测(仿真派) | 光轮 · NVIDIA | 高毛利,标准权竞争;数据复售率 10× | 非对手;远期"仿真数据的真机校验"可合作 |
| G 端训练场基建(基建派) | 凡拓数创 · 省级具身智能公司 · 64 个采集中心 | 项目制,现金流好;但数据端"左手倒右手"体内循环,基本不盈利 | 训练场的 QC/验收分包 + 运营标是我们的切口;不做总包,不进体内循环 |
| 质检·验收·认证(空夹层) | 我们 | 轻资产 · 网络效应(双边都用我们的尺子) | 唯一无人卡位的层;12-24 个月标准窗口 |
| 采集执行(人力派) | 国曙类 · 数据堂 · 众包 | 议价权在平台手里,长期毛利被压 | 我们自有渠道在此层,但靠上面两层的技术溢价挣钱,不赚纯劳务差价 |
收入三条腿(按现金流先后)
- 人社《人工智能训练师》五级体系;补贴(广东):五级 1000 / 四级 1500 / 三级 2400 / 二级 3000 / 一级 3600 元;上海三级 2500(学生 80%)
- 市面培训收费 2500-4980 元/人(重庆人社口径 1500-3500;中传继教院 4980)—— "有补贴等于半价/免费"是现成招生话术
- 落地路径:不自建评价组织(备案周期长),与已备案高校继教院合办(中传/上海交大/上海电机学院模式):我们出"具身数采实操"课程+就业出口(基地上岗),对方出证书通道
- 毕业进自己基地或输送同行 —— 同时解决基地人员供给;订单班公开案例为零 = 先发空位
- 蜂巢加盟单(标准化产能)+ 灵巧手数据包(自有高毛利 SKU)
- 计价锚点(2026-06 一手):无本体成本 50-100 / 真机 250 / 售价 500-1000+(北京人形/觅蜂)—— 4-10× 毛利差是基地代采核心利差
- 计价按"合格小时";行业有效率 ~50%,合格率每提 10pp = 白赚 10% 产能
- 失败样本子包选配(溢价 1.5×,世界模型训练需求)
- 给其他基地做验收、给买方做第三方审计;规则库+评测集独立品牌
- 对齐 YD/T 6770 出「数据集质量评测报告」——对标国曙 PPT 里 Benchmark 卖 8-50 万/套;YD/T 6770 尚无首批通过名单 = 预测试服务窗口
- 远期:政府训练场运营标(建设已招、运营未招)+ 数据交易所挂牌前的质量评估报告(上海标准要求上架附质量评估报告 = 制度性需求)
市场定价矩阵(2025-26 一手行情 · 我们的品类站位)
另:LLM 数据全家桶 SFT 200-15000 元/千条 · RLHF 至 3 万/千对 · 红队至 5 万/千条 · Benchmark 评估 8-50 万/套(与我方 FDE 基准业务直接重叠 = 轨 B 定价锚)。来源:国曙 PPT 2025 版,与 ITBear 2026-07 行情互证。
合同与验收:具体怎么操作(二轮调研沉淀)
- 全流程:人员准入 → 规则培训 → 初标 → 复核 → 抽检 → 仲裁 → 质检报告 → 返工闭环
- 一致性量化:Kappa 系数 κ≥0.8 高可信;κ<0.6 判规则歧义/培训失效
- 人员配比:常规任务 初标:复核 ≈ 4:1-5:1;复杂任务提至 2:1
- 我们的差异化加法:episode 级可复现判定当仲裁(同输入同输出,争议可复跑)——甲方公告普遍缺失的一块,把"合格小时"定义成可仲裁的量化指标
- 全国首单具身数据集场内交易:2026-01-03 江苏省数据交易所成交(金额/授权方式未披露);京东云"具身智能数据交易平台"已上线 —— 场内挂牌通道成形
- 上海地方标准:数据产品上架须过合规审查 + 附质量评估报告 = 裁判报告的制度性需求
- "一采多授"公开层无先例无判例:机会(同批合格小时可场内二次变现)+ 风险(合同必须显式写排他期/授权范围,没有行业惯例可援引);默认甲方会要求独家,二次授权权利在合同里显式争取
五套打法(playbook)
- 不直接卖通用遥操数据给智元(和它自己工厂竞争);正确入口 = 蜂巢共创伙伴,领 MEgo 设备做委托产能
- 差异化承诺:全网合格率最高的基地——裁判链预检,废品不出厂,贵方复检成本与返工率显著下降
- 合格率对赌:按合格小时计价、接受抽检复核;判定可复现,争议可复跑仲裁
- 弹药已备:一页纸提案 + spec 问询清单;加盟财务条款不公开 → 首次商务接触就要拿一手结算条款 等 spec
- 它出手(硬件+SDK),我们出采集运营+QC → 联合 SKU「XX 手 + N 类任务 + 合格轨迹 M 小时 + 验收报告」
- 逻辑:买它手的客户天然缺配套操作数据 → 它有动力推;触觉数据全行业稀缺刚起量(帕西尼 OmniSharing 定价都不透明 = 定价权真空)
- 低成本试水:1-2 只手 + 4-6 周首个样板包 → 共同拿去 1 家目标客户验货 → 过了再谈量产分成;触觉通道可选帕西尼 PX-3AX 消费级
- 输出格式对齐 EgoScale 手部关键点管线 → 数据可直接进主流 VLA 预训练 = 卖点
- 国曙 105 地区人社关系 × 证书补贴(三级 2400-2500 元)= 培训成本大头由补贴对冲,先于数采订单回款
- 路径:与已备案高校继教院合办(中传 4980/人 是市价上限参照),我们出课程+考核系统+就业出口
- FDE 培训链 + 飞书派活-QC-结算引擎换内容即用(已 LIVE 资产);毕业考核数据直接喂裁判规则库(人才侧飞轮)
- 院校订单班空位先占;县域基地直雇砍掉中介层(中介抽 5 元/h ≈ 20% 工时差价)
- 开源一份可复现《废品率审计报告》(AgiBot World/DROID 公开数据)当获客漏斗 —— 光轮 YCB 模式
- 对齐 YD/T 6770 出评测报告;实施一个半月尚无首批通过名单 → 做"预测试/陪跑认证"首批服务商
- 以方法论挤进地方/团体标准("定义 benchmark 者控制领域");北京人形已牵头数采规范国标 = 下一个标准阵地在验收
- 独立第三方身份 = 对抗平台派自建 QC 的防线(买方不信卖方自检)
- 世界模型厂新买方:失败样本溢价 1.5×(智元已自己开源失败数据集);裁判天然产出"带证据的失败样本"= 废品变商品
- 评估 ground truth 校准集:GAIA-3/RoboChallenge 共识"评估必须真机"
- Cosmos 3 全开源后,合成混入真采的 provenance 验证(真机采的吗?)成新需求 → 提前进裁判能力清单
- 64 个已投用、90 个在建/用;城投出资 1.26-2.64 亿/个;"左手倒右手"体内循环基本不盈利已被公开锤 —— 各地平台公司急需能带来外部买方与合格数据的运营方
- 广东样板:省具身智能公司持有训练场 → 电信 3518 万中标集成 → 运营标还没出现 = 提前备好运营服务方案模板(含合格率门槛/抽检比例/复检机制)做首批投标人
- 入口 = 国曙的 105+ 地区政府关系;弹药 = 对齐 YD/T 6770 的评测报告(轨 B 同一套资产)
- 互证:凡拓 3000 万参股换渠道 —— 数采生意本质是渠道+验收标准之争,我们两样都占
- 不自研硬件(买 ARX/MEgo/灵心巧手;五目设备走 ODM 路线图)
- 不做仿真引擎(光轮+NVIDIA 已卡位)
- 不接纯劳务外包单(价格战已开打,标注员月薪已腰斩)
- 不先建大基地(64 个训练场亏损样本在前;以销定产,Phase 0 预算 ≤¥15 万)
- 不进"政府买机器人→采数据→机器人公司回购"的体内循环
五目无感穿戴设备(用户愿景 · Phase 2+ 硬件路线图)
- 行业坐标:与光轮 EgoSuite、觅蜂 MEgo View(7 摄)、Meta Aria Gen 2、鹿明 FastUMI Ego 同赛道;但"吊坠+手环+装饰品级"形态与 UWB 方案公开调研未见先例。
- 技术依据(2026-02 更新):EgoScale 证明 2 万 h ego 视频 log-linear scaling(+54%);MANUS 手套 21 关键点→22-DoF 重定向已跑通;自标注参照 EgoScale 管线;跨本体对应 LeRobot/RLDS 格式层。
- 执行定位:不进 Phase 0/1 预算。先用现成设备验证管线与买方需求 → 设备定义文档(传感器清单/UWB 组网/标定/BOM 目标价)→ 找 ODM,不自建电子研发团队。
头部工厂运营参数对标(2025-26 一手信源)
| 工厂 | 场地/设备 | 产能 | 关键口径 |
|---|---|---|---|
| 智元 · 上海张江 | 3000㎡ · 5 复刻场景(家庭/零售/服务/餐饮/工厂)· 近百台机器人 | 日 3-5 万条;2 个多月累计百万条 | 任务 1000+ 种,每任务几百条;手持遥操+VR 映射 |
| 国地中心 · 浦东"麒麟" | 5000㎡+ · 100+ 台异构 · 7 大场景 | 单机日 500+ 条 · 全场日 10TB | 异构遥操/动捕/便携末端/仿真 4 路线并跑;目标 5000 万条开源语料 |
| 北京人形 · 亦庄 | 近 5000㎡ · 6 大类 30+ 场景 · 120+ 台 | 年产十几万小时 · 千万条任务级 | 合格率 95%+(SOP 化的力量)· 数据外售 500-1000 元/h · 牵头首个数采规范标准 |
| 帕西尼 | 5 厂(天津 1.2 万㎡ 超级工厂等) | — | 触觉全模态"以人为中心"实采体系 |
| 数据堂 | 8000㎡ 实景工厂 | PB 级方案 | 众包+工厂双轨;ISO9001/27001/27701 |
核心公式(行业基准):日薪 200 元 × 有效率 50% × 单机日 500 条。我们对着这三个数下手:县域日薪 120-150、有效率靠裁判提到 70%+、多任务轮换防边际递减。
政府训练场的真相(64 个样本 · 我们怎么站位)
- 截至 2026-04:64 个已投用、90 个在用/在建;23 省 27 城(浙苏粤最多,各 10+);合计机器人 2500+ 台、总面积 28 万㎡+(≈110㎡/台)
- 出资方压倒性是地方城投/国资平台:防城港 2.64 亿 / 自贡 1.59 亿 / 九江 1.43 亿 / 柳州 1.26 亿
- 运营 = "政府平台 + 企业参与"(德清由浙江无问智行运营,联合浙大+云深处+灵心巧手等 30 余家)
- 商业模式被公开点名"左手倒右手":政府买机器人→采数据→机器人公司回购,大型采集场基本没有盈利(投资界 2026-06)
- 不复制体内循环:不当"国资买机器人再卖数据给本体厂"的第 65 个样本
- 当外包产能节点:接 64 个中心和头部数据商的委托采集单,设备争取委托方提供或租赁,避开亿级重资产门槛
- 抢运营标:建设已招(广东 3518 万电信)、运营未招 —— 平台公司花了钱必然要找"能带来外部买方+合格数据交付"的运营方,提前备好含合格率门槛/抽检/复检机制的运营方案模板
- 细节彩蛋:灵心巧手已在德清训练场生态里 —— 联合数据包可借这个场落地第一单
采集员:招聘 → 培训 → 绩效(行业实录 vs 我们的改法)
| 环节 | 行业现状(投资界/虎嗅 2026-06 一线调查) | 我们的改法(县域 20-50 人) |
|---|---|---|
| 招聘画像 | 20 多岁为主,大专/职院,00 后多;无学历硬门槛;体格是硬筛选(手套尺寸适配、耐受 VR) | 同画像 + 本地已婚劳动力池(低流失);体格筛选进面试 checklist |
| 培训 | 3 天速成上岗,试岗不合格不结费;培训期两次点名都有人退出 | 5 天带考核(考核数据过裁判 ≥ 阈值才上岗)= 用 2 天换有效率;毕业即报《人工智能训练师》证(补贴 2400 元档) |
| 薪酬 | 日薪制 200 元基准(区间 150-250);加班 2h +80、夜班 +100;勤快者月 9000+;中介抽成:工厂结 25 元/h、工人拿 20 元/h | 直雇砍中介(省 20% 差价归双方分享);底薪 + 有效小时奖金 —— 把 50% 有效率漏斗变成员工自己的 KPI |
| 质检反馈 | 动作过快/多余动作/手汗 → 整段作废不计酬;质检滞后,白干一天才知道 | 裁判当日反馈(采完即判):废品当天告知+归因(7 类失败模式),士气和有效率同时救 |
| 劳动强度 | 单任务重复 700+ 遍("夹三明治");"羽毛球入筒"采 3 天;情绪管理是公认难题 | 多任务轮换排产(同时防单任务 500-1000 条后边际递减);任务多样性本身就是数据卖点 |
| 流失 | 无量化公开数据;日结临时工为主,归属感低 | 县域全职+持证+晋升通道(采集员→质检员→班组长);证书是可带走的资产 = 招聘卖点 |
基地平面 v0(县域 20 工位示意 · 约 600-800㎡)
预算大头是设备不是装修:穿戴手套约 10 万/工位(投资界口径),遥操工位 ¥10-13 万/套;20-50 人基地设备投入 200-500 万量级,远低于"买 30 台人形机器人"路线;Phase 0 先 1 个工位(≤15 万)验证,签约量到了再扩。
基地经济模型(拖动滑杆算账)
口径:营收 = 人数×日有效小时×合格率×月天×单价;成本 = 人力(日薪×人数×月天)× 1.45(含场地/水电/管理/设备摊销的粗估系数);行业参数锚:日有效 3-4h(国曙/觅蜂口径)、合格率 50%(行业)vs 95%(北京人形 SOP 化)、单价见定价矩阵。仅作沙盘,签约用真实参数覆盖。
建站五步法(5-8 周投产 · 国曙框架 + 我们的门)
行业教训前置:爬坡瓶颈不在场地在设备稳定性("不是通信问题就是网络/电池问题"——投资界一线实录),机房维修台与备件是标配不是可选。
组织架构(Phase 1 · 20-50 人)
带过 50 人班组;比算法工程师更难找也更关键 —— 现场管理决定合格率。先找。
培训班优秀毕业生或有带班经验者;负责排班/情绪管理/当日反馈落实。
裁判系统抽检复核(一致率 ≥95%);培训班留用;质检人力比压到 5% 以下 = 结构优势。
持证上岗;底薪+有效小时奖金;晋升通道:采集→质检→班组长。
冷启动不是先建基地,而是先交一包能验货的任务 001
缺的不是泛视频,而是有任务边界、授权、失败标签、可追溯来源的工作流数据。首选 EGO:头部/胸前/手部视角,补少量 UMI 动作线索。
关心数据是否能转成动作能力。首选 UMI 或对方本体,EGO 补足场景与意图;先共同冻结成功判据,不承诺跨本体零适配。
需要区域交付、培训、预检、返工和结算治理。首选 兼容对方设备;我们的 EGO/UMI 只做样机与兜底,不抢平台入口。
任务 001 立项器(交互版)
八项硬门有一项不满足就不启动;评分 ≥80 分才能进入三天闭环。先填写每项评分,再看设备与下一步如何变化。
先过八项硬门
100 分选择评分
不是用这张表替代客户判断,而是先把“可交付性”变成团队可以共同检查的标准。
选定任务后,先用哪套设备
三天交付节奏与对外话术
写清目标、对象、episode 边界、成功/失败、授权;先录 10 条试采,修机位和判据。
采 30–50 条原始样本:10 条金样本、10 条边界样本、10 条失败样本;当天把返工原因回传给采集员。
交视频/轨迹、元数据、标签、授权记录、QC 与拒收字典、回放页、LeRobot/Parquet 格式说明;只要书面反馈,不急于扩量。
团队执行细节见 《任务 001 选择清单与评分表》 与 《EGO/UMI 设备采购与组装清单 v0》。这两份文档是本页的可打印、可执行版本。
八环节生产 SOP(点环节看产出物与验收标准)
- 3 天单样板闭环:`pilot_day3_core_v1` 只证明一条样板可复跑(pass@5=5/5、repeat=100%、E-D=96%),不把它包装成规模化成绩。
- Paris HTML 实时生成导览 Demo:放在外发能力册,用于解释"输入需求 → 生成交互页面"。对应我们的业务用法是基地参观导览页和审计报告动态页。
- 团队工作台:/embodied/team/ 已新增 3 天闭环、讲解顺序、网页融合红线。团队讲解以那里为准。
QC 裁判 · 交互演示(模拟一条产线过裁判门)
左侧是产线:每个方块 = 一条 episode 轨迹,过裁判门被判合格(绿)或废品(红,标失败模式)。拖动滑杆看「培训/SOP 投入」如何改变合格率 —— 这就是我们对甲方讲的那笔账。
废品失败模式分布(RoboMIND 7 类)
判定规则 = qc_judge v0 的 7 条(时长/丢帧/停滞/平滑度/标签/越限/夹爪);真实系统同输入同输出、可复跑仲裁 —— 本演示用同分布随机数直观化。行业 50% vs SOP 化 70%+:同样的人,产能差一半。
遥操沙盘 · 你亲手采一条数据试试(可生成 · 可交互 · 现场判定 · 可回放导出)
跑在浏览器里的物理小世界,两种任务随机生成:抓放(按住闭合夹爪,拖到绿区放下)和推块(pusht 同款——就是我们刚审计过 206 条的那种任务,用夹爪把积木顶进绿区)。结束后你的轨迹立刻过裁判 7 条规则并显影(绿=平滑,红=抖动);可回放(演示"可复现仲裁"),可导出 LeRobot 风格 JSON(演示交付格式)。
QC 裁判:行业标准怎么编进规则
- 学术四维协议(Eval-Actions 基准):成功率(二元)/ 平滑度(关节角速度方差)/ 安全性(碰撞)/ 效率
- RoboMIND 7 类失败模式:抓取不完整 · 握持不足 · 关键帧错位 · 旋转错误 · 动作顺序错 · 目标物错 等
- 操作层口径:延迟 ≥300ms 判无效 · 动作过快/多余动作/变形 = 作废 · 传感器伪影过滤
- 依据:过滤最差 10-20% demo 稳定提升策略性能(ICLR 2025,DROID 76k→36k)—— 裁判不是成本,是买方的性能提升器
- 7 条纯函数规则:R1 时长 · R2 丢帧间隔 · R3 停滞 · R4 平滑度(jerk)· R5 成败标签 · R6 关节越限 · R7 夹爪活动
- 确定性判定:同输入同输出,criticals→0 分、warning 每条 −10,pass ≥70 —— 争议可复跑仲裁
- 15 项单元测试全绿;批量报告 = 合格率 + 废品清单(每条附证据);通用审计 CLI 支持任意 LeRobot v2/v3 数据集(阈值自动分布校准)
- 已审计两个真实公开数据集:① pusht(206 条仿真人类演示):官方判据 0% vs 商业口径 44.2%;② aloha_static_coffee(50 条 ALOHA 真机双臂演示,50fps/弧度/双夹爪):严格结算口径 0%(整个数据集没有任何成败标注列)vs 质量口径 98%。双数据集同一结论:卡脖子的不是采集质量,是验收基础设施(标签/判据/合同) —— 可复跑核验
人力结构:结构性成本优势在哪
质检大半自动化(自动预检+人工抽检复核一致率 ≥95%)→ 质检人力比从 8-12% 压到 5% 以下;叠加合格率提升(行业 ~50% 起步,北京人形 SOP 化 95% 是天花板证明),同样的人力产出更多可计费"合格小时" —— 双重结构优势。
三阶段路线(每阶段有门,不达标不进下一阶)
第 1-6 周
≤¥15 万
- 硬件:双臂标准工位 ¥10-13 万(或蜂巢申领 MEgo 抵部分自购)—— spec 到手才下单
- 人:用户(BD/统筹)+ 采集员 2(熟人/兼职,日薪 200-250 行情)+ AI 侧软件全包(不占 headcount)
- 软件(已开工):QC 裁判 v0 ✅ → LeRobot v3 适配器 → 飞书 ERP(FDE S1-S3 引擎换内容)
第 7-16 周
以签约量定投资
- 选址县域:人力 120-200 元/天 + 政府场地/就业补贴;规模 = 订单量 ÷(3-4h/人/天 × 目标合格率),先 20-50 人不超;基地长先于一切招
- 培训班先行:开班→持证(补贴 2400 元档)→上岗;与已备案高校继教院合办拿证书通道;毕业考核数据直接喂裁判规则库
第 4 个月后
- 基地复制(五步法 5-8 周/个);政府训练场运营标投标(方案模板提前备好)
- 灵巧手数据包成标准 SKU;裁判规则库对外输出(轨 B);五目设备定义文档启动
风险与对冲(只列真的)
议价权在觅蜂手里,且加盟财务条款不公开。对冲:灵巧手自有品类 + 轨 B 独立规则库,不做纯代工;"合格率对赌"换议价筹码;合同显式争取二次授权权利。
基础采集/仿真单价下探,标注员月薪已腰斩。对冲:只做"合格小时"计价与高溢价品类(灵巧手/失败样本/评估 GT),不接底价单。
团队/场地/资金从零;64 个训练场亏损样本证明重资产危险。对冲:Phase 0 只花 ≤15 万验证,以销定产;每阶段的门不达标不加码;基地长先找;设备稳定性(行业头号中断源)备件与维修台标配。
3 年+尺度;当前业内共识"预训练几乎全用真实数据"。对冲:裁判/评估层反而受益(数据越被质疑裁判越值钱);盯 Cosmos Coalition 真机用量与 1X/Tesla 真实/合成配比。
分工界面(谁干什么,现在)
| 线 | 负责 | 本周动作 | 状态 |
|---|---|---|---|
| 商务(spec) | 用户 | 向智元/觅蜂、灵心巧手分别要数据规格;谁先给先做谁的样板;顺带要蜂巢一手结算条款 | 进行中 |
| QC 裁判 | AI 侧 | v0 已建;下一步 LeRobot v3 适配器 + AgiBot World 首份审计报告 | v0 完成 |
| 飞书 ERP | AI 侧 | FDE S1-S3 派活-QC-结算引擎换内容(排在适配器后) | 排队 |
| 培训考核系统 | AI 侧 | fde.nautilus.social 培训链换内容(排第三) | 排队 |
| 训练场运营方案模板 | AI 侧 | 含合格率门槛/抽检比例/复检仲裁机制,等运营标出现即投 | 排队 |
| 硬件采购 | 用户 | 不动 —— spec 到手、样板品类定了再下单(以销定产) | 冻结 |
| 五目设备 | AI 侧(文档)+ ODM(远期) | Phase 2+ 定义文档进 backlog(技术锚 = EgoScale 管线对齐) | 冻结 |