业内按「有效小时」验收
我们给有效小时标上效用含量
第一层 · 行业怎么算账
数量级鸿沟 × 效用不分层 × 政策开了口子——三个事实把「验证评级」推上桌。
数量级鸿沟
LLM 训练语料 ≈ 100 亿小时 vs 具身高质量实采 ≈ 50 万小时——相差四个数量级,真实任务数据是最稀缺的一段。
效用不分层
业内「有效小时」是质检口径(画面有效·动作完整·合格才结算)——但同样「有效」,效用差 81 个百分点,计价仍不分效用含量。
政策开口子
上市公司数据入表 134 家/38.6 亿(2025 年报,年增 70%+,高金/证券时报口径);「质量评估」列为可入表成本项——质量评价进入法定链路。
业内「有效小时」是质检口径(画面有效·动作完整·合格才结算);但同样「有效」,效用差 81 个百分点—— 计价仍不分效用含量。谁能量出「数据→能力提升」的对应关系,谁坐上定价位。
第二层 · 我们的秤
量效曲线 + 六道闸 · 交互演示(免密)
剂量滑块交互 · 六道闸逐闸实跑(拦截批/放行批)· 我们否决自己判定器的金标记录——全部真数据。
进入演示 →
六道闸:指纹 | 形式 | 几何 | 语义 | 效用 | 金标——分档出证:金牌/银牌/拦截;⑤⑥第二期参数化(零件已有实测)。
第三层 · 交付实例
验证报告
47 条真实采集数据全链验收:先被拦下(查出参照组偏差)→ 修正后同批数据银牌放行,一拦一放完整弧线;
演示页还可现场真验一条(真管道真数据,1-2 分钟出报告)。
看报告 → 现场真验 →
实证矩阵(四组全可复跑)
π0.5 两臂 81pp | CL1 剂量曲线 | G1 盲区双证+特异度 1.0 | X1 金标否决(33%<80%,读数作废)——
含我们对自己的判定器开刀的记录。
计量方法 →
证据库
19 份公开验收证据包:判据预注册、评测日志、复核记录。
进证据库 →
为什么可以信
独立验证 · 已签名回执
compass 独立验证系统(2026-09-17)对我方 C 族校准包独立复核: 6/6 全部复现(零裁量),出具 ed25519 签名回执 (manifest f196d1241b931992…,公钥 f7554b87…3e8be)—— 任何第三方持公钥与数据包即可零成本重验。边界:独立技术验证,不作客户验收或结算决定。
我们不报"自评分"。每个结论附带:预注册判定标准(先定判据再看结果)、可复跑评测日志、独立复核记录—— 语义判定器曾被我们的人工金标校准环否决(33%<80%),读数作废不对外。敢把短板印在自家报告上,才配当裁判。
当前状态:核心计量方法通过两轮独立复核;10 万小时级 EGO 询价在手;头部具身模型企业效用结算洽谈中。