智涌飞轮

具身数据 · 采集 × 效用计量 × 独立验证合作洽谈工作台登录

SSI 特性 LLM 最小复现可行性 · 通俗分析报告 v0

2026-09-07。回答两个问题:①评估器+Waddle+SSI+compass 四件能不能拼成一条融合路线;②我们能不能做出 SSI 那种"边干边学"的模型(借助开源项目 minimind)。 全文不用行话,先说结论。

结论(三句话)

  1. 四件能拼成一条流水线,而且我们已经有四分之三:compass 是"随身笔记本",Waddle 技能库是"招式库",判据库是"考官",SSI 特性是"肌肉记忆"。缺的只是最后一件,而它有 3 块钱的沙盘可试。
  2. "迷你版 SSI 特性"我们能做——用开源项目 minimind(一个 6400 万参数的小模型,GPT-3 的七千分之一大),花 3 块钱、2 小时就能从零训出一个,在它身上试验"边干边学"是可行的。
  3. "真正的 SSI"我们做不了也不该做——那是几十亿美金的事。我们做的是这件事里最缺的一个岗位:考官。"一个模型边干边学之后,怎么证明它学会了新的、没忘掉旧的?"——这个评分方法本身就是能卖的判据。

一、四件怎么拼成一台机器(融合路线)

经验的一生是四步,四个件各管一步:

① 遇到新事 → 查笔记本(compass 召回旧经验,照猫画虎先干起来)
② 干完记录 → 笔记本/招式库(compass 沉淀经验;Waddle 式招式库存具体做法)
③ 考官打分 → 判据库(这条经验靠谱吗?复用过几次?成功率多少?)
④ 反复验证合格的 → 练成肌肉记忆(写进模型权重——这就是 SSI 特性:不是关机就没)

现在的行业现状:Skild 把①跑通了(看一段视频就干活),Waddle 把②跑通了(招式库跨任务复用),compass 是①②在 agent 世界里的翻版——但全世界都卡在③④之间:经验怎么凭成绩晋升进权重,晋升的时候怎么防止把旧的冲掉。SSI 押的就是解③④,没发布。我们的位置:③的考官我们已经造了一半(判据库+双臂对照打分法),④的考场我们能先搭(见下)。

二、minimind 是什么,为什么它是合适的沙盘

三、"能不能做出来"——分三件事拆开答

SSI 特性拆解 大白话 小模型上能不能做
推理时改权重(TTT) 干活的时候顺手把学到的东西记进脑子 。方法在学术论文里是公开的,小模型上可实现,就是没人在小模型+中文环境做过完整评测
持续学习不遗忘 学了数学别把古诗忘了 能做、且特别需要做。这是小模型的弱项(脑子容量小更容易忘),但"怎么测遗忘、怎么防遗忘"的评分方法是我们能贡献的
学会学习(元学习) 练出"怎么学都学得快"的本事 只能摸边。这需要海量预训练,小模型上做不出 SSI 级效果——诚实说:这块我们做不出来

四、这对生意有什么用(不然就不该做)

按 9/7 系统性审视的收敛原则(一切向第一笔收入看齐),这个实验不直接来钱,所以只配用碎片资源做。它换三样东西:

  1. 给 P3 练手:世界模型/机器人策略将来也要"边部署边学",怎么测学没学会、忘没忘掉——先在小文本模型上把评分方法跑通, protocols 直接搬去具身侧
  2. 长一条新判据:"学新忘旧曲线"(学了新任务后旧任务掉多少分)是判据库里还没有的秤。SSI 这类公司最需要也最缺的就是这个——"第一个做持续学习的赢者通吃"的前提是"能证明持续学习没退化",证明就是考官的活
  3. 评估器枢纽叙事有了实物:不再是 PPT 上的理论章,是"我们有自研的持续学习评测台"

五、最小实验(1-2 周,随时可叫停)

六、诚实的边界