SSI 特性 LLM 最小复现可行性 · 通俗分析报告 v0
2026-09-07。回答两个问题:①评估器+Waddle+SSI+compass 四件能不能拼成一条融合路线;②我们能不能做出 SSI 那种"边干边学"的模型(借助开源项目 minimind)。 全文不用行话,先说结论。
结论(三句话)
- 四件能拼成一条流水线,而且我们已经有四分之三:compass 是"随身笔记本",Waddle 技能库是"招式库",判据库是"考官",SSI 特性是"肌肉记忆"。缺的只是最后一件,而它有 3 块钱的沙盘可试。
- "迷你版 SSI 特性"我们能做——用开源项目 minimind(一个 6400 万参数的小模型,GPT-3 的七千分之一大),花 3 块钱、2 小时就能从零训出一个,在它身上试验"边干边学"是可行的。
- "真正的 SSI"我们做不了也不该做——那是几十亿美金的事。我们做的是这件事里最缺的一个岗位:考官。"一个模型边干边学之后,怎么证明它学会了新的、没忘掉旧的?"——这个评分方法本身就是能卖的判据。
一、四件怎么拼成一台机器(融合路线)
经验的一生是四步,四个件各管一步:
① 遇到新事 → 查笔记本(compass 召回旧经验,照猫画虎先干起来)
② 干完记录 → 笔记本/招式库(compass 沉淀经验;Waddle 式招式库存具体做法)
③ 考官打分 → 判据库(这条经验靠谱吗?复用过几次?成功率多少?)
④ 反复验证合格的 → 练成肌肉记忆(写进模型权重——这就是 SSI 特性:不是关机就没)
现在的行业现状:Skild 把①跑通了(看一段视频就干活),Waddle 把②跑通了(招式库跨任务复用),compass 是①②在 agent 世界里的翻版——但全世界都卡在③④之间:经验怎么凭成绩晋升进权重,晋升的时候怎么防止把旧的冲掉。SSI 押的就是解③④,没发布。我们的位置:③的考官我们已经造了一半(判据库+双臂对照打分法),④的考场我们能先搭(见下)。
二、minimind 是什么,为什么它是合适的沙盘
- GitHub 上的开源项目(jingyaogong/minimind),教人从零训一个超小语言模型:3 块钱、2 小时、一张消费级显卡,训练全流程代码全公开。另有衍生版 minimind-o(0.1B 的全模态版,能听能看能说)。
- 它本身不会"边干边学"(没有 SSI 特性)——这恰好是重点:它是干净的沙盘,我们自己往上加特性,加出来的每一分效果都归因得清清楚楚。
- 我们现租的 GPU 实例跑批的空闲窗口就能跑它,不用新增硬件投入。
三、"能不能做出来"——分三件事拆开答
| SSI 特性拆解 | 大白话 | 小模型上能不能做 |
|---|---|---|
| 推理时改权重(TTT) | 干活的时候顺手把学到的东西记进脑子 | 能。方法在学术论文里是公开的,小模型上可实现,就是没人在小模型+中文环境做过完整评测 |
| 持续学习不遗忘 | 学了数学别把古诗忘了 | 能做、且特别需要做。这是小模型的弱项(脑子容量小更容易忘),但"怎么测遗忘、怎么防遗忘"的评分方法是我们能贡献的 |
| 学会学习(元学习) | 练出"怎么学都学得快"的本事 | 只能摸边。这需要海量预训练,小模型上做不出 SSI 级效果——诚实说:这块我们做不出来 |
四、这对生意有什么用(不然就不该做)
按 9/7 系统性审视的收敛原则(一切向第一笔收入看齐),这个实验不直接来钱,所以只配用碎片资源做。它换三样东西:
- 给 P3 练手:世界模型/机器人策略将来也要"边部署边学",怎么测学没学会、忘没忘掉——先在小文本模型上把评分方法跑通, protocols 直接搬去具身侧
- 长一条新判据:"学新忘旧曲线"(学了新任务后旧任务掉多少分)是判据库里还没有的秤。SSI 这类公司最需要也最缺的就是这个——"第一个做持续学习的赢者通吃"的前提是"能证明持续学习没退化",证明就是考官的活
- 评估器枢纽叙事有了实物:不再是 PPT 上的理论章,是"我们有自研的持续学习评测台"
五、最小实验(1-2 周,随时可叫停)
- 第 1 周:跑通 minimind 标准训练(对照组);设计任务序列(先学 A 类知识再学 B 类)
- 第 2 周:加"边干边学"环节(推理时小步更新权重);用我们现成的双臂对照打分法测三件事——学了 B 之后 A 忘了多少;掺回放复习能防多少忘;评分方法能不能固化为判据
- 产出:一份《持续学习最小复现报告》+一条新判据进判据库+对"能不能做"的实测答案
- 红线:只用 GPU 空闲窗口;不投一分钱新硬件;两周不出结论即停(反烂尾纪律)
六、诚实的边界
- 小模型测出的遗忘数字不能外推到大模型——我们测的是方法,不是 SSI 的性能
- minimind 是纯文本模型,具身是机器人模型,迁移不免费;可迁移的是"怎么测、怎么防"的评分学
- 这是研究实验不是产品,90 天内不来钱;它的优先级天然低于 10 万小时单和验证业务首单——排班只能用 GPU 碎片时间
- 关联:[[2026-09-07-自进化链条与评估器枢纽-战略理论章v0]](§4 晋升管道)、[[2026-09-07-系统性审视-战略产出×业务基本盘-v0]](30/60/90 骨架)