Perslis 国防
PERSLIS 国防 · 技术

冻结的权重,还是无权重学习。什么时候用哪一个。

是的,一个 GPT 级别的模型可以装进人形机器人的身体。问题是装进去以后它能做什么。它的知识在训练结束那天就固定在权重里。到了现场,它不能在两次尝试之间改变战术,不能告诉你某次尝试为什么失败,还可能说出不真实的东西。如果任务要求机器适应、一次比一次结果更好,它就是错的工具。如果任务是你的邮件,它就是对的工具——而 Perslis 是大材小用。

简短的回答

用训练好的模型(冻结的权重)邮件、摘要、搜索、起草、翻译。看和读:把像素和语音变成有名字的事实。任何一个错误答案代价很小、并且有人检查输出的任务。
用 Perslis(无权重学习)在真实世界里行动的机器:结果必须在两次尝试之间变好,每个决定都必须能重放,可能没有数据链,而且只有指挥链能设定边界。

冻结的权重意味着什么

神经模型在训练中学习。它知道的一切分散在数十亿个数字里,而训练一结束,这些数字就不再变化。部署第 100 天的模型就是第 1 天的模型,除非有人把它收回去、收集新数据、在别处花几天重新训练。

对一台在现场的机器,这意味着三件事:

无权重学习意味着什么

Peel 把它知道的东西保存为人能读懂的数据行和有名字的规则,而不是权重。一次尝试失败时,失败连同发生时的情境一起被记录。针对它,在成对的比赛中测试一个改变,只有明显胜出才保留,否则丢掉。下一次尝试就运行在新规则上——无需重新训练,无需数据中心。

因为每个决定都是在命令允许的动作里、根据读到的事实、附带书面理由选出的,所以一次失败可以追溯到造成它的那条规则。它不生成任何东西,所以不会编造任何东西。而学习被放在一块它无法放宽的地板之内:它在任务上变得更好,但永远不会越过命令。

它不是什么:学习发生在两次尝试之间,而不是在一场战斗之中;在坦克竞技场里,学习循环可以尝试的改变清单是工程师写的,由循环决定保留哪些。

证据,来自一个竞技场

在我们的 BZFlag 坦克竞技场里,五辆坦克互相对战:BZFlag 自带的 AI、我们的规则驾驶员,以及通过同一套控制驾驶的三个语言模型。

完整的坦克竞技场 → · 失败如何变成规则 →

它们一起工作

这不是在整台机器上二选一:神经网络还是规则。训练好的模型是我们看和读的最好工具:它把摄像头画面和语音变成有名字的事实。Peel 接过这些事实,在指挥官的规则之内做决定,并从结果中学习。模型是眼睛,它不负责指挥。

如果你需要的只是回邮件、写摘要或搜索文档,就单独用一个模型——在那里,Perslis 不会增加任何你需要的东西。Perslis 是给这样一台机器的:它的结果每失败一次都必须变得更好,它的每一个决定都必须经得起战后复盘。

对齐的是你,不是某个模型 → · 联系我们 ↗