冻结的权重,还是无权重学习。什么时候用哪一个。
是的,一个 GPT 级别的模型可以装进人形机器人的身体。问题是装进去以后它能做什么。它的知识在训练结束那天就固定在权重里。到了现场,它不能在两次尝试之间改变战术,不能告诉你某次尝试为什么失败,还可能说出不真实的东西。如果任务要求机器适应、一次比一次结果更好,它就是错的工具。如果任务是你的邮件,它就是对的工具——而 Perslis 是大材小用。
简短的回答
冻结的权重意味着什么
神经模型在训练中学习。它知道的一切分散在数十亿个数字里,而训练一结束,这些数字就不再变化。部署第 100 天的模型就是第 1 天的模型,除非有人把它收回去、收集新数据、在别处花几天重新训练。
对一台在现场的机器,这意味着三件事:
- 它不能在两次尝试之间改变策略。如果一种打法失败了,下一次尝试仍然来自同样的权重。它也许能说出一个新计划,但从失败中学到的东西一样也没有留下。
- 它说不清自己为什么失败。没有可以指着看的规则,只有数字。它可以写一段解释,但那段解释是生成的文字,不是原因。
- 它会编造。答案是它生成的,所以它也能生成一个自信的错误答案——在邮件里,代价是改一下;在一台会行动的机器里,代价是结果本身。
无权重学习意味着什么
Peel 把它知道的东西保存为人能读懂的数据行和有名字的规则,而不是权重。一次尝试失败时,失败连同发生时的情境一起被记录。针对它,在成对的比赛中测试一个改变,只有明显胜出才保留,否则丢掉。下一次尝试就运行在新规则上——无需重新训练,无需数据中心。
因为每个决定都是在命令允许的动作里、根据读到的事实、附带书面理由选出的,所以一次失败可以追溯到造成它的那条规则。它不生成任何东西,所以不会编造任何东西。而学习被放在一块它无法放宽的地板之内:它在任务上变得更好,但永远不会越过命令。
它不是什么:学习发生在两次尝试之间,而不是在一场战斗之中;在坦克竞技场里,学习循环可以尝试的改变清单是工程师写的,由循环决定保留哪些。
证据,来自一个竞技场
在我们的 BZFlag 坦克竞技场里,五辆坦克互相对战:BZFlag 自带的 AI、我们的规则驾驶员,以及通过同一套控制驾驶的三个语言模型。
- 决策速度。在一场十分钟的比赛里,规则驾驶员做了 60,140 个决定(约每秒 100 个)。DeepSeek 做了 415 个,llama3.2 做了 213 个,Claude 做了 58 个——通过命令行工具,每个决定的中位数是 7.6 秒。
- 没有时间压力时的知识。在一份八道题的坦克情境笔试中:规则驾驶员 8/8,Claude 6/8,DeepSeek 5/8,llama3.2 4/8。
- 在两场战斗之间变好。学习循环保留了两个改变、丢掉其余的,把手写的驾驶员对 BZFlag AI 的每坦克分钟净击杀从 −1.17 提升到 −0.26(z = 2.93)。模型的权重在比赛之间没有任何变化。
- 它没有做到的。它仍然输给 BZFlag 自带的 AI:同样时间里 45 次击杀对 74 次。它较低的死亡率(每分钟 1.53 对 1.73)在统计上并不显著。我们的主张是它变好了、并且说得出原因,而不是它赢了。
它们一起工作
这不是在整台机器上二选一:神经网络还是规则。训练好的模型是我们看和读的最好工具:它把摄像头画面和语音变成有名字的事实。Peel 接过这些事实,在指挥官的规则之内做决定,并从结果中学习。模型是眼睛,它不负责指挥。
如果你需要的只是回邮件、写摘要或搜索文档,就单独用一个模型——在那里,Perslis 不会增加任何你需要的东西。Perslis 是给这样一台机器的:它的结果每失败一次都必须变得更好,它的每一个决定都必须经得起战后复盘。