观看地板拒绝。
一个真实的 Atari 2600 ROM,以 210×160 的原始像素读取。没有权重,没有梯度,没有训练过程。驾驶层提议一个动作;一份关于既往失败的记忆,会在驾驶层做出选择之前,先把某些动作从可容许集合中移除。每一次拒绝都会指名产生它的证据 —— 这一确切情境被见到过多少次、其中多少次以死亡告终,以及这与基准率相比如何。
录制回放。按下一次坠毁可跳到地板学习的那些时刻。
它刚刚学到了什么
显式卡片·没有权重·每条规则都引用其证据
本回合
—
—
已写下的卡片
当前生效的阻断规则 0
- 暂无 —— 一条规则需要足够的证据,并且必须指名它所应对的危险
签名节点 0 大小 = 见到次数 · 红色 = 致死率
0得分
0回合
0坠毁
如何解读
视频下方的条带是决策流水线,逐级点亮:像素 → 事实 → 可容许 → 目标 → 投影 → 记忆 → 动作。最值得注意的是 记忆 亮起的那些帧 —— 那就是地板推翻了驾驶层的首选动作。
右侧面板不是对某个隐藏状态的可视化,它本身就是状态。每张卡片都是一行字面记录:一个分桶情境、所采取的动作,以及结果如何。当某个情境积累了足够证据,它就变成一条规则,把该动作从可容许集合中移除。删掉那一行,行为就会改变。里面再没有别的东西。
这是 v1 机制,而它并非总是有益。在《太空侵略者》上它值 +32%;在《Freeway》上,同一套机制损失 12%,因为在那里唯一的得分动作同时也是危险动作。结果页给出了两个数字及其原因。