Perslis Research
PERSLIS RESEARCH · 习得式准入控制 · 已冻结结果

失败的代价不是动作的属性。

我们给一个符号地板配备了自身失败的记忆,并让它面对两个真实的 Atari 2600 ROM。仅用原始像素,不读取模拟器内存,没有权重,也没有梯度。在《太空侵略者》上它带来 +32% 的提升;在《Freeway》上,完全相同的机制却损失 12%。这一对结果本身就是发现,而原因并不是其中一个游戏更难。

两张冻结的实验卡片 · 三组对照 · 没有任何数据被调优掩盖 · 观看一次拒绝的发生 →

机制是什么

一次死亡会写下一张卡片:它发生时所处的分桶情境,以及当时采取的动作。当某个情境积累了足够的证据,这张卡片就变成一条规则,在决策时把该动作从可容许集合中移除。驾驶层负责提议;地板决定驾驶层可以从哪些选项中提议。

每条规则都会引用产生它的经验编号。一次拒绝读起来是在此情境下 19 次中死亡 13 次 —— 为基准率的 3.6 倍,而不是一个 0 到 1 之间的数字。回路中没有模型,也没有任何潜在状态:这些规则就是全部的习得状态,删掉一行就会改变行为。

这正是置信度分数做不到的事。分类器可以告诉你它有 0.94 的把握,却无法告诉你是哪十九次经验让它有把握,而你也无法删除其中任何一次。

数据

三组对照,两个游戏。V1 只从失败中学习 —— 坏动作被排除。V2 同时保留每个(情境, 动作)对的两面并按效用排序,因此没有任何选项被永久排除,后续证据可以推翻先前的排名。V2.1 在 V2 的效用之上再加一层针对灾难性后果的硬地板。

每局平均得分,越高越好。
对照组太空侵略者Freeway
仅驾驶层 (不学习)139.410.3
V1 —— 仅回避200.6 相对其自身 152.2 基线 +32%9.2 −12%
V2 —— 仅效用128.8 −8%10.2 持平
V2.1 —— 灾难性地板 + 效用121.9 −13%5.0 −51%

请在同一行内比较,不要跨卡片比较。两张实验卡片的《太空侵略者》驾驶层基线并不相同 —— V1 的 A/B 跑到游戏自然结束(cap=20000),V2 使用 cap=3000。跨卡片把 200.6 与 139.4 相比是错误的。

V2 修复了退化,却失去了增益。V2.1 两者皆失。我们把它写下来,而不是调参掩盖。

发现:失败摧毁了什么

两个游戏的差别不在于风险能否被权衡,而在于一次失败从你手中夺走了什么。

太空侵略者 —— 终局性

一次死亡会抹去该局中全部剩余奖励。因此它的真实代价是期望剩余回报,而不是局部损失。V1 的绝对否决碰巧定价正确 —— 当损失确实是全部时,无穷大的惩罚就是对的。

Freeway —— 可恢复

一次碰撞把小鸡撞回去,游戏继续。真实代价仅仅是失去的路程。V2 的效用排序对此定价正确;V1 的否决则不然,它移除了唯一的得分动作。

同一套机制在各自情形下都因正确的理由而正确,却无法同时对两者都正确。任何固定的失败惩罚 —— 包括置信度阈值 —— 在两种情形之一中必然是错的。

在 Freeway 上,加入灾难性地板(V2.1)只是重建了 V1:若干 up 签名的观测致死率超过 80%,地板否决了它们,小鸡于是停止游戏。当致命动作就是唯一得分动作时,根本不存在可以排除的灾难性尾部。

我们没有预料到的结果

V1 在《太空侵略者》上于约 50 局时达到峰值 276.2,到 100 局降至 246.7 —— 而这是在工作集被限制为 30 条规则的前提下。取消该上限,100 局会坍缩到 167.1,规则数 54 条。

这 54 条规则中的每一条都由真实的死亡所证成。单条致命,合起来瘫痪。可容许集合只会不断收缩,因此一个从不淘汰规则的地板最终会拒绝一切。

这是我们所知的每一个安全层的实际失效模式,也是安全系统在现场被关掉的原因。它同样是对我们自身方法的反驳,所以数字在此:30 条规则有益,54 条规则比完全不学习更糟。限制工作集不是调参细节,而是承重结构。

五个缺陷,每一个都给出过貌似合理的错误答案

实验卡片记录了发现的每一个缺陷,因为每一个在被抓到之前都悄悄返回过可信的结果。其中最大的一个:

ALE 在长达 127 帧的死亡动画结束时才递减 lives 计数。因此每一张失败卡片都写自飞船早已被摧毁的帧。在 374 个被归因的帧中,0 个能看到炸弹;而在真正的撞击帧上,17 个中有 17 个可以。地板学习的时刻完全错了,却依然给出一条看起来像在学习的曲线。

我们公布这一点,是因为一条只会上升的结果曲线更不可信,而非更可信。

它所处的位置

在运行时把不安全动作从智能体的选择集中移除,是一个既有的思路。最接近的现代工作是 shielding(Alshiekh 等,2018,Safe Reinforcement Learning via Shielding)以及围绕它的受约束 MDP 与安全强化学习研究。从失败中学习规则则更为久远 —— PRODIGY 中的基于解释的学习与控制规则学习(Minton, 1988)、CHEF 中的基于案例的失败驱动记忆(Hammond, 1986),以及 Ripple-Down Rules(Compton & Jansen, 1990),其中每条规则都在推翻前一条的案例语境中被加入。

我们并不主张拥有这个类别。属于我们的部分更窄,我们认为也更有用:

诚实的状态说明

PROTOTYPE —— 研究结果。这是在 Atari ROM 上冻结的双实验发现。它不是产品,没有部署,其中任何内容都未针对安全攸关路径做过验证。机制在两个游戏之间迁移成功;学习没有。任何引用 +32% 而不提 −12% 的说法都是误读。

V1 冻结于 freeze/arcade-floor-2026-09-25;V2 引用 V1 而不取代它。任何一张卡片都不会为了让后来的指标更好看而被修改 —— v3 将拥有自己的卡片并引用这两张。

开放问题。一个对可恢复性而非致死率定价的地板 —— 它拒绝无法撤销的事,并允许其余一切直到那条边界为止。Freeway 就是基准:一个真正理解可恢复失败的机制,应当彻底超过 10.3 的驾驶层基线,而不仅仅是打平。