Perslis Science
PEEL · 失效安全模型

Peel 是第一个失效安全模型。

一个从失败中学习、却不会学会绕过自身安全约束的模型。

据我们所知,它是第一个同时具备定义失效安全模型的三项性质的模型。确切的主张与最接近的更早工作见下文。

Peel 预期会失败。让它成为失效安全的,是它在失败之后被允许做什么。一次失败可以改变 Peel 下一步尝试什么,却永远不能改变 Peel 被允许当作真相的东西,也不能改变它被允许做的事。Peel 的核心没有神经网络,也没有训练过程。它的知识是有类型、有来源的卡片;它的学习是一张你能逐行读懂的计数表。

“失效安全”指什么

在工程上,失效安全(fail-safe)指一个系统被设计成:一旦发生故障,它会走向受控状态,而不是失控状态。Peel 以两种方式把这个理念用在一个 AI 模型上:

它在失效时关闭

证据缺失时,Peel 回答未知,而不是去猜。语言模型可以提议;只有地板能接纳一条事实。一张已核验的卡片要么完整,要么不存在,永远不会是“86% 正确”。

它学习,却不放松

失败时,Peel 把失败记录下来,把它记在导致它的那个决策上,并建立一条规则。规则可以拿走选项,却永远不能增加一个。

学习回路可以改变行为。它不能改变安全地板。
用测试套件里的话说:学习者可以改写它认为什么有效,但永远不能改写它被授权做什么。

回路

失败  →  观察  →  解释  →  建立规则  →  核验  →  重试
  1. 失败。出了问题,它会被记录下来,而不是被平均掉。
  2. 观察。决策那一刻的事实直接读自系统自身的状态,而不是推断出来的。
  3. 解释。失败被记在导致它的那个决策上。在这一步出错,是学习型系统最常见的自欺方式;我们公布过两次自己犯的这种错。
  4. 建立规则。只有当一个模式相对于基准率的危害在统计上明确时,它才会成为规则。每条规则都引用挣得它的那些失败,因此一次倒霉的事件不会变成迷信。
  5. 核验。规则只在其之前算出的授权之内起作用。授权来自有来源的依据(Peel 卡片)和人的指令,学习者对两者都无法写入。
  6. 重试。下一次,被判定有害的选择不再出现在台面上,其余一切保持开放。

看它从失败中学习

飞行控制台的真实录屏。前二十秒,无人机飞的是一条它已经学会的路线(最佳单圈 28.06 秒,用了 69 轮)。随后它的记忆被清空,从零重新学习这条赛道。每一轮只对一个 6 米路段尝试一项改动(飞高、更快或更慢),只有当每一圈都更干净、更快时才保留;否则撤回这项改动。在这段视频里,7 轮把代价从 69.39 降到 51.52:保留 2 项改动,撤回 5 项。学习过程中会发生碰撞;每次碰撞计 15 秒,带来碰撞的那一轮会被丢弃。学习者碰不到的东西:它的速度最先施加,停止距离限制与反射在它之后施加,因此它们只能让它减速。仿真(MuJoCo),赛道来自开源的 jev-drone 项目,以 4 倍及最高仿真速度加速播放。回路中没有神经网络。

一个模型,两种部署

面向科学的 Peel

科学运行时下的地板。模型可以提议去哪里查;地板决定什么是已知的。我们测量过让模型的猜测进入接纳环节会发生什么:测量成本下降了 38.4%,但正确识别率从 1.000 跌到 0.753。把接纳限制在地板核验过的事实上、只让模型对查找顺序排序,识别率保持在 1.000。这就是失效安全性质在真实数据上的样子:会腐蚀真相的捷径被拒绝。测量结果 ↗

VDSG:军用 Peel

同一个模型驾驶《DOOM》、《德军总部 3D》与《辐射》。一本游戏手册变成 2,250 张 Peel 卡片,许可它可以做什么,你的指令再把范围收窄。它在这条边界之内从自己的死亡中学习,测试钉住了学习者永远不能增加目标、也不能推翻指令。完整章节 →

证据,负面结果在前

内部测量。请在同一行内与其自身基线比较。
线路结果解读
Freeway
失败记忆,无针对游戏的策略
9.2 对 10.4
−12%
当唯一能得分的动作同时也是危险动作时,从失败中学习有害。
DOOM
规则,再加上规则 + 记忆
17.9 → 20.3
配对 t = 0.78
持平,而非胜出。
太空侵略者
原始像素
200.6 对 152.2
+32%
在失败即终局的地方,习得的拒绝有帮助。
激酶识别
160 个人类激酶,参考库遮蔽 40%
1.000 对 0.753
地板核验的接纳 对 放行模型的猜测
让猜测变成事实,使答案每四次就错一次。地板拒绝这笔交易。
《辐射》(1997)
脚本化场景,真实决策回路
只死一次
随后选择和平的那句台词
在修复信用分配之前,一次实机运行在同一个守卫面前死了 49 次。

它是第一个吗?

各个部件都不新。把失败变成规则(ExpeL,2023;AutoManual,NeurIPS 2024)得到的是语言模型可能忽略的提示词文本。屏蔽(Alshiekh 等,AAAI 2018)强制执行一个固定的、手工规定的层。最接近的已有工作,Shperberg、Liu 与 Stone(2022)及其基于规则的后续工作(CoLLAs 2022),在一个强化学习智能体旁边从灾难性失败中学习安全规则。

我们的主张,仅此而已:据我们所知,Peel 是第一个同时结合以下三点的模型:(1)由观察到的失败建立的规则,每条都引用挣得它的那些失败;(2)在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;(3)做决定的回路中没有神经网络。如果你知道更早的这样一个模型,请告诉我们,我们会在这里引用它。

常见问题

我们没有主张什么