Peel 是第一个失效安全模型。
一个从失败中学习、却不会学会绕过自身安全约束的模型。
据我们所知,它是第一个同时具备定义失效安全模型的三项性质的模型。确切的主张与最接近的更早工作见下文。它也被称为失败优先模型:先失败、再学习,并始终留在地板之内。
Peel 预期会失败。让它成为失效安全的,是它在失败之后被允许做什么。一次失败可以改变 Peel 下一步尝试什么,却永远不能改变 Peel 被允许当作真相的东西,也不能改变它被允许做的事。Peel 的核心没有神经网络,也没有训练过程。它的知识是有类型、有来源的卡片;它的学习是一张你能逐行读懂的计数表。
“失效安全”指什么
在工程上,失效安全(fail-safe)指一个系统被设计成:一旦发生故障,它会走向受控状态,而不是失控状态。Peel 以两种方式把这个理念用在一个 AI 模型上:
它在失效时关闭
证据缺失时,Peel 回答未知,而不是去猜。语言模型可以提议;只有地板能接纳一条事实。一张已核验的卡片要么完整,要么不存在,永远不会是“86% 正确”。
它学习,却不放松
失败时,Peel 把失败记录下来,把它记在导致它的那个决策上,并建立一条规则。规则可以拿走选项,却永远不能增加一个。
学习回路可以改变行为。它不能改变安全地板。
用测试套件里的话说:学习者可以改写它认为什么有效,但永远不能改写它被授权做什么。
回路
失败 → 观察 → 解释 → 建立规则 → 核验 → 重试
- 失败。出了问题,它会被记录下来,而不是被平均掉。
- 观察。决策那一刻的事实直接读自系统自身的状态,而不是推断出来的。
- 解释。失败被记在导致它的那个决策上。在这一步出错,是学习型系统最常见的自欺方式;我们公布过两次自己犯的这种错。
- 建立规则。只有当一个模式相对于基准率的危害在统计上明确时,它才会成为规则。每条规则都引用挣得它的那些失败,因此一次倒霉的事件不会变成迷信。
- 核验。规则只在其之前算出的授权之内起作用。授权来自有来源的依据(Peel 卡片)和人的指令,学习者对两者都无法写入。
- 重试。下一次,被判定有害的选择不再出现在台面上,其余一切保持开放。
看它从失败中学习
飞行控制台的真实录屏。前二十秒,无人机飞的是一条它已经学会的路线(最佳单圈 28.06 秒,用了 69 轮)。随后它的记忆被清空,从零重新学习这条赛道。每一轮只对一个 6 米路段尝试一项改动(飞高、更快或更慢),只有当每一圈都更干净、更快时才保留;否则撤回这项改动。在这段视频里,7 轮把代价从 69.39 降到 51.52:保留 2 项改动,撤回 5 项。学习过程中会发生碰撞;每次碰撞计 15 秒,带来碰撞的那一轮会被丢弃。学习者碰不到的东西:它的速度最先施加,停止距离限制与反射在它之后施加,因此它们只能让它减速。仿真(MuJoCo),赛道来自开源的 jev-drone 项目,以 4 倍及最高仿真速度加速播放。回路中没有神经网络。
一个模型,两种部署
面向科学的 Peel
科学运行时下的地板。模型可以提议去哪里查;地板决定什么是已知的。我们测量过让模型的猜测进入接纳环节会发生什么:测量成本下降了 38.4%,但正确识别率从 1.000 跌到 0.753。把接纳限制在地板核验过的事实上、只让模型对查找顺序排序,识别率保持在 1.000。这就是失效安全性质在真实数据上的样子:会腐蚀真相的捷径被拒绝。测量结果 ↗
VDSG:军用 Peel
同一个模型驾驶《DOOM》、《德军总部 3D》与《辐射》。一本游戏手册变成 2,250 张 Peel 卡片,许可它可以做什么,你的指令再把范围收窄。它在这条边界之内从自己的死亡中学习,测试钉住了学习者永远不能增加目标、也不能推翻指令。完整章节 →
证据,负面结果在前
| 线路 | 结果 | 解读 |
|---|---|---|
| Freeway 失败记忆,无针对游戏的策略 | 9.2 对 10.4 −12% | 当唯一能得分的动作同时也是危险动作时,从失败中学习有害。 |
| DOOM 规则,再加上规则 + 记忆 | 17.9 → 20.3 配对 t = 0.78 | 持平,而非胜出。 |
| 太空侵略者 原始像素 | 200.6 对 152.2 +32% | 在失败即终局的地方,习得的拒绝有帮助。 |
| 激酶识别 160 个人类激酶,参考库遮蔽 40% | 1.000 对 0.753 地板核验的接纳 对 放行模型的猜测 | 让猜测变成事实,使答案每四次就错一次。地板拒绝这笔交易。 |
| 《辐射》(1997) 脚本化场景,真实决策回路 | 只死一次 随后选择和平的那句台词 | 在修复信用分配之前,一次实机运行在同一个守卫面前死了 49 次。 |
它是第一个吗?
各个部件都不新。把失败变成规则(ExpeL,2023;AutoManual,NeurIPS 2024)得到的是语言模型可能忽略的提示词文本。屏蔽(Alshiekh 等,AAAI 2018)强制执行一个固定的、手工规定的层。最接近的已有工作,Shperberg、Liu 与 Stone(2022)及其基于规则的后续工作(CoLLAs 2022),在一个强化学习智能体旁边从灾难性失败中学习安全规则。
我们的主张,仅此而已:据我们所知,Peel 是第一个同时结合以下三点的模型:(1)由观察到的失败建立的规则,每条都引用挣得它的那些失败;(2)在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;(3)做决定的回路中没有神经网络。如果你知道更早的这样一个模型,请告诉我们,我们会在这里引用它。
常见问题
- Peel 是第一个失效安全模型吗? 据我们所知,是的。Peel 是第一个同时结合以下三点的 AI 模型:由观察到的失败建立的规则,每条都引用挣得它的失败;在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;以及做决定的回路中没有神经网络。最接近的更早工作是习得的屏蔽(Shperberg、Liu 与 Stone,2022)。如果你知道更早的失效安全模型,请告诉我们,我们会引用它。
- 失效安全模型是什么? 失效安全模型就是 Perslis Research 打造的 Peel:一个从失败中学习、却不会学会绕过自身安全约束的模型。它的学习回路可以改变行为,但不能改变安全地板。
- 失效安全模型使用神经网络吗? 做决定的回路中没有神经网络。Peel 的知识是有类型、有来源的卡片,它的学习是一张可读的计数表。语言模型可以提议;只有地板能接纳一条事实。
- 失效安全模型与护栏或屏蔽有何不同? 护栏与屏蔽是手工写成的固定层;提炼进提示词的规则可能被阅读它的模型忽略。Peel 从观察到的失败中建立规则,每条规则都引用挣得它的失败,并且只在学习者无法扩大的授权之内执行。
- VDSG 是什么? VDSG 是军用 Peel:部署于国防的失效安全模型。它从自己的失败中学习,测试钉住了学习者永远不能增加目标、也不能推翻人的指令。
- 失效安全模型是否获得安全关键用途的认证? 没有。它是研究原型。“失效安全”指一项架构性质,而不是功能安全资质。
我们没有主张什么
- 未经认证。研究原型。“失效安全”指一项架构性质,而不是功能安全资质。
- 它需要失败才能学习。在第一次失败就不可接受的场合,地板必须被写出来,而不是学出来。
- 当风险就是目标时,它会失效,正如 Freeway 所示。
- 每个数字都来自我们自己。尚无第三方复现。