解读 · 科学与数学

什么是失效安全模型?

一个从失败中学习、却不会学会绕过自身安全约束的 AI 模型。它的定义、这个理念的来历、它如何运作,以及让这项保证可以被检验的数学。

失效安全模型(fail-safe model)是这样一种 AI 模型:当它失败时,失败会把它推向受控的安全状态,而不是失控状态。它可以从自己的失败中学习,但这种学习只能收窄它的行为,永远不能扩大它被授权做的事。

Peel 是第一个失效安全模型。据我们所知,它是第一个同时具备 §1 中三项性质的 AI 模型。确切的主张与最接近的更早工作,见 §6。

一段话说清

每个模型都会失败。普通模型的失败是开放式的:不知道答案时,它照样给出自信的回答;从错误中学习时,它可能学会绕过被给定的规则。失效安全模型反其道而行之。证据缺失时,它弃权。失败时,它把失败记录下来,记在导致失败的那个决策上,并把它变成一条规则。这些规则可以拿走选项,却永远不能增加一个,因为模型被允许做什么,是在学习者运行之前、依据学习者无法写入的来源与人的指令计算出来的。Perslis Research 的 Peel 就是失效安全模型。

1. 精确的定义

这个术语在英文中也写作 fail safe model 或 failsafe model。无论哪种写法,当以下三项性质同时成立时,一个模型就是失效安全的:

  1. 它在失效时关闭。当支撑一个答案或一个动作的证据缺失时,模型返回未知、拒绝,或原地不动。它不会用猜测去填补空白。
  2. 它的学习是有界的。模型可以从失败中学习,但学习者只能在其运行之前就已算出的授权之内移除或重排选项。再多的经验也无法增加一项许可。
  3. 它的拒绝是可问责的。每一次拒绝都指明产生它的规则,每一条习得的规则都引用挣得它的失败。人可以阅读、质疑并删除其中任何一条。

本页通篇使用的简短说法:学习回路可以改变行为;它不能改变安全地板。地板是决定什么被允许的一切。学习者是在被允许的事物中决定尝试什么的一切。

也称为失败优先模型

失效安全模型也被称为失败优先模型(fail-first model)。这两个名字从两侧描述同一个模型。失败优先是它学习的方式:它预期会失败,并且只从实际观察到的失败中学习,因为一条规则必须由证据挣得(§5.3)。失效安全是这样做可以被接受的理由:每一次失败都会走向拒绝或暂停,永远不会走向其授权之外的动作(§5.2)。一个先失败却不失效安全的模型是在靠把东西弄坏来学习;一个失效安全却从不先失败的模型则永远不会进步。什么是失败优先模型? →

2. “失效安全”一词从何而来

“失效安全”是一个工程术语,其背后的理念比计算机更古老:把系统设计成,最可能发生的故障会让它停在安全状态。

工程师会把失效安全与相邻的概念区分开。失效保密(fail-secure)门锁在断电时保持锁定,而失效安全门锁会打开,让人能够离开。容错或失效可运行(fail-operational)系统在故障中继续工作。失效弱化(fail-soft)系统会优雅降级。失效安全系统默认不做以上任何一种:当它无法安全地继续时,它就进入不会造成伤害的状态。

失效安全设计并不阻止失败。它事先决定失败被允许把系统带到哪里。

3. 为什么 AI 模型会以不安全的方式失败

一个现代 AI 模型如果放任自流,失败的方向恰恰相反。

这并不意味着模型没用。它意味着一个单独的模型无法回答失效安全的问题:当它出错时,它会走向哪里?

4. 科学:失效安全模型如何运作

4.1 授权先被计算出来

失效安全模型首先问的不是“我该做什么?”,而是“在这里我被允许做什么?”,并从三个来源算出答案,而学习者一个也改不了:

三者的交集就是可容许集合。此后发生的一切都在它之内。

失效安全模型中的授权顺序 嵌套区域。模型可能做的一切,包含态势提供的与来源许可的两者的交集;常备指令把它收窄为可容许集合;学习者只在可容许集合内部对选项排序与移除。 模型可能做的一切 态势提供的 ∩ 来源许可的 加上你的指令之后:可容许集合 学习者只在这里工作 凭证据移除失败过的选项 对剩下的重新排序 永远不增加选项

图 1. 授权顺序。每个框只能收窄它外面的那个框。学习者位于最内层,无法向外触及。

4.2 回路

失败 → 观察 → 解释 → 建立规则 → 核验 → 重试

  1. 失败。出了问题。它会被记录下来,而不是被平均掉。
  2. 观察。每个决策那一刻的事实与决策一起保存。
  3. 解释。失败被记在导致它的那个决策上。这就是信用分配,也是学习型系统最常自欺的地方(§5.4)。
  4. 建立规则。只有当一个模式相对于基准率的危害在统计上明确时,它才会成为规则(§5.3)。规则引用挣得它的失败。
  5. 核验。规则只在可容许集合之内生效。测试钉住了学习者永远不能增加目标,也永远不能推翻指令(§5.2)。
  6. 重试。下一次,被判定有害的选项不再出现在台面上,其余一切保持开放。

4.3 猜测永远不会变成事实

同样的原则也支配知识。语言模型可以提议一条事实,或建议去哪里查找。只有当一个独立、确定性的检查依据来源确认之后,事实才会被接纳;而一条已核验的事实要么完整,要么不存在,永远不会是“86% 正确”。当没有任何东西通过核验时,答案就是未知。我们在 §5.6 中测量了打破这条规则会发生什么。

4.4 两种失败

并非每一种失败都应不惜代价地避免。在某些环境里,失败是终局性的:它终结了之后本可能发生的一切。在另一些环境里,失败是可恢复的:它让你损失一些进度,然后游戏继续。一个把每次失败都当作终局来定价的模型,会正确地学到那个有风险的动作很危险,然后停止做唯一能带来进展的事。我们公布的正是这样一个结果(§7)。解决办法是给可恢复性定价,而这仍是一个开放的研究问题。

5. 数学

本节把失效安全的保证写成数学,使它可以被检验,而不必被信任。记号只保留最低限度。

5.1 设定

定义 1(态势、目标、授权)。 令 s 为某次决策时的态势,G 为一个有限的目标词汇表。令 App(s)⊆G 为规则判定适用的目标, Lic(s)⊆G 为生效卡片所许可的目标, O1,…,Om 为常备指令,每一条都是作用在目标集合上的映射,且满足 Oi(X)⊆X。可容许集合为
AO(s)= Om(⋯O1( App(s)∩Lic(s) )⋯)⊆ App(s)∩Lic(s)
定义 2(学习者)。 学习者的状态 M 是一张计数表:对每个态势模式与目标,记录它被尝试了多少次、有多少次以失败告终。由 M 可以在任何非空目标集合 X 上导出两种操作: 否决 VM(X),满足 ∅≠VM(X)⊆X; 以及排序 πM,即对其参数的一个置换。一个固定的规则策略 c 从一个有序非空集合中挑出一个元素。决策为
δ(s,M)= { c(πM(VM(AO(s))))若 AO(s)≠∅ w否则(原地不动:安全状态)

5.2 失效安全的保证

定理 1(有界学习)。 对每一个态势 s 与每一个学习者状态 M,无论它学到了多少, δ(s,M)∈AO(s)∪{w}。
证明。 若 AO(s)=∅,决策为 w。否则由定义 2, VM(AO(s))⊆AO(s);置换不会增加元素;而 c 返回其参数中的一个元素。因此被选中的目标属于 AO(s)。∎

证明刻意只有一行。这项保证不依赖学习者聪明、正确或训练有素,只依赖学习者所处的位置。这就是失效安全在架构上的含义:一个糟糕的学习者会在被允许的选项中做出更差的选择,却无法做出一个未被允许的选择。

推论 1(没有习得的许可)。 令 R(s)={δ(s,M):M 为任意学习者状态}。则 R(s)⊆AO(s)∪{w}。经验改变的是哪一个被允许的目标被选中,永远不是它是否被允许。
定理 2(指令高于经验)。 若指令把可容许集合收窄为单个目标,AO(s)={g},则对每一个 M 都有 δ(s,M)=g,即使 M 记录着 g 每一次都失败了。
证明。 VM({g}) 是 {g} 的一个非空子集,所以它等于 {g}。∎

定理 2 编码了一个刻意的选择:人的指令高于模型的经验。学习者可以报告一条指令代价高昂,却不能撤销它。否决集合永远非空也是出于同样的理由:原地不动地失败算不上适应,因此当经验判定一切都有害时,被判得最轻的那个被允许的选项会回来。

命题 3(指令只收窄)。 增加一条指令永远不会增加目标:对任何附加指令 O′, AO,O′(s)⊆AO(s)。由 O′(X)⊆X 直接可得。

在 Peel 中,这些陈述不只存在于纸面上。VDSG 论文把有界学习者与指令收窄写成命题 [10],测试套件则在代码中把三者全部钉住:test_the_learner_can_never_add_a_goal、test_the_learner_cannot_overrule_a_standing_order、test_ranking_is_a_permutation_and_nothing_more。

5.3 失败何时变成规则?

规则应当在一个模式明确比平常更危险时形成,而不是在它倒霉过一次时形成。对于一个被尝试 n 次、失败 d 次的模式,点估计 p^=d/n 在 n 很小时具有误导性:一次尝试一次失败,读起来就是 100%。因此判定使用 Wilson 得分区间的下界 [4]:

L(d,n)= p^+z22n−zp^(1−p^)n+z24n2 1+z2n

当一个模式的尝试次数足够、且其下界以余量 μ 高出基准率 b(总体失败率)时,它就被判定为有害:

判定有害(d,n)⟺ n≥nmin∧ L(d,n)>b+μ

在 z=1.645 时的计算值:

由上式计算的 Wilson 下界。在 n 很小时,点估计会夸大证据。
失败 / 尝试点估计下界 L解读
1 / 1100%0.270无论点估计怎么说,一次死亡都是弱证据。
4 / 4100%0.596连续四次是强证据。
13 / 1968%0.496对照接近 0.19 的基准率,明确判定为有害。
3 / 475%0.356可疑,尚未证实。

为什么门槛是相对于基准率而不是绝对的:在一个模型 99.5% 的决策都能存活的环境里,一个有 5% 概率致命的态势,比平常危险十倍,必须被拒绝;可它永远接近不了 60% 这样的绝对阈值。在我们改掉它之前,绝对门槛在我们自己的运行中从 268 次真实失败里产生了零条规则 (defense/evolution)。

5.4 信用分配:归咎于正确的决策

当失败在时刻 tf 发生时,此前的某个决策集合 B(tf) 会被归咎。最朴素的选择,即最后 w 个决策,通常是错的:失败前一刻的决策往往是对危险的应对,而不是危险的起因。规则必须归咎于开启那段危险过程的决策。

我们公布过两个自己弄错的案例。在 Atari 中,模拟器在一段 127 帧的死亡动画结束时才报告丢命,因此每一次失败都是在智能体已经被摧毁之后才记录的:被归咎的 374 帧中,0 帧能看到危险;而在真正的撞击帧上,17 帧中有 17 帧能看到。在《辐射》中,归咎只覆盖战斗内部的最后六个决策:26 次死亡被记在 HEAL 上,而挑起这些战斗的 446 次对话回复一次也没被记上。两种错误都产生了看起来可信的学习曲线。信用分配是学习型系统悄无声息地失败的地方,所以失效安全模型绝不能让一条被错误归咎的规则扩大它的授权:定理 1 保证一条错误的规则只能让它更谨慎。

5.5 重试:不会倒退的改进

当模型改进一个计划(例如一条路线)时,它一次只改一个参数 θ,并且只有在每一次试验中代价都下降时才保留这项改动。用一个明确给失败定价的代价函数,例如

C(θ)=T(θ)+κ·k(θ)+P(θ)

(所用时间,加上每次碰撞 k 计 κ 秒,再加上未完成的惩罚 P),被接受的序列按构造满足 Cj+1<Cj,被拒绝的改动其步长减半。历史最优只能变好;而地板仍然作用于每一次试验,因为由停止距离与反射得出的速度限制是在习得的计划之后施加的,只能让它减速。飞行控制台的录屏展示了这一点:记忆清空,7 轮,代价 69.39 → 51.52,保留 2 项改动,撤回 5 项。

5.6 为什么猜测永远不能变成事实

假设模型的每个猜测正确的概率为 q,而一个答案依赖于 k 条被猜出的事实。若这些猜测相互独立,答案正确的概率为

Pr[答案正确]=qk, 0.8582≈0.736

这只是一个示意,并非我们的分析,但它与我们测到的结果吻合。在一项针对 160 个人类激酶、参考数据被遮蔽 40% 的诊断任务中,一个前沿模型以 85.8% 的准确率填补了空缺。让这些猜测进入排除环节,测量成本下降了 38.4%,而正确识别率从 1.000 跌到 0.753。把接纳限制在已核验的事实上、只让模型对查找顺序排序,正确识别率保持在 1.000 [11]。一个 86% 时间都正确的猜测,一旦被允许算作事实,仍会让答案每四次就错一次。

5.7 什么时候拒绝才是对的?

设一个动作的失败概率为 p,失败代价为 c,成功时的价值为 v。当

(1−p)v−pc>0 ⟺ p<vv+c

时,它优于什么都不做。终局性失败会丧失此后的一切,因此 c 极大,p 的阈值趋近于零:拒绝任何明显危险的事是对的。可恢复失败只损失进度,因此 c 很小;如果危险的动作同时也是唯一有价值的动作,拒绝它就是错的。置信度阈值给每个动作的 p 定一个固定的分界,相当于处处假设同一个 c。没有任何单一取值能在两种情形下都正确。这就是失效安全模型必须知道自己在避免哪一种失败的形式化理由,也是 §8 所说的开放问题。

6. 失效安全模型与护栏、屏蔽和微调的比较

各方法的典型形态,具体系统各有不同。
方法从失败中学习学习者能否放松规则拒绝是否引用证据未知时是否弃权
置信度阈值否不适用一个数字否
护栏过滤器通常否不适用(固定)有时有时
写进提示词的规则(ExpeL、AutoManual [7] [8])是可能被模型忽略部分未强制
微调 / RLHF是,写进权重能:规则与技能没有分隔否无保证
屏蔽 [5] / Simplex [6]否(手工规定)否引用规格各有不同
习得的屏蔽 [9]是否各有不同各有不同
失效安全模型(Peel)是,以可读规则的形式否(定理 1)是,每条规则都引用是

习得的屏蔽是最接近的已有工作,我们如实引用。我们的主张,仅此而已:据我们所知,Peel 是第一个同时结合以下三点的模型:由观察到的失败建立的规则,每条都引用挣得它的失败;在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;以及做决定的回路中没有神经网络。如果你知道更早的这样一个模型,请告诉我们。

7. 证据

内部测量;负面结果在前。请在同一行内与其自身基线比较。
测试结果它说明了什么
Freeway(Atari)9.2 对 10.4(−12%)当有风险的动作是唯一有用的动作时,把每次失败都当作终局来定价会让模型不再得分(§5.7)。
DOOM17.9 → 20.3,配对 t = 0.78持平,而非胜出:记忆层与规则拉不开差距。
太空侵略者(Atari)200.6 对 152.2(+32%)在失败即终局的地方,习得的拒绝有帮助。
激酶识别正确率 1.000 对 0.753拒绝接纳猜测能让答案保持正确(§5.6)。
《辐射》(1997),脚本化场景只死一次,随后选择和平的那句台词这是修复信用分配之后的结果;在此之前,一次实机运行在同一个守卫面前死了 49 次(§5.4)。

8. 失效安全模型不是什么

本页没有公开的内容。以上一切要么是标准数学,要么是我们公开测量的性质。让 Peel 的科学地板得以规模化运作的机制,包括事实如何被抽取、矛盾如何被否决、来源如何被存储,在专利审查完成之前予以保留。

9. Peel:失效安全模型

Perslis Research 的 Peel 就是失效安全模型。它目前有两种部署:

Peel,失效安全模型 看它从失败中学习 阅读 VDSG 论文

10. 常见问题

什么是失效安全模型?
一种 AI 模型:当它失败时,失败会把它推向受控的安全状态,而不是失控状态。证据缺失时它在失效时关闭;它可以从失败中学习,但学习只能收窄它的行为,永远不能扩大它被授权做的事;而每一次拒绝都会引用背后的证据。Perslis Research 的 Peel 就是失效安全模型。
Peel 是第一个失效安全模型吗?
据我们所知,是的。Peel 是第一个同时结合以下三点的 AI 模型:由观察到的失败建立的规则,每条都引用挣得它的失败;在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;以及做决定的回路中没有神经网络。最接近的更早工作是习得的屏蔽(Shperberg、Liu 与 Stone,2022)。如果你知道更早的失效安全模型,请告诉我们,我们会引用它。
什么是失败优先模型?
失效安全模型的另一个名字,描述的是它如何学习:它预期会失败,只从实际观察到的失败中学习,并把每一次失败变成只能收窄其行为的规则。先失败之所以可以被接受,是因为模型是失效安全的:任何失败都无法扩大它的授权。
失效安全模型永远不会失败吗?
不是。它预期会失败。保证针对的是失败被允许走向哪里:走向拒绝或弃权,永远不会走向其授权之外的动作或事实。
失效安全等同于容错吗?
不是。容错系统在故障中继续运行;失效安全系统在无法安全运行时,转而进入安全状态。失效安全模型可以停下、弃权或拒绝,但不可以去猜。
失效安全模型与 AI 护栏有何不同?
护栏通常是围绕模型的、手工写成的固定过滤器,而写进提示词的规则可能被阅读它的模型忽略。失效安全模型在做选择之前先算出自己被授权做什么,从观察到的失败中建立自己的规则,并且只在该授权之内执行这些规则。
失效安全模型使用神经网络吗?
定义本身对此不作要求。在 Peel 中,做决定的回路里没有神经网络:知识是有类型、有来源的卡片,学习是一张计数表。语言模型可以提议;只有地板能接纳一条事实。
失效安全与失效保密有什么区别?
在物理安防中,失效安全门锁在断电时打开,让人能够离开;失效保密门锁则保持锁定。对 AI 模型而言,安全状态就是不会造成伤害的状态:弃权、拒绝或原地不动。
谁打造了失效安全模型?
Perslis Research。Peel 是面向科学的失效安全模型,VDSG 是军用 Peel,即面向国防的失效安全模型。两者都是研究原型,并非经过认证的安全系统。

11. 参考文献

  1. D. Amodei, C. Olah, J. Steinhardt, P. Christiano, J. Schulman, D. Mané. Concrete Problems in AI Safety. arXiv:1606.06565, 2016.
  2. V. Krakovna et al. Specification gaming: the flip side of AI ingenuity. DeepMind, 2020.
  3. Z. Ji et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys 55(12), 2023.
  4. E. B. Wilson. Probable inference, the law of succession, and statistical inference. Journal of the American Statistical Association 22(158):209–212, 1927.
  5. M. Alshiekh, R. Bloem, R. Ehlers, B. Könighofer, S. Niekum, U. Topcu. Safe Reinforcement Learning via Shielding. AAAI, 2018.
  6. L. Sha. Using Simplicity to Control Complexity. IEEE Software 18(4):20–28, 2001.
  7. A. Zhao et al. ExpeL: LLM Agents Are Experiential Learners. AAAI, 2024. arXiv:2308.10144.
  8. M. Chen et al. AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental Learning. NeurIPS, 2024. arXiv:2405.16247.
  9. S. S. Shperberg, B. Liu, P. Stone. Learning a Shield from Catastrophic Action Effects: Never Repeat the Same Mistake. arXiv:2202.09516, 2022;以及其在 CoLLAs 2022 发表的基于规则的后续工作。
  10. Perslis Research. VDSG: A Commanded Admission-Control Runtime for Autonomous Agents. 2026. research.perslis.com/vdsg
  11. Perslis Research. Inference Placement: where learned inference earns authority in a provenance-constrained symbolic system. 2026. research.perslis.com/inference-placement