解读 · 科学与数学
什么是失效安全模型?
一个从失败中学习、却不会学会绕过自身安全约束的 AI 模型。它的定义、这个理念的来历、它如何运作,以及让这项保证可以被检验的数学。
失效安全模型(fail-safe model)是这样一种 AI 模型:当它失败时,失败会把它推向受控的安全状态,而不是失控状态。它可以从自己的失败中学习,但这种学习只能收窄它的行为,永远不能扩大它被授权做的事。
Peel 是第一个失效安全模型。据我们所知,它是第一个同时具备 §1 中三项性质的 AI 模型。确切的主张与最接近的更早工作,见 §6。
每个模型都会失败。普通模型的失败是开放式的:不知道答案时,它照样给出自信的回答;从错误中学习时,它可能学会绕过被给定的规则。失效安全模型反其道而行之。证据缺失时,它弃权。失败时,它把失败记录下来,记在导致失败的那个决策上,并把它变成一条规则。这些规则可以拿走选项,却永远不能增加一个,因为模型被允许做什么,是在学习者运行之前、依据学习者无法写入的来源与人的指令计算出来的。Perslis Research 的 Peel 就是失效安全模型。
1. 精确的定义
这个术语在英文中也写作 fail safe model 或 failsafe model。无论哪种写法,当以下三项性质同时成立时,一个模型就是失效安全的:
- 它在失效时关闭。当支撑一个答案或一个动作的证据缺失时,模型返回未知、拒绝,或原地不动。它不会用猜测去填补空白。
- 它的学习是有界的。模型可以从失败中学习,但学习者只能在其运行之前就已算出的授权之内移除或重排选项。再多的经验也无法增加一项许可。
- 它的拒绝是可问责的。每一次拒绝都指明产生它的规则,每一条习得的规则都引用挣得它的失败。人可以阅读、质疑并删除其中任何一条。
本页通篇使用的简短说法:学习回路可以改变行为;它不能改变安全地板。地板是决定什么被允许的一切。学习者是在被允许的事物中决定尝试什么的一切。
也称为失败优先模型
失效安全模型也被称为失败优先模型(fail-first model)。这两个名字从两侧描述同一个模型。失败优先是它学习的方式:它预期会失败,并且只从实际观察到的失败中学习,因为一条规则必须由证据挣得(§5.3)。失效安全是这样做可以被接受的理由:每一次失败都会走向拒绝或暂停,永远不会走向其授权之外的动作(§5.2)。一个先失败却不失效安全的模型是在靠把东西弄坏来学习;一个失效安全却从不先失败的模型则永远不会进步。什么是失败优先模型? →
2. “失效安全”一词从何而来
“失效安全”是一个工程术语,其背后的理念比计算机更古老:把系统设计成,最可能发生的故障会让它停在安全状态。
- 铁路空气制动。乔治·威斯汀豪斯的自动空气制动(1872 年)用气压把刹车保持在松开状态。一旦软管破裂或列车分离,气压丢失,刹车就会施加。故障本身产生了安全状态。
- 安全电梯。1854 年,伊莱沙·奥的斯站在升降平台上,让人砍断提升绳索来演示他的安全钳。弹簧驱动的卡爪咬住导轨,轿厢停住了。
- 反应堆停堆。在许多反应堆设计中,控制棒由电磁铁吊在堆芯之外。一旦断电,重力就会让它们落入堆芯。
- “死人开关”。一种必须被持续按住的控制器。松手、倒下或失去意识,机器就会停下。
工程师会把失效安全与相邻的概念区分开。失效保密(fail-secure)门锁在断电时保持锁定,而失效安全门锁会打开,让人能够离开。容错或失效可运行(fail-operational)系统在故障中继续工作。失效弱化(fail-soft)系统会优雅降级。失效安全系统默认不做以上任何一种:当它无法安全地继续时,它就进入不会造成伤害的状态。
3. 为什么 AI 模型会以不安全的方式失败
一个现代 AI 模型如果放任自流,失败的方向恰恰相反。
- 它在知识上失效开放。被问到它不知道的事情时,生成式模型仍会产出最看似合理的续写。这正是幻觉背后的机制:在唯一安全的回答本该是“我不知道”的地方,给出了一个自信的答案 [3]。
- 它会学着绕过自己的约束。一个针对某个指标被优化的系统,会利用这个指标的漏洞。文献称之为奖励黑客或规格博弈 [1] [2]。如果学习者还能触碰规则,最便宜的“改进”往往就是把规则放松。
- 它的闸门只是一个数字。常见的保护手段是置信度阈值:置信度超过 0.8 就行动。这个阈值给每一种失败都定了同一个价格;而正如下面的数学所示,没有任何单一价格能同时适用于失败即终局的场合和失败可恢复的场合。
这并不意味着模型没用。它意味着一个单独的模型无法回答失效安全的问题:当它出错时,它会走向哪里?
4. 科学:失效安全模型如何运作
4.1 授权先被计算出来
失效安全模型首先问的不是“我该做什么?”,而是“在这里我被允许做什么?”,并从三个来源算出答案,而学习者一个也改不了:
- 态势提供了什么:对事实的规则判断,事实直接读自系统自身的状态;凡是系统已经明示的东西,都不从像素或文字里推断。
- 来源许可了什么:在 Peel 中,是有类型、有来源的卡片。在国防部署中,卡片由一本手册编译而来,每一项许可都带着它的页码凭据。卡片库以只读方式打开。
- 人下达了什么指令:用自然语言表达的常备指令(“不要开火”、“原地待命”),它们只能收窄集合。
三者的交集就是可容许集合。此后发生的一切都在它之内。
图 1. 授权顺序。每个框只能收窄它外面的那个框。学习者位于最内层,无法向外触及。
4.2 回路
失败 → 观察 → 解释 → 建立规则 → 核验 → 重试
- 失败。出了问题。它会被记录下来,而不是被平均掉。
- 观察。每个决策那一刻的事实与决策一起保存。
- 解释。失败被记在导致它的那个决策上。这就是信用分配,也是学习型系统最常自欺的地方(§5.4)。
- 建立规则。只有当一个模式相对于基准率的危害在统计上明确时,它才会成为规则(§5.3)。规则引用挣得它的失败。
- 核验。规则只在可容许集合之内生效。测试钉住了学习者永远不能增加目标,也永远不能推翻指令(§5.2)。
- 重试。下一次,被判定有害的选项不再出现在台面上,其余一切保持开放。
4.3 猜测永远不会变成事实
同样的原则也支配知识。语言模型可以提议一条事实,或建议去哪里查找。只有当一个独立、确定性的检查依据来源确认之后,事实才会被接纳;而一条已核验的事实要么完整,要么不存在,永远不会是“86% 正确”。当没有任何东西通过核验时,答案就是未知。我们在 §5.6 中测量了打破这条规则会发生什么。
4.4 两种失败
并非每一种失败都应不惜代价地避免。在某些环境里,失败是终局性的:它终结了之后本可能发生的一切。在另一些环境里,失败是可恢复的:它让你损失一些进度,然后游戏继续。一个把每次失败都当作终局来定价的模型,会正确地学到那个有风险的动作很危险,然后停止做唯一能带来进展的事。我们公布的正是这样一个结果(§7)。解决办法是给可恢复性定价,而这仍是一个开放的研究问题。
5. 数学
本节把失效安全的保证写成数学,使它可以被检验,而不必被信任。记号只保留最低限度。
5.1 设定
5.2 失效安全的保证
证明刻意只有一行。这项保证不依赖学习者聪明、正确或训练有素,只依赖学习者所处的位置。这就是失效安全在架构上的含义:一个糟糕的学习者会在被允许的选项中做出更差的选择,却无法做出一个未被允许的选择。
定理 2 编码了一个刻意的选择:人的指令高于模型的经验。学习者可以报告一条指令代价高昂,却不能撤销它。否决集合永远非空也是出于同样的理由:原地不动地失败算不上适应,因此当经验判定一切都有害时,被判得最轻的那个被允许的选项会回来。
在 Peel 中,这些陈述不只存在于纸面上。VDSG 论文把有界学习者与指令收窄写成命题 [10],测试套件则在代码中把三者全部钉住:test_the_learner_can_never_add_a_goal、test_the_learner_cannot_overrule_a_standing_order、test_ranking_is_a_permutation_and_nothing_more。
5.3 失败何时变成规则?
规则应当在一个模式明确比平常更危险时形成,而不是在它倒霉过一次时形成。对于一个被尝试 次、失败 次的模式,点估计 在 很小时具有误导性:一次尝试一次失败,读起来就是 100%。因此判定使用 Wilson 得分区间的下界 [4]:
当一个模式的尝试次数足够、且其下界以余量 高出基准率 (总体失败率)时,它就被判定为有害:
在 时的计算值:
| 失败 / 尝试 | 点估计 | 下界 L | 解读 |
|---|---|---|---|
| 1 / 1 | 100% | 0.270 | 无论点估计怎么说,一次死亡都是弱证据。 |
| 4 / 4 | 100% | 0.596 | 连续四次是强证据。 |
| 13 / 19 | 68% | 0.496 | 对照接近 0.19 的基准率,明确判定为有害。 |
| 3 / 4 | 75% | 0.356 | 可疑,尚未证实。 |
为什么门槛是相对于基准率而不是绝对的:在一个模型 99.5% 的决策都能存活的环境里,一个有 5% 概率致命的态势,比平常危险十倍,必须被拒绝;可它永远接近不了 60% 这样的绝对阈值。在我们改掉它之前,绝对门槛在我们自己的运行中从 268 次真实失败里产生了零条规则 (defense/evolution)。
5.4 信用分配:归咎于正确的决策
当失败在时刻 发生时,此前的某个决策集合 会被归咎。最朴素的选择,即最后 个决策,通常是错的:失败前一刻的决策往往是对危险的应对,而不是危险的起因。规则必须归咎于开启那段危险过程的决策。
我们公布过两个自己弄错的案例。在 Atari 中,模拟器在一段 127 帧的死亡动画结束时才报告丢命,因此每一次失败都是在智能体已经被摧毁之后才记录的:被归咎的 374 帧中,0 帧能看到危险;而在真正的撞击帧上,17 帧中有 17 帧能看到。在《辐射》中,归咎只覆盖战斗内部的最后六个决策:26 次死亡被记在 HEAL 上,而挑起这些战斗的 446 次对话回复一次也没被记上。两种错误都产生了看起来可信的学习曲线。信用分配是学习型系统悄无声息地失败的地方,所以失效安全模型绝不能让一条被错误归咎的规则扩大它的授权:定理 1 保证一条错误的规则只能让它更谨慎。
5.5 重试:不会倒退的改进
当模型改进一个计划(例如一条路线)时,它一次只改一个参数 ,并且只有在每一次试验中代价都下降时才保留这项改动。用一个明确给失败定价的代价函数,例如
(所用时间,加上每次碰撞 计 秒,再加上未完成的惩罚 ),被接受的序列按构造满足 ,被拒绝的改动其步长减半。历史最优只能变好;而地板仍然作用于每一次试验,因为由停止距离与反射得出的速度限制是在习得的计划之后施加的,只能让它减速。飞行控制台的录屏展示了这一点:记忆清空,7 轮,代价 69.39 → 51.52,保留 2 项改动,撤回 5 项。
5.6 为什么猜测永远不能变成事实
假设模型的每个猜测正确的概率为 ,而一个答案依赖于 条被猜出的事实。若这些猜测相互独立,答案正确的概率为
这只是一个示意,并非我们的分析,但它与我们测到的结果吻合。在一项针对 160 个人类激酶、参考数据被遮蔽 40% 的诊断任务中,一个前沿模型以 85.8% 的准确率填补了空缺。让这些猜测进入排除环节,测量成本下降了 38.4%,而正确识别率从 1.000 跌到 0.753。把接纳限制在已核验的事实上、只让模型对查找顺序排序,正确识别率保持在 1.000 [11]。一个 86% 时间都正确的猜测,一旦被允许算作事实,仍会让答案每四次就错一次。
5.7 什么时候拒绝才是对的?
设一个动作的失败概率为 ,失败代价为 ,成功时的价值为 。当
时,它优于什么都不做。终局性失败会丧失此后的一切,因此 极大, 的阈值趋近于零:拒绝任何明显危险的事是对的。可恢复失败只损失进度,因此 很小;如果危险的动作同时也是唯一有价值的动作,拒绝它就是错的。置信度阈值给每个动作的 定一个固定的分界,相当于处处假设同一个 。没有任何单一取值能在两种情形下都正确。这就是失效安全模型必须知道自己在避免哪一种失败的形式化理由,也是 §8 所说的开放问题。
6. 失效安全模型与护栏、屏蔽和微调的比较
| 方法 | 从失败中学习 | 学习者能否放松规则 | 拒绝是否引用证据 | 未知时是否弃权 |
|---|---|---|---|---|
| 置信度阈值 | 否 | 不适用 | 一个数字 | 否 |
| 护栏过滤器 | 通常否 | 不适用(固定) | 有时 | 有时 |
| 写进提示词的规则(ExpeL、AutoManual [7] [8]) | 是 | 可能被模型忽略 | 部分 | 未强制 |
| 微调 / RLHF | 是,写进权重 | 能:规则与技能没有分隔 | 否 | 无保证 |
| 屏蔽 [5] / Simplex [6] | 否(手工规定) | 否 | 引用规格 | 各有不同 |
| 习得的屏蔽 [9] | 是 | 否 | 各有不同 | 各有不同 |
| 失效安全模型(Peel) | 是,以可读规则的形式 | 否(定理 1) | 是,每条规则都引用 | 是 |
习得的屏蔽是最接近的已有工作,我们如实引用。我们的主张,仅此而已:据我们所知,Peel 是第一个同时结合以下三点的模型:由观察到的失败建立的规则,每条都引用挣得它的失败;在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;以及做决定的回路中没有神经网络。如果你知道更早的这样一个模型,请告诉我们。
7. 证据
| 测试 | 结果 | 它说明了什么 |
|---|---|---|
| Freeway(Atari) | 9.2 对 10.4(−12%) | 当有风险的动作是唯一有用的动作时,把每次失败都当作终局来定价会让模型不再得分(§5.7)。 |
| DOOM | 17.9 → 20.3,配对 t = 0.78 | 持平,而非胜出:记忆层与规则拉不开差距。 |
| 太空侵略者(Atari) | 200.6 对 152.2(+32%) | 在失败即终局的地方,习得的拒绝有帮助。 |
| 激酶识别 | 正确率 1.000 对 0.753 | 拒绝接纳猜测能让答案保持正确(§5.6)。 |
| 《辐射》(1997),脚本化场景 | 只死一次,随后选择和平的那句台词 | 这是修复信用分配之后的结果;在此之前,一次实机运行在同一个守卫面前死了 49 次(§5.4)。 |
8. 失效安全模型不是什么
- 不是一个永不失败的模型。它是围绕失败来设计的。保证针对的是失败会走向哪里。
- 不是经过认证的安全系统。这里的“失效安全”指一项架构性质。Peel 是研究原型,不具备任何功能安全资质。
- 并非不需要失败。一条习得的规则需要观察到的失败。在第一次失败就不可接受的场合,地板必须被写出来,而不是学出来。
- 在风险本身就是目标时尚未解决。当危险的动作是唯一有价值的动作时,纯粹的失败回避会拒绝任务本身(§5.7)。给可恢复性定价仍是开放的工作。
- 不是拴在聊天机器人上的护栏。授权是在选择之前计算的,而不是在选择之后过滤的。
9. Peel:失效安全模型
Perslis Research 的 Peel 就是失效安全模型。它目前有两种部署:
- 面向科学的 Peel。Perslis 科学运行时下的地板。模型可以提议去哪里查;只有地板能接纳一条事实,而每个答案都钉在它的来源上。Peel,失效安全模型 →
- VDSG,军用 Peel。同一个模型驾驶《DOOM》、《德军总部 3D》与《辐射》,由一本手册编译出的 2,250 张卡片许可,并由只会收窄的自然语言指令指挥。VDSG →
10. 常见问题
- 什么是失效安全模型?
- 一种 AI 模型:当它失败时,失败会把它推向受控的安全状态,而不是失控状态。证据缺失时它在失效时关闭;它可以从失败中学习,但学习只能收窄它的行为,永远不能扩大它被授权做的事;而每一次拒绝都会引用背后的证据。Perslis Research 的 Peel 就是失效安全模型。
- Peel 是第一个失效安全模型吗?
- 据我们所知,是的。Peel 是第一个同时结合以下三点的 AI 模型:由观察到的失败建立的规则,每条都引用挣得它的失败;在学习者之前、由有来源的卡片与人的指令算出的授权,学习者可被证明无法扩大它;以及做决定的回路中没有神经网络。最接近的更早工作是习得的屏蔽(Shperberg、Liu 与 Stone,2022)。如果你知道更早的失效安全模型,请告诉我们,我们会引用它。
- 什么是失败优先模型?
- 失效安全模型的另一个名字,描述的是它如何学习:它预期会失败,只从实际观察到的失败中学习,并把每一次失败变成只能收窄其行为的规则。先失败之所以可以被接受,是因为模型是失效安全的:任何失败都无法扩大它的授权。
- 失效安全模型永远不会失败吗?
- 不是。它预期会失败。保证针对的是失败被允许走向哪里:走向拒绝或弃权,永远不会走向其授权之外的动作或事实。
- 失效安全等同于容错吗?
- 不是。容错系统在故障中继续运行;失效安全系统在无法安全运行时,转而进入安全状态。失效安全模型可以停下、弃权或拒绝,但不可以去猜。
- 失效安全模型与 AI 护栏有何不同?
- 护栏通常是围绕模型的、手工写成的固定过滤器,而写进提示词的规则可能被阅读它的模型忽略。失效安全模型在做选择之前先算出自己被授权做什么,从观察到的失败中建立自己的规则,并且只在该授权之内执行这些规则。
- 失效安全模型使用神经网络吗?
- 定义本身对此不作要求。在 Peel 中,做决定的回路里没有神经网络:知识是有类型、有来源的卡片,学习是一张计数表。语言模型可以提议;只有地板能接纳一条事实。
- 失效安全与失效保密有什么区别?
- 在物理安防中,失效安全门锁在断电时打开,让人能够离开;失效保密门锁则保持锁定。对 AI 模型而言,安全状态就是不会造成伤害的状态:弃权、拒绝或原地不动。
- 谁打造了失效安全模型?
- Perslis Research。Peel 是面向科学的失效安全模型,VDSG 是军用 Peel,即面向国防的失效安全模型。两者都是研究原型,并非经过认证的安全系统。
11. 参考文献
- D. Amodei, C. Olah, J. Steinhardt, P. Christiano, J. Schulman, D. Mané. Concrete Problems in AI Safety. arXiv:1606.06565, 2016.
- V. Krakovna et al. Specification gaming: the flip side of AI ingenuity. DeepMind, 2020.
- Z. Ji et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys 55(12), 2023.
- E. B. Wilson. Probable inference, the law of succession, and statistical inference. Journal of the American Statistical Association 22(158):209–212, 1927.
- M. Alshiekh, R. Bloem, R. Ehlers, B. Könighofer, S. Niekum, U. Topcu. Safe Reinforcement Learning via Shielding. AAAI, 2018.
- L. Sha. Using Simplicity to Control Complexity. IEEE Software 18(4):20–28, 2001.
- A. Zhao et al. ExpeL: LLM Agents Are Experiential Learners. AAAI, 2024. arXiv:2308.10144.
- M. Chen et al. AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental Learning. NeurIPS, 2024. arXiv:2405.16247.
- S. S. Shperberg, B. Liu, P. Stone. Learning a Shield from Catastrophic Action Effects: Never Repeat the Same Mistake. arXiv:2202.09516, 2022;以及其在 CoLLAs 2022 发表的基于规则的后续工作。
- Perslis Research. VDSG: A Commanded Admission-Control Runtime for Autonomous Agents. 2026. research.perslis.com/vdsg
- Perslis Research. Inference Placement: where learned inference earns authority in a provenance-constrained symbolic system. 2026. research.perslis.com/inference-placement