让任何智能来引领。只有可容许的动作能抵达平台。
机器学习擅长感知和提出行动方案,但它不是可以在关键路径上认证的东西。业界趋同的答案是运行时保障:让能力强但未经验证的控制器提议,让一个小而可验证的层决定什么被执行。
Perslis 就是这一层。学习型模型、符号规划器或一个机组都可以位于其上;无论它提议什么,平台只会执行可容许的动作或安全保持——并且每一次拒绝都连同其背后的证据被记录下来。
这个模式,以及它属于谁
运行时保障不是我们的发明。Simplex 架构(Sha,2001)在接近安全集边缘时把控制权从未经验证的控制器交给经过验证的控制器;屏蔽(Alshiekh 等,2018)按规格过滤学习型智能体的动作;ASTM F3269 为含复杂功能的无人机约束其行为提供了标准。我们在它们的基础上构建。Perslis 增加的是:
证据
| 地板之上 | 结果 | 出处 |
|---|---|---|
| 敌对控制器 CARLA,照片级驾驶仿真 | 在连续 40,052 米的行驶中,它发出了 64,952 条违反不变量的指令;地板覆盖了全部指令,零碰撞。移除地板后,同样的提议直达执行器:43 条危险指令被放行,数秒内发生 2 次碰撞。 | CARLA 准入控制 |
| 语言模型驾驶 前沿与本地模型,CARLA | 在地板之下零碰撞,但测得约 0.8–2.0 秒的“瞥视”延迟:模型保持一条过时的指令,以 40 km/h 盲开约 10 米。所有语言模型都以约 8–10 km/h 缓行;经典控制器以 34 km/h 行驶。 | CARLA 准入控制 |
| 实时 3D 坦克竞技场中的语言模型 BZFlag,一场标题比赛 | 规则 20–20,共 60,140 次决策;DeepSeek 10–18,约每次决策 1.0 秒;通过命令行接口调用的前沿模型 1–15,每次决策 7.6 秒(58 次决策——这是传输限制,而不是模型测量)。BZFlag 自带的 AI 击败了我们的规则。 | 《规则掌舵》 |
| 以游戏自带的机器人 AI 作为规划器 Quake III Arena 引擎(OpenArena 内容),5 级对手 | 9 场十分钟成对比赛:地板之上的同一机器人 K/D 1.05,不带地板 0.93,每场净差 +12.2(t = 2.02,p = 0.08)——一个倾向,而不是显著的结果。在有危险地形的地图上,它的逃避动作仍会造成熔岩与虚空死亡,从中学习的效果尚未显示。内部测量,运行日志留存。 | — |
地板保证什么,不保证什么
- 保证(已证明,并在 VDSG 中由测试钉住):对学习者能达到的每一个状态,每个被执行的动作都在可容许集合之内,否则就是安全保持;指令优先于经验。
- 不会让提议者变得能干。正确的地板也可能拒绝任务:在 Freeway 上,三条正确的规则封锁了唯一得分的动作(−12%)。
- 不认证任何东西。这里没有任何功能安全资质;一个向地板撒谎的传感器,也就是在向证明撒谎。见边界。
优势
节奏与问责兼得。提议者以它能思考的最快速度运行;地板在每个周期核对真实状态(CARLA 中为 20 Hz),并记录下每一次拒绝及其证据——于是团队既获得机器节奏的决策,也获得一份可以摆到安全委员会面前的、对每一次决策的交代。