Perslis 国防
PERSLIS 国防 · 任何模型居上

让任何智能来引领。只有可容许的动作能抵达平台。

机器学习擅长感知和提出行动方案,但它不是可以在关键路径上认证的东西。业界趋同的答案是运行时保障:让能力强但未经验证的控制器提议,让一个小而可验证的层决定什么被执行。

Perslis 就是这一层。学习型模型、符号规划器或一个机组都可以位于其上;无论它提议什么,平台只会执行可容许的动作或安全保持——并且每一次拒绝都连同其背后的证据被记录下来。

这个模式,以及它属于谁

运行时保障不是我们的发明。Simplex 架构(Sha,2001)在接近安全集边缘时把控制权从未经验证的控制器交给经过验证的控制器;屏蔽(Alshiekh 等,2018)按规格过滤学习型智能体的动作;ASTM F3269 为含复杂功能的无人机约束其行为提供了标准。我们在它们的基础上构建。Perslis 增加的是:

  1. 授权先行计算。可容许集合在提议者选择之前,由有来源的规则和人的指令计算出来,所以提议者只在可容许的动作中选择——这是事前限制,而不是事后否决(运行时)。
  2. 指令只会收窄。一条长期指令优先于任何数量的经验(《失败优先模型》定理 2)。
  3. 学习无法扩大它。地板从失败中学习可读的规则,每条都引用其背后的失败;并且已证明学习只能移除和重排选项,永远不能增加选项(定理 1,由同一篇论文中的测试钉住)。

证据

地板之上结果出处
敌对控制器
CARLA,照片级驾驶仿真
在连续 40,052 米的行驶中,它发出了 64,952 条违反不变量的指令;地板覆盖了全部指令,零碰撞。移除地板后,同样的提议直达执行器:43 条危险指令被放行,数秒内发生 2 次碰撞。CARLA 准入控制
语言模型驾驶
前沿与本地模型,CARLA
在地板之下零碰撞,但测得约 0.8–2.0 秒的“瞥视”延迟:模型保持一条过时的指令,以 40 km/h 盲开约 10 米。所有语言模型都以约 8–10 km/h 缓行;经典控制器以 34 km/h 行驶。CARLA 准入控制
实时 3D 坦克竞技场中的语言模型
BZFlag,一场标题比赛
规则 20–20,共 60,140 次决策;DeepSeek 10–18,约每次决策 1.0 秒;通过命令行接口调用的前沿模型 1–15,每次决策 7.6 秒(58 次决策——这是传输限制,而不是模型测量)。BZFlag 自带的 AI 击败了我们的规则。《规则掌舵》
以游戏自带的机器人 AI 作为规划器
Quake III Arena 引擎(OpenArena 内容),5 级对手
9 场十分钟成对比赛:地板之上的同一机器人 K/D 1.05,不带地板 0.93,每场净差 +12.2(t = 2.02,p = 0.08)——一个倾向,而不是显著的结果。在有危险地形的地图上,它的逃避动作仍会造成熔岩与虚空死亡,从中学习的效果尚未显示。内部测量,运行日志留存。—

地板保证什么,不保证什么

优势

节奏与问责兼得。提议者以它能思考的最快速度运行;地板在每个周期核对真实状态(CARLA 中为 20 Hz),并记录下每一次拒绝及其证据——于是团队既获得机器节奏的决策,也获得一份可以摆到安全委员会面前的、对每一次决策的交代。