Perslis Defense
Perslis Defense — 机械狮子吉祥物 PERSLIS DEFENSE · 面向对抗环境的可信自主

交战时的机器速度。复盘时的可问责。

自主系统进入部队的速度,快于对其追责的手段。操作员被要求接受一个无法解释任何一次判断的系统所做出的机器级决策 —— 而指挥官被要求为此签字。今天,这整份责任压在一个数字上:if confidence > 0.8。一个来自未校准估计器的标量,配上凭感觉挑的阈值,就这样横在武器系统与不可逆行为之间。

Perslis 是自主堆栈之下的准入控制层。它在边缘运行 —— 断连、拒止、无网络、无推理预算 —— 并在当前战术态势下判定哪些动作是被许可的,拒绝其余,并把每一次拒绝连同产生它的证据一起记录下来。任何规划器都可以坐在它之上:习得的策略、经典自动驾驶仪,或一组机组人员。

任务保证不是一个「通常正确」的系统,而是一个能在事后展示哪些行动方案曾经可用、哪些被否决、依据是什么的系统 —— 既要跟得上交战节奏,也要经得起安全评审。

我们没有让自主更聪明。我们界定了它被许可做什么,并让每一次拒绝都站得住。

章节

1 · 运行时

跨四个领域的同一份契约。为什么地板位于规划器之前而非事后否决,以及为什么规则必须指名危险。

2 · 证据

CARLA 碰撞为 0、太空侵略者 +32%、同一份代码在 Freeway 上 −12%、Doom 持平,以及我们公布的信用分配缺陷。

3 · 班组

约束彼此组合得很糟。30 条规则 → 6 个死局,50 条 → 12 个,以及把它降回 0 的规则退休。

4 · 演化

一条规则如何挣得:卡片、相对证据门槛、指名的危险,以及 203 张相连的证据瓦片。

5 · 回执

影子模式。地板即使处于停用状态也会记录判定,因此你可以在不授予权限的情况下评估它。

6 · 边界

PROTOTYPE,未取得任何资质,以及尚未解决的问题:当风险与目标耦合时机制会失效。

7 · VDSG

演示:运行时掌舵《DOOM》与《德军总部 3D》,录制后逐面板回放:只收窄的指令、眼睛、里程计、按所见定尺的脱出。

为什么这是国防问题,而不是 AI 问题

政策本身已经要求如此。对武力使用保持适当的人类判断,不能靠一个「通常正确」的模型来满足;它要靠一个能在事后证明哪些行动方案曾经可用、哪些被否决、依据是什么的系统来满足。交战规则、禁入空域、火力消解与指挥官意图,全都是对什么可以被执行的约束 —— 而这正是这一层所强制的,也正是置信度分数无法表达的。

置信度分数不是核验

0.94 无法告诉你是哪十九次经验把它变成 0.94,你也无法删掉其中任何一次。它说不出「我没有依据作答」。它会无声地退化,事故之后也无法审计。

带证据的拒绝可以

在此情境下 19 次中死亡 13 次 —— 为基准率的 3.6 倍。可计数、可查验、可编辑,并且能一路回溯到为它背书的每一次具体事件。

运行时

同一份契约,在我们跑过的每个领域里都未曾改变。只有事实抽取器是领域专用的。

pixels / telemetry  →  facts  →  ADMISSIBLE SET  →  objective  →  projection  →  memory  →  action
                                       ▲                                            │
                                       └──────────  a refusal, with its evidence  ───┘

规划器从不在完整动作空间中选择,它只在地板已经宣告为可容许的集合中选择。当地板移除一个选项时,它会指名自己所应对的危险,并引用赢得该规则的那些经验 —— 一条无法指名危险的规则在构造时就会被拒绝,因为那正是迷信的形状。

运行时不含任何模型。它在平台上离线运行,没有网络,也没有推理预算。执行器共 303 行,可直接下载。

我们真正测量到了什么

四个领域,一套架构。负面结果之所以列在这里,是因为国防评审迟早会找到它们,也因为一条只会上升的结果曲线更不可信,而非更可信。

均为内部测量。每个数字都可从一张冻结的实验卡片复现。
领域结果解读
驾驶 —— CARLA,敌对控制器在 38–40 km/h 下行驶 100–490 m,碰撞 = 0;保持约 9.7 m 间距,记录约 400 次拒绝地板从敌对规划器手中接管车辆并保持间距。关闭地板后,同一个规划器会撞车。
太空侵略者 —— 原始像素,无权重200.6 vs 152.2 (+32%)当失败是终局性的时,习得式拒绝有帮助。
Freeway —— 完全相同的机制9.2 vs 10.4 (−12%)当唯一的得分动作同时也是危险动作时,它有害。如实公布,未经调参掩盖。
Doom —— 基于规则,无机器学习random 3.2 · rules 17.9 · rules+memory 20.3规则显著优于随机;其上的记忆层是持平,而非胜出(配对 t = 0.78)。

这一对结果本身就是发现。《太空侵略者》和 Freeway 运行的是同一份代码 —— Freeway 原样导入了前者的失败记忆。架构迁移成功,学习没有。原因在于失败摧毁了什么:前者的死亡是终局性的,代价是整局剩余回报;后者的碰撞可以恢复,代价只是失去的路程。没有任何单一的失败定价能在两种情形下都正确,而固定阈值正是一个单一的失败定价。完整结果 →

班组,以及没人公布的那个失效模式

约束彼此组合得很糟。每一条交战规则、每一个禁入空域、每一条冲突消解规则单独看都成立;问题在于它们合起来会做什么,而这一点在业界几乎无人测量。

我们测量了。在一个智能体真实遭遇过的 91 个情境上:

规则集规则数死局
所有选项被拒
被迫
只剩一个选项
有界工作集3069
无界501215

规则翻倍,死局也翻倍。其中每一条规则都由真实的失败换来。单条致命,合起来瘫痪。在无界情况下,智能体的表现比完全不学习更差 —— 不是因为哪条规则错了,而是因为可容许集合只会不断收缩。

这正是安全层在现场被关掉的原因,也是多智能体约束的核心工程问题。我们的答案是覆盖度感知的规则退休:为集合而非单条规则打分,测量约束多久会让智能体只剩零个或一个选项,并按「代价/保护」最差的顺序退休规则,直到选择空间恢复。在实测集合上,这把死局从 6 降到 0,代价是交还 29 次已记录的失败。退休让可容许集合能够重新长回来 —— 这是纯粹的累积永远做不到的。

它如何学习,以及你为何读得懂

没有权重,没有梯度,没有训练过程。行为的改变来自写下一行行你可以查验、也可以删除的记录。

  1. 一次事件写下一张卡片。分桶后的情境,以及当时采取的动作。
  2. 证据不断累积。一个签名必须被见到足够多次、在绝对意义上确实致命,并且跨过一道相对门槛 —— 95% Wilson 下界数倍于基准率 —— 这样一次倒霉事件就无法制造迷信。
  3. 卡片变成一条规则,把该动作从可容许集合中移除,并且这条规则必须指名它所应对的危险。
  4. 每条规则都有追溯。30 条规则展开为 203 张规范证据瓦片,父子相连,因此单次否决可以一路回溯到为它背书的每一次具体事件。

一次否决读起来是:当 bomb dx+0 drop0 时,left 被移出可容许集合:4 次中死亡 4 次(100%),为基准率的 5.2 倍 —— 随后是那四次事件的编号。这就是安全论证证物,由运行本身生成,而不是事后补写。

它不是什么,以及还需要什么成立

PROTOTYPE,研究级。这里没有任何内容针对安全攸关路径做过验证,没有任何功能安全资质,也从未上过飞行器、公路车辆或靶场。演示对象是一个仿真器、四个游戏和一个文档语料库。任何引用 +32% 而不提 −12% 的说法都是误读。

尚未解决的问题,恰恰是国防最关心的那个。我们自己冻结的结果表明:当风险与目标耦合时 —— 即完成任务的动作同时也是暴露你的动作 —— 该机制会失效。那就是 Freeway,也是对抗环境的常态。一个会拒绝「以前害死过自己的动作」的地板,也会拒绝任务本身。要做的工作是为可恢复性而非致命性定价:拒绝无法撤销的事,并允许其余一切直到那条边界为止。我们把它写在正文而不是脚注里,因为这是任何内容接近真实平台之前必须先解决的事。

我们的不可恢复性研究是这个问题的形式化一面。

为什么是我们

从哪里开始

诚实的第一步是评估而非部署:针对一段已记录的任务,以影子模式运行地板(保持停用),然后阅读那份反事实日志。它在作战上零成本,却能准确告诉你它本会拒绝什么、以及为什么。

联系我们 ↗

交互式驾驶演示 · 冻结的街机结果 · 可下载的运行时