Perslis Defense
PERSLIS DEFENSE · 第六章 · 边界

它不是什么。

一项安全主张会招来最严厉的审视,本该如此。以下是我们宁愿评审从我们这里听到、而不是自己发现的全部内容。

状态

PROTOTYPE,研究级。这里没有任何内容针对安全攸关路径做过验证,没有任何功能安全资质,从未上过飞行器、公路车辆或靶场。演示对象是一个仿真器、四个游戏和一个文档语料库。任何引用 +32% 而不提 −12% 的说法都是误读。

尚未解决的问题

我们自己冻结的结果表明:当风险与目标耦合时 —— 即完成任务的动作同时也是暴露你的动作 —— 该机制会失效。

那就是 Freeway:up 既是唯一的得分动作,也是危险动作;形成了三条规则,全部阻断 up;智能体正确地得出「移动是致命的」,也正确地停止了游戏。而这同样是对抗环境的常态。一个会拒绝「以前害死过自己的动作」的地板,也会拒绝任务本身。

在效用排序之上叠加一层灾难性后果地板并没有修好它 —— 那只是重建了原来的否决,并让两个游戏都更差。当致命动作就是唯一有用的动作时,根本不存在可以排除的灾难性尾部。

要做的工作是为可恢复性而非致命性定价:拒绝无法撤销的事,并允许其余一切直到那条边界为止。一个真正理解可恢复失败的机制,应当在 Freeway 上彻底超过无辅助基线,而不仅仅是打平 —— 那是基准,而它尚未达成。我们的不可恢复性研究是这个问题的形式化一面。

其他值得点明的边界

即便如此,从哪里开始

以上没有一条会阻碍评估,因为评估并不要求系统已被信任。针对一段已记录的任务运行影子模式,在构造上就是惰性的:阅读那份反事实日志,自行判断它本会拒绝什么、以及这样做是否正确。

联系我们 ↗