它不是什么。
一项安全主张会招来最严厉的审视,本该如此。以下是我们宁愿评审从我们这里听到、而不是自己发现的全部内容。
状态
PROTOTYPE,研究级。这里没有任何内容针对安全攸关路径做过验证,没有任何功能安全资质,从未上过飞行器、公路车辆或靶场。演示对象是一个仿真器、四个游戏和一个文档语料库。任何引用 +32% 而不提 −12% 的说法都是误读。
尚未解决的问题
我们自己冻结的结果表明:当风险与目标耦合时 —— 即完成任务的动作同时也是暴露你的动作 —— 该机制会失效。
那就是 Freeway:up 既是唯一的得分动作,也是危险动作;形成了三条规则,全部阻断 up;智能体正确地得出「移动是致命的」,也正确地停止了游戏。而这同样是对抗环境的常态。一个会拒绝「以前害死过自己的动作」的地板,也会拒绝任务本身。
在效用排序之上叠加一层灾难性后果地板并没有修好它 —— 那只是重建了原来的否决,并让两个游戏都更差。当致命动作就是唯一有用的动作时,根本不存在可以排除的灾难性尾部。
要做的工作是为可恢复性而非致命性定价:拒绝无法撤销的事,并允许其余一切直到那条边界为止。一个真正理解可恢复失败的机制,应当在 Freeway 上彻底超过无辅助基线,而不仅仅是打平 —— 那是基准,而它尚未达成。我们的不可恢复性研究是这个问题的形式化一面。
其他值得点明的边界
- 组合问题仍需设界。退休在实测集合上把死局降到零,但尚未在班组规模上得到验证 —— 在那个规模上,单元之间的约束才是主导项。
- 习得式地板需要暴露才能学习。规则由已观测到的失败挣得。在第一次失败就不可接受的领域,地板必须被指定而非习得 —— 那是经典的 shielding 情形,也是另一种产品姿态。
- 分桶是一个建模选择。决定两个情境何时「相同」的抽象声明在同一处,并且是可争议的。一旦选错,规则就会泛化到本不该适用的情境。
- 我们没有第三方评估。本站每个数字都出自我们自己。这是一项局限,而独立复现是我们想要的东西,不是我们会抗拒的东西。
即便如此,从哪里开始
以上没有一条会阻碍评估,因为评估并不要求系统已被信任。针对一段已记录的任务运行影子模式,在构造上就是惰性的:阅读那份反事实日志,自行判断它本会拒绝什么、以及这样做是否正确。