我们真正测量到了什么。
四个领域,一套架构,每个数字都由内部产出,并可从一张冻结的实验卡片复现。负面结果列在这里,是因为评审迟早会找到它们 —— 也因为一条只会上升的结果曲线更不可信,而非更可信。
四个领域
| 领域 | 结果 | 解读 |
|---|---|---|
| 驾驶 CARLA,敌对控制器 | 碰撞 = 0 38–40 km/h 下行驶 100–490 m · 保持约 9.7 m 间距 · 记录约 400 次拒绝 | 地板从敌对规划器手中接管车辆并保持间距。关闭地板后,同一个规划器会撞车。 |
| 太空侵略者 原始 210×160 像素,不读模拟器内存 | 200.6 对 152.2 +32% · 第 50 局峰值 276.2 | 当失败是终局性的时,习得式拒绝有帮助。 |
| Freeway 完全相同的机制与代码 | 9.2 对 10.4 −12% · 形成 3 条规则,全部阻断 up | 当唯一的得分动作同时也是危险动作时,它有害。 |
| Doom 基于规则,无机器学习 | 随机 3.2 · 规则 17.9 · 规则+记忆 20.3 配对 t = 0.78 | 规则显著优于随机。其上的记忆层是持平,而非胜出,并如实报告。 |
这一对结果本身就是发现
《太空侵略者》和 Freeway 不是两个实验,而是同一份代码指向两个 ROM —— Freeway 原样导入了前者的失败记忆,没有任何按游戏定制的策略。架构迁移成功,学习没有。
终局性失败
《太空侵略者》中的死亡会抹去全部剩余奖励,其真实代价是期望剩余回报,因此绝对否决碰巧定价正确。当损失确实是全部时,无穷大的惩罚就是对的。
可恢复的失败
Freeway 中的碰撞把小鸡撞回去,游戏继续,代价只是失去的路程。绝对否决对此定价错误,并移除了唯一的得分动作。
没有任何单一的失败定价能在两种情形下都正确 —— 而置信度阈值正是一个单一的失败定价。这是我们手上迁移性最强的结论,而且它反对的是整个行业的默认关卡,不只是我们自己的。
一个我们公布的缺陷
模拟器在长达 127 帧的死亡动画结束时才递减 lives 计数,因此每一次失败都记录自智能体早已被摧毁的帧。在 374 个被归因的帧中,0 个能看到危险源;而在真正的撞击帧上,17 个中有 17 个可以。我们学习的时刻完全错了 —— 却依然给出一条看起来像在学习的曲线。
实验卡片上共记录了五个这类缺陷,每一个在被抓到之前都悄悄返回过可信的结果。我们把它们列出来,是因为信用分配错误正是这类系统中最可能潜藏的失效模式 —— 包括竞争对手的系统。