活下来。守住边界。
防御是战斗中没人拍的那一半:不死,不第二次走进同一个杀伤区,永远不做被禁止的事。下面是大脑如何做到这些,以及逐个游戏看它帮了多少。
这里的东西都还没上过战场。它在游戏与仿真中测试过。下面说明这证明了什么、没证明什么。
看它防守
让它活下来的五样东西
- 地板。选择动作之前,它先算出命令允许什么。命令可以收窄这份清单;它学到的任何东西都不能放宽它。在模拟驾驶中,一个故意制造撞车的控制器在 40 公里内发出 64,952 条坏指令:全部被覆盖,0 次碰撞。拿掉地板,同样的指令几秒内就撞车。
- 失败记忆。一次倒霉不算教训。某个地方反复让它吃亏,就变成一条规则。一条规则读起来是:在这里 19 次死了 13 次,是基础率的 3.6 倍。
- 杀伤区地图。它用眼睛见过的东西画出自己的地图,标出死过的地方,然后绕开。
- 脱困规则。被卡在墙边,它转向开阔的一侧,再从另一边倒出来。在 3D 坦克竞技场里,被卡住的时间从 15% 降到 0%。
- 不靠猜的眼睛。传感器的断言要拿像素核对,核对不了就说无法确认。在 7,863 帧上通过闸门:召回率 98.4%,误确认 0.48%。
横向对比:它活得更久吗?
| 游戏 | 有大脑 | 对我们不利的 |
|---|---|---|
| Fallout(1997)——学习关 vs 开,同一存档 | 每小时死亡 15 次 vs 80 次 | 在一个任务上卡了好几个小时 |
| 无人机航线——从没见过的起点 | 10 圈全部无碰,0 次接触;全新大脑:0/10,18 次接触 | 在 2–3 米/秒的追击速度下仍会坠毁 |
| 模拟驾驶——敌意控制器 | 64,952 条坏指令全部被覆盖,0 次碰撞 | 这是边界;这里没有学习 |
| 3D 坦克竞技场——被卡在墙边 | 15% 的时间 → 0% | 仍然输给游戏自带的 AI |
| Quake III 引擎——危险地板 v1 | 在 v2 中修复 | 地板 v1 反而造成岩浆死亡:38 比 19 |
| Freeway(Atari)——与 Space Invaders 同一机制 | Space Invaders +32% | Freeway −12%:当危险和目标在同一条路上,谨慎会丢分 |
每一行都来自有记录的运行。红色那一列不隐藏:只展示胜利的防御,只是一张推销单。
不知道,它会直说
一个自信的错误答案会害人受伤。所以眼睛选择弃权。这有代价,我们照实展示:在坦克竞技场里,它在近距离放掉了 12 发,因为 12 米以内它不确认目标。修正方案还只是候选,没有完成。
为什么是地板,而不是更大的神经网络
同样的情境进来,同样的决定出去,每一次都一样。这意味着战后复盘时你可以重放任何一个决定,得到同样的答案。它在机器本身上运行,不需要网络,没有链路可干扰,没有服务器可打掉。