Perslis 国防
PERSLIS 国防 · 防御

活下来。守住边界。

防御是战斗中没人拍的那一半:不死,不第二次走进同一个杀伤区,永远不做被禁止的事。下面是大脑如何做到这些,以及逐个游戏看它帮了多少。

这里的东西都还没上过战场。它在游戏与仿真中测试过。下面说明这证明了什么、没证明什么。

3D 竞技场里的坦克战:我们的大脑在驾驶、闪避、被卡住时倒出来,眼睛无法确认时不开火。

让它活下来的五样东西

  1. 地板。选择动作之前,它先算出命令允许什么。命令可以收窄这份清单;它学到的任何东西都不能放宽它。在模拟驾驶中,一个故意制造撞车的控制器在 40 公里内发出 64,952 条坏指令:全部被覆盖,0 次碰撞。拿掉地板,同样的指令几秒内就撞车。
  2. 失败记忆。一次倒霉不算教训。某个地方反复让它吃亏,就变成一条规则。一条规则读起来是:在这里 19 次死了 13 次,是基础率的 3.6 倍。
  3. 杀伤区地图。它用眼睛见过的东西画出自己的地图,标出死过的地方,然后绕开。
  4. 脱困规则。被卡在墙边,它转向开阔的一侧,再从另一边倒出来。在 3D 坦克竞技场里,被卡住的时间从 15% 降到 0%。
  5. 不靠猜的眼睛。传感器的断言要拿像素核对,核对不了就说无法确认。在 7,863 帧上通过闸门:召回率 98.4%,误确认 0.48%。

横向对比:它活得更久吗?

游戏有大脑对我们不利的
Fallout(1997)——学习关 vs 开,同一存档每小时死亡 15 次 vs 80 次在一个任务上卡了好几个小时
无人机航线——从没见过的起点10 圈全部无碰,0 次接触;全新大脑:0/10,18 次接触在 2–3 米/秒的追击速度下仍会坠毁
模拟驾驶——敌意控制器64,952 条坏指令全部被覆盖,0 次碰撞这是边界;这里没有学习
3D 坦克竞技场——被卡在墙边15% 的时间 → 0%仍然输给游戏自带的 AI
Quake III 引擎——危险地板 v1在 v2 中修复地板 v1 反而造成岩浆死亡:38 比 19
Freeway(Atari)——与 Space Invaders 同一机制Space Invaders +32%Freeway −12%:当危险和目标在同一条路上,谨慎会丢分

每一行都来自有记录的运行。红色那一列不隐藏:只展示胜利的防御,只是一张推销单。

不知道,它会直说

一个自信的错误答案会害人受伤。所以眼睛选择弃权。这有代价,我们照实展示:在坦克竞技场里,它在近距离放掉了 12 发,因为 12 米以内它不确认目标。修正方案还只是候选,没有完成。

为什么是地板,而不是更大的神经网络

同样的情境进来,同样的决定出去,每一次都一样。这意味着战后复盘时你可以重放任何一个决定,得到同样的答案。它在机器本身上运行,不需要网络,没有链路可干扰,没有服务器可打掉。