同一份契约,更难的阶梯。
同一份准入契约,沿着一架环境阶梯向上运行:从单人 Atari 到对阵引擎自带 AI 的实时 3D。每一级之间只有事实提取器在变。
每一级都附上样本量和对我们不利的结果,因为一架只会向上的阶梯更不可信,而不是更可信。
各级
| 级 | 考验什么 | 结果 | 对我们不利的 | 出处 |
|---|---|---|---|---|
| Atari《太空侵略者》与 Freeway | 原始像素;终局性失败与可恢复失败 | 《太空侵略者》+32% | Freeway −12%,同一份代码 | 失败优先模型 |
| Atari BattleZone | 从屏幕上操作坦克:搜索、交战 | 27,000 对随机 3,000,不开火 0(10 个种子) | 一条闪避规则在验证中被否决(24,800 对 28,000) | 规则掌舵 |
| BZFlag | 实时 3D 坦克竞技场;语言模型作为驾驶者 | 规则击败了所有语言模型驾驶者(38 场计入的比赛) | 在每一场对等的正面比赛中 BZFlag 自带的 AI 都击败了我们的规则;回放说明了原因 | 规则掌舵 |
| 《DOOM》与《德军总部 3D》 | 只会收窄的指令;由引擎教会的眼睛 | 规则 17.9 对随机 3.2(32 个种子);E1M1 通关 | 其上的记忆是持平(t = 0.78);E1M2 未通关 | VDSG · 失败优先模型 |
| 《辐射》(1997) | 长时程、对话、归咎 | 在同一个守卫面前死了 49 次的驾驶者只死一次,然后选择和平的台词 | 在脚本化场景中展示;开放游戏仍然很难 | 失败优先模型 |
| 无人机赛道 | 3D 飞行;从清空的记忆中重新学习 | 留出的起点 10 次中 10 次,零碰撞,基线 10 次中 1 次 | 种子只改变起始姿态 | 失败优先模型 |
| CARLA | 照片级驾驶;敌对控制器;模型驾驶 | 40 公里内覆盖 64,952 条敌对指令,零碰撞 | 语言模型因过时的“瞥视”以约 8–10 km/h 缓行 | CARLA 准入控制 |
| Quake III Arena 引擎 | 连续 3D 中的高速弹丸与溅射;以游戏自带的机器人 AI 作为规划器,对阵 5 级(“Nightmare!”)机器人 | 进行中 | — | — |
如何阅读
每一级是一次考验,而不是一座奖杯。BattleZone 与 BZFlag 考验决策节奏与交战;DOOM 与《德军总部》考验指令与感知;《辐射》考验长时程上的归咎;无人机考验重新学习;CARLA 考验地板对抗一个以撞车为目的的控制器。失利的那几行最有用:下一步工作就在那里。