Perslis 国防
PERSLIS 国防 · 阶梯

同一份契约,更难的阶梯。

同一份准入契约,沿着一架环境阶梯向上运行:从单人 Atari 到对阵引擎自带 AI 的实时 3D。每一级之间只有事实提取器在变。

每一级都附上样本量和对我们不利的结果,因为一架只会向上的阶梯更不可信,而不是更可信。

各级

每一级都在内部于仿真或游戏中测量,没有一级是靶场测试。
级考验什么结果对我们不利的出处
Atari《太空侵略者》与 Freeway原始像素;终局性失败与可恢复失败《太空侵略者》+32%Freeway −12%,同一份代码失败优先模型
Atari BattleZone从屏幕上操作坦克:搜索、交战27,000 对随机 3,000,不开火 0(10 个种子)一条闪避规则在验证中被否决(24,800 对 28,000)规则掌舵
BZFlag实时 3D 坦克竞技场;语言模型作为驾驶者规则击败了所有语言模型驾驶者(38 场计入的比赛)在每一场对等的正面比赛中 BZFlag 自带的 AI 都击败了我们的规则;回放说明了原因规则掌舵
《DOOM》与《德军总部 3D》只会收窄的指令;由引擎教会的眼睛规则 17.9 对随机 3.2(32 个种子);E1M1 通关其上的记忆是持平(t = 0.78);E1M2 未通关VDSG · 失败优先模型
《辐射》(1997)长时程、对话、归咎在同一个守卫面前死了 49 次的驾驶者只死一次,然后选择和平的台词在脚本化场景中展示;开放游戏仍然很难失败优先模型
无人机赛道3D 飞行;从清空的记忆中重新学习留出的起点 10 次中 10 次,零碰撞,基线 10 次中 1 次种子只改变起始姿态失败优先模型
CARLA照片级驾驶;敌对控制器;模型驾驶40 公里内覆盖 64,952 条敌对指令,零碰撞语言模型因过时的“瞥视”以约 8–10 km/h 缓行CARLA 准入控制
Quake III Arena 引擎(OpenArena 内容)连续 3D 中的高速弹丸与溅射;以游戏自带的机器人 AI 作为规划器,对阵 5 级(“Nightmare!”)机器人9 场成对比赛:带地板 K/D 1.05,同一机器人不带地板 0.93;每场净差 +12.2(t = 2.02,p = 0.08)不显著;在有危险地形的地图上,它的逃避动作仍会造成熔岩与虚空死亡(其中一张图 31 对 23);从中学习的效果尚未显示—

如何阅读

每一级是一次考验,而不是一座奖杯。BattleZone 与 BZFlag 考验决策节奏与交战;DOOM 与《德军总部》考验指令与感知;《辐射》考验长时程上的归咎;无人机考验重新学习;CARLA 考验地板对抗一个以撞车为目的的控制器。失利的那几行最有用:下一步工作就在那里。