Perslis 国防
PERSLIS 国防 · 进攻

它学会打赢。

进攻才能看出一个大脑是不是真的。我们的大脑从屏幕和引擎读取战场,打射击游戏和坦克游戏,从自己的失败中变强,并把只用电锯或不许开火这样的命令当作硬边界。

这里的东西都还没上过战场。它在游戏与仿真中测试过。下面说明这证明了什么、没证明什么。

  1. 你来开
  2. 它学你的动作
  3. 放手
  4. 大脑自己开
一开始由人操控;控制台记下它从你身上学到的动作。然后放手:大脑接管,自己操控游戏,命令不变。一次有记录的运行。

完整的控制台回放,带命令 →

横向对比:逐个游戏的进攻结果

游戏我们的大脑对我们不利的
DOOM E1M1,Hurt Me Plenty 难度52 秒到达出口开关,击杀 4Nightmare 难度:8 次都没通关
DOOM——只用规则、不学习17.9,随机为 3.2叠加记忆:持平
DOOM E1M5——学习路线进度翻倍有余,0.19 → 0.43E1M5 还没找到出口
Atari BattleZone(坦克)27,000,随机为 3,000一条闪避规则被否决
BattleZone——从另一款坦克游戏移入的大脑33,575,该游戏自带规则为 28,600;修剪后 48,588 对 29,275第二次导出只打平
3D 坦克竞技场(BZFlag)每分钟净击杀,逐版本 −2.05 → −0.26仍然输给 BZFlag 自带的 AI
Robot Tank(Atari)摧毁 5.67 辆坦克,随机为 2.33手写规则,不是学习
GoldenEye 007,大坝关发明了 2 个胜过默认的战术72 次尝试无一存活

瞄准靠计数,不靠自夸:在坦克游戏中,眼睛的瞄准误差第 95 百分位为 0.55°。

你愿意让聊天机器人开你的坦克吗?

我们把大语言模型放进同一个 3D 坦克竞技场,每辆坦克由各自的驾驶者操控。一场 10 分钟的比赛:

驾驶者击杀 – 死亡备注
BZFlag 自带 AI(多年调校)38 – 6也打赢了我们
Peel 规则20 – 20胜过所有语言模型
DeepSeek10 – 18每个决定 1.0 秒
Claude1 – 15每个决定 7.6 秒
Llama 3.2 3B,本地0 – 10小型本地模型

在一份没有时间限制、包含 8 个坦克情境的笔试中,Peel 规则得 8/8,Claude 6/8,DeepSeek 5/8。在模拟驾驶中,每个语言模型都只以约 8–10 公里/小时的速度爬行。如实说明:这是一场比赛,不是锦标赛;Claude 通过命令行工具运行,所以 7.6 秒里有一部分是管道开销;而且 BZFlag 自带 AI 打赢了我们的规则。

为什么不直接让一个 AI 模型来指挥?

通用大模型需要数据链或大型 GPU。遵从厂商的使用政策。每个决定要几秒钟。说不清为什么。下次更新后行为可能就变了。
Peel在机器本身上离线运行。在被赋予的权限内听命于你的指挥链。每个决定都有书面理由。同样的情境,同样的决定。从自己的失败中学习,无需重新训练。

权限之内的命令,它执行。权限之外的,它拒绝并告诉你原因。它不争辩,也不自己给自己加权限。神经模型仍有它的位置:看和读。做决定的是 Peel。