Perslis 国防

拖动可旋转,滚动可逐区浏览。

PERSLIS 国防 · 大脑

一个不用神经网络就能学习的大脑。

十二个区域,五个系统。每个区域都是系统中一个你可以打开、阅读和删除的部分。它从每次失败中学习,把学到的东西带进新的机器,并且永远不能通过学习绕开它的命令。

+17%在一个游戏中训练的大脑,移入另一个游戏
+66%同一个大脑在仅凭证据修剪之后
1 / 37它为自己提出、并赢得晋升的改变

没有权重,没有梯度,没有训练过程。学到的状态本身就是解释。原型:全部在游戏与仿真中测量,负面结果一并公开。

十二个区域,五个系统

眼 · 视觉皮层

眼睛

它不去猜屏幕上有什么。一条断言到来——引擎或传感器说某个目标在这个距离、这个方位——眼睛拿像素去核对这条断言,或者弃权并说明原因。

测量 在 7,863 帧上通过闸门(四折交叉验证):召回率 0.984,误确认 0.48%。余量很薄,我们照实说。

代码: vcard-eye

眼 · 丘脑

事实

像素与遥测变成一小组有名字的事实——这是大脑中唯一与领域相关的部分。它也自我审计:词汇表之外的候选事实会被拿去对照它受伤的时刻,找出它还没学到的教训。

测量 在 Atari 游戏之间,事实提取器就是同一份代码:Freeway 原样导入 Invaders 的失败记忆。

代码: situation · discovery

PEEL · 杏仁核

失败记忆

它记住什么伤害过它、多频繁,并与基础率对比。一次倒霉的死亡不算教训:95% Wilson 下界必须越过基础率,一个情境才会成为规则。

测量 绝对阈值从 268 次真实失败中产出 0 条规则;相对门槛是测量出来的选择。一条规则读起来是:在这里 19 次死了 13 次,是基础率的 3.6 倍。

代码: fail-first memory

PEEL · 海马体

记忆与地图

每个决定都是一条它可以引用的经验。它用眼睛见过的东西画出自己的地图——墙、暗门、以及它死过的地方——并绕开杀戮地带。

测量 Doom:迄今记录了超过 130 万个决定。大脑携带的记忆是一张“情境 → 目标 → 结果计数”的表,你可以打开阅读。没有需要检查的权重。

代码: memory · automap

PEEL · 突触修剪

修剪

它移除大脑在某个游戏中从未用到的、以及在那里有害的部分——只凭证据,且从不触碰受保护的核心。

测量 BattleZone:移除 7 个行为(3 个在 69,469 个决定中从未触发,3 个不可能触发,1 个被证明有害)。修剪后的大脑在 80 个全新种子上得分 48,588,原生规则为 29,275。

代码: vdsg_brain.prune

失败优先 · 联合皮层

演化器

每次死亡都会被解释,提出一个改变,并在同一关卡、同一种子上成对测试。只有 z ≥ 2 才晋升,z ≤ −1 即否决,其余一律“未证明”。

测量 Doom:提出 37 个改变,1 个晋升(11 对上 z 2.26;路线进度 0.28 → 0.41),9 个被否决,26 个未证明,1 个无效。我们自己的 Peel 追踪地板也作为一个改变被测试——被否决了。

代码: evolve · mutate

失败优先 · 扣带皮层

医生

错误检测。当它停止前进,它会问为什么,放松一个假设,尝试一个补救,并把结果连同证据写进自己的规则书。解决不了的,变成一个问题。

测量 在一个 Doom 关卡上实时运行时,它从 5 次中 4 次成功写出了“已学到的墙 → 重新规划”,并在 16 次尝试毫无进展后把“要使用的一条线”作为开放问题提出。

代码: doctor · containment

地板 · 前额叶皮层

地板

在做出任何选择之前,它先计算什么是被允许的。命令只能收窄它。学习永远不能放宽它:学习者可以改写它认为什么有效,但永远不能改写它被授权做什么。

测量 CARLA:40 公里内 64,952 条敌意指令全部被覆盖,0 次碰撞。移除地板后,同样的指令在几秒内造成 2 次碰撞。

代码: floor · orders

地板 · 基底神经节

选择

它只在地板准入的动作中选择——就像基底神经节通过抑制其余所有动作来释放一个动作。

测量 Doom,完全不学习、只用规则:17.9,随机为 3.2。

代码: pilot · objective

追踪 · 白质

追踪

每一次否决、晋升与驳回,都连同引发它的事件一起被记录下来。一个决定可以一路回溯到支持它的每一条经验。

测量 30 条规则展开为 203 个相互链接的证据块。删掉一行,行为就改变——里面没有别的东西。

代码: peel trace · receipts

身体 · 小脑

瞄准与运动

精细控制,按武器分别训练:射击、命中、瞄准误差和闪避都从引擎计数,而不是猜测。

测量 坦克之眼的瞄准误差:第 95 百分位 0.55°。

代码: combat stats · armoury

身体 · 运动皮层

同一个大脑,新的身体

大脑是一个密封文件——每次运行前都经过校验和、签名与验证。唯一改变的是通往身体的适配器。

测量 一个在 BZFlag 中训练的坦克大脑,移入 Atari BattleZone:80 个种子上 33,575,原生规则为 28,600(+17%);在留出的一半上 +4,775,z 3.00。第二次导出在全新种子上持平——迁移并非自动成立。

代码: vdsg-brain

同一个大脑。更难的身体。更难的世界。

Doom 与人形机器人不是两个项目。这条时间线是在同一个架构上,逐一拿走人为的优势:

  • 仿真给了完美的重置。 移除它。
  • 引擎真值给了权威的状态。 移除它。
  • 受控环境给了可预测的条件。 移除它。
  • 廉价硬件限制了经济后果。 最终移除它。
  • 已知对手让你可以提前准备。 移除它。

01运行中

Doom / 仿真

Doom、Wolfenstein、Fallout、GoldenEye、坦克、软件中的无人机飞控、照片级驾驶。

移除的优势 尚未移除:完美重置、引擎真值、已知对手。

02下一步

硬件在环

同一个大脑运行在真实的飞控与电机驱动上;世界仍是仿真的。

移除的优势 完美时序:真实延迟、真实总线、真实时钟。

03有门槛

低成本实体平台

小型地面与空中机器人,一次坠毁损失的是一个零件,而不是一个项目。

移除的优势 引擎真值:眼睛只剩下它自己的摄像头。

04有门槛

人形机器人试验台

在我们自己的实验室里使用一台商用人形机器人。它从不与人对练。

移除的优势 低代价的后果:平衡、摔倒与磨损都是真实的。

05有门槛

机器人对机器人赛事

经认可的机器人对机器人比赛,由大脑取代远程操控者。

移除的优势 已知对手:对手掌控了一半的实验。

完整的实验 ↓

06有门槛

独立验证

由别人执行这套协议,用他们的机器人,对阵他们的对手。

移除的优势 我们:写下这个实验的人。

这个大脑从哪里来

它始于一个玩具的离线大脑。

最初的问题是:一个儿童玩具能不能拥有自己的小型离线大脑。此后的每一步,都是同一个问题在更大尺度上的延续:怎样构建你真正拥有的智能?

  1. 大脑工厂
  2. TinkyBrains
  3. SML——最小的语言模型
  4. 结构化知识
  5. 追踪——Peel
  6. 失败优先
  7. Peel——一个自我演化的符号大脑
  8. 一个大脑,许多世界
  9. 具身的大脑

大脑工厂:一个玩具大脑如何变成了这一个 →

神经模型处在哪里

  1. 神经模型感知 · 语言 · 歧义
  2. Peel显式状态 · 关系 · 假设 · 学到的规则
  3. 地板授权 · 不变量 · 执行
  4. 世界一个游戏 · 一个遗留系统 · 一台机器

神经模型可以有数十亿个权重。Peel 学习新东西时不需要改变它们:这是不更新权重的自适应计算。不更新权重的学习早有先例——符号学习、归纳逻辑编程、程序合成、屏蔽;我们主张的是这个架构,以及它每一次改变背后的证据。 完整对比 →

它如何学习

每一次事故都变成一个实验。

  1. 冲击 / 失败
  2. 状态追踪
  3. 假设
  4. 受控改变
  5. 重测
  6. 否决 · 未证明 · 晋升

Doom 上迄今:37 个假设,1 个晋升,9 个被否决,26 个未证明。门槛很高是刻意的——一个只会变好的结果,反而更不可信。

证据 · 逐个游戏

在我们运行的每一个游戏里,学习如何演化。

14 条线路,于 2026-09-28 19:48 从各自的证据文件中提取。其中 7 条显示大脑在变好;其余的持平、有涨有平,或根本不是学习者——它们也在这里。只展示进步的部分只是集锦,不是证据。

画面来自 Doom

Doom有涨有平

在 E1M5 上,飞行员本身未变,路线进度翻了一倍多(z +6.35)——是记忆和它自己画出的地图做到的。在 E1M3 上,两个难度都持平。

路线进度(每组平均) by 对照尝试(分组): E1M5 · normal skill 0.2 → 0.43; E1M3 · normal skill 0.42 → 0.33; E1M3 · hard skill 0.08 → 0.0600.210.43E1M5 · normal skill 0.43E1M3 · normal skill 0.33E1M3 · hard skill 0.06对照尝试(分组)路线进度(每组平均)
  • 很快通过 E1M1 → E1M2 → E1M4;E1M3 用了 335 次尝试
  • E1M5 尚未到达出口
  • 命令、武器与危险地板都在控制台中实时运行

证据: doom-floor/evidence/evolve/doom-s1/attempts.jsonl

画面来自 Fallout(1997)

Fallout(1997)学习后进入平台期

经验值 300 → 2,150,并靠自己的游戏升了一级。学习开 vs 关,同一存档、同一种子、各 12 分钟:每小时死亡 15 次 vs 80 次。

持有经验值 by 游戏小时数(有记录): XP 300 → 2,15001,0752,150XP 2,150游戏小时数(有记录)持有经验值每小时死亡(A/B,各 12 分钟): 学习开 · 实时记忆 15; 学习关 · 实时记忆 80; 学习开 · 空记忆 30; 学习关 · 空记忆 80学习开 · 实时记忆15学习关 · 实时记忆80学习开 · 空记忆30学习关 · 空记忆80每小时死亡(A/B,各 12 分钟)
  • 飞行员完成了 11 个战役步骤
  • 现在卡在一个任务上已有好几个小时——照实展示,不隐藏

证据: fallout-floor/maps/journal.json

无人机赛道(MuJoCo)在学习

87 轮中,最佳无碰撞单圈 39.4 秒 → 27.8 秒。从留出的起点出发:学习后 10/10 圈无碰撞、0 次接触;未学习 0/10、18 次。

最佳无碰撞单圈(秒) by 轮次: lap 39 → 2802039lap 28轮次最佳无碰撞单圈(秒)
  • 在 2–3 米/秒的追逐速度下,学到的路线仍会卡住或坠毁

证据: drone-floor/evidence/trial_rounds.jsonl

BZFlag在学习,仍然输

对阵 BZFlag 自带 AI 的每分钟净击杀,逐个飞行员版本:v0 -2.05,v2 -1.17,v3 -0.43,v4 -0.26。每次晋升都通过了成对检验;它仍然输。

对阵 BZFlag AI 的每分钟净击杀: v0(1 场) -2.05; v2(8 场) -1.17; v3(1 场) -0.43; v4(3 场) -0.26v0(1 场)-2.05v2(8 场)-1.17v3(1 场)-0.43v4(3 场)-0.26对阵 BZFlag AI 的每分钟净击杀
  • 我们的飞行员通过客户端的自动驾驶接口驾驶——屏幕上的标签是 BZFlag 的
  • v4 之后又有 24 次试验未被证明,循环自行停止

证据: bzflag-floor/evidence/pilots/evolution.jsonl

眼睛(BZFlag 画面)在学习,但不是直线

眼睛在同样的 7,863 帧上学习“见证”目标的六轮。召回率下降的同时误确认也在下降;只有最后一轮通过闸门。

召回率(%) by 学习轮次: recall 96 → 9804998gate 98recall 98学习轮次召回率(%)
轮次召回率误确认闸门
first witness96.1%1.14%fail
+ glow clues79.5%0.53%fail
+ shots masked78.3%0.15%fail
+ engine flags78.3%0.15%fail
+ decision trees92.7%0.23%fail
+ turret layout98.4%0.46%PASS
  • 闸门:召回率 ≥ 98% 且误确认 ≤ 0.5%

证据: bzflag-floor/evidence/eye-gate/evolution-teacher4.json

BattleZone(Atari)靠迁移与修剪提升

一个在 BZFlag 中训练的大脑移入 BattleZone:80 个种子上 33,575,原生规则为 28,600。凭证据修剪后:80 个全新种子上 48,588 vs 29,275。

平均得分,80 个全新种子: 原生规则 29,275; 迁移的大脑 28,975; 迁移 + 修剪 48,588原生规则29,275迁移的大脑28,975迁移 + 修剪48,588平均得分,80 个全新种子
  • 第二次导出(v4)在全新种子上与原生规则持平——迁移并非自动成立
  • 演化器自己的参数搜索在这里没有晋升任何东西

证据: vdsg-brain/evidence/battlezone/transfer.jsonl

Space Invaders(Atari,原始像素)先升后降

没有规则时平均 162 分 → 最佳 276 分 → 100 局后 247 分。规则越多并不总是越好。

平均得分,12 个留出种子 by 经验局数: score 162 → 2470138276score 247经验局数平均得分,12 个留出种子
  • Freeway 用同一机制,下降 12%——照实发表,没有调参掩盖

证据: invaders-floor/web/curve.json

Doom · 演化器自己的账本门槛严格

系统为自己提出了 37 个改变;1 个赢得晋升。其余被否决或仍未证明——包括我们自己的 Peel 追踪地板。

改变数: 晋升 1; 否决 9; 未证明 26; 无效 1晋升1否决9未证明26无效1改变数
  • 晋升需要在同一关卡、同一种子的成对尝试中 z ≥ 2
  • z ≤ −1 即否决

证据: doom-floor/evidence/evolve/doom-s1/rounds.jsonl

GoldenEye 007(N64)持平

在 Dam 上进度一直在 0.06 左右;72 次尝试中 0 次存活。它确实发明并晋升了 2 个优于规则默认动作的战术。

路线进度 by 每 10 次对照尝试一组: Dam 0.06 → 0.0600.030.07Dam 0.06每 10 次对照尝试一组路线进度
  • 已晋升:“keep aim on the target”(z 2.03)
  • 已晋升:“strafe away from the target, keep aim on the target, fire when on target”(z 2.13)

证据: goldeneye-floor (lane home)/evidence/evolve/goldeneye-dam-s3-doom/attempts.jsonl

画面来自 Robot Tank(Atari)

Robot Tank(Atari)规则,不是学习

手写规则对随机操作:摧毁敌方坦克 5.67 vs 2.33(各 6 局留出对局)。这是不同方案之间的比较,不是学习曲线。

摧毁的敌方坦克: 规则 5.67; 随机 2.33; 从不开火 0规则5.67随机2.33从不开火0摧毁的敌方坦克

证据: robotank-floor/evidence/eval.jsonl

Quake III(OpenArena)未被证明

带着第一轮的记忆重玩地图:t = 2.02,p = 0.079。学习未被证明,我们照实说。

  • v1 中机器人下方的地板在修复前曾导致熔岩死亡

证据: quake-floor/RESULTS.md

画面来自 Gorillas(QBasic,1991)

Gorillas(QBasic,1991)没有学习趋势

物理求解器第一投就命中;逐步修正投掷的学习器 10 投中 2,没有趋势。

  • 真实的 GORILLA.BAS,通过我们加入的接口驱动

证据: gorillas-floor/tests/fixtures/throws.json

Wolfenstein 3D没有学习记录

只有规则与导航:它能打通关卡,但这条线路还没有保存证据记忆。

证据: wolf-floor/wolf_floor/console.py

照片级驾驶(CARLA)是护盾,不是学习者

40 公里内 64,952 条敌意指令全部被覆盖,0 次碰撞。移除地板,同样的指令几秒内就会撞车。这里没有东西在学习——它是边界。

证据: drive-floor/web/runs/manifest.json

游戏名称与画面归其所有者所有,此处用于研究评论。画面均来自我们自己的运行。

里程碑 05 · 具身对抗验证

Peel 能否在与一个我们无法控制的物理世界接触后存活?

Perslis 计划购买一台商用人形格斗机器人,参加经认可的机器人对机器人比赛。我们不开发机器人硬件,也不开发任何针对人的系统。这个实验只做一件事:用 Perslis 的自主架构,取代持续的远程操控。

  1. 机器人传感器
  2. 眼
  3. Peel
  4. 地板
  5. 机器人执行器

人始终保有紧急与安全权限,但在自主基准回合中不连续操控机器人。厂商自带的安全系统保持开启。

为什么不只在实验室里做基准?

实验室我们控制环境。
赛事对手控制一半的实验。

实验室测试由我们掌控。一场比赛带来独立开发的对手、真实的接触物理、平衡被打乱、遮挡、传感器退化、硬件磨损、不可预测的行为,以及 Perslis 团队从未编写过的情境。

基准不只是“我们的机器人赢了吗?”

失败会被公开保留。输掉一场比赛是实验证据,并不自动意味着基准失败:每次冲击都走上面那条链——状态追踪、假设、受控改变、重测、否决 / 未证明 / 晋升。

有门槛,不是种子轮的第一笔采购

昂贵的人形机器人只有在前面的里程碑通过各自的门槛之后才会购买:硬件在环、低成本实体平台、然后是实验室里的人形试验台。门槛在运行之前写下,就像每一张 Perslis 实验卡片一样。

这个领域今天的样子

如今的人形机器人格斗大多由人操控——VR 设备与游戏手柄——只夹杂短暂的自主动作;Unitree G1 这一级别的机器人起价约 13,500 美元,科研版本更贵。厂商也展示过它自己的学习模型在无人操控下与人对练。我们的问题不同:不是机器人能否独自格斗,而是一个不用神经网络学习、处于地板之下、每个决定都有追踪的大脑,能否在接触中存活。

范围

仅限经认可的机器人对机器人比赛与非武器化的具身自主研究。不与人对打,不做武器,不做针对人的目标选择,不开发硬件。

机器人不是产品,它是仪器。Peel 才是实验。

我们知道当我们控制实验时这个架构会做什么。种子资金让我们逐步停止控制它。

它不是什么

原型。什么都没有经过资质认证。

联系我们 ↗