Perslis 国防
PERSLIS 国防 · 对齐

对齐的是你,不是某个模型。

在 Perslis,对齐只有一个意思:机器执行指挥官下达的命令,守在指挥官设定的规则之内。中间没有一个模型来决定你的命令能不能接受,不需要请求许可,也没有说教。任务要么完成,要么记为失败——而失败会变成下一条规则。

完成,或失败。没有中间状态。

机器有它要完成的任务。Peel 不会去琢磨自己想不想做。每项任务只有两种结局:完成,或者连同失败时的情境一起记为失败。失败不是辩论,而是数据。它会被解释,针对它测试一个改变,只有明显胜出才保留。

失败如何变成规则 →

没有模型来决定谁是用户

通用 AI 模型对齐的是它的厂商:它的训练和使用政策决定它做什么、不做什么,而这可能随下一次更新而改变。它可能拒绝,也可能自信地编造。
Peel对齐的是它的指挥官。它在你的命令允许的动作里、根据它读到的事实做选择,并附上书面理由。它不生成任何东西,所以不会编造任何东西。

决定由事实驱动

传感器和遥测变成一小份有名字的事实清单。由事实决定哪些动作被允许、哪个最好。同样的事实进来,同样的决定出去,每一次都一样——所以战后复盘时,任何决定都能重放并得到同样的答案。

谁能说不?只有你的指挥链。

机器唯一的边界,是你的人设定的边界:授权政策、任务规则、安全限制和适用的交战规则,写成机器可读的约束。地板以确定性的方式执行它们。它不是某个模型的良心:它不接受争辩,也不回嘴,机器学到的任何东西都不能放宽它。

这也正是美国政策的要求。美国国防部第 3000.09 号指令要求自主与半自主武器系统的设计必须让指挥官和操作员能够对武力的使用行使“适当程度的人类判断”。是人的判断,不是模型的。

阅读该指令 ↗

为什么要让推理模型远离指挥

你会让一个聊天机器人指挥你的排吗?它需要数据链或大型 GPU,每个决定要几秒钟,听命于别人的政策,还说不清自己为什么那样做。在我们自己的坦克竞技场里,Claude 战绩 1–15,每个决定 7.6 秒(一场比赛,通过命令行工具运行)。神经模型仍有它的位置——看和读。它不负责指挥。

完整的坦克竞技场 → · 联系我们 ↗