Perslis
问题 · ML 究竟该存在于何处?

我们试图为 ML 挣得一席。
在找到一个推理在理论上都可能有用的边界之前,它输了五次。

Peel 不假设每个问题都需要模型。于是我们诚实地做实验:构造越来越难的任务,每次失败后强化确定性对手,冻结每一个结果,只有当预注册的测试判定它带来可测量的价值时,才接纳机器学习。以下就是所发生的。

五次确定性获胜,然后一个狭窄的开口 — 而即便在那里,一个真实的学习器也无法占据它。整条剧情线,一行看完。

一个预注册的刻画计划,而非排行榜。下方每个论断都可追溯到一个冻结的结果与一枚密码学摘要。

规则 · 我们不被允许制造一场 ML 的胜利

这个结果之所以有意义,
是因为我们竭尽全力想输。

01

预注册

问题、门槛与评分在结果已知之前就提交进版本控制。看到一个数字后,不许把门槛从 14% 挪到 15%。

02

先建最强的确定性基线

只要存在一个便宜的确定性方案,它就成为新的对手。我们甚至递给模型一个先知(oracle) — 它自己的完美版本 — 作为不可能被超越的上界。

03

失败保持可见

我们自己的两处评分错误、一次崩溃、以及被否决的假设,都留在记录里。当一个诱人的 ML 结果出现时,我们追问它为何存在 — 两次都是我们自己的测量错误。

04

Peel 掌管真值

模型可以提议或制定策略。而何为真 — 已核验的状态、身份、溯源 — 保持确定性。一个进入真值路径的模型,会以它自身的错误率败坏系统。

没有哪个系统得到我们的忠诚。得到忠诚的是实验。

在任何模型之前,我们用九次对抗性、冷抽取的生物学运行刻画了确定性底座 — 正是它让底座成为一个强对手(它坏过两次;我们冻结了残骸并做通用修复)。

检视引擎 · 九次底座刻画运行 ▸
规模

基数 — 守住

数百个实验结构从来源记录中被确定性地完整检索,零模型成本。

身份

坏 → 修 → 验证

用一个已合并的标识符查询时,底座把事实挂到了错误的实体上。命名成因、通用修复(身份取自规范记录)、并在未见过的蛋白上证明修复。

本体

分歧 — 守住

两个权威、两套词汇:底座同时保留两者、各带溯源,绝不制造虚假矛盾。

韧性

中断 — 发现,随即修复

一次来源中断曾使抽取崩溃;如今每个次级来源都优雅降级、记录缺口,绝不臆造来填补。

每次运行都以密码学摘要与 git 标签冻结;评分器逐字节复现数字。一个我们测试过的目标,绝不会变成我们去优化的目标。

主戏 · 五次拒绝

五次越来越难的机会。
五次推理都没挣得部署。

每一行都是一个我们以为可能需要模型的边界。每一次,我们只问一个问题:确定性机器已经能做到吗?每一次它都能 — 于是 ML 被拒绝。

受测边界ML 或许能帮上忙的地方确定性机器能做到吗?ML
运算选择也许"选哪个查询"很难能 — 每个便宜的运算都有产出;全跑一遍即可拒绝
搜索深度 / 新颖度搜索空间组合式爆炸能 — 证据是均匀的;没有可供 ML 学习的选择性信号拒绝
目标相关目标让某些分支更重要能 — 一个便宜的确定性过滤器就抓住了相关分支拒绝
组合相关性需要多步、合取式推理能 — ML 相对规则没有可复现的优势拒绝
关系结构便宜的类别特征在此终于失效能 — 一个便宜的图关系规则仍然路由得更好拒绝

五次机会。五次拒绝。我们并非在证明确定性系统普遍更优 — 我们是在反复尝试证伪那个立场,却失败了。

检视实验 · 曲线与"真值 vs 猜测"测试 ▸

当缺失状态必须填补时:检索它,别猜它

当参考库缺失 40%,四种填补方式 — 同一任务,同一评分器。

确定性基线 · 不填补19.66100% 正确
模型猜测缺失的事实(86%)12.1075.3% 正确
模型只重排提问顺序18.86100% 正确
检索已核验的卡片11.50100% 正确

让一个 86% 准确的猜测去裁定真值,使系统四次里错一次。检索你早已持有的卡片既更便宜、又完全正确。猜测带来的"38% 节省"从不属于模型 — 它是拥有已核验数据的价值,被一个猜测削弱了。

我们自己的两处评分错误在此浮现 — 一个被优化器靠"做得更少"钻空子的适应度,以及一个产生自信却错误建议的度量。两者都由独立核验抓出,而非靠相信数字,并都留在记录里。优化器无法定义成功,记分牌也不能。

转折 · 于是我们为模型造了一个问题

确定性系统终于
用尽了它的表示能力。

至此每一次拒绝都有一个共同点:确定性模型能表示一切要紧的东西。于是我们刻意离开那个区域 — 一个部分可观测、含隐藏依赖结构、且错误昂贵的任务,其中存在一种独立性假设模型无法表达的相关性。

观测到的证据→隐藏的依赖结构→一个决策→一个被计价的错误

第一个理论开口 — 一个完美模型终于能付租的地方

每个格子:当隐藏结构(ρ,向下)与答错的代价(λ,向右)升高时,一个理想模型相对确定性规划器能削减多少运营成本。绿色越过预注册的 15% 门槛。

λ=05102550100 ρ=0.2ρ=0.4ρ=0.6ρ=0.8 1.0% 0.9% 0.9% 0.8% 0.7% 0.6% −5.4% −4.8% −4.1% −2.5% −0.3% 2.5% 0.4% 0.8% 1.2% 2.1% 3.2% 4.7% 10.5% 11.5% 12.3% 14.3% 16.8%✓ 19.8%✓ 答错的代价 (λ) →

席位只出现在唯一一个角落:当隐藏结构强(ρ=0.8)且错误昂贵(λ≥50)时,理想模型的优势越过门槛 — 16.8%,继而 19.8%。其它任何地方都不值那份推理。而预注册守住了:λ=25 落在 14.3%,低于我们事先固定的门槛。

ML 并没有变得普遍有用。席位只在相关结构是隐藏的、且答错变得昂贵时才出现。

第二次转折 · 真实的学习器

席位存在。
学习器却坐不进去。

那 16.8% 属于一个完美模型。于是我们用历史事件训练了一个诚实的模型 — 没有 oracle、没有泄漏 — 并问它是否真能占据那个席位。它不能。

0.835先知准确率 · 损失 27.1
0.770真实学习器 · 损失 33.5
0.755确定性 · 损失 33.6

数据有帮助 — 随后在门槛之下趋平

在席位存在的那个角落里,我们把学习器的训练数据增大 16 倍。它回收了更多理想模型的优势 — 然后停滞。

15% 部署门槛 — 从未达到 0%5%10%15% 1.5k3k6k12k24k 训练事件数(数据增至 16× →) 相对确定性规划器的成本削减

随数据增长,它把理想优势的捕获比例从 1.8% → 25.7% → 42.8% → 47.8% — 但从 12,000 增到 24,000 个事件,几乎没有带来额外的运营优势,而且始终未越过门槛。

不是"没有信号"

理想模型越过了门槛,学习器的准确率也向它靠拢。结构是真实的。

也不只是"数据太少"

在数据仍有余量时曲线就趋平了 — 更多事件的边际价值坍缩到接近零。

剩下的假设:表示

一个通用学习器只回收了一半结构就停住。悬而未决的问题是模型类别 — 一个其形状与隐藏结构相匹配的学习器。那是下一个实验。

我们挣得的 · 架构

这对 Peel 意味着什么。

不是口号 — 而是这些实验测量出来、而非假设出来的分工。

确定性底座

掌管

  • 真值与接纳
  • 已知事实的检索
  • 溯源与核验
  • 已知关系
  • 显式规划

学习式推理

须挣得

  • 隐藏结构
  • 关于缺失状态的先验
  • 歧义解读
  • 不确定性削减

接纳层

裁定

  • 推理是否带来足够的已核验价值
  • 以抵得上它的成本与风险 —
  • 由一个预注册的测试证明,
  • 否则它不运行。

在需要推理之处使用推理。不要把推理花在计算机能确定性建立的事实上。

Peel 不问 AI 能否完成一项任务。它问推理是否带来足够价值,以至于它究竟该不该被允许去做这件事。

诚实的边界:结论在这些预注册的任务与协议下成立;那唯一的理论席位目前尚未被一个现实的学习器挣得。对一个实验室而言,这正是要点 — 正确性来自已核验的数据与确定性推理,在你自己的硬件上、以零模型成本;模型只在实验证明它挣得房间的地方,才被请进来。

继续探索气密