预注册
问题、门槛与评分在结果已知之前就提交进版本控制。看到一个数字后,不许把门槛从 14% 挪到 15%。
Peel 不假设每个问题都需要模型。于是我们诚实地做实验:构造越来越难的任务,每次失败后强化确定性对手,冻结每一个结果,只有当预注册的测试判定它带来可测量的价值时,才接纳机器学习。以下就是所发生的。
五次确定性获胜,然后一个狭窄的开口 — 而即便在那里,一个真实的学习器也无法占据它。整条剧情线,一行看完。
一个预注册的刻画计划,而非排行榜。下方每个论断都可追溯到一个冻结的结果与一枚密码学摘要。
问题、门槛与评分在结果已知之前就提交进版本控制。看到一个数字后,不许把门槛从 14% 挪到 15%。
只要存在一个便宜的确定性方案,它就成为新的对手。我们甚至递给模型一个先知(oracle) — 它自己的完美版本 — 作为不可能被超越的上界。
我们自己的两处评分错误、一次崩溃、以及被否决的假设,都留在记录里。当一个诱人的 ML 结果出现时,我们追问它为何存在 — 两次都是我们自己的测量错误。
模型可以提议或制定策略。而何为真 — 已核验的状态、身份、溯源 — 保持确定性。一个进入真值路径的模型,会以它自身的错误率败坏系统。
没有哪个系统得到我们的忠诚。得到忠诚的是实验。
在任何模型之前,我们用九次对抗性、冷抽取的生物学运行刻画了确定性底座 — 正是它让底座成为一个强对手(它坏过两次;我们冻结了残骸并做通用修复)。
每一行都是一个我们以为可能需要模型的边界。每一次,我们只问一个问题:确定性机器已经能做到吗?每一次它都能 — 于是 ML 被拒绝。
| 受测边界 | ML 或许能帮上忙的地方 | 确定性机器能做到吗? | ML |
|---|---|---|---|
| 运算选择 | 也许"选哪个查询"很难 | 能 — 每个便宜的运算都有产出;全跑一遍即可 | 拒绝 |
| 搜索深度 / 新颖度 | 搜索空间组合式爆炸 | 能 — 证据是均匀的;没有可供 ML 学习的选择性信号 | 拒绝 |
| 目标相关 | 目标让某些分支更重要 | 能 — 一个便宜的确定性过滤器就抓住了相关分支 | 拒绝 |
| 组合 | 相关性需要多步、合取式推理 | 能 — ML 相对规则没有可复现的优势 | 拒绝 |
| 关系结构 | 便宜的类别特征在此终于失效 | 能 — 一个便宜的图关系规则仍然路由得更好 | 拒绝 |
五次机会。五次拒绝。我们并非在证明确定性系统普遍更优 — 我们是在反复尝试证伪那个立场,却失败了。
至此每一次拒绝都有一个共同点:确定性模型能表示一切要紧的东西。于是我们刻意离开那个区域 — 一个部分可观测、含隐藏依赖结构、且错误昂贵的任务,其中存在一种独立性假设模型无法表达的相关性。
每个格子:当隐藏结构(ρ,向下)与答错的代价(λ,向右)升高时,一个理想模型相对确定性规划器能削减多少运营成本。绿色越过预注册的 15% 门槛。
席位只出现在唯一一个角落:当隐藏结构强(ρ=0.8)且错误昂贵(λ≥50)时,理想模型的优势越过门槛 — 16.8%,继而 19.8%。其它任何地方都不值那份推理。而预注册守住了:λ=25 落在 14.3%,低于我们事先固定的门槛。
ML 并没有变得普遍有用。席位只在相关结构是隐藏的、且答错变得昂贵时才出现。
那 16.8% 属于一个完美模型。于是我们用历史事件训练了一个诚实的模型 — 没有 oracle、没有泄漏 — 并问它是否真能占据那个席位。它不能。
在席位存在的那个角落里,我们把学习器的训练数据增大 16 倍。它回收了更多理想模型的优势 — 然后停滞。
随数据增长,它把理想优势的捕获比例从 1.8% → 25.7% → 42.8% → 47.8% — 但从 12,000 增到 24,000 个事件,几乎没有带来额外的运营优势,而且始终未越过门槛。
理想模型越过了门槛,学习器的准确率也向它靠拢。结构是真实的。
在数据仍有余量时曲线就趋平了 — 更多事件的边际价值坍缩到接近零。
一个通用学习器只回收了一半结构就停住。悬而未决的问题是模型类别 — 一个其形状与隐藏结构相匹配的学习器。那是下一个实验。
不是口号 — 而是这些实验测量出来、而非假设出来的分工。
掌管
须挣得
裁定
在需要推理之处使用推理。不要把推理花在计算机能确定性建立的事实上。
Peel 不问 AI 能否完成一项任务。它问推理是否带来足够价值,以至于它究竟该不该被允许去做这件事。
诚实的边界:结论在这些预注册的任务与协议下成立;那唯一的理论席位目前尚未被一个现实的学习器挣得。对一个实验室而言,这正是要点 — 正确性来自已核验的数据与确定性推理,在你自己的硬件上、以零模型成本;模型只在实验证明它挣得房间的地方,才被请进来。