PERSLIS SCIENCE / 认识模型

认识一个
拒绝编造科学的模型。

Peel 是失败优先的无权重模型。它从来源构建可检查记录,测试记录支持什么,无法证明时就回答未知。

◈ 有据可查⌁ 未知保持未知
PEEL / FAIL-FIRST

对模型问题的不同答案。

生成式模型

预测什么听起来可能。

  • 知识压缩到权重中
  • 流畅度可能超过证据
  • 推理路径被重建
VS
PEEL

证明记录所支持的内容。

  • 知识保留在类型化记录中
  • 每个事实保留来源
  • 未知始终可见
160个高难度激酶基准实例100% → 75.3%当模型猜测被允许成为真理时的正确识别率原型 DGM-005C-HARD 结果;未经同行评议。
亲自探索

追踪知识如何形成。

拖动平移,使用按钮缩放,选择节点了解更多。键盘:Tab 选择节点,Enter 打开;聚焦图形后用方向键平移。

100%观看相关演示 ↗
科学你与证据之间没有权重失败变成边界未知也是有用的结果模型提议,平台决定。
实测结果

比较证据策略,再亲自测试。

我们记录的 Claude 实验使用 160 个激酶实例,并遮蔽 40% 的参考信息。这是单项任务的内部原型结果,不是通用幻觉排行榜。

测试条件正确识别率测得任务成本
确定性基线,不填补缺失100%19.66
将 Claude 猜测接纳为事实75.3%12.10
模型仅调整问题顺序100%18.86
检索已验证记录100%11.50
GPT此处尚无匹配测试结果

任务成本是实验评分单位,不是美元或产品额度。未经同行评审。模型猜测遮蔽事实的 85.8% 准确率与端到端识别率是不同指标。

阅读基准条件与结果 →
运行自己的比较

向 Peel、GPT 和 Claude 提出相同问题。

为各系统提供相同的来源包、日期和工具权限,记录准确模型版本与设置。以下是访客评估练习,不等同于复现 160 实例研究。

  1. 来源检查:“研究 P69905,列出五个论点及各自支持的精确数据库记录和网址。”打开每个链接,统计有支持、无支持和明确未知的论点。

  2. 缺失证据:从相同来源包中移除一条支持记录,再提出同一问题。系统是否指出缺口,还是提供无支持答案?

  3. 假设检查:“BRCA1 与 TP53 有何联系?区分已记录关系和假设。”验证每条引用关系,检查候选假设是否被当作发现。

  4. 交接检查:请求有来源的报告,重新打开引用,统计另一位研究者可追踪的发现数量。完成时间和成本应与正确性分开记录。

在研究平台尝试评估 →
探索细节

每一步,都有依据。

01

你与证据之间没有权重

事实以带标识符和来源的类型化记录存在,而不是从隐藏的统计记忆中找回的答案。

进一步了解
02

失败变成边界

失败路径会被保留,并可变成更狭的规则。学习不能悄悄扩大系统可声称或执行的范围。

进一步了解
03

未知也是有用的结果

缺失证据始终可见,把不确定性变成下一个实验,而不是润色过的猜测。

进一步了解
04

模型提议,平台决定。

语言模型可以排序、规划或表述答案,但不能接纳科学事实;证据的成立属于符号平台。

进一步了解
观看演示

了解失败为何让模型更安全。

失败优先学习模型的简短说明。

研究原型录制画面。展示范围以录制内容为准。

亲自探索研究平台 →
PERSLIS / SCIENCE录制演示
失败优先学习模型的简短说明。
一条连贯的线索

从问题,到可检查的记录。

01提问
02检索
03钉定
04验证
05保留
了解工作原理 →
向 LOIS 提出真实问题

让下一次发现从这里开始。

从靶点、数据集或研究问题开始,一起检查证据支持什么,拒绝什么,还有哪些未知。

启动研究试点 →

Perslis 全站