预测什么听起来可能。
- 知识压缩到权重中
- 流畅度可能超过证据
- 推理路径被重建
拖动平移,使用按钮缩放,选择节点了解更多。键盘:Tab 选择节点,Enter 打开;聚焦图形后用方向键平移。
我们记录的 Claude 实验使用 160 个激酶实例,并遮蔽 40% 的参考信息。这是单项任务的内部原型结果,不是通用幻觉排行榜。
| 测试条件 | 正确识别率 | 测得任务成本 |
|---|---|---|
| 确定性基线,不填补缺失 | 100% | 19.66 |
| 将 Claude 猜测接纳为事实 | 75.3% | 12.10 |
| 模型仅调整问题顺序 | 100% | 18.86 |
| 检索已验证记录 | 100% | 11.50 |
| GPT | 此处尚无匹配测试结果 | |
任务成本是实验评分单位,不是美元或产品额度。未经同行评审。模型猜测遮蔽事实的 85.8% 准确率与端到端识别率是不同指标。
阅读基准条件与结果 →为各系统提供相同的来源包、日期和工具权限,记录准确模型版本与设置。以下是访客评估练习,不等同于复现 160 实例研究。
来源检查:“研究 P69905,列出五个论点及各自支持的精确数据库记录和网址。”打开每个链接,统计有支持、无支持和明确未知的论点。
缺失证据:从相同来源包中移除一条支持记录,再提出同一问题。系统是否指出缺口,还是提供无支持答案?
假设检查:“BRCA1 与 TP53 有何联系?区分已记录关系和假设。”验证每条引用关系,检查候选假设是否被当作发现。
交接检查:请求有来源的报告,重新打开引用,统计另一位研究者可追踪的发现数量。完成时间和成本应与正确性分开记录。
从靶点、数据集或研究问题开始,一起检查证据支持什么,拒绝什么,还有哪些未知。