一个合理的质疑:你是不是先看了已知答案,再把分界线调到能对上答案的位置?这一页专门解释一个具体的、结构性的理由,说明为什么这种可能性不大——以及这跟 AI 癌症预测模型的工作方式有本质区别。
这是所有定量科学共有的问题,不是AI特有的:如果一个分类阈值是看着哪些样本是癌症、哪些不是之后才调整出来的,它在同一批数据上分得很好是意料之中的事——这本身不能证明这条规则真的抓住了什么。这也是为什么"没有例外"这句话的可信度,很大程度上取决于它是怎么得出来的,而不只是这句话本身。
有监督的 AI 癌症分类模型是按任务分别训练的:它需要针对特定物种、特定癌种、往往还要特定取材部位的标注样本,换一个新类别,通常需要重新训练或微调才能生效。这种依赖性是这类模型的构建方式决定的——它拟合的是某一个已标注类别的统计规律,一次只能拟合一个。
一把为某一把锁量身定做的钥匙,通常打不开其他锁。一把不需要重新打磨、就能打开很多把互不相关的锁的钥匙,更可能是抓住了这些锁背后某种共通的构造原理,而不是巧合。
如果 Tail Runaway 的分界线真的是照着某一批数据的标签调出来的,没有理由这同一条、完全没做任何调整的规则,还能在一个完全不同的物种、完全不同的组织采集流程里,同样把癌症和非癌症分开,而且不需要针对物种或癌种做任何专属调整。同一条固定规则能在人、大鼠、狗的数据里都成立,也能在33个各自独立采集的 TCGA 癌种里都成立——这本身就是"这条规则不太可能是迎合某一批数据凑出来的"的证据。