结构去重后,不同化合物仍可能产生相同指纹

瓦伦西亚理工大学(Universitat Politècnica de València)Pablo Ferri 与 Juan M. García-Gómez 在 Journal of Chemical Information and Modeling 报道血脑屏障通透性预测中的数据偏倚。研究关注:测试分子与训练分子过于相近时,较高的预测成绩有多少来自这些相似性。

团队合并 MoleculeNet、B3DB、DeePred-BBB、QSAR-BBB 和 NeuTox2 的 27,369 条记录。用 RDKit 处理盐与溶剂片段、电荷和互变异构形式,再按规范化结构去重并删除同一结构的冲突标签,得到 7,845 个化合物。

结构去重仍不能消除所有模型输入的重复。不同规范化结构可能产生完全相同的 ECFP 指纹,称为精确特征碰撞;也可能产生高度相近的指纹,称为近似特征碰撞。研究关注这些相近分子在数据中过度集中所造成的预测偏倚。

从训练集的邻近距离自动确定近似碰撞阈值

研究以 ECFP 指纹的 Jaccard 距离衡量分子特征差异,距离为 0 表示精确碰撞。对于距离较小但不为 0 的化合物,团队没有直接采用固定阈值,而是分析每个化合物与最近邻居的距离分布。

去除精确碰撞后,算法拟合 4 种候选的 beta 分布或混合分布,用带约束的期望最大化算法估计参数,再依据贝叶斯信息准则选择分布。若分布包含近似碰撞成分,便由该成分与普通邻近分布的交点确定阈值。

阈值估计与参数调节只使用训练数据,测试数据在这一阶段留出。30 个随机种子得到的阈值平均为 0.054、标准差为 0.003;这是当前数据与指纹下的结果,换用其他特征或数据集时需要重新估计。

3 种测试集数量与类别比例一致,分子组成不同

团队先按 75%/25% 分层划分训练与测试数据,再形成随机、去精确碰撞、去精确及近似碰撞(ExApr)3 套数据。精确碰撞处理中,同标签化合物只保留第 1 个,标签冲突的化合物删除;测试集还删除与训练集精确碰撞的化合物。

近似碰撞的处理有所不同:同标签的相近化合物只保留第 1 个,标签不同的相近化合物保留,因为这些通透性差异可能提供有效信息。训练与测试之间的近似碰撞也依照标签是否一致处理。

为减少测试规模和类别比例的影响,随机与去精确碰撞测试集按 ExApr 测试集的数量和类别频率重新分层抽样。3 个测试集的组成不同,研究比较的是相同规模、相同类别比例下,不同相似性处理对成绩的影响。

预测模型包括随机森林、梯度提升、前馈神经网络、稀疏编码器、图卷积网络和 ChemBERTa,分别使用分子描述符、指纹、图或 SMILES 输入。超参数通过训练集内的 4 折交叉验证优化;描述符标准化也在划分后完成,避免测试信息进入训练处理。

随机测试集的 AUC 与宏 F1 平均相对增幅超过 10%

论文报告,随机测试相较 ExApr 测试的 AUC 平均相对增幅为 13.3%,宏 F1 平均相对增幅为 16.44%。团队采用 1,000 次非参数自助重抽样计算 95% 置信区间;文中相应性能增幅的区间均未包含 0。

同一模型更换测试集时的成绩变化,比更换输入特征或模型结构时更大。相较之下,使用随机、去精确碰撞或 ExApr 训练集所带来的变化较小。作者据此认为,本研究中的主要影响来自测试集中与训练分子相近的实例。

精确碰撞的影响大于继续去除近似碰撞的增量影响。作者将这一差别与数据中精确碰撞的数量更多联系起来;结果提示,仅按规范化结构去重仍不足以检查模型实际接收到的重复特征。

熟悉骨架中的插值与新骨架上的外推分别评价

研究另外区分 2 类用途。分布内测试要求测试分子的骨架已出现在训练集中,接近围绕既有先导骨架优化分子的任务;骨架留出测试让训练与测试的 Bemis–Murcko 骨架互不重叠,用于评价对新骨架的外推。

分布内随机测试的 AUC 常超过 0.95。去除精确和近似特征碰撞后,分布内 ExApr 的 AUC 为 0.770–0.857、宏 F1 为 0.702–0.773;骨架留出测试的相应范围为 0.699–0.818 和 0.567–0.697。

作者提出,ExApr 与骨架留出各自回答不同问题:前者检查熟悉化学空间中的预测是否依赖相近化合物,后者检查模型能否推广到新的结构骨架。两类成绩应结合实际候选筛选或先导优化用途解释。

随机、骨架留出及分布内去碰撞测试化合物的二维特征分布

窄屏可横向滑动查看完整图表。

不同数据划分下,测试化合物按特征距离投影得到的二维分布;颜色区分血脑屏障通透性类别。(Pablo Ferri、Juan M. García-Gómez / Journal of Chemical Information and Modeling, 2026, Figure 5;CC BY 4.0)

二维特征与公开数据库分布限定了结果的用途

这里的通透性标签反映跨越血脑屏障的综合结果,混合了被动扩散和转运体等影响。ECFP 使用二维结构表示,对三维构象和立体差异的描述有限,预测仍受到这些结构因素的影响。

作者也保留了另一种可能:特征碰撞有时来自有效的特征提取,并不必然表示模型只在记忆训练化合物。如果这些表示仍能提取可推广的规律,不同碰撞处理后的测试成绩应更接近。

公开数据库的可通透分子比例高于许多实际筛选任务,实际使用时的预测精确率还会随类别比例变化。这项工作是既有数据上的模型评价,没有新增化合物的脑暴露实测;将同一偏倚处理扩展到其他药物性质,是作者提出的后续方向。

来源与延伸阅读

  1. Overrepresentation Bias Leads to Performance Overestimation in Blood–Brain Barrier Permeability Prediction Models: Characterization and Mitigation. Journal of Chemical Information and Modeling (2026). ↗