血脑屏障预测的特征碰撞检测与去偏评价
在结构去重后的血脑屏障数据中识别精确及近似特征碰撞,再用不同测试集合评价预测成绩的偏倚。
用途与模型
- 研究用途
- 审查血脑屏障分类模型的数据划分,并分别评价熟悉化学空间中的插值和新分子骨架上的外推。
- 模型与细胞来源
- 来自 5 个公开数据库的既有通透性标签。规范化结构去重后形成 7,845 个化合物;标签反映被动扩散、转运和外排等共同作用下的综合结果。
- 方法版本
- 2026 年 ECFP 距离阈值、ExApr 与骨架留出比较版本
- 实验形式
- RDKit 结构整理;ECFP/Jaccard 特征距离;带约束的 beta 混合分布拟合;随机、去精确碰撞、ExApr 与分子骨架留出评价。
材料与平台
- 数据库与结构整理
- MoleculeNet、B3DB、DeePred-BBB、QSAR-BBB 和 NeuTox2 共 27,369 条记录。保留最大有机片段、中和电荷、规范化互变异构体,按规范化结构去重并删除同一结构的冲突标签后为 7,845 个化合物。
- 特征与近邻距离
- 用 ECFP/Jaccard 距离检测精确和近似碰撞;预测输入另包括 709 个分子描述符、166 位 MACCS 指纹、分子图和 SMILES。描述符标准化在数据划分后进行。
- 阈值估计与模型比较
- 在去精确碰撞的训练数据中,拟合最近邻距离的 4 种候选分布,经贝叶斯信息准则选取模型并确定近似碰撞阈值。比较随机森林、梯度提升及 4 类神经网络模型。
测量指标与分析
- ROC AUC 与宏 F1
- 随机测试相对 ExApr 测试的性能增幅
- 精确及近似特征碰撞的分布
- 熟悉骨架与新骨架上的预测成绩
先按 75%/25% 分层划分训练与测试数据。精确碰撞中同标签只保留第 1 个,冲突标签删除;近似碰撞中同标签只保留第 1 个,冲突标签保留。测试数据另按与训练数据的碰撞关系处理,3 种测试集对齐样本数和类别频率。超参数在训练集内以 4 折交叉验证优化;用 1,000 次自助重抽样估计成绩及性能增幅的 95% 置信区间,骨架留出另评价新结构上的外推。
研究设计与结果
训练集与交叉验证
- 研究设计
- 既有数据库内比较不同碰撞处理的留出测试,并分别建立分布内测试与训练/测试骨架互不重叠的分布外测试。
- 测试范围
- 5 库合计 27,369 条记录,结构整理后为 7,845 个化合物;3 种碰撞处理测试集的数量和类别比例一致,具体分子组成不同。
- 参照体系
- 相同模型及输入特征在随机、去精确碰撞与 ExApr 测试集中的成绩;分布内随机、分布内 ExApr 与骨架留出成绩。
- 研究结果
- 随机测试相较 ExApr 测试的 AUC 平均相对增幅为 13.3%、宏 F1 为 16.44%。分布内 ExApr 的 AUC 为 0.770–0.857、宏 F1 为 0.702–0.773;骨架留出相应为 0.699–0.818 和 0.567–0.697。
适用条件与研究局限
- 评价来自既有数据库留出,未新增化合物的脑暴露实测。
- 特征碰撞反映二维表示的相似性,不等于化合物在三维结构或生理条件下完全相同。
- 近似碰撞中标签不同的实例保留,处理规则与精确碰撞不同。
- 当前阈值由当前训练数据估计,其他数据集或三维模型需要适合自身表示的距离与阈值。
- 特征碰撞并不必然意味着实例记忆;有用的特征提取也可能产生碰撞。
- 公开库与实际筛选的类别比例不同,实际预测精确率还会随比例变化。
来源与原文
- Overrepresentation Bias Leads to Performance Overestimation in Blood–Brain Barrier Permeability Prediction Models: Characterization and Mitigation原始研究 · Journal of Chemical Information and Modeling · 2026-06-02