NAMs新方法学前沿

BBBP 分类的内部交叉验证与重采样评价

用分子指纹与理化描述符比较血脑屏障(BBB)标签分类算法,在数据库内分析重采样对各类错误和性能指标的影响。

用途与模型

研究用途
早期脑部药物筛选的计算模型比较与适用范围分析。
模型与细胞来源
MoleculeNet 血脑屏障穿透数据集(BBBP)整理后的 1,955 个分子:1,492 个阳性、463 个阴性标签。计算任务为二分类。
方法版本
2025 年原研究版本
实验形式
基准模型采用分层 10 折交叉验证;重采样比较另以单次划分结果报告。每组混淆矩阵的验证预测合计为 587 个分子。

材料与平台

分子表示
2,048 位 Morgan 分子指纹、166 位结构片段指纹及 RDKit 化学信息学工具计算的 208 项理化描述符;去除缺失/无限值和方差低于 0.14 的特征后保留 743 维。连续变量标准化,模型不显式表示多种离子化状态。
算法和采样
比较逻辑回归、随机森林、梯度提升等 11 个模型;对逻辑回归和随机森林比较合成少数类过采样(SMOTE)、边界 SMOTE 及联合欠采样。合成少数类样本仅在训练折内生成。

测量指标与分析

  • 准确率
  • 精确率、召回率及其调和均值 F1 分数
  • 假阳性与假阴性数量
  • 受试者工作特征曲线下面积
  • 分组准确率及特征重要性

分层折内保持类别比例,报告基准交叉验证均值;单次划分的混淆矩阵另用于比较重采样。以随机森林分析分子计数特征及各组分类表现。

研究设计与结果

训练集与交叉验证

研究设计
数据库内 11 种算法作分层 10 折基准评价。
测试范围
1,955 个既有标签分子。
参照体系
同一来源数据上的算法及多数类别基线。
研究结果
逻辑回归准确率/F1 为 0.881/0.925,随机森林为 0.877/0.924;多数类别基线准确率 0.763。

适用条件与研究局限

  • 结果属于内部交叉验证,未完成新来源分子或化学骨架外部检验。
  • 主动转运蛋白和多种离子化状态未建模。

训练集与交叉验证

研究设计
单次划分比较有无重采样的逻辑回归和随机森林。
测试范围
每组表中 587 个验证预测,阳性 448 个、阴性 139 个,按原混淆矩阵合计。
参照体系
未重采样、SMOTE、边界 SMOTE 和联合欠采样。
研究结果
随机森林准确率从 0.903 到 SMOTE 的 0.906;联合欠采样精确率 0.911、召回率 0.955。逻辑回归 SMOTE 减少假阳性但增加假阴性。

适用条件与研究局限

  • 单次划分结果与交叉验证均值分别评价。
  • 分组计数的重要性与分类相关,未通过配对化合物实验验证因果关系。

来源与原文

  1. Feature-Guided Machine Learning for Studying Passive Blood–Brain Barrier Permeability to Aid Drug Discovery原始研究 · International Journal of Molecular Sciences · 2025-11-20

相关资讯与知识

自定义隐私设置

必要设置始终启用

用于记住你的隐私选择。文章原站配图会向图片提供方发起请求,详见隐私政策。