BBBP 分类的内部交叉验证与重采样评价
用分子指纹与理化描述符比较血脑屏障(BBB)标签分类算法,在数据库内分析重采样对各类错误和性能指标的影响。
用途与模型
- 研究用途
- 早期脑部药物筛选的计算模型比较与适用范围分析。
- 模型与细胞来源
- MoleculeNet 血脑屏障穿透数据集(BBBP)整理后的 1,955 个分子:1,492 个阳性、463 个阴性标签。计算任务为二分类。
- 方法版本
- 2025 年原研究版本
- 实验形式
- 基准模型采用分层 10 折交叉验证;重采样比较另以单次划分结果报告。每组混淆矩阵的验证预测合计为 587 个分子。
材料与平台
- 分子表示
- 2,048 位 Morgan 分子指纹、166 位结构片段指纹及 RDKit 化学信息学工具计算的 208 项理化描述符;去除缺失/无限值和方差低于 0.14 的特征后保留 743 维。连续变量标准化,模型不显式表示多种离子化状态。
- 算法和采样
- 比较逻辑回归、随机森林、梯度提升等 11 个模型;对逻辑回归和随机森林比较合成少数类过采样(SMOTE)、边界 SMOTE 及联合欠采样。合成少数类样本仅在训练折内生成。
测量指标与分析
- 准确率
- 精确率、召回率及其调和均值 F1 分数
- 假阳性与假阴性数量
- 受试者工作特征曲线下面积
- 分组准确率及特征重要性
分层折内保持类别比例,报告基准交叉验证均值;单次划分的混淆矩阵另用于比较重采样。以随机森林分析分子计数特征及各组分类表现。
研究设计与结果
训练集与交叉验证
- 研究设计
- 数据库内 11 种算法作分层 10 折基准评价。
- 测试范围
- 1,955 个既有标签分子。
- 参照体系
- 同一来源数据上的算法及多数类别基线。
- 研究结果
- 逻辑回归准确率/F1 为 0.881/0.925,随机森林为 0.877/0.924;多数类别基线准确率 0.763。
适用条件与研究局限
- 结果属于内部交叉验证,未完成新来源分子或化学骨架外部检验。
- 主动转运蛋白和多种离子化状态未建模。
训练集与交叉验证
- 研究设计
- 单次划分比较有无重采样的逻辑回归和随机森林。
- 测试范围
- 每组表中 587 个验证预测,阳性 448 个、阴性 139 个,按原混淆矩阵合计。
- 参照体系
- 未重采样、SMOTE、边界 SMOTE 和联合欠采样。
- 研究结果
- 随机森林准确率从 0.903 到 SMOTE 的 0.906;联合欠采样精确率 0.911、召回率 0.955。逻辑回归 SMOTE 减少假阳性但增加假阴性。
适用条件与研究局限
- 单次划分结果与交叉验证均值分别评价。
- 分组计数的重要性与分类相关,未通过配对化合物实验验证因果关系。
来源与原文
- Feature-Guided Machine Learning for Studying Passive Blood–Brain Barrier Permeability to Aid Drug Discovery原始研究 · International Journal of Molecular Sciences · 2025-11-20