NAMs新方法学前沿

B3clf 重采样分类与外部标签评价

将 4 种分类算法与 6 种采样策略组合,以分子描述符预测血脑屏障通透标签,分别评价交叉验证和外部标签测试。

用途与模型

研究用途
小分子脑药物早期筛选及类别不平衡条件下的算法比较。
模型与细胞来源
B3DB 初始 7,807 种分子,筛选带电/三维结构失败后 7,407 种(4,855 阳性/2,552 阴性),PaDEL 阶段另去除 5 种不兼容分子。外部数据 175 种(171 阳性/4 阴性),剔除与 B3DB 重叠及单原子物种。
方法版本
2025 年 ChemRxiv v1 预印本
实验形式
决策树、k 近邻、逻辑回归、极端梯度提升(XGBoost)分别与不重采样、随机欠采样、合成少数类过采样(SMOTE)及边界/聚类变体、自适应合成采样(ADASYN)组合,共 24 种分类流程。

材料与平台

结构与特征
有可用 PubChem 编号时读取坐标,否则由线性分子结构字符串(SMILES)生成;OpenBabel/MMFF94s 优化,最多 10,000 次迭代。PaDEL 计算 1,875 描述符,包含 431 个三维特征;去除非有限值、绝对值超过 100,000 及常量特征,再按 Pearson 相关系数 0.8 阈值筛除高度相关特征,保留 475 个。
数据划分与搜索
第一轮分层 10 折每折 90% 训练、5% 测试、5% 验证;仅训练部分重采样。Hyperopt 以树结构 Parzen 估计搜索超参数,得到 10 组。第二轮分层 10 折以 90% 训练、10% 评价比较这些参数,选择最低误差组。
外部标签与输出
外部 175 分子来自中枢药物、H1 抗组胺药及因 BBB 通透较差停止开发的化合物;结构优化/特征计算与 B3DB 一致。程序接受结构文件或 SMILES,输出通透标签与概率。

测量指标与分析

  • 受试者工作特征曲线下面积(ROC-AUC)
  • 敏感度与特异度
  • 准确率与 F1 分数
  • 平均精确率 AP
  • Matthews 相关系数
  • 预测标签与概率

交叉验证先搜索再比较超参数,随后在作者另行整理且无 B3DB 分子重叠的标签集合评价;算法/采样组合按多项指标比较,交叉验证与外部指标各按对应数据集和类别组成解释。

研究设计与结果

训练集与交叉验证;药物集评价

研究设计
4 算法×6 策略经过 2 轮分层 10 折及超参数搜索,比较各项分类指标。
测试范围
B3DB 按分子结构/特征兼容性筛选后的数据。
参照体系
24 种算法—采样组合及各算法不重采样版本。
研究结果
XGBoost–ADASYN 交叉验证 ROC-AUC 为 0.9585 ± 0.0048、敏感度 0.9275±0.0121、特异度 0.8233±0.0180、准确率 0.8916±0.0083;采样收益随算法/指标改变。

适用条件与研究局限

  • 超参数选择与交叉验证均基于同一 B3DB 来源,外部测试单独解释。
  • 原始标签来自不同实验条件,数据噪声和化学空间覆盖仍有限。

训练集与交叉验证;药物集评价

研究设计
在新整理的 175 种外部化合物标签上比较 B3clf 组合及 6 项既有模型。
测试范围
175 种化合物:171 通透阳性、4 阴性,无 B3DB 分子重叠。
参照体系
各组合及作者所比较的 6 项既有模型。
研究结果
XGBoost–ADASYN:AP 为 0.9993、准确率 0.9086、敏感度 0.9064、特异度 1.0;决策树–边界 SMOTE:AP 为 0.9997、准确率 0.8114。

适用条件与研究局限

  • 仅 4 个阴性,特异度和排序指标需连同类别分布解释。
  • 作者指出既有比较模型可能含 40–60 个外部分子的训练重叠,模型间结果需连同训练资料解释。
  • 概率阈值未优化,仍需更多一致测量和阴性数据。
  • ChemRxiv v1 预印本,尚未经过同行评审。

来源与原文

  1. B3clf: A Resampling-Integrated Machine Learning Framework to Predict Blood-Brain Barrier Permeability原始研究 · ChemRxiv · 2025-08-20

相关资讯与知识

自定义隐私设置

必要设置始终启用

用于记住你的隐私选择。文章原站配图会向图片提供方发起请求,详见隐私政策。