NAMs新方法学前沿

血脑屏障多模型分类与骨架划分评价

从实验数据库整理化合物,分别预测血脑屏障穿透类别与 LogBB,并用骨架划分评价新结构上的表现。

用途与模型

研究用途
中枢药物及神经毒性候选的脑暴露优先级筛选。
模型与细胞来源
基于 B3DB 的计算模型。分类数据经整理后为 3968 个分子;连续 LogBB 子集为 917 个分子。实验标签来源不同,二维表示不保留全部立体差别。
方法版本
2026 年 B3DB 二维标准化、类别平衡与 7 个模型投票版本
实验形式
随机森林、XGBoost 和图神经网络配合 MACCS、Morgan 指纹及 Mordred 描述符;7 个分类模型多数投票,按模型分歧单列不确定结果。

材料与平台

实验数据库与分子身份
B3DB 原始分类数据 7807 个、连续值 1058 个;结构规范化和去重后分别为 3968 个与 917 个。最终分类含 2447 个可穿透、1521 个不可穿透分子。
软件与特征
RDKit 2024.3.5、Mordred 1.2.0、Chemprop 1.7.1 及相应随机森林/XGBoost 工具;采用二维结构表示和分子骨架。
平衡与适用范围
平衡仅用于训练:平衡随机森林、XGBoost 类别权重及图模型等量采样。综合模型用 CONS-STD < 0.46 定义适用范围;7 个模型中至少 5 个一致。

测量指标与分析

  • 分类敏感度、特异度、平衡准确率与 ROC AUC
  • 模型分歧与适用范围覆盖率
  • LogBB 测试集 R² 和均方误差
  • 受体筛选分子的可穿透、不可穿透及不确定预测

分类分别采用 5 折交叉验证和训练/测试约 80%/20% 的分子骨架划分,相同骨架保留在同一集合。比较类别平衡前后的同一测试集合,综合 7 个模型投票;连续预测仅采用骨架划分。SHAP 和片段统计解释数据中的结构关联。

研究设计与结果

训练集与交叉验证

研究设计
在整理后的实验数据中,用交叉验证和分子骨架留出检验分类;LogBB 模型另在连续值子集检验。
测试范围
分类 3968 个分子、回归 917 个分子。骨架测试的适用范围筛选排除 97 个约 12% 的不确定分子。
参照体系
同一测试集合的未平衡模型与平衡模型;7 个单模型与多数投票;不同 LogBB 回归模型。
研究结果
平衡综合分类的骨架测试 BACC 为 0.81、AUC 为 0.89,5 折平均相应为 0.80 和 0.89。连续预测中最佳图模型的 R² 为 0.48、MSE 为 0.26,模型平均未改善回归成绩。

适用条件与研究局限

  • 验证来自既有数据库留出,尚无新增化合物脑浓度实测。
  • 连续数据超过 90% 为可穿透类别,不可穿透分子的定量预测较弱。
  • 结构去重合并部分立体异构体,实验来源与测量条件也会影响标签。
  • 受体应用集合中的 52 个已知分子与建模数据重叠,其结果不构成独立外部验证。
  • 排除不确定分子可以提高分类成绩,同时会减少模型能够明确判断的分子比例。

来源与原文

  1. Predicting blood-brain barrier permeability of chemicals by machine learning modeling原始研究 · NAM Journal · 2026-07-25

相关资讯与知识

自定义隐私设置

必要设置始终启用

用于记住你的隐私选择。文章原站配图会向图片提供方发起请求,详见隐私政策。