血脑屏障多模型分类与骨架划分评价
从实验数据库整理化合物,分别预测血脑屏障穿透类别与 LogBB,并用骨架划分评价新结构上的表现。
用途与模型
- 研究用途
- 中枢药物及神经毒性候选的脑暴露优先级筛选。
- 模型与细胞来源
- 基于 B3DB 的计算模型。分类数据经整理后为 3968 个分子;连续 LogBB 子集为 917 个分子。实验标签来源不同,二维表示不保留全部立体差别。
- 方法版本
- 2026 年 B3DB 二维标准化、类别平衡与 7 个模型投票版本
- 实验形式
- 随机森林、XGBoost 和图神经网络配合 MACCS、Morgan 指纹及 Mordred 描述符;7 个分类模型多数投票,按模型分歧单列不确定结果。
材料与平台
- 实验数据库与分子身份
- B3DB 原始分类数据 7807 个、连续值 1058 个;结构规范化和去重后分别为 3968 个与 917 个。最终分类含 2447 个可穿透、1521 个不可穿透分子。
- 软件与特征
- RDKit 2024.3.5、Mordred 1.2.0、Chemprop 1.7.1 及相应随机森林/XGBoost 工具;采用二维结构表示和分子骨架。
- 平衡与适用范围
- 平衡仅用于训练:平衡随机森林、XGBoost 类别权重及图模型等量采样。综合模型用 CONS-STD < 0.46 定义适用范围;7 个模型中至少 5 个一致。
测量指标与分析
- 分类敏感度、特异度、平衡准确率与 ROC AUC
- 模型分歧与适用范围覆盖率
- LogBB 测试集 R² 和均方误差
- 受体筛选分子的可穿透、不可穿透及不确定预测
分类分别采用 5 折交叉验证和训练/测试约 80%/20% 的分子骨架划分,相同骨架保留在同一集合。比较类别平衡前后的同一测试集合,综合 7 个模型投票;连续预测仅采用骨架划分。SHAP 和片段统计解释数据中的结构关联。
研究设计与结果
训练集与交叉验证
- 研究设计
- 在整理后的实验数据中,用交叉验证和分子骨架留出检验分类;LogBB 模型另在连续值子集检验。
- 测试范围
- 分类 3968 个分子、回归 917 个分子。骨架测试的适用范围筛选排除 97 个约 12% 的不确定分子。
- 参照体系
- 同一测试集合的未平衡模型与平衡模型;7 个单模型与多数投票;不同 LogBB 回归模型。
- 研究结果
- 平衡综合分类的骨架测试 BACC 为 0.81、AUC 为 0.89,5 折平均相应为 0.80 和 0.89。连续预测中最佳图模型的 R² 为 0.48、MSE 为 0.26,模型平均未改善回归成绩。
适用条件与研究局限
- 验证来自既有数据库留出,尚无新增化合物脑浓度实测。
- 连续数据超过 90% 为可穿透类别,不可穿透分子的定量预测较弱。
- 结构去重合并部分立体异构体,实验来源与测量条件也会影响标签。
- 受体应用集合中的 52 个已知分子与建模数据重叠,其结果不构成独立外部验证。
- 排除不确定分子可以提高分类成绩,同时会减少模型能够明确判断的分子比例。
来源与原文
- Predicting blood-brain barrier permeability of chemicals by machine learning modeling原始研究 · NAM Journal · 2026-07-25