横版独立斜线图比较扩展 QM9 偶极矩模型从随机划分 100% 到骨架划分 72.22%,极化率模型从 94.44% 到 72.22%;横轴标训练数据划分,全部数值对应同一组 18 种化合物 PAMPA 集合。
扩展 QM9 偶极矩和极化率模型在同一组 18 种化合物人工膜测试中的准确率,随机与骨架划分训练分别呈现。(NAMs China)

量子属性预训练,再学习通透标签

美国团队在 Drug Delivery and Translational Research 比较小分子血脑屏障(BBB)通透预测。基础数据 B3DB 包含 7,807 种分子,标签来自约 50 项既有研究,其中 4,956 种为通透阳性、2,851 种为阴性。

研究比较支持向量机、深度神经网络及基于分子图的消息传递网络。迁移学习则先用 QM9 或扩展 QM9 中的量子化学属性训练神经网络,再固定隐藏层,加入新的分类部分学习 BBB 标签。预训练目标分别包括偶极矩、极化率及分子轨道相关属性。

基础输入包括分子量、脂水分配相关指标、极性表面积和氢键供体数等描述符。量子属性预训练用于为这些输入补充分子表示,作者认为它可能帮助模型学习与通透相关的物理化学差异。

同一数据库采用随机与骨架划分

随机划分以 75% 数据训练、25% 测试,只对训练集中的少数类别做随机过采样。骨架划分按分子的 Bemis–Murcko 核心结构分组,排除 2 个无效结构后形成 5,853 个训练样本和 1,952 个测试样本。后者检验模型面对不同核心结构时的表现。

在随机划分的 B3DB 测试中,结合二维描述符与 Morgan 分子指纹的支持向量机取得 89.08% 准确率。部分量子迁移模型在同一数据库上的准确率约为 81%,说明预训练的优势随输入和测试对象改变。

骨架划分改变了各模型的结果,内部准确率、曲线下面积与新实测集合的分类表现也未同步变化。研究因此把数据库标签测试与人工膜实验分开比较。

18 种人工膜实测化合物构成另一组测试

团队从含 2,036 种生物活性化合物的 Emory 库整理测试对象,并排除与 B3DB 训练数据重叠的分子,最终保留 18 种。研究采用血脑屏障平行人工膜通透实验(PAMPA-BBB)测量被动扩散,据通透系数阈值形成分类标签。

随机划分训练后,扩展 QM9 偶极矩模型对 18 种化合物全部分类正确;极化率模型正确率为 94.44%。同组深度神经网络和分子图模型分别为 83.33%、77.78%,支持向量机为 72.22%。这些比例对应这 18 种化合物。

改用骨架划分训练后,扩展 QM9 偶极矩与极化率模型的人工膜测试准确率均为 72.22%。论文列出的其他量子目标还有更低或更高的结果,因此较好的随机划分表现需要连同模型目标和化学结构划分解释。

被动扩散测试与细胞运输仍需衔接

人工膜实验提供新的实测参照,但缺少细胞转运体、主动外排及脑微血管环境。研究还比较了用 P-糖蛋白抑制标签预训练的模型,这属于计算上的预训练任务比较。

作者提出扩展实测化合物集合,进一步加入细胞和体内运输参照,并考虑疾病状态下的屏障变化。当前数据支持比较不同分子表示与划分方式在既有标签和有限实测集合上的表现,后续仍需更广的化学空间与生物运输验证。

来源与延伸阅读

  1. Leveraging quantum chemical properties in transfer learning for predicting blood-brain barrier permeability of drugs. Drug Delivery and Translational Research (2025). ↗