
细胞系预训练与类器官数据微调
2025 年 8 月,npj Precision Oncology 发表 PharmaFormer 研究。团队利用较丰富的细胞系药物响应数据,弥补患者来源类器官测试资料有限的问题,通过迁移学习建立模型,再用回顾性患者队列检验其预测表现。
PharmaFormer 以基因表达和药物结构信息为输入。模型先从细胞系中学习基因表达与药物响应的关系,再用相应癌种的类器官数据微调,最后应用于已有的患者肿瘤数据。
训练的第一阶段采用癌症药物敏感性基因组数据库(Genomics of Drug Sensitivity in Cancer,GDSC)第二版中的资料,覆盖 900 多条细胞系和 100 多种药物。研究用剂量—响应曲线下面积描述体外响应,并在细胞系数据中进行交叉验证。
特征整合与预测表现
基因表达与药物结构由两个独立模块提取特征,再合并输入 Transformer 编码器。药物结构采用简化分子线性输入规范(SMILES)字符串表示,经过编码后与基因表达特征共同用于预测药物响应。
预训练后,团队用较小规模的肿瘤类器官药物测试数据微调模型,并采用正则化等方法调整参数。模型由此保留从细胞系大规模数据中学到的信息,再适应类器官数据。
研究将模型与支持向量回归、随机森林、K 近邻算法、岭回归及多层感知机等方法比较。细胞系阶段的评估使用 5 折交叉验证,计算每种药物预测值与测量值的相关性,并继续按组织和药物类别检查表现。这个阶段验证的是体外数据预测能力。
论文采用的 Transformer 编码器包含 3 层,每层设 8 个自注意力头。编码结果再经后续模块生成药物响应预测。
在细胞系的 5 折交叉验证中,各药物 Pearson 相关系数的平均值为 0.742;支持向量回归为 0.477,其余比较算法介于 0.342–0.388。靶向药与常规化疗药、FDA 已批准与未批准药物之间的预测表现均未见显著差异。
回顾性患者队列中的生存分析
临床分析使用癌症基因组图谱项目(The Cancer Genome Atlas Program,TCGA)中的肿瘤基因表达、治疗记录和总体生存资料。模型给患者评分并划分高、低风险组,随后比较生存曲线和风险比。因此,研究在患者队列中考察的是预测分组与已有结局的关联。
结肠癌模型以 29 份患者来源类器官数据微调。氟尿嘧啶分析中,预测耐药与敏感组的生存风险比从细胞系预训练模型的 2.50 升至微调后的 3.91;奥沙利铂从 1.95 升至 4.49,微调后 95% 置信区间分别为 1.54–9.39 和 1.76–11.48。
膀胱癌吉西他滨和顺铂分析中,微调后风险比分别为 4.91 和 6.01,95% 置信区间分别为 1.18–20.49 和 1.43–25.24。肝细胞癌索拉非尼分析的风险比为 5.67,95% 置信区间为 1.49–21.59。相应的预训练模型风险比均较低,且置信区间跨越 1;微调后的估计区间仍较宽。
研究还使用 4 个独立的结直肠癌队列,按已知氟尿嘧啶治疗结局比较有响应与无响应患者。四组数据中,类器官微调模型的区分能力均优于只用细胞系训练的模型。这项验证补充了 TCGA 生存分析。
直接合并数据与迁移学习有何差别
团队设置 4 种训练条件:仅细胞系、仅类器官、直接合并二者,以及细胞系预训练后用类器官微调。比较显示,论文测试的药物中,预训练加微调的策略总体表现更好。这使结果不仅反映模型架构,也提供了对数据使用方式的比较。
为了进一步区分类器官资料的贡献,研究先排除特定癌种的细胞系进行预训练,再分别用该癌种的细胞系或类器官数据微调。在结直肠癌和膀胱癌的相应分析中,用类器官微调的模型更好地区分了临床队列的结局,显示了患者来源类器官数据对模型微调的贡献。
临床预测阶段除上述常见算法外,还比较了生物网络模型和另一种深度神经网络。PharmaFormer 在所报告癌种和药物组合中的风险分层表现更强,支持作者对架构与迁移学习共同作用的判断。
细胞系、类器官与临床资料的分阶段应用
模型目前只使用基因表达作为细胞状态输入。作者选择整体组织 RNA 测序资料,考虑到其可获得性、成本及既有数据积累;单细胞测序和基因组其他层面的信息尚未纳入当前模型。
作者提出,后续需要扩大类器官数据规模及癌种覆盖,并探索纳入拷贝数变异、突变等基因组特征,以改进模型的泛化能力。