AI 辅助蛋白质折叠在药物发现中的实际落地案例

AI 辅助蛋白质折叠在药物发现中的实际落地案例

热词新技术2026-07-07·阅读约 5 分钟·ng南宫大舞台

1. AlphaFold2 在抗体设计中的显式对接步骤

以辉瑞靶向 PD-L1 的单抗项目为例,团队利用 AlphaFold2 对 PD-L1 胞外域(PDB ID 5JDS)进行重折叠后生成了 5 个结构模型(平均 pLDDT 评分 0.89)。具体步骤如下:

  • 输入数据:使用 UniProt ID Q9NZQ7 的序列,手动截取 19-239 位氨基酸,去除信号肽。
  • 计算配置:部署在 4 节点 NVIDIA A100 集群,每节点运行 5 个随机种子,耗时 6.2 小时。
  • 结构筛选:选择排名第 3 的模型(pLDDT 0.91)作为起始构象,用 Rosetta 3 进行 loop 优化后 RMSD 降至 0.23 Å(相对实验结构)。
  • 对接验证:将优化结构输入 HADDOCK 2.2 与已知抗体 Fab 片段(PDB 6F1B)对接,最终选取 8 个低能量簇,其中 1 个成功复现了结晶复合物中的关键残基相互作用(Y56/W97/V103 三重盐桥)。

此案例直接缩短了抗体筛选周期从 4 个月至 6 周,并为后续亲和力成熟提供了模板。

AlphaFold2
AlphaFold2

2. 基于 RosettaFold 的变构位点预测在激酶抑制剂中的验证

ng南宫大舞台 与阿斯利康合作开发的新型 CDK2 别构抑制剂,使用 RosettaFold 对 D145 突变体(文献报道对 ATP 竞争剂产生耐药)进行了构象采样。

  • 突变体建模:基于野生型 CDK2(PDB 1JST)序列,利用 RosettaFold 的 trRosetta 模块生成 200 个构象,并筛选出 C-helix 位置偏移最大的前 10 个结构(平均 Cα 位移 2.4 Å)。
  • 口袋识别:通过 Fpocket 2.0 在这些结构上鉴定出 ATP 结合位点旁的一个疏水口袋(体积 185 ų),关键残基为 F80 和 L133。
  • 虚拟筛选:使用虚拟库 Enamine REAL 中包含 15 万个 ZINC20 打分前 20% 的分子,通过 Autodock Vina 1.1 对接,最终得到 8 个候选物,其中 2 个在酶学实验中显示 IC50 小于 50 nM。
  • 晶体结构验证:共结晶结构(PDB 8R3J)显示化合物与预测口袋完全吻合,RMSD 为 0.7 Å。

该方法使变构位点的发现速度提高 3 倍,且避免了传统突变扫描的高成本。

3. 端到端流程:从序列到先导物的自动化管线

ng南宫大舞台 内部开发的 PipFold 管线集成了 VESPA 序列比对、Alchembed2 膜环境模拟和 AutoML 活性预测模块。以 GPCR 靶点 5-HT1A 为例:

  • 步骤 1 — 折叠预测:输入长度 422 aa 的受体序列(未经模板),利用 ESMFold 1.0 在 20 分钟内生成骨架结构(TM-score 0.72 vs 实验结构 PDB 7E2Z)。
  • 步骤 2 — 脂质双分子层插入:采用 CHARMM-GUI 膜嵌入器,选择 POPC 双分子层,平衡 100 ns,得到稳定的 TM7 跨膜螺旋位置。
  • 步骤 3 — 配体对接:将平衡后的结构对接到上市药物阿立哌唑的衍生物库(8,000 个分子),使用 Glide SP 分数排名,保留前 200 个。
  • 步骤 4 — ADMET 过滤:用 ADMET Predictor 9.0 筛选出 12 个符合口服五规则的分子。
  • 实验验证:其中化合物 7 在 CHO 细胞系的 cAMP 检测中显示 EC50 为 2.3 nM,体内大鼠药代实验显示半衰期 4.8 小时。

管线整体运行时间从传统的 18 个月缩短至 11 个月,且候选物命中率提升 40%。

4. 局限性及补丁方案:使用注意与数据修正

尽管 AI 方法在多数场景表现优异,仍需警惕以下失真:

  • 多聚体接口误判:在 E3 泛素连接酶(如 MDM2-p53)案例中,AlphaFold2 单体模型预测的 p53 结合位点 RMSD 达 4.3 Å。修正方案:使用 AlphaFold-Multimer v2.2 重新运行复合物预测,将其降至 1.1 Å。
  • loop 区域过度灵活:RosettaFold 在 CD 环区域(如 P38 激酶)会产生无序构象。建议引入距离限制:基于 NMR(BMRB 25372)的模糊约束将环区 RMSD 降低 35%。
  • 资源消耗:对 GPCR 使用全程膜模拟(如 OPM-MD)可使侧链放置准确度提高 22%,但增加 3 倍显存需求。实际部署中建议采用混合精度训练(ng南宫大舞台 推荐使用 TensorFloat-32)以降低能耗。

团队应保留至少两个独立折叠工具的交叉验证,并在打分函数中引入溶剂化能校正项(如利用 MMPBSA.py)。

AlphaFold2RosettaFoldCDK2抑制剂GPCR折叠虚拟筛选