摘要:本研究以SARS-CoV-2主蛋白酶(Mpro)为靶点,利用包含76个非共价抑制剂的实验活性数据集,系统构建并比较了2D-QSAR与3D-QSAR回归模型。2D-QSAR模型基于6个理化描述符及多种分子指纹,采用SVM、GPR、RF、MLP等机器学习方法开发;3D-QSAR模型则采用Field 3D-QSAR方法及kNN、SVM、GPR、RF、MLP、共识法等多种算法。结果表明,所有模型均展现出良好的统计性能与预测能力,其中Morgan指纹MLP 2D-QSAR模型与MLP 3D-QSAR模型表现最佳(测试集r²均为0.72)。特别地,Field 3D-QSAR方法不仅具有优越的预测性能,还可通过静电和立体系数的可视化分析识别影响活性的关键分子区域,为合理设计新型抗SARS-CoV-2候选药物提供了重要指导。

Natercia Braz. 2026-1-20. Prioritization of new molecule design using QSAR models 2D- and 3D-QSAR studies

引言

病毒主蛋白酶(Main protease,Mpro)是严重急性呼吸综合征冠状病毒2型(SARS-CoV-2)复制的关键酶,而SARS-CoV-2正是引发COVID-19全球大流行的病原体。除已建立的COVID-19疫苗接种计划外,抗病毒药物被视为控制未来不可避免的冠状病毒疫情的重要手段。因其关键作用,Mpro作为新型治疗药物的潜在靶点受到了广泛关注1-6

针对SARS-CoV-2 Mpro的活性,可建立稳健且具备预测能力的定量构效关系(QSAR)模型,从而阐明已知活性数据的SAR并用于指导新分子设计。Cresset Discovery CRO团队利用一组包含76个已知实验活性且具有共同结合模式的化合物1-6,在分子建模解决方案FlareTM中分别构建了预测性机器学习(ML)模型与场3D-QSAR模型7

所有模型均展现出与实验结果一致的统计性能,且在描述能力和预测能力方面各模型之间具有可比性。此外,Field-based 3D-QSAR方法还揭示了驱动活性的关键分子区域。

方法

数据集

在本案例研究中,选取了76个具有不同化学类型且活性范围均匀分布(pIC50: 4.00–7.74)的非共价抑制剂作为数据集,采用26%活性分层方法将其划分为训练集(56个分子)和测试集(20个分子)。

2D-QSAR

首先对初始选取的二维描述符(部分源自RDKit8)进行线性Pearson相关矩阵交叉相关性分析,以剔除冗余描述符。随后,以6个理化描述符(分子量MW、拓扑极性表面积TPSA、可旋转键数#RB、氢键受体数NumHAcceptors、氢键供体数NumHDonors和环计数RingCount)及分子指纹(RDKit、Morgan和MACCS键)作为特征,采用支持向量机(SVM)9、高斯过程回归(GPR)10、随机森林(RF)11和多层感知器(MLP)12等监督机器学习(ML)方法,构建了2D-QSAR回归模型。

3D-QSAR

3D-QSAR模型的构建对构象搜索和分子叠合的精度要求极高。Flare 软件能够执行高质量的分子叠合,尤其是基于最大公共子结构(MCS)算法的叠合,再结合 Cresset Discovery 团队对结果的深入解读,从而获得了噪声水平低、具有实际意义的分子叠合结果(图1)。具体而言,化合物通过 MCS 方法叠合至 PDB ID 分别为 7L131、7L141、7QBB5 和 8SXR6 的共结晶配体上(以加权平均贡献作为参考),同时采用 7L13 蛋白的”软”硬度参数作为排除体积。构象搜索参数则设置为标准的”very accurate and slow”模式(能量窗口为 2.5 kcal/mol)。

本研究采用Field-based 3D-QSAR方法(标准的”Normal with Y scrambles”方案)及多种机器学习方法——包括k近邻(kNN)、SVM、GPR、RF、MLP和共识法(Consensus)——来构建3D-QSAR回归模型7。除kNN方法外,上述方法均利用由Cresset XED力场生成的场点直接确定探针位置,进而对训练集中每个分子的静电势以及体积/形状进行采样,并将采样结果作为QSAR模型的描述符。而kNN方法则另辟蹊径,直接使用Cresset XED力场作为相似性度量标准7

化合物数据集分子叠合示意图

图1. 化合物数据集分子叠合示意图。

结果

统计分析

表1汇总了各模型的性能,并按照所有评估QSAR方法的预测统计量进行了排序。图2分别展示了Morgan指纹MLP 2D-QSAR模型和MLP 3D-QSAR模型的实验活性与预测活性关系图,两者的测试集总体r²均为0.72,在所有模型中表现最佳。除MACCS key SVM 2D-QSAR模型外,其余模型的测试集r²均处于较高水平且彼此相当,表明模型具有较高的可信度。因此,这些模型中的任意一个均能对新化合物的活性提供准确预测。此外,2D与3D模型之间表现出良好的一致性,提示该数据集中的化合物可能通过相似的机制发挥作用。这也表明,RDKit 2D描述符和分子指纹可作为Cresset 3D描述符的有效替代,用于构建预测性ML模型。然而,与Cresset分子场点不同的是,这些模型无法揭示对活性有关键影响的分子区域,因而难以据此进一步开展分子设计以改善目标化合物的识别、结合能力及活性。

表1. 不同QSAR模型实测与预测统计量的比较。

QSAR type Regression model r²_training set q²_training set CV r²_test set
2D-QSAR
(6 physico-chemical descriptors)
MLP 0.91 0.68 0.69
GPR 0.89 0.73 0.67
Consensus 0.89 0.74 0.65
RF 0.86 0.74 0.62
SVM 0.86 0.75 0.61
2D-QSAR
(fingerprints, FP)
MLP (Morgan FP) 1.00 0.80 0.72
SVM (RDKit FP) 1.00 0.83 0.63
SVM (MACCS key) 0.96 0.80 0.50
3D-QSAR MLP 1.00 0.82 0.72
Field-based QSAR 0.96 0.81 0.71
kNN 0.75 0.71
Consensus 0.99 0.82 0.70
SVM 0.98 0.82 0.70
GPR 0.99 0.77 0.70
RF 0.99 0.82 0.70


MLP Morgan FP 2D-QSAR(左)和3D-QSAR(右)模型

图2. MLP Morgan FP 2D-QSAR(左)和3D-QSAR(右)模型——训练集(紫色)、训练集交叉验证CV(黑色)和测试集(绿色)中化合物的实验活性与预测活性对比图。

模型可视化与解读

Cresset Field 3D-QSAR方法相较于传统机器学习方法具有独特优势,它可以通过直观检查模型系数来确定对活性具有显著影响的关键区域。图3展示了将静电和立体模型系数叠加于活性最强的化合物(化合物37,pIC50 = 7.74)之上的结果。在母核环的酰胺羰基及吡啶单元的氮原子处观察到有利的负静电系数区域,表明这些区域的正电荷越少,活性越高。此外,大面积的绿色圆点标示出2-氯苄基附近存在有利的立体系数区域,结合该区域较高的立体方差,表明该基团是最适于进行结构修饰以提升活性的位点。基于模型分析结果以及Cresset Discovery团队在计算化学与药物化学方面的深厚经验,在2-氯苄基单元的3位引入氰基或甲基取代基可显著提升活性,其活性预测值甚至超过化合物37(预测pIC50分别为7.70和7.60)。除了立体效应外,这些取代基还能够优化抑制剂与靶标酶之间的分子间相互作用:氰基可与Q192的骨架NH形成氢键,而甲基则与P168以及Q192侧链的烷基区域形成疏水接触,从而进一步增强了抑制剂的活性。

此外,通过比较化合物37与一系列类似分子的场贡献差异(图4),进一步凸显了2-氯苄醇基团的重要性。对于化合物8而言,该基团的缺失导致了不利的静电贡献,使其活性下降了约2.5个对数单位;而当将芳香环替换为烷基链或饱和环时,则观察到较大乃至中等程度的不利静电与立体贡献,最终使活性降低约1个对数单位。类似地,化合物28中羟基的存在也带来了强烈的不利静电贡献,从而削弱了其预测活性。

SARS-CoV-2 Mpro场QSAR模型的模型系数图

图3. SARS-CoV-2 Mpro场QSAR模型的模型系数图。(A) 静电系数和位阻系数;(B) 静电方差和位阻方差,以活性最强分子(化合物37)为参考。化合物编号依据专利WO2022/150584A14

化合物37、8、28、38和46的SARS-CoV-2 Mpro 3D-QSAR场贡献对预测活性的影响

图4. 化合物37、8、28、38和46的SARS-CoV-2 Mpro 3D-QSAR场贡献对预测活性的影响。

结论

Cresset Discovery的研究团队成功构建了稳健的2D-QSAR与3D-QSAR回归模型,用于描述和预测一系列非共价SARS-CoV-2 Mpro抑制剂的活性。研究结果显示,2D-QSAR与3D-QSAR模型之间具有良好的—致性,且Field-based 3D-QSAR模型的性能优于机器学习方法。凭借团队丰富的经验,进一步通过分析静电和立体系数深入阐释了抑制剂的活性机制,并明确了如何利用模型来指导新型治疗性分子的设计及其优先级排序。

Flare 中强大的 QSAR 方法,结合 Cresset Discovery CRO 在定量构效关系领域的深厚专业积累,为加速创新药物设计提供了卓越的服务支持。欢迎随时联系我们,了解 Cresset Discovery CRO 团队如何为您的 QSAR 项目提供专业支持、答疑解惑,或直接承接相关研究。

参考文献

  1. Chun-Hui Zhang, et al., ACS Cent. Sci. 2021, 7, 467–475, https://doi.org/10.1021/acscentsci.1c00039
  2. Chun-Hui Zhang, et al., ACS Med. Chem. Lett. 2021, 12, 1325–1332, https://doi.org/10.1021/acsmedchemlett.1c00326
  3. Maya G. Deshmukh, et al., Structure 2021, 29, 823–833, https://doi.org/10.1016/j.str.2021.06.002
  4. William L. Jorgensen, Patent WO 2022/150584 A1
  5. Andreas Luttens et. al., J. Am. Chem. Soc. 2022, 144, 2905–2920, https://doi.org/10.1021/jacs.1c08402
  6. Jimena Perez-Vargas et. al., Emerg. Microbes Infect. 2023, 12, 2246594, doi.10.1080/22221751.2023.2246594
  7. Flare™, Cresset®, Litlington, Cambridgeshire, UK; https://www.cresset-group.com/software/flare/; Cheeseright T., Mackey M., Rose S., Vinter, A.; Molecular Field Extrema as Descriptors of Biological Activity: Definition and Validation J. Chem. Inf. Model. 2006, 46 (2), 665-676.
  8. RDKit: Open-source cheminformatics. https://www.rdkit.org
  9. Harris Drucker et. al., Support Vector Regression Machines, Advanced in Neural Information Processing Systems 9, 1996, 155-161.
    C. E. Rasmussen, C. K. I. Williams, Gaussian processes for machine learning 2016, The MIT Press, ISBN 026218253X.
  10. L. Breiman, Random Forests, Machine Learning, 2001, 45, 5-32.
  11. F. Rosenblatt, Principles of Neurodynamics: Perceptrons and the Theory of Brain Mechanisms, Washington: Spartan Books, 1962.