无描述符的深度学习QSAR模型用于人类等离子体中未结合的分数
Michael Riedl1, Sayak Mukherjee1, Mitch Gauthier1
1Battelle, Columbus, Ohio 43201, United States.
本研究引入了一种新的自然语言处理方法,用于定量结构-活性关系 (QSAR) 建模,绕过传统的化学描述符. 该方法有效地预测化学性质,如分数不结合,降低药物发现的计算成本.
科学领域:
- 计算化学是一种计算化学.
- 化学信息学 化学信息学
- 机器学习是机器学习.
背景情况:
- 量化结构-活动关系 (QSAR) 模型传统上依赖于化学描述符和机器学习.
- 现有的QSAR方法涉及描述符提取,子集选择和模型训练,这可能是计算密集的.
研究的目的:
- 开发一种新的QSAR框架,利用自然语言处理 (NLP) 来预测化学特异性参数.
- 通过利用NLP模型来规避明确化学描述器计算的需要.
主要方法:
- 采用了一种最先进的NLP模型,即来自变压器的双向编码器表示 (BERT).
- 利用简化的分子输入线输入系统 (SMILES) 字符串,通过两阶段的训练过程将它们嵌入到一个高维空间中:在掩盖的SMILES令牌任务上进行预训,并在QSAR预测任务上进行微调.
- 在ZINC 15数据集上预训练模型,以学习化学令牌关系.
主要成果:
- 通过NLP框架成功开发了人类血中未结合的分数 (fu) 的预测模型.
- 证明了该模型能够对多个QSAR终点重复使用预训练的嵌入,从而显著降低计算负担.
- 这种方法需要最小的领域专业知识,并显示了通用化的灵活性.
结论:
- 基于NLP的QSAR框架为传统方法提供了一个灵活且计算效率高的替代方案.
- 这种方法可以被通用化,以快速准确地估计各种吸收,分布,新陈代谢,分泌和毒性 (ADMET) 参数.
- 该方法有望加速药物发现和开发过程.
更多相关视频
11:25Multi-step Preparation Technique to Recover Multiple Metabolite Compound Classes for In-depth and Informative Metabolomic Analysis
Published on: July 11, 2014
15:27Determination of High-affinity Antibody-antigen Binding Kinetics Using Four Biosensor Platforms
Published on: April 17, 2017
相关概念视频
Drug Distribution: Plasma Protein Binding
Physiological Pharmacokinetic Models: Assumption with Protein Binding
Model-Independent Approaches for Pharmacokinetic Data: Noncompartmental Analysis
One important characteristic of noncompartmental analyses is that drug exposure increases proportionally with increasing doses. This...
Physiological Pharmacokinetic Models: Incorporating Hepatic Transporter-Mediated Clearance
A recent model describes pravastatin's hepatobiliary excretion,...
Three-Compartment Open Model
Nonlinear Pharmacokinetics: Bioavailability and Protein-Drug Binding
To quantify the extent of bioavailability, pharmacologists often use a parameter called .
