QDπ数据集,对类似药物分子和生物聚合物碎片及其相互作用的训练数据
Jinzhe Zeng1, Timothy J Giese1, Andreas W Götz2
1Laboratory for Biomolecular Simulation Research, Institute for Quantitative Biomedicine, and Department of Chemistry and Chemical Biology, Rutgers University, Piscataway, NJ, 08854-8087, USA.
Scientific data
|April 25, 2025
概括
我们开发了QDπ数据集,这是一个由160万个分子结构组成的多样化数据集,用于训练用于药物发现的通用机器学习潜力 (MLP). 这一数据集有助于为小型有机分子开发精确的MLP.
科学领域:
- 计算化学的计算化学
- 机器学习 机器学习
- 药物发现 药物发现 药物发现
背景情况:
- 开发有机分子的通用机器学习潜力 (MLP) 需要广泛而准确的数据集,涵盖各种化学空间.
- 现有的数据集往往缺乏必要的多样性,并且可能是有效的神经网络训练的冗余.
研究的目的:
- 介绍QDπ数据集,这是一个策划资源,旨在促进药物发现的通用MLP的开发.
- 提高分子建模的化学信息密度和训练数据的多样性.
主要方法:
- 通过整合来自多个来源的数据构建了QDπ数据集.
- 采用了每个委员会查询的积极学习策略来选择多样化和非冗余的分子结构.
- 在 ωB97M-D3(BJ) /def2-TZVPPD 理论层面计算了分子特性.
主要成果:
- QDπ数据集包括160万个结构,捕捉了13个元素的化学多样性.
- 能够实现灵活的目标损失功能,用于药物发现中的神经网络训练.
- 包括关于形态能量,分子间相互作用,体和质子能量的信息.
结论:
- QDπ数据集是推动药物发现中的通用MLP的宝贵资源.
- 它的高化学信息密度和多样性将加速分子行为预测模型的开发.
- 促进制造更准确和多功能机器学习模型用于制药研究.
更多相关视频
08:31Biosensor-based High Throughput Biopanning and Bioinformatics Analysis Strategy for the Global Validation of Drug-protein Interactions
Published on: December 1, 2020
4.9K
10:29Quantitative Structure-Activity Relationship, Activity Prediction, and Molecular Dynamics of Non-nucleotide Reverse Transcriptase Inhibitors
Published on: May 9, 2025
108
