对近期的深度学习化学语言模型进行系统审查
Hector Flores-Hernandez1, Emmanuel Martinez-Ledesma2,3
1Tecnológico de Monterrey, School of Engineering and Sciences, Monterrey, 64710, Nuevo León, México.
Journal of cheminformatics
|November 19, 2024
概括
深度学习通过分析分子数据来加速化学化合物发现. 本综述将分子生成的深度学习策略进行统计比较,强调化学语言模型中的挑战和机遇.
科学领域:
- 计算化学计算化学
- 人工智能的人工智能
- 材料科学 材料科学 材料科学
背景情况:
- 发现新的化学化合物是资源密集的.
- 深度学习通过分析分子数据改变了分子设计.
- 为了探索化学空间和生成特定化合物,存在各种深度学习策略.
研究的目的:
- 系统地审查和统计比较分子生成的深度学习策略.
- 分析化学语言模型和分子图表表示.
- 识别该领域的挑战,优势和机会.
主要方法:
- 系统的文献审查来自Scopus和Web of Science的72篇文章.
- 分析深度学习架构,包括变压器,RNN,GAN,S4和VAE.
- 使用MOSES或Guacamol指标进行统计比较,重点关注分子表示,数据库和模型性能.
主要成果:
- 62篇文章集中在化学语言模型上,10篇关于分子图表表示.
- 变压器,RNN,GAN,S4和VAE都是关键的架构.
- 转移学习,强化学习和条件学习是偏见生成的常见技术.
结论:
- 深度学习显著减少了分子发现的时间和资源.
- 该审查提供了对当前战略及其有效性的统计见解.
- 未来发展的关键领域包括分子表示,数据集优化和性能权衡.


