深度强化学习可以更好地控制虚拟选的基准偏差
Tao Shen1, Shan Li2, Xiang Simon Wang3
1State Key Laboratory of Bioactive Substance and Function of Natural Medicines, Institute of Materia Medica, Chinese Academy of Medical Sciences and Peking Union Medical College, Beijing, 100050, China.
Computers in biology and medicine
|February 25, 2024
概括
一个新的基准,MUBDsyn,使用合成诱和深度强化学习来减少虚拟选 (VS) 模型培训中的偏见. 这种先进的基准提供了对用于药物发现的机器学习模型的更可靠的评估.
科学领域:
- 计算化学和化学信息学
- 药物的发现和开发.
- 医学中的人工智能
背景情况:
- 虚拟查 (VS) 是现代药物发现的组成部分.
- 机器学习 (ML) 正在彻底改变VS,但面临着现有数据集的挑战.
- 当前的基准数据受限于有限的数据量,狭窄的应用领域和固有的偏见.
研究的目的:
- 介绍MUBDsyn,这是一个新的对VS的基准数据集.
- 通过结合合成诱来解决现有基准的局限性.
- 提供一个强大的平台来评估药物发现中的ML模型.
主要方法:
- 开发了MUBDsyn,使用合成诱 (假定是不活跃的).
- 在诱生成过程中使用深度强化学习来控制偏差.
- 进行了广泛的验证,将MUBDsyn与经典基准进行比较.
主要成果:
- MUBDsyn在控制域偏差,人工丰富偏差和模拟偏差方面表现出优越性.
- 使用MUBDsyn对ML模型的评估显示了偏差的减少,包括不对称的验证嵌入偏差.
- 与NRLiSt-BDB相比,MUBD提供了一个更具挑战性和有效的深度学习模型基准.
结论:
- MUBDsyn是虚拟选的一个近乎理想的基准.
- 该基准有效地减轻了传统数据集中存在的偏差.
- MUBDsyn有助于在药物发现中更准确,更可靠地评估ML模型.
- 对于MUBDsyn的计算工具是公开的.


