对于实验生化学家和其他分子科学家来说,开始使用机器学习
Matthew J K Vince1,2, Kristin A Hughes1,2, Anastasiya Buzuk1,2
1Department of Chemistry, Boston University, Boston, Massachusetts.
Current protocols
|April 21, 2025
概括
本研究为实验科学家介绍了可访问的协议,以便在分子科学中应用机器学习 (ML) 方法,如聚类和主要组件分析 (PCA). 这些指南使没有编码背景的研究人员能够利用ML进行数据分析和实验设计.
科学领域:
- 实验分子科学实验分子科学
- 生物化学 生化学
- 细胞生物学 细胞生物学
- 药物发现 药物发现
背景情况:
- 机器学习 (ML) 对于分析实验科学中的复杂数据越来越重要.
- 从历史上看,ML需要专门的统计或化学信息学培训,这限制了许多科学家的可访问性.
- 越来越需要民主化机器学习工具,以便实验研究人员更广泛地采用.
研究的目的:
- 为四种关键的ML方法提供可访问的,逐步的协议:等级聚类,主要组件分析 (PCA),部分最小方程差异分析 (PLSDA) 和部分最小方程回归 (PLSR).
- 降低缺乏计算机科学或统计学背景的实验科学家的进入障碍.
- 为了使研究人员能够有效地使用ML进行实验设计,假设测试和数据分析.
主要方法:
- 使用MATLAB进行层次聚类,PCA,PLSDA和PLSR的详细协议.
- 针对没有ML或编码经验的用户量身定制的解释.
- 关于数据选择,缩放和将方法与科学问题保持一致的指导.
主要成果:
- 这些协议的设计是为了方便使用,不需要先前的 MATLAB 或编码知识.
- 重点是理解科学调查与适当的ML方法论之间的关系.
- 涵盖的方法特别适用于生物化学,细胞生物学和药物发现的应用.
结论:
- 实验科学家现在可以很容易地将强大的ML技术应用于他们的研究.
- 这些协议促进了基于数据的假设测试和分子科学中的实验设计.
- 扩大对机器学习的获取能力使化学生物学,化学和生物医学领域的新一代研究人员有能力.


