机器学习用于RPLC/HRMS非目标化工作流中的增强识别概率
Hiu-Lok Ngan1, Viktoriia Turkina2, Denice van Herwerden2
1State Key Laboratory of Environmental and Biological Analysis, Department of Chemistry, Hong Kong Baptist University, Kowloon, Hong Kong 999077 P. R. China.
Analytical chemistry
|August 12, 2025
概括
本研究引入了一种机器学习方法,使用预测的保留时间指数来改善基于HRMS的非目标分析中的化学物质识别. 该方法显著提高了复杂样本中农药的识别概率.
科学领域:
- 分析化学 分析化学
- 质谱测量质量谱测量
- 机器学习 机器学习
背景情况:
- 基于高分辨率质谱 (HRMS) 的非目标分析 (NTA) 在很大程度上依赖于光谱匹配来进行化学识别,特别是在没有保留数据的情况下.
- 准确的化学识别对于解释各种科学领域的复杂样品成分至关重要.
研究的目的:
- 开发和验证一种基于机器学习 (ML) 的新型方法,以提高基于HRMS的NTA中的化学识别概率 (IP).
- 利用从分子指纹和累积中性损失中获得的预测保留时间指数 (RTIs) 来提高光谱匹配精度.
主要方法:
- 开发了三个ML模型:分子指纹 (MF) 到RTI,累积中性损失 (CNL) 到RTI,以及真正/负光谱匹配的二元分类模型.
- 在广泛的数据集上训练模型,包括校准和实验光谱,并使用独立的测试集进行验证.
- 整合预测的RTIs与光谱库搜索,并使用F1得分和马修斯相关系数等指标评估性能,以识别农药.
主要成果:
- 在MF和CNL衍生的RTI值之间的高相关性 (R2=0.96训练,0.88测试) 表明真正光谱匹配的误差减少.
- 在空白样本中,k-最近邻近算法获得了0.65的加权F1得分和0.30的MCC,用于在空白样本中识别农药 (1-1000ppb).
- 与图书馆单独匹配不同样本稀释量相比,平均农药IP增加了46.7-54.5%.
结论:
- 机器学习模型有效地预测RTIs,减少HRMS-NTA中的识别不确定性.
- 拟议的ML方法显著提高了化学识别的可靠性,特别是复杂矩阵中的农药.
- 这种方法为推进化学发现和分析科学中表征提供了强大的工具.
更多相关视频
07:34Large Scale Non-targeted Metabolomic Profiling of Serum by Ultra Performance Liquid Chromatography-Mass Spectrometry UPLC-MS
Published on: March 14, 2013
12.9K
09:04Identifying Per- and Polyfluorinated Chemical Species with a Combined Targeted and Non-Targeted-Screening High-Resolution Mass Spectrometry Workflow
Published on: April 18, 2019
12.6K
