在非目标代谢学中归咎或不归咎――这是构成问题
Dennis D Krutkin1,2, Sydney Thomas3, Simone Zuffa3,4
1School of Biological Sciences, University of California San Diego, La Jolla, California 92037, United States.
Journal of the American Society for Mass Spectrometry
|February 26, 2025
概括
使用k-最近邻居 (kNN) 和随机森林 (RF) 的代谢数据归算对于遗漏的非随机 (MNAR) 数据是不可靠的. 建议谨慎进行归算,特别是当缺失的数据类型未知时.
科学领域:
- 代谢学 代谢学 代谢学
- 生物信息学是一种生物信息学.
- 统计分析 统计分析
背景情况:
- 未定位的代谢学产生了大量数据集,缺少值,可能会导致结果偏差.
- 缺失的值可能来自生物或技术问题,影响统计有效性.
- 像kNN和RF这样的推算方法很常见,但它们的准确性取决于缺失的数据类型 (MCAR,MNAR).
研究的目的:
- 在不同程度和类型的代谢学缺失数据下,评估kNN和RF归算方法的准确性.
- 评估组合数据分析 (CoDA) 对数据解释的影响.
- 为在代谢学研究中谨慎使用归算提供指导.
主要方法:
- 使用了两个数据集:一个有针对性的代谢组数据集,带有尖端标准和一个非有针对性的代谢组数据集.
- 根据缺失数据的比例和类型 (MCAR,MNAR) 来评估kNN和RF归算的准确性.
- 研究了组成数据方法 (CoDA) 的影响,包括CLR转换.
主要成果:
- kNN和RF归算精度随着缺失数据比例的增加而下降.
- 这些归算方法无法准确处理MNAR数据,产生错误的值.
- 缺少数据的程度显著影响了归算准确性和随后的数据解释.
- 缺失值的存在和处理也影响了CoDA方法.
结论:
- 在代谢学中,应非常谨慎地使用kNN和RF等推算方法,特别是在MNAR数据中.
- 缺失数据的比例对归算可靠性和生物解释有很大影响.
- 研究人员必须在应用归算技术之前仔细考虑缺失的类型及其潜在影响.
更多相关视频
11:00Untargeted Metabolomics from Biological Sources Using Ultraperformance Liquid Chromatography-High Resolution Mass Spectrometry UPLC-HRMS
Published on: May 20, 2013
22.4K
05:35An Integrated Workflow of Identification and Quantification on FDR Control-Based Untargeted Metabolome
Published on: September 20, 2022
3.6K
