相关实验视频
Updated: Jun 26, 2025

05:07
Assessing the Particulate Matter Removal Abilities of Tree Leaves
Published on: October 7, 2018
6.8K
用机器学习进行估计来取代PM2.5组成部分的缺失值,是否比排除或中位数替换更好地进行源分配?
Youngkwon Kim1, Seung-Muk Yi2, Jongbae Heo3
1Department of Environmental Health Sciences, Graduate School of Public Health, Seoul National University, 1 Gwanak-ro, Gwanak-gu, Seoul, 08826, Republic of Korea.
Environmental pollution (Barking, Essex : 1987)
|May 17, 2024
概括
机器学习有效地估计了缺少的碳物种数据,用于改进细颗粒物 (PM2.5) 源分配. 然而,其他化学物种需要进一步提高ML准确性,以减少分配偏差.
科学领域:
- 环境科学 环境科学
- 大气化学 大气化学
- 数据科学数据科学数据科学
背景情况:
- 细颗粒物 (PM2.5) 的来源分配对于东亚的空气质量管理至关重要.
- 来自监测站点的PM2.5成分度缺失的数据可能会影响传统的正矩阵因子化 (PMF) 分析.
- 传统的方法,如数据排除或中位数替换,在来源贡献估计中引入了重大错误.
研究的目的:
- 评估机器学习 (ML) 在估计缺少的PM2.5数据的来源分配方面的有效性.
- 将ML输入数据的准确性与PMF分析的传统方法进行比较.
- 为了确定哪些化学物种的缺失数据可以通过ML可靠地估计,以最大限度地减少偏差.
主要方法:
- 使用随机森林ML模型,利用气象和气体污染物数据估计缺少的PM2.5成分数据.
- 在数据集上进行PMF分析,数据集中缺失了ML计算的值,并将结果与完整的数据集进行了比较.
- 计算出来源贡献中的百分比错误,以评估不同化学物种的ML归算的影响.
主要成果:
- 对于碳物种,ML归算获得了高精度 (r2=0.874),但对于离子物种和微量元素,精度较低 (r2=0.631).
- 将缺失的碳物种数据归入,将来源贡献误差降低到平均2.0%.
- 将其他物种归咎于错误增加 (平均9.7%),离子物种和微量元素显示最大的错误 (平均37%).
结论:
- 基于ML的归算在涉及缺失的碳物种数据时有效改善PM2.5来源分配.
- 排除离子物种和微量元素的数据,而不是以当前的ML准确度计算,与中位数替换相比,错误率更低 (7.4%).
- 提高对更广泛的化学物种的ML模型准确性是必要的,以完全减轻PM2.5来源分配中的偏差.

