从Sparse监管监测数据生成高空间分辨率的曝光估计
Yihui Ge1, Zhenchun Yang2, Yan Lin2
1Nicholas School of the Environment, Duke University, Durham, NC 27708, United States.
概括
这项研究使用低成本传感器改进了空气质量模型,以便在数据有限的地区更好地估计细颗粒物 (PM2.5). 改进的模型显示了更好的准确性和可比的健康结果关系.
科学领域:
- 环境科学 环境科学
- 数据科学数据科学数据科学
- 公共卫生 公共卫生
背景情况:
- 随机森林模型被广泛用于估计环境空气污染物度.
- 由于测量数据稀疏,模型准确性可能受到外推问题的限制.
- 在数据稀缺的地区提高模型性能对于准确的空气质量评估至关重要.
研究的目的:
- 开发和评估新的方法来提高随机森林模型的推断能力.
- 纳入低成本传感器数据,以提高PM2.5度估计在监测稀疏的地区.
- 为了评估使用尿中的1-基烯作为生物标志物的改进模型的性能.
主要方法:
- 开发了两种方法:两步向后选择和回归增强的随机森林方法.
- 从NAMS/SLAMS站点使用的每日PM2.5度作为响应变量.
- 集成的卫星,气象,土地利用和低成本传感器数据作为预测器.
主要成果:
- 两步方法改善了外部验证R2,从0.49降至0.65,并将RMSE从3.56降至2.96μg/m3.
- 通过回归增强的随机森林模型实现了0.54的外部验证R2和3.40μg/m3的RMSE.
- 这两种改进的模型都显示出与尿液中1-基烯水平的显著和可比关系.
结论:
- 拟议的策略有效地提高了随机森林模型在监测数据稀少的地区的推断能力.
- 纳入低成本传感器数据是改善空气污染物度估计的可行方法.
- 开发的PM2.5估计策略为数据有限的地区的环境健康研究提供了有价值的工具.


