基于森林的土地利用回归模型,使用德国柏林的颗粒物传感器
Janani Venkatraman Jagatha1, Christoph Schneider1, Tobias Sauter1
1Geography Department, Humboldt-Universität zu Berlin, Unter den Linden 6, 10099 Berlin, Germany.
Sensors (Basel, Switzerland)
|July 13, 2024
概括
功能选择显著改善了用于预测颗粒物 (PM2.5) 度的机器学习模型. 优化的模型减少了错误,提高了可解释性,突出了关键的土地利用预测因素.
科学领域:
- 环境科学 环境科学
- 数据科学数据科学数据科学
- 大气科学 大气科学
背景情况:
- 机器学习 (ML) 模型对于使用空气质量传感器数据进行颗粒物 (PM2.5) 预测至关重要.
- 机器学习模型的"黑子"性质阻碍了对预测机制的理解,给数据质量和计算强度带来了挑战.
- 特性选择方法对于提高环境应用中的ML模型的可解释性和效率至关重要.
研究的目的:
- 采用特征选择技术,特别是递归特征消除和全球灵敏度分析 (GSA),以优化基于随机森林 (RF) 的土地利用回归模型,用于柏林的PM2.5预测.
- 用各种土地使用预测指标将节的射频模型的性能与基线模型进行比较.
- 确定影响PM2.5度的关键土地利用参数,并提高模型的解释性.
主要方法:
- 开发了一个基线RF土地利用回归模型,使用220个柏林预测因素.
- 实施了五种额外的模型:三种使用递归特征消除,两种使用基于Sobol的GSA.
- 使用诸如平均绝对误差 (MAE) 和根平均平方误差 (RMSE) 等指标与参考站数据进行模型性能比较.
主要成果:
- 功能消除将预测因素从220降至8个,而不会造成性能损失.
- 基于GSA的节模型显著超过了基线,将MAE从8.69降低到3.6μg/m3和RMSE从9.86降低到4.23μg/m3.
- GSA_parsimonious模型将R2从3%提高到17%,并预测了PM2.5与MAE<5μg/m3在12个参考位置中的10个.
结论:
- 特性选择,特别是GSA,提高了ML模型的性能,可解释性和PM2.5预测效率.
- 人口密度,叶面积指数和交通量被确定为主要的PM2.5预测因素.
- 虽然GSA_parsimonious模型在地方范围内有效地识别了指导性土地使用参数,但其不确定性限制了其在区域范围内的适用性.


