通过使用包装损失和神经网络减轻年度数据漂移来提高PM2.5预测
Md Khalid Hossen1,2,3, Yan-Tsung Peng2, Meng Chang Chen3
1Social Networks and Human-Centered Computing, Taiwan International Graduate Program, Academia Sinca, Taipei, Taiwan.
PloS one
|February 11, 2025
概括
本研究通过分析年度温度数据并提出PM2.5预测的新模型来解决深度学习中的数据漂移问题. 新的前载和后载连接模型显著提高了预测准确性,超过了传统的神经网络.
科学领域:
- 环境科学 环境科学
- 数据科学数据科学数据科学
- 气象学 天气学
背景情况:
- 深度学习模型通常假定训练数据来自单个分布,这对于现实数据并不总是如此.
- 随着时间的推移或从不同的环境中收集的数据可能会出现分布变化,影响模型性能.
- 年度温度变化和空气质量数据 (PM2.5) 是这种上下文依赖的数据漂移的例子.
研究的目的:
- 分析气象和空气质量数据集中的数据漂移现象.
- 开发和评估用于PM2.5预测的新型深度学习模型,以解释数据漂移.
- 将拟议模型的性能与现有的深度学习架构进行比较.
主要方法:
- 使用了三种统计技术来计算P值,以识别年度站数据 (2014-2018) 中的数据漂移.
- 提出了两种模型,前载连接 (FLC) 和后载连接 (BLC),旨在处理数据漂移特征.
- 整合了封装损失功能,以进一步提高模型训练和准确性.
- 使用根平均平方误差 (RMSE),平均绝对误差 (MAE) 和平均绝对百分比误差 (MAPE) 评估模型性能.
主要成果:
- 统计分析确定了有显著数据漂移的站点.
- 与基线BiLSTM和CNN模型相比,拟的FLC和BLC模型在PM2.5预测方面表现优越.
- 在FLC/BLC和BiLSTM之间,FLC/BLC的性能提升幅度从24.1%到16%和12%到8.3%不等.
- 与CNN相比,FLC/BLC的改善率为24.6%至11.8%,FLC/BLC的改善率为10%至10.2%.
结论:
- 数据漂移是深度学习中的一个关键问题,用于时间序列数据,如PM2.5.5.
- 拟议的FLC和BLC模型有效地解决了数据漂移,从而更准确地预测PM2.5.
- 包装损失函数进一步提高了模型的稳定性和准确性,在数据漂移的情况下.


