基于AutoEncoder的CatBoost模型的研究减少污染源分配的维度
1School of Mathematics and Information Science, North Minzu University, 750024, Yinchuan, People's Republic of China.
Environmental geochemistry and health
|November 2, 2025
概括
本研究引入了一种新的PCA-AE-CatBoost模型,用于准确的水污染源分配,其性能优于传统方法. 该模型精确识别和量化污染源,有助于有效的水质管理.
科学领域:
- 环境科学 环境科学
- 数据科学数据科学数据科学
- 水资源管理 水资源管理
背景情况:
- 水质数据是复杂的,高维的,非线性的.
- 传统的受体模型 (PCA,PMF,APCS-MLR) 难以处理这些数据特征,导致污染源的分配不准确.
- 异常值和缺失值进一步损害了传统模型的可靠性.
研究的目的:
- 为水质数据开发精确的污染源分配模型.
- 确定潜在污染源的数量,类型和贡献率.
- 克服传统受体模型在处理复杂的水质数据方面的局限性.
主要方法:
- 主要成分分析 (PCA) 用于确定污染源的数量.
- 自动编码器 (AE) 模型用于减小维度和识别污染源.
- CatBoost模型用于量化每个已识别来源的贡献率.
- 在海新河进行模型验证的案例研究.
主要成果:
- 确定了四种污染源类型:有机/家庭污水,工业,城市排水/土壤侵蚀和农业.
- 量化来源贡献:有机 (31.1%),工业 (21.5%),城市排水 (21.7%) 和农业 (25.7%).
- 在AE模型中实现了重建R2>0.95和MSE<0.05.
- CatBoost模型实现了R2>0.95和MSE<0.05用于贡献量化.
结论:
- 该PCA-AE-CatBoost模型为水污染控制提供了更准确的技术基础.
- 这种先进的模型在准确性和可靠性方面优于PCA-APCS-MLR和PCA-CatBoost模型.
- 这些发现为有针对性的水质管理策略提供了关键的见解.
