如何小是足够大的? 大数据驱动的机器学习预测对于一个全面的废水处理厂
Yanyan Ma1, Yiheng Qiao1, Mengxue Chen2
1State Key Laboratory of Pollution Control and Resource Reuse, School of Environment, Nanjing University, Nanjing 210023, China.
Water research
|December 31, 2024
概括
在废水处理厂 (WWTP) 中,优化机器学习 (ML) 的数据量是关键. 这项研究表明,更大的数据集并不总是改善 ML 模型的性能,用于预测操作和生物参数.
科学领域:
- 环境工程 环境工程
- 数据科学数据科学数据科学
- 微生物学 微生物学
背景情况:
- 污水处理厂 (WWTP) 产生大量的数据,这些数据对管理至关重要.
- 机器学习 (ML) 提供了利用大数据改善WWTP操作的潜力.
- 在WWTP中有效应用ML的最佳数据量尚未确定,这会影响成本和效率.
研究的目的:
- 分析数据量和收集频率对WWTP中的ML模型性能的影响.
- 确定是否需要更大的数据集和更小的收集间隔来进行准确的预测.
- 为优化WWTP数据管理提供见解.
主要方法:
- 从970天的WWTP中获得的水质,运营和生物数据的全面分析.
- 开发和评估ML模型以预测操作参数 (溶解氧,废水化学氧气需求) 和细菌丰度.
- 评估模型性能与不同的数据量和收集间隔.
主要成果:
- ML模型成功预测了操作参数和功能细菌丰度.
- 增加的数据量并没有持续提高模型性能.
- 适度的数据收集间隔产生了可靠的预测,这表明较小的间隔并不总是必要的.
结论:
- 在WWTP中,对于有效的ML预测,可能不需要过大的数据集.
- 优化数据集大小对于平衡计算效率和预测准确度至关重要.
- 研究结果提供了有价值的数据管理策略,以提高WWTP的运营效率和可持续性.
更多相关视频
08:49Vegetated Treatment Systems for Removing Contaminants Associated with Surface Water Toxicity in Agriculture and Urban Runoff
Published on: May 15, 2017
10.5K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
相关概念视频
Typical Model Studies
340
Fluid mechanics model studies often utilize scaled-down systems to predict fluid behavior in full-scale environments, such as river flows, dam spillways, and structures interacting with open surfaces. Maintaining Froude number similarity in river models is crucial, as it replicates surface flow features like wave patterns and velocities.
340
Design Example: Creating a Hydraulic Model of a Dam Spillway
122
Scaled hydraulic models of dam spillways provide a practical way to replicate and study the intricate flow dynamics of these structures. Often built to a 1:15 ratio, these models allow for observing critical water behavior, such as velocity distribution, flow patterns, and energy dissipation.
122
