更多的数据总是更好吗? - 基于长期观察的藻类的机器学习预测
D Atton Beckmann1, M Werther2, E B Mackay3
1Biological and Environmental Sciences, School of Natural Sciences, University of Stirling, Stirling, United Kingdom.
Journal of environmental management
|December 3, 2024
概括
机器学习模型可以有效地预测藻类开花,如果有足够的数据. 五年的一致的监测数据,重点关注关键参数,可以为类似的湖泊提供可靠的短期藻类预测.
科学领域:
- 环境科学 环境科学
- 临界技术 临界技术
- 机器学习应用 机器学习应用
背景情况:
- 藻类繁殖对生态系统服务和健康构成风险.
- 有效的短期藻类预测对于缓解是至关重要的.
- 机器学习 (ML) 对藻类预测有希望.
研究的目的:
- 为了确定可靠的ML藻类预测所需的培训数据的数量.
- 评估训练数据持续时间对ML模型性能的影响.
- 为指导未来的监测策略和资源分配,以预测藻类繁殖.
主要方法:
- 利用了30年来每两周测量13个参数的英国湖泊.
- 训练了一种随机森林模型,以提前两周预测叶绿素a.
- 研究了训练数据持续时间和特征选择对模型性能的影响.
主要成果:
- 随机森林模型在经过四年的训练数据后表现优于基准.
- 随着五年多的数据,模型性能有所改善,但回报率正在下降.
- 使用重要特征的子集实现了可比或更好的性能.
- 减少采样频率对预测性能产生了负面影响.
结论:
- 大约五年来,对关键参数的持续,定期监测足以对类似湖泊的藻类进行短期预测.
- 这一发现证明了启动新的监测计划和利用现有的数据集是合理的.
- 优化的监测策略可以提高基于ML的藻类繁殖预测的可靠性.
更多相关视频
10:08Construction and Setup of a Bench-scale Algal Photosynthetic Bioreactor with Temperature, Light, and pH Monitoring for Kinetic Growth Tests
Published on: June 14, 2017
16.2K
08:41Microalgae Cultivation and Biomass Quantification in a Bench-Scale Photobioreactor with Corrosive Flue Gases
Published on: December 19, 2019
10.1K
