解决机器学习研究中的数据处理缺陷 关于重金属修复生物炭的机器学习研究
Destika Cahyana1, Ho Jun Jang2
1Research Center for Food Crops, Research Organization for Agriculture and Food, National Research and Innovation Agency (BRIN), Indonesia.
Journal of hazardous materials
|March 13, 2025
概括
机器学习 (ML) 显示了使用生物炭吸附重金属的环境修复的希望. 然而,数据泄漏和不当分割等数据问题可能会扭曲结果,需要更好的数据管理来实现可靠的机器学习应用.
科学领域:
- 环境科学 环境科学
- 数据科学数据科学数据科学
背景情况:
- 机器学习 (ML) 应用在环境科学中正在扩大,特别是在土壤和水资源修复方面.
- 生物炭越来越多地研究重金属吸附,ML提供了优化潜力.
研究的目的:
- 审查ML在优化生物炭重金属吸附方面的应用.
- 识别和解决ML环境研究中的数据处理缺陷,特别是数据泄露和不正确的数据分割.
- 提出方法来提高数据完整性和ML模型在环境修复中的通用性.
主要方法:
- 对最近使用ML用于基于生物炭的重金属吸附的研究进行文献综述.
- 分析环境科学中的数据特征,包括由于实验分组而导致的非独立性.
- 讨论机器学习应用中的数据完整性和代表性挑战.
主要成果:
- 确定了关键数据处理问题 (泄漏,不当分割),这些问题影响了环境科学中的ML可靠性.
- 突出了实验组内数据点的非独立性,影响了模型的概括性.
- 强调在基于机器学习的环境研究中需要严格的数据管理实践.
结论:
- 解决数据泄漏和不适当的分割对于环境修复中的强大的ML应用至关重要.
- 改进的数据管理实践将提高基于生物炭的重金属吸附的ML模型的可靠性和适用性.
- 未来的研究应该专注于开发和实施严格的数据处理策略,以获得可靠的ML驱动的环境解决方案.


