基于机器学习的矩阵特定PFAS来源分配模型:识别土壤和水系统中的差异指标
Jin-Kyung Hong1, Sungjik Oh2, Tae Kwon Lee3
1Department of Environment and Energy Engineering, Chnonnam National University, Gwangju, 61186, Republic of Korea.
Environmental research
|July 12, 2025
概括
新的机器学习模型能够准确地识别土壤和水中的多基物质 (PFAS) 的来源. 这种特定于矩阵的方法简化了PFAS来源跟踪,并通过识别关键指标化合物来降低分析成本.
科学领域:
- 环境化学环境化学
- 环境科学 环境科学
- 毒理学 毒理学 毒理学
背景情况:
- 聚甲基物质 (PFAS) 是持久性环境污染物,具有显著的人类健康风险.
- 目前的PFAS源分配方法由于广泛的数据要求和忽视矩阵特定行为的原因,成本昂贵且容易出现错误.
研究的目的:
- 开发和验证特定于矩阵的机器学习分类器,用于在土壤和水中区分PFAS来源 (水性薄膜形成泡[AFFF]与非AFFF).
- 为了确定PFAS指标的关键化合物,以有效地跟踪来源并减少分析负担.
主要方法:
- 从同行评审文献 (2012-2024) 中编制了PFAS度的综合数据集,用于土壤,水和AFFF配方.
- 通过H2O.AutoML应用了15个分类算法,对12个遗留的PFAS化合物的日志转换度进行了分析.
- 利用特征重要性分析和逐步变量减小来确定最佳指标化合物并评估模型性能.
主要成果:
- 最佳水模型 (梯度增强机) 实现了AUC 0.9864;最佳土壤模型 (分布式随机森林) 实现了AUC 0.9936.
- 特性重要性确定了PFOS,PFHxS和PFPeS作为关键水指标,PFHxS,PFPeA和PFOS作为关键土壤指标.
- 源分配精度>0.92,在水中的PFAS只有9个,在土壤中的PFAS只有6个,大大减少了数据需求.
结论:
- 特定于矩阵的机器学习模型提供了在土壤和水中准确和高效的PFAS来源分配.
- 识别关键的"哨兵"PFAS指标可以大幅减少分析要求,而不会影响分类性能.
- 这种方法增强了法医来源追踪,并为更有效的环境修复策略提供了信息.


