将交叉验证引入现实世界,以评估基于卫星的植被模型的可转移性
Sean P Kearney1,2, David J Augustine3, Lauren M Porensky3
1Thunder Basin Grasslands Prairie Ecosystem Association, Wyoming, USA. sean.kearney@tbgpea.org.
Scientific reports
|February 16, 2026
概括
对于卫星植被模型的复杂机器学习算法 (MLA) 可能会高估准确性. 更简单的模型显示出更好的一致性,用于在新条件下的真实环境监测和预测.
科学领域:
- 生态生态学 生态生态学
- 遥感 遥感 遥感 遥感
- 机器学习 机器学习
背景情况:
- 使用卫星图像进行近实时植被测绘对于生态系统监测至关重要.
- 大数据集推动了对卫星植被模型的复杂机器学习算法 (MLA) 的使用.
研究的目的:
- 为了评估逐渐复杂的MLA的性能和可转移性,用于植被生物质估计.
- 为了比较卫星植被模型的不同交叉验证 (CV) 策略的有效性.
主要方法:
- 经过培训的MLA使用了十年的草生牧场生物质数据 (近10,000个样本).
- 在越来越多的推断交叉验证 (CV) 组中测试模型性能.
- 随机k-fold CV与更现实的预测任务进行比较,用于未见的年份.
主要成果:
- 模型性能显著下降,与更多的推断CV分组.
- 随机的k-fold CV产生了过于乐观的R2 (0.71-0.78) 与预测未见年相比 (R2:0.49-0.54).
- 简单的MLA,如部分最小平方回归,更一致,在推断任务中表现优于复杂的MLA.
结论:
- 随机的k-fold CV可能会为现实世界的卫星植被模型提供不切实际的准确性预期.
- 复杂的MLA可能在新的环境条件下表现不佳,可能导致预测错误.
- 更简单的MLA为推断植被监测应用提供了更大的一致性和可靠性.


