Remote Sensing·9月10日 · 周四论文农业人工智能与决策模型阅读 0

Crop Yield Estimation with MODIS Derived Normalized Difference Vegetation Index and Comparative Study on Crop Yield Prediction Among Linear Regression, Random Forest and Gradient Boosting as Well as CatBoost

Kohei Arai · Sara Sanwal

论文解读
81精选
速览

用MODIS NDVI与四种回归模型预测印度各邦作物产量,并做全国尺度验证。

方法

MODIS NDVI时序、线性回归、随机森林、梯度提升、CatBoost及前向验

发现

随机森林最优(MAPE 11.4%),NDVI贡献主要增益,主粮误差低而小作物误差高。

机会点

可探索多源遥感与深度模型融合,并针对小作物和行政数据缺口改进预测。

影响力18
信息增量23
专业深度18
信源权威14
时效性8

基于MODIS NDVI与多种机器学习模型的作物产量预测研究,方法严谨、结论可靠,对农业遥感估产有实质参考价值。

原文摘要

本文介绍了一个机器学习系统的设计、开发与评估,该系统用于预测2000年至2026年间印度各邦的农作物产量,并辅以一项基于MODIS衍生的NDVI时间序列(MOD13A3.061植被指数月度L3全球1 km SIN网格)在全国尺度上对预测作物产量的验证。尽管此前已有许多研究采用线性回归、随机森林、梯度提升及相关方法进行作物产量预测,但针对预测作物产量的补充性、聚合层面的验证方法却鲜有提出。本文提出了这样一种方法,并辅以一种基于NDVI的粮食总产量估算方法。作物产量与MODIS衍生的NDVI高度相关(年最大NDVI的r = 0.84;年均NDVI的r = 0.78),仅以年最大NDVI对粮食总产量进行简单回归即可达到R² = 0.70。本文构建了四种建模方法——线性回归、随机森林、梯度提升和CatBoost——并采用保持时间顺序的扩展窗口前向验证程序进行比较,最终以2024—2026年作为未触碰的留出集,而非随机划分;一项配套的泄漏检查证实,报告产量与报告单产在代数上几乎完全相同,因此必须将其从特征集中排除。随机森林产生了最可靠且一致的预测,在最终留出集上达到平均绝对百分比误差(MAPE)为11.4%、R² = 0.982,优于CatBoost(MAPE = 11.6%,R² = 0.969)和梯度提升(MAPE = 13.0%,R² = 0.908),并大幅优于线性回归,后者未能泛化至留出期(R² = −10.67);然而在此留出集之前的各前向验证折中,三种树集成方法在统计上无法区分。一项四配置消融研究证实,大部分性能提升归因于纳入MODIS衍生的NDVI,而非仅归因于模型选择。预测误差因作物而异,主要粮食作物(水稻、小麦、玉米、甘蔗、绿豆)的MAPE低于10%,而若干低产量作物(大豆、大蒜、菽麻、烟草、马铃薯)的MAPE则远超80%。本文还记录了两项重要的数据质量发现——产量与单产之间近乎完美的代数关系,以及2020年结构性的行政报告缺口——并在结尾提出了未来研究方向。

信源(1 个)