From patterns to prediction: detecting crop sequence and interpreting crop selection with explainable AI at field level in Denmark
João G. Serra · Edwin Haas · Diego Ábalos 等 12 人
用丹麦十年田块数据识别轮作模式并预测年度作物选择。
60万田块年数据,启发式序列检测+LightGBM/TabNet,SHAP解释。
作物序列以谷物为主、多样化低;作物选择主要由前茬和农场类型决定。
可结合可解释AI生成区域化可行轮作方案,替代脱离实际的标准化轮作假设。
基于丹麦十年全国田块数据,用可解释AI预测作物选择,方法新颖、数据规模大,对农业信息化与轮作模拟有参考价值。
背景 作物序列对可持续农业至关重要,但我们对它们在单个田块中如何重复出现,以及哪些信息最能预测每年种植的作物知之甚少。丹麦的国家田块记录使这两个问题得以在长时间尺度上加以考察。 目标 我们识别了丹麦全国范围内重复出现的作物序列,并检验了年度作物科选择能在多大程度上由作物历史、农场特征、管理、价格、土壤和气候来预测。 方法 利用10年(2011−2020年)的国家田块级作物数据(每年约60万块田),我们开发了一种启发式算法来检测重复出现的作物序列模式。随后,我们训练了机器学习(LightGBM)和深度学习(TabNet)模型,基于前茬作物以及滞后的管理和农场结构预测因子及土壤气候条件来预测年度作物选择。模型通过前向链式验证和时间留出测试进行评估,并使用SHAP值考察LightGBM如何利用每个预测因子。 结果与讨论 作物序列在很大程度上以谷类作物为主,即使在较长的序列中也几乎没有多样化。作物选择模式与前茬作物和农场类型密切相关,而土壤气候条件和先前管理的作用较小。深度学习模型取得了略高的总体准确率,尤其是在优势作物上,而机器学习模型在不同作物之间提供了更均衡的表现,并可通过SHAP进行解释。 意义 该分析区分了两个不同的任务:识别多年作物序列和预测每年种植的作物科。序列分析表明,为什么不能仅凭序列长度或作物计数来评估多样化。预测模型有助于为农业环境模拟生成局部合理的序列,减少对不能很好反映观测田块历史的标准轮作方式的依赖。