Machine learning models combined with feature importance methods for honey yield classification: A replicable approach
Roberto Ahumada‐García · David Zabala‐Blanco · Víctor Hugo Monzón 等 10 人
构建可复现工作流,用气候变量与机器学习分类蜂蜜产量。
开放数据库、特征重要性/SHAP、9种ML模型、SMOTE与投票集成。
降雨是最重要变量;SVM准确率0.80,集成后达0.82。
可扩展至多源物联网数据与实时预测,开发养蜂决策支持工具。
该论文提出可复现的机器学习工作流,结合开放数据集与可解释性方法预测蜂蜜产量,方法新颖、结论可靠,对养蜂业数字化规划有参考价值。
养蜂人需要借助机器学习和物联网等现代技术支持的规划工具,以应对蜂蜜产量下降和波动等农业挑战。为确保可复现性,本文提出了一套研究流程:首先构建一个开放获取数据库,该数据库基于年度生产记录和气候变量(温度和降雨量)开发,并整合了数据构建、可解释性分析和模型评估。随后,应用特征重要性方法和可解释性技术,如特征重要性、随机森林中各特征的深度频率以及Shapley加性解释方法。最后,评估多种机器学习方法用于蜂蜜产量预测:逻辑回归、k近邻、支持向量机、决策树、多层感知机、随机森林、线性判别分析、梯度提升和朴素贝叶斯。这些算法在以下方面进行比较:(1)基线模型,即未进行超参数优化的模型,采用留一交叉验证和分层10折交叉验证;(2)基线加归一化/标准化(最大值除法、最小-最大和z-score);(3)第2点配置加装袋法;(4)使用SMOTE评估数据增强和类别平衡策略,并结合投票分类器进行模型组合。结果表明,降雨量是蜂蜜产量预测中最重要的变量之一。通过选择特定特征,模型在某些情况下性能得到提升,或性能未显著下降。最小-最大和z-score方法使部分算法的预测效果得到改善;例如,支持向量机达到了0.80的准确率,而参考研究中基于随机森林的准确率为0.67,提升了13个百分点。最后,使用KNN和SVM等算法结合装袋技术、SMOTE过采样和投票分类器,可以达到0.82的准确率。总体而言,本研究提出了一套可复现的、基于数据挖掘的工作流程,整合了机器学习技术以从气候变量预测蜂蜜产量,包括使用开放获取数据集、可解释性分析以及机器学习模型的比较评估,为养蜂领域未来分析和规划工具的开发做出了贡献。