Bulletin of the National Research Centre/Bulletin of the National Research Center·9月14日 · 周一论文农业人工智能与决策模型阅读 0

Evidence integrity and review utility in crop-image decision support: an audit-to-review framework for precision agriculture

Xin Li · Bojian Guo · A.Dzh. Kartanova

Bulletin of the National Research Centre/Bulletin of the National Research CenterDOI 10.1186/s42269-026-01492-x开放获取 PDF ↗
论文解读
77精选
速览

提出审计到评审框架,先固定证据身份再比较作物图像分类器,并关联预测不确定性与评审工作量。

方法

对7595个小麦叶片文件哈希去重,构建915内容五类任务,用分裂保形预测评估。

发现

基准解释对证据工作流规范远比对表示优化敏感,P0与P2宏F1差约15.7个百分点。

机会点

可将证据单元定义与评审效用纳入农业AI基准标准,并探索田间级验证与主动学习结合。

影响力15
信息增量22
专业深度18
信源权威13
时效性9

该论文提出面向作物图像决策支持的证据完整性审计框架,揭示基准测试中证据单元定义对性能评估的显著影响,方法新颖、数据规模较大,对农业AI模型评估具有参考价值,但属细分领域方法学研究,产业影响有限。

原文摘要

摘要 背景 当多个文件代表同一生物学证据或划分来源不明时,农业人工智能基准可能高估决策可靠性。我们评估了一个与分类器无关的“审计到复核”框架,该框架在模型比较前固定证据身份和角色来源,声明聚合估计目标,并将预测不确定性关联到复核工作量。一个包含7,595个文件的公开小麦叶片语料库经哈希处理得到5,118个唯一内容;资格标准定义了一个915个内容的五分类任务。将归档的文件级基准与三种冻结的近重复分组P2划分配置分离,并在划分加权和“一内容一权重”估计目标下评估了语义、纹理和融合表示。通过经验覆盖率、复核率、错误捕获率、复核产出率和无量纲复核效用评估分裂保形预测。结果 在遗留P0基准下,宏F1为0.962;仅语义P2为0.805 ± 0.030;直接融合为0.819 ± 0.029。描述性的P0-P2工作流敏感性差距约为15.7个百分点,而划分加权融合增量为1.4个百分点(95%自助法区间−0.006至0.036)。领先的融合相关变体在数值上接近,因此不声称推断性排序。在α = 0.10时,全局分裂保形预测实现了0.896的经验覆盖率,同时复核了20.8%的图像并捕获了51.4%的top-1错误;类条件Mondrian校准实现了0.923的覆盖率,同时复核了29.7%并捕获了64.8%的错误。结论 定义证据单元是作物图像基准统计规范的一部分,而不仅仅是数据清理步骤。在该语料库中,基准解释对证据-工作流规范的敏感性远高于对所评估表示改进的敏感性。该框架支持可审计的内部评估和复核分诊,但不能确立田间、农场级或干预性能。