arXiv | 2026-09-08·9月8日 · 周二论文农业人工智能与决策模型阅读 0

[预印本]Vision-language models know more about agriculture than they show and rubric-grounded verifications close the gap

论文解读
77精选
速览

构建农业图像基准,发现视觉语言模型已编码农业特征,但输出未充分体现。

方法

116个数据集、8324张图像基准测试,用PPT验证器做结构化测试时推理。

发现

PPT评判F1近两倍于下限,Gemma 4病害F1达0.71,但置信度与正确性负相关。

机会点

可研究农业VLM置信度校准与不确定性量化,提升病害诊断可靠性。

影响力18
信息增量22
专业深度18
信源权威13
时效性6

预印本以116数据集、8324张图像的规模系统评测农业视觉语言模型,并提出PPT验证器显著提升病害识别F1,方法新颖、数据扎实,对农业AI落地有参考价值,但尚未经同行评审。

原文摘要

arXiv 2609.09417(2026-09-08)。基于116个数据集、834个类别、8324张图像基准测试,发现VLM视觉编码器已能编码与DINOv3基线相当可分离性的农业特征;通过Probabilistic Pivot Tournament(PPT)验证器结构化测试时推理,评判F1近两倍于下限,其中Gemma 4 E4B-it's病害F1达0.71,高于其自身上限0.60。但置信度分数与正确性负相关。

信源(1 个)