bioRxiv (Cold Spring Harbor Laboratory)·9月10日 · 周四论文农业遥感与作物表型阅读 0

Vision Transformers Enable Advanced Plant Phenotyping in Controlled Environments

Janou Milligan · Anand Seethepalli · Aristeidis Tsaris 等 6 人

bioRxiv (Cold Spring Harbor Laboratory)DOI 10.64898/2026.09.04.748299
论文解读
79精选
速览

比较阈值法、U-Net和预训练ViT在植物分割中的跨物种泛化能力。

方法

使用ORNL表型实验室图像,对比阈值法、U-Net和微调ViT的分割性能。

发现

预训练ViT在未见物种上Dice达95.7,显著优于U-Net的86.2和阈值法的56.5。

机会点

可探索预训练ViT在田间复杂场景的跨物种泛化,并降低微调数据需求。

影响力18
信息增量22
专业深度18
信源权威13
时效性8

预训练视觉Transformer在跨物种植物分割上显著优于U-Net与阈值法,为受控环境高通量表型提供可复用基准,方法新颖、数据扎实,值得入选。

原文摘要

在高通量表型分析中,可靠的植物分割必须能够在不同物种和成像条件之间迁移,而无需重复调整模型或进行大量重新标注。我们利用橡树岭国家实验室先进植物表型实验室的图像,比较了三种分割策略:(i)基于颜色的固定阈值法,(ii)从零开始训练的有监督U-Net,以及(iii)针对二值分割进行微调的预训练视觉Transformer。模型在留出测试集和包含未见物种的泛化集上进行了评估。在留出测试集上,阈值法、最佳U-Net和最佳视觉Transformer的平均Dice分数分别为58.3、96.6和97.3。在泛化集上,相应的Dice分数分别为56.5、86.2和95.7。阈值法在某些数据集上仍然有效,但当植物外观发生变化时则失效。有监督U-Net训练解决了分布内误差,但未能泛化到新物种和背景。预训练视觉Transformer在所评估的物种、视角、土壤背景和托盘类型上始终产生高精度分割。这些结果基准了受控环境植物表型分析中从固定规则到任务特定监督再到预训练视觉表示的实际进展。