Multi-grained image-text retrieval in farmland remote sensing via multimodal large language models
KeJian Yu · Wentao Ma · Shichao Jin 等 8 人
提出农田遥感图文跨模态检索任务,构建数据集并提出FarmMGR框架实现语言驱动检索。
构建67,806图文对FRS-CMR数据集,用多粒度对齐与记忆增强对比学习。
FarmMGR平均召回率28.57%,优于现有图文检索方法,验证语言驱动农田遥感检索可行。
可探索多模态大模型生成数据的噪声校正、跨区域泛化及细粒度农田语义检索基准。
构建首个农田遥感跨模态检索数据集并提出多粒度对齐框架,方法新颖、数据规模可观,对语言驱动的精准农业监测有实质推动。
低空农田遥感(FRS)已成为精准农业监测的重要工具。然而,现有农田遥感方法主要针对预定义类别的分割任务设计,难以进行语义理解,也无法支持灵活的自然语言查询。为解决这一局限,我们引入了一项基于人工智能的任务——农田遥感跨模态检索,旨在利用文本描述从大规模遥感图像中检索目标农田区域。为支撑该任务,我们构建了首个农田遥感跨模态检索(FRS-CMR)数据集,包含67,806个通过多模态大语言模型生成并经专家精炼的图像-文本对。基于FRS-CMR,我们提出了面向农田的多粒度检索(FarmMGR)框架以实现图像-文本对齐。FarmMGR联合利用全局场景语义和局部区域级线索,以同时捕获大尺度景观格局和细粒度农田特征。为进一步提升语义对齐效果,我们设计了基于原型的语义对齐(PBSA)以缓解软正样本问题,全局语义层次特征融合(GSHFI)以自适应融合全局与局部表示,以及实例级语义关系建模(ISRM)以捕获农田实例间的关系依赖。此外,记忆增强跨模态对比学习(MECCL)扩大了负样本池并提升了表示判别能力。在FRS-CMR上的大量实验表明,FarmMGR取得了28.57%的平均召回率,优于现有图像-文本检索方法,证明了其在语言驱动农田遥感检索中的有效性。