Transformer-Fused Hybrid Descriptors for Remote Sensing Scene Classification, Integrating Texture-Morphology Features with EfficientNetV2 Semantic Embeddings on MLRSNet
Cheruku Bujji Babu · Gurumurthy Hari Krishnan
提出Transformer融合手工纹理形态特征与EfficientNetV2深度特征的遥感场景分类模
LBP、GLCM与形态特征结合EfficientNetV2-B0,用多头自注意力
平均五折准确率达99.98%,融合机制显著提升相似地物类间区分能力。
可探索轻量化融合与跨数据集泛化,并迁移至作物精细分类与长时序LULC监测。
方法新颖、数据规模大且精度极高,但属遥感场景分类的通用技术论文,对农业信息化的直接产业影响有限,可作为技术前沿收录。
遥感图像分类因类内差异大、类间相似度高以及空间复杂度高而成为一个难题。本文提出了一种新颖的Transformer融合混合特征学习模型,旨在有效结合手工特征与深度特征,实现精确的土地利用/土地覆盖(LULC)场景分类。在该模型中,纹理特征采用局部二值模式(LBP)和灰度共生矩阵(GLCM)特征表示,形态区域特征则为场景表征提供形状信息。同时,深度语义特征从EfficientNetV2-B0中学习获得。为有效融合这些特征,本文提出了一种新颖的多头自注意力融合机制,用于学习纹理、形态和语义特征之间的显式特征依赖关系,从而获得紧凑且具有判别力的特征表示。实验评估使用完整的MLRSNet数据集,包含全部46个场景类别和46,000幅图像,每类选取1,000幅图像以确保均衡且全面的实验设置。所提框架实现了99.98%的平均五折准确率,在完整的多类别且视觉相似的遥感场景集上展现出高度一致的学习性能。在相同实验设置下与已有预训练CNN和基于Transformer的模型进行对比评估,并结合逐组件消融分析,进一步验证了手工描述符、EfficientNetV2语义嵌入和Transformer引导融合机制的贡献。该融合方法有效提升了视觉相似LULC类别间的类间判别能力,是从遥感图像进行大规模LULC制图、城市增长分析、环境监测等的有力工具。