A multi-agent multi-modal LLM with Monte Carlo tree search for interpretable plant disease classification
Ridong Wu · Hua Zou · Zhijie Li 等 5 人
提出多智能体多模态LLM结合蒙特卡洛树搜索,实现可解释的植物病害分类。
MCTS引导多智能体生成区域描述文本,构建复杂多模态信息并自训练优化。
分类准确率大幅提升,如马铃薯三分类从0.6701升至0.9965,并提供推理链。
可探索将MCTS多智能体框架迁移至其他作物病害或田间复杂场景,提升可解释性与泛化性。
提出多智能体+MCTS+多模态增强的可解释植物病害分类框架,准确率大幅提升,方法新颖且结论可靠,对智慧农业AI应用有参考价值。
在植物病害分类任务中,现有的植物病害分类专用模型通常通过采用定制化的网络架构来实现高准确率。然而,这些模型无法提供推理链,这降低了可解释性,并在实际应用中削弱了可信度。此外,尽管多模态大语言模型(MLLMs)在智慧农业领域取得了显著进展,但由于领域知识不足,其病害分类准确率仍落后于专用模型。虽然微调可以增强领域特定知识,但仅依赖单模态数据或简单的多模态信息仍不足以充分提升分类准确率。具体而言,此处的简单多模态信息是指MLLM对整个图像生成的单一全局描述。为解决上述问题,本文提出了一种融合蒙特卡洛树搜索(MCTS)与多模态增强的多智能体协同分类框架。该框架以MLLM为核心,首先引入MCTS引导的多智能体协同机制,引导各智能体逐步生成区域特定的描述性文本信息,这些信息与图像共同构成复杂的多模态信息,从而提升分类性能。同时,利用MCTS生成的搜索轨迹构建推理过程,以增强可解释性。最后,采用自训练机制迭代优化模型,进一步提升整体性能。实验结果表明,该框架在提升基线MLLM准确率的同时提供了可解释的推理链,在三分类马铃薯上从0.6701提升至0.9965,在五分类马铃薯上从0.5340提升至0.9651,在番茄上从0.5387提升至0.9467,在葡萄上从0.4705提升至0.9948。