超越总分:GWHD小麦头检测模型库中的国家域偏移分析

1 阅读

在农业人工智能领域,小麦头检测是精准农业和产量预测的关键技术。然而,模型在不同地理区域的表现差异往往被单一的聚合分数所掩盖。本文基于GWHD数据集,对9种目标检测模型进行了按国家划分的性能评估,揭示了域偏移对模型可靠性的深远影响。

gwhd_rfdetr-medium_showcase

背景与动机

此前,我们开源了一个包含YOLOv8、YOLOv11、YOLOv26和RF-DETR等9种模型的模型库,这些模型在GWHD 2021数据集上进行了微调。该数据集包含来自6个国家、18个研究机构的田间图像,旨在最大化基因型、生长阶段和成像条件的多样性。所有模型均采用统一的训练和评估流程,并发布了mAP、精确率、召回率等指标。

尽管聚合分数显示YOLOv11x以74.25%的mAP@50领先,但社区反馈指出,按国家或基因型划分的性能可能比聚合分数更能反映实际部署中的问题。因此,我们进行了这项后续分析,以评估模型在不同国家子集上的表现。

方法论

我们构建了一个图像清单,将测试集中的每张图像映射到其来源国家和生长阶段。这一映射并非原始GWHD发布的一部分,而是专门为此分析构建的。对于每个模型,我们使用相同的评估引擎,但将评估限制在特定国家的图像子集上。这样,按国家划分的结果与已发布的聚合分数直接可比。

测试集共包含1,381张图像,其中美国占43.8%,澳大利亚占20.3%,墨西哥占14.8%,中国占14.5%,日本占4.3%,苏丹占2.2%。这种不平衡对解释聚合分数至关重要。

结果:按国家的mAP@50

下表展示了各模型在不同国家子集上的mAP@50(完整结果见各模型卡):

模型 中国 苏丹 日本 墨西哥 澳大利亚 美国
YOLOv11x 92.36 73.01 69.97 77.92 69.28 70.42
YOLOv26m 88.99 66.42 66.21 71.47 70.30 66.40
YOLOv26s 90.76 69.65 67.18 70.73 66.99 65.43
YOLOv8m 89.49 72.49 65.96 72.68 68.99 60.85
YOLOv8s 89.21 71.88 67.41 71.27 63.67 62.88
YOLOv8n 88.87 69.19 62.35 70.65 62.26 58.95
RF-DETR Nano 79.78 61.42 61.07 54.51 35.40 58.70
RF-DETR Small 83.83 72.84 69.56 63.80 55.34 64.84
RF-DETR Medium 88.71 74.03 71.10 68.54 57.87 64.97

发现1:中国是所有模型表现最强的国家

所有9个模型,无论架构、大小或训练策略如何,在中国子集上均取得最高分(79.8-92.4% mAP@50)。这一结果并不意外,因为中国是数据集中较大且视觉上更一致的域之一(2个机构,200张图像),域内一致性使得评估相对容易。

发现2:YOLO和RF-DETR在表现最差的国家上存在分歧

观察每个模型表现最差的国家,我们发现:

  • 6个YOLO变体中有4个(YOLOv26s、YOLOv8m、YOLOv8s、YOLOv8n)在美国子集上表现最差,而美国占测试集的43.8%。这意味着这些模型的聚合分数主要受其表现最差的区域影响,而非“典型”国家表现。
  • 所有三个RF-DETR变体在澳大利亚子集上表现最差,这与大多数YOLO模型不同。

发现3:域偏移的鲁棒性与原始精度无关

YOLOv26m的国家间性能差距最小(22.8个百分点),尽管它不是总分最高的模型。相反,RF-DETR Nano的差距最大(44.4个百分点),其在中国和澳大利亚的表现差异巨大。这表明,对于RF-DETR Nano,部署图像的国家比模型选择更重要。

此外,YOLOv26s和YOLOv8m的聚合分数几乎相同(70.49% vs. 69.55%),但它们的国家间差距相差超过3个百分点。这进一步说明,聚合分数无法反映模型在不同域上的可靠性差异。

注意事项

  • 苏丹(30张)和日本(60张)的样本量较小,结果可能受少数图像影响,应谨慎解读。
  • 本分析仅按国家划分,未涉及基因型层面,因为元数据中缺乏基因型标签。
  • 生长阶段分层分析将在后续进行,需先解决元数据中的标签不一致问题。

资源与致谢

所有模型卡现已包含按国家性能的详细表格和原始结果文件。数据集和代码分别可在Hugging Face和GitHub上获取。感谢原始数据集作者和社区反馈,这项分析揭示了聚合分数无法体现的模型可靠性差异,为实际部署提供了重要指导。