复杂场景不是“鸟种不够”这么简单
COCO 上从 N 升到 M,召回由 37.0% 增至 52.7%,但 M 对小鸟也只有 29.5%。更大模型能补回一部分目标,却无法替代高分辨率、小鸟样本和密集标注。
Local benchmark · Error analysis · 2026-07-21
同一套未经微调的 COCO 权重,在“真实复杂场景”和“干净单鸟图”上表现像两个模型。本报告从 5,919 张测试图和六组预测中逐图重算 TP、FP、FN,解释差异来自目标尺寸、密集实例、定位口径还是模型容量,并把结论转成可执行的数据集计划。
原始 COCO 模型已经能处理“主体明显的标准鸟图”,但真正的拍鸟场景瓶颈集中在小目标、密集鸟群、遮挡/异常姿态和框边界。YOLO26s 是下一轮微调的更合理起点;YOLO26m 应保留为上限对照,而不是默认生产模型。
COCO 上从 N 升到 M,召回由 37.0% 增至 52.7%,但 M 对小鸟也只有 29.5%。更大模型能补回一部分目标,却无法替代高分辨率、小鸟样本和密集标注。
有些是真背景误报,有些是同一只鸟的重复框,还有些是框到鸟体但与人工框 IoU 不足 0.5。三者分别对应 hard negative、NMS/标签一致性、定位训练,不能统统塞进“非鸟”类别。
CUB 每图一只明显主体,而且没有无鸟图。99% 命中说明模型认识典型鸟外观,但没有测到树枝、叶片、远处黑点、空镜头等你最在意的误报来源。
以下所有分数都来自保存的原始预测重新计算;没有训练、微调或改权重。COCO 的 13 个 crowd 框从自定义 TP/FP/FN 中排除,因此尺寸召回的分母是 427 个普通鸟框,而不是注释文件中的 440 个总框。
| 项目 | COCO bird val2017 | CUB-200-2011 test | 解释 |
|---|---|---|---|
| 图片 / 鸟框 | 125 / 440(含 13 crowd) | 5,794 / 5,794 | COCO 多实例、尺度跨度大;CUB 一图一只主体鸟。 |
| 评估分辨率 | 640 px,MPS,batch 8 | 所有模型同条件,便于横向比较。 | |
| 保存阈值 / NMS | conf ≥ 0.001 / NMS IoU 0.70 | 保留低分预测,之后可重新评估不同工作点。 | |
| 本报告工作点 | conf ≥ 0.25 / 匹配 IoU ≥ 0.50 | 预测按置信度排序,一对一贪心匹配。 | |
| 能回答 | 框级 AP、P/R/F1、正图命中、速度、不同尺寸召回、逐图错误类型 | 适合判断原始模型上限和微调方向。 | |
| 不能回答 | 真实无鸟误报率、Lightroom 全图库准确率、模糊/对焦失败分片表现 | 这些需要本地负样本和质量标签。 | |
CUB 的 AP50 都接近 0.98,但 COCO AP50 只有 0.52–0.70。模型变大确实提高召回和框质量,不过复杂场景的性能缺口远大于 N/S/M 之间的差距。
| 数据集 | 模型 | 参数 | mAP50–95 | AP50 | Precision | Recall | F1 | 正图命中 | 速度 |
|---|---|---|---|---|---|---|---|---|---|
| COCO bird 125 图 / 427 普通框 | YOLO26n | 2.57M | 0.333 | 0.524 | 77.5% | 37.0% | 50.1% | 67.2% | 98.6 img/s |
| YOLO26s | 10.01M | 0.425 | 0.637 | 74.4% | 45.7% | 56.6% | 76.0% | 58.3 img/s | |
| YOLO26m | 21.90M | 0.469 | 0.696 | 77.3% | 52.7% | 62.7% | 81.6% | 25.8 img/s | |
| CUB test 5,794 图 / 5,794 框 | YOLO26n | 2.57M | 0.793 | 0.978 | 92.5% | 96.1% | 94.3% | 96.1% | 147.4 img/s |
| YOLO26s | 10.01M | 0.830 | 0.987 | 95.1% | 98.3% | 96.7% | 98.3% | 77.1 img/s | |
| YOLO26m | 21.90M | 0.850 | 0.988 | 94.1% | 99.1% | 96.6% | 99.1% | 27.4 img/s |
COCO 绝对面积口径:small < 32²,medium < 96²,large ≥ 96²。分母分别为 234 / 115 / 78。
每组从原始图、YOLO26n、s、m 四个面板横向对比。青色为人工 GT,黄绿色为 TP,红色为未匹配预测。红框不一定是“背景认成鸟”:它也可能是重复框,或框到真实鸟但 IoU 没过 0.5。
人工鸟框 匹配成功 未匹配预测 / FP。框上的数字为置信度。
12 GT · N/S/M 均 TP 0 · 同类候选 20 图
远处天空中的鸟接近点状,最小框只占画面约 0.0012%,640 输入后几乎没有可稳定利用的纹理。三种模型在 0.25 以上都没有输出。
主因是有效像素不足,不是模型参数不足。加入本地远距离小鸟、提高到 960/1280 或切片推理;训练时增加小目标 copy-paste 与 P2 检测头实验。只换 M 不够。
25 GT · M TP 4 / FP 5 / FN 21 · 同类候选 9 图
N 完全无输出,S 产生 3 个未匹配框,M 成功匹配 4 只,但仍漏掉 21 只。密集、重叠、浪花背景和相似尺度共同放大了检测难度。
容量能帮助实例分离,但密集小鸟还受 stride、NMS 和“所有实例是否标全”影响。数据中要专门建立 flock 分片;检查 NMS,加入密集标注图,并报告每图召回而不只看“是否命中”。
3 GT · N TP 0 · S TP 1 · M TP 1 / FP 1 · 同类候选 11 图
鸟体很小,猫反而是画面中更显著的动物。S 和 M 都找到一只鸟;M 同时给猫附近的大框一个预测,形成“召回提高但并非无副作用”。
加入猫、松鼠、石块等动物形状 hard negatives;训练图必须标全所有小鸟。模型选择要同时看 recall 和 FP/image,不能只看“更大模型找到更多”。
22 GT · N 0/22 · S 1/22 · M 2/22 · 多鸟部分召回候选 23 图
如果只按图片级“有鸟/无鸟”,S 和 M 都算成功;但检测任务显示 M 仍漏 20 只。小鸟剪影与天空对比清楚,却因尺寸过小、实例密集而难以逐只定位。
明确产品目标:Lightroom 只需证明“有鸟”时,至少命中一只可以接受;要裁主鸟或数鸟时则不够。评估同时保留 image hit rate 和 box recall,避免指标替产品做决定。
2 GT · S TP 1 · M best IoU 0.288 / FP 1 · 定位型候选 1 图
背景中的鸟只有几个像素。M 在正确区域附近给出 0.31 分框,但框与 GT 的重叠不足 0.5,于是同时产生 1 FP + 2 FN;这不是纯粹的语义“没认出鸟”。
小框的几像素偏差会让 IoU 急剧下降。标注时统一极小目标框法,训练中提高小目标权重,并补充中心距离或低 IoU 分片。二分类 presence 头可容忍定位偏差,但不能替代可用鸟框。
13 GT · M TP 12 / FP 6 / FN 1 · 最高未匹配分 0.884
M 的召回很好,但同一鸟附近出现多框,最高未匹配预测达到 0.88。这会显著拉低检测 Precision,却不等同于把“无鸟背景”认成鸟。
先按 IoU/中心距离把 FP 分成 duplicate、localization、background 三类。重复框优先调 NMS、去重和框标签一致性;真正背景 FP 才进入 hard-negative mining。否则把真实鸟裁片错误标成非鸟,会毒化二分类网络。
1 GT · N/S/M 均 TP 0 · CUB 全模型漏检候选 25 图
鸟只占画面约 7.7%,枝叶纹理复杂,身体被遮挡且颜色与环境接近。即使 CUB 整体命中率很高,这类伪装与遮挡组合仍让三种模型完全沉默。
专门采集枝叶遮挡、逆光、伪装色和异常姿态,不要只用“居中、完整、清晰”的鸟种分类图。建立 occluded/camouflage 标签分片,才能验证增强是否真的有效。
1 GT · N score 0.916 / IoU 0.458 · S/M TP · 同类候选 153 图
N 对鸟有很高信心,但只覆盖躯干,漏掉长尾,IoU 只有 0.458,于是被记为 FP+FN;S/M 的框与人工框接近重合。
这是模型容量和边界回归收益的典型例子,也是“有无鸟二分类”和“鸟框检测”口径的分叉点。若只做 presence,N 其实已成功;若要裁鸟,必须训练完整可见鸟体的统一框规范。
1 GT · S score 0.715 / IoU 0.475 · M IoU 0.978 · 同类候选 35 图
S 已找到正确鸟体,却因只差 0.025 IoU 没过线;M 的框达到 0.978。枝叶横穿身体、尾部延伸和细长目标形状共同影响边界。
验证集要同时展示 IoU 0.50/0.75 和 image-level hit;训练时加入遮挡长尾鸟、边缘鸟和细长框。若生产只需“有鸟”,可设置独立 presence 判定,不应直接拿检测 TP 作为二分类标签。
1 GT · N IoU 0.521 / FP 2 · S/M IoU ≈ 0.98 · 定位提升候选 330 图
展翼蜂鸟的轮廓非常规,N 给出多个局部框;S/M 能把翅膀和躯干合成一个完整实例。它显示更强特征融合对姿态变化和整体性有帮助。
数据中增加飞行、展翼、俯冲、背向、半鸟等姿态;标注规范明确“框完整可见轮廓”。再用 duplicate/part-box 分片监控是否只学会了鸟头或鸟身局部纹理。
第一版数据集不追求“最大”,而追求标签完整、切片可解释、训练/测试隔离。先建立能量化真实无鸟误报的固定测试集,再用两轮 hard-negative mining 把你已经看到的典型误报系统化。
| 数据块 | 建议规模 | 必须标签 | 用途与注意 |
|---|---|---|---|
| 固定本地 test | 1,000–1,500 图 | presence、全鸟框、场景/连拍组、错误切片 | 鸟/无鸟各约一半;只用真实原图,不做增强,不再进入训练。 |
| 本地真实有鸟训练图 | 2,000–3,000 图 | 标全所有鸟框;truncated、occluded、size、pose | 优先七月照片目标域;多鸟图不得只标主鸟。 |
| 本地明确无鸟图 | 1,500–2,000 图 | presence=0、hard-negative 类型 | 树枝、叶片、飞机、飞虫、反光、水面、猫、松鼠、石块、远处黑点。 |
| 质量失败但仍有鸟 | 800–1,500 图 | presence=1、bbox、defocus、motion_blur、under/overexposure | 模糊鸟不能标成“非鸟”;同时服务检测与后续质量评分。 |
| COCO bird train | 3,237 图 / 10,542 框 | 沿用官方 bbox | 保留复杂通用场景;与本地数据分阶段混合,避免覆盖目标域。 |
| CUB train 抽样 | 2,000–4,000 图 | 沿用单鸟 bbox | 补鸟外观和姿态,但批次占比控制在约 10–20%,不让干净主体域主导。 |
| 每轮 hard-negative | 300–800 图 × 2 | 确认无漏标鸟;记录模型、阈值、误报类型 | 从剩余本地图库低阈值扫出最高分错误,价值高于随机加数千图。 |
tiny、edge、truncated、occluded、flock、flight、defocus、motion_blur、camouflage、hard_negative_type。
这些标签主要用于评估分片,不必全部进入模型类别。
按日期 × 地点 × 连拍组 × 原始文件拆分,而不是逐图随机。清晰帧、模糊增强、裁切版本必须留在同一 split,防止同一场景泄漏。
presence recall、specificity/FPR、FP/1,000 无鸟图、box AP50/75、每图 recall,以及 tiny/blur/edge/occluded/flock 各分片指标。
从七月图库按连拍组抽 1,000–1,500 张固定测试图;训练集先做 4,000–6,000 张。以 YOLO26s 单类 bird fine-tune,640 与 960 做受控对比,其他超参数尽量不变。
对剩余图库低阈值扫描:duplicate/localization 不进入非鸟;background FP 才补无鸟样本。同步复核所有 FN 是否漏标,尤其是小鸟群和画面边缘。
小鸟为主:960/tiles/P2;普通鸟仍漏:补目标域与标签;树枝误报:hard negatives 或小分类器复核;局部框/重复框:定位与 NMS;只有容量曲线仍未饱和时再上 M。
| 实验 | 模型 / 分辨率 | 数据变化 | 要回答的问题 | 晋级条件 |
|---|---|---|---|---|
| A0 | 原始 YOLO26s / 640 | 无 | 固定本地 test 的真实基线 | 作为所有实验共同对照 |
| A1 | YOLO26s / 640 | 本地 + COCO 微调 | 目标域数据能补多少召回和误报 | FPR 下降且各难例 recall 不倒退 |
| A2 | YOLO26s / 960 | 同 A1 | 小鸟瓶颈是否主要来自分辨率 | tiny recall 增益覆盖速度成本 |
| A3 | YOLO26s / 640 | A1 + hard negatives | 真实背景误报能否系统下降 | FP/1,000 无鸟图显著下降,正样本 recall 保持 |
| A4 | YOLO26m / 640 | 完全同 A1 | 同数据下是否仍有容量瓶颈 | 增益明显且吞吐/内存可接受 |
| A5 | S detector + 轻量分类复核 | 只用 background FP 裁片 | 二阶段是否比单纯提阈值更好 | 同 recall 下 FPR 优于 A3 |
六组预测都保留到置信度 0.001,可重算不同工作点。模型文件、数据注释和官方 CUB 压缩包均记录哈希;评估脚本未调用训练接口,审计结果通过。
9b09…4fef646f…a1b401c…0b7benchmark_summary.csv:六组总体指标predictions.json:每模型/数据集原始预测scale_recall.csv:逐框尺寸召回selected_cases.json:十组案例的 TP/FP/FN 与 IoUaudit.json:完整性和未训练审计本报告的具体分数、速度与案例均为 2026-07-21 本机实测;数据集和模型定义链接到官方资料。案例图来自本次评估所用公开数据集,并叠加本地计算的预测框。