STILLFRAME / MODEL LAB

Error audit · 2026-08-08 · Apple M5 / MPS

训练有效,但下一分提升主要藏在数据里

以同条件原始模型基线、四域独立测试和 18,605 张逐图预测为证据,量化 YOLO26s 鸟类微调收益,拆解 FP、FN 与框偏差,并给出数据修复、训练优化和 YOLO26m 受控实验建议。。结论不是简单换更大模型:先修标签、负样本和小目标协议,才能知道剩余差距究竟来自数据还是容量。

原始 YOLO26s bird-only 基线四域 test 18,605 张案例阈值 0.304 / IoU 0.5证据截至 2026-08-08
+16.22 pp全验证 Precision:78.71% → 94.92%
+21.29 pp全验证 Recall:68.89% → 90.18%
+21.32 pp全验证 mAP50:74.98% → 96.30%
+40.25 pp全验证 mAP50–95:29.63% → 69.88%
Executive decision

三条结论决定下一轮顺序

所有量化提升来自同架构、同输入和同测试口径;YOLO26m 的数字单独标为估算,不与本机实测混写。

01

微调把“通用鸟类”变成专用定位器

总验证 mAP50–95 从 29.63% 升至 69.88%,相对增幅 135.8%。mAP50 与 Recall 同时大幅上升,说明收益不是单纯调高置信度。

02

Big Bird 决定当前下限

Big Bird 的中位目标短边只有 40.8 px,35.3% 小于 32 px;固定阈值下有 2,093 个 FN,是主要召回缺口。

03

更大模型不能修复错误 GT

高置信好框被偏移 GT 判错、倒影语义未定义、孔雀羽斑触发大量小框,这些问题应先通过标签协议、hard negatives 和后处理解决。

推荐决策:

先完成一次“数据修复版 YOLO26s”受控复训,再让 YOLO26m 使用完全相同的清洁数据和预算。否则 m 的增益会被标签噪声与域差异淹没,无法判断容量是否真正有用。

本地实测人工复核条件化估算边界与风险
Chapter 01

原始模型到微调模型:提升在哪里

原始 yolo26s.pt 只保留 COCO class 14(bird),没有把其他 79 类折叠成鸟;标签映射到 class 14 后使用相同 960 px、batch 8、MPS 和测试清单。

评估域PrecisionRecallmAP50mAP50–95
全量验证78.7194.92+16.22 pp68.8990.18+21.29 pp74.9896.30+21.32 pp29.6369.88+40.25 pp
GBDD76.7797.45+20.68 pp73.3096.19+22.89 pp75.7799.10+23.33 pp24.1976.70+52.50 pp
IBERBIRDS70.4795.99+25.52 pp66.1991.78+25.60 pp68.6798.44+29.77 pp20.9475.67+54.74 pp
NABirds91.6197.27+5.66 pp92.3495.66+3.32 pp95.4998.54+3.05 pp54.4171.47+17.06 pp
Big Bird63.5181.22+17.71 pp48.7170.28+21.57 pp54.1079.22+25.12 pp27.7742.42+14.65 pp
Measured uplift

mAP50–95 提升(百分点)

全量验证
+40.25
GBDD
+52.50
IBERBIRDS
+54.74
NABirds
+17.06
Big Bird
+14.65

框精度改善大于“有没有鸟”

全验证 mAP50 提升 21.32 pp,而 mAP50–95 提升 40.25 pp。后者更大,说明训练显著改善了框的位置与大小,而不只是找到了更多鸟。

推理时间 12.94 → 13.23 ms/张,差 +0.30 ms;架构和 9.5M 融合参数均未变化,这个差异应视为运行波动。

NABirds 为什么只小幅提升?

原始 COCO bird 已很适合清晰、单主体、长焦构图,mAP50 基线即 95.49%。微调剩余收益集中在严格框定位:mAP50–95 仍提高 17.06 pp。

Chapter 02

四个数据集为什么表现不同

“鸟种多”并不自动意味着检测难。真正影响本任务的是目标像素、每图实例数、空图比例、拍摄视角、背景纹理和框协议。

测试图空图GT / 每图中位像素中位短边P10 短边<32 px匹配框中位 IoU
GBDD13,8340 (0.0%)14,073 / 1.020.051 MP157.4 px102.1 px0.0%0.890
IBERBIRDS2920 (0.0%)292 / 1.000.786 MP74.6 px26.6 px17.1%0.899
NABirds3,2490 (0.0%)3,249 / 1.000.694 MP311.0 px171.0 px0.0%0.875
Big Bird1,230150 (12.2%)7,052 / 5.731.049 MP40.8 px18.5 px35.3%0.787

GBDD:低像素但目标巨大

中位图仅 0.051 MP,鸟框却占画面约 38.4%,识别线索被放大;图源广使外观覆盖强。短板是框只标头、整群框、坐标偏移和同图漏标等协议噪声。

IBERBIRDS:小飞鸟、简单背景

17.1% 目标短边 <32 px,但多为单只飞鸟和天空/远景,几何匹配好;292 张 test 太小且全为正图,Precision 与稳定性不能代表真实图库空景。

NABirds:最像长焦主体照

中位目标短边 311 px、每图一只,原始模型已有很强先验。逆光、枝叶遮挡、倒影与框松紧差异主要伤害 mAP50–95,而不是 mAP50。

Big Bird:航拍、密集、极小

平均 5.73 个 GT/切片,35.3% 短边 <32 px;俯拍外观与地面长焦相反。它还是唯一含明确空图的 test,因此同时暴露召回、定位与真实背景误报。

跨域总分的边界:

GBDD 有 13,834 张,IBERBIRDS 只有 292 张;直接平均或合并会让大域主导结果。报告因此同时给出分域指标、固定阈值错误数和尺度切片,不把总分当作现代无反部署结论。

Chapter 03

当前 FP 和 FN 到底是什么

案例筛选固定使用全验证集 F1 峰值 conf=0.304,IoU≥0.5 计 TP;预测最低保留到 0.001,用于判断模型是“看见但没过阈值”还是“完全没有候选”。

图像TPFPFNPrecisionRecallFP/图FN:低置信 / 定位 / 无候选
GBDD13,83413,69461737995.7%97.3%0.045328 / 45 / 6
IBERBIRDS292278291490.6%95.2%0.09914 / 0 / 0
NABirds3,2493,11111413896.5%95.8%0.035112 / 26 / 0
Big Bird1,2304,9591,1422,09381.3%70.3%0.9281,681 / 320 / 92

FN 主要是阈值问题

GBDD、IBERBIRDS、NABirds、Big Bird 的低置信 FN 分别为 328、14、112、1,681,占各域 FN 的 86.5%、100%、81.2%、80.3%。先做目标域校准通常比直接换模型更划算。

Big Bird 仍有真实特征失败

除 1,681 个低置信 FN 外,Big Bird 还有 320 个定位 FN 和 92 个无候选 FN;已匹配框中 11.5% 的 IoU 低于 0.65,解释了 mAP50 与 mAP50–95 的巨大差距。

FP 不能只看“背景”

固定阈值下,重复/一鸟多框、框偏差、漏标实例和真实硬负样本都会记为 FP。Big Bird 150 张空图中 12 张发生误报,空图误报率 8.0%;其他三域没有空图,无法测真实 no-bird 风险。

口径提醒:

本表是固定部署阈值下的贪心 IoU50 计数,用于错误分析;Ultralytics 主表 Precision/Recall 是曲线最优点,mAP 又对置信度和多个 IoU 阈值积分,因此数值不应逐项强求相等。

Chapter 04

14 组失败案例:每一类需要不同药方

青色为 GT/匹配,绿色为 TP,红色为阈值以上 FP,黄色为 FN,紫色为阈值以下候选。案例来自四域 test,不是训练图。

硬负样本:不是鸟,却长得像鸟

人工复核
水面高光成为航拍假鸟
case-001

水面高光成为航拍假鸟

观察:空标 Big Bird 切片上,模型把一个高光小斑点以 0.59 置信度报成鸟。尺度、亮度和孤立轮廓都接近远距离白色水鸟。

对应动作:补水面高光、泡沫、漂浮物和水草空图;按相机/水体分组做 hard-negative mining。

树洞比真鸟更像鸟
case-011

树洞比真鸟更像鸟

观察:同图真鸟仅 0.35,树干黑色结疤却得到 0.53。圆暗主体、亮边和“停栖位置”形成背景捷径。

对应动作:加入树洞、树瘤、断枝和深色叶团负样本;必要时用框后 bird/no-bird 复核器。

语义与标签:指标失败不一定是视觉失败

人工复核
倒影是否算第二只鸟
case-012

倒影是否算第二只鸟

观察:模型正确框出实体鸟,也把清晰倒影以 0.53 报为鸟;GT 只标实体。视觉上合理,任务语义却未定义。

对应动作:冻结规则:倒影统一标 ignore 或 hard negative;不要让不同来源采用不同口径。

高置信好框被偏移 GT 判错
case-016

高置信好框被偏移 GT 判错

观察:预测框以 0.91 覆盖完整鸟体,但 GT 明显向右下偏移,IoU=0.497,刚好低于 0.5。它更像标签注册问题,而非模型定位失败。

对应动作:抽审低 IoU 高置信样本;统一“可见鸟体紧框”协议,并修复坐标/EXIF/转换链路。

极小飞鸟:看见了,但阈值不让它通过

人工复核
纯天空中的小飞鸟
case-028

纯天空中的小飞鸟

观察:候选框 IoU=0.897,但置信度 0.279,略低于 0.304。几何是对的,属于校准型 FN。

对应动作:召回优先部署可先降低阈值;训练侧补短边 16–64 px 的真实飞鸟和尺度分层采样。

雾岩背景吞掉目标对比
case-029

雾岩背景吞掉目标对比

观察:目标约 31×26 px,候选置信度 0.262、IoU=0.580;岩壁纹理与雾降低了轮廓可分性。

对应动作:固定 1280/分块推理做受控对比;加入真实薄雾、岩壁和低对比飞鸟,不用纯高斯噪声代替。

遮挡与曝光:目标并不小,信息仍可能不足

人工复核
树枝遮挡下的临界置信度
case-031

树枝遮挡下的临界置信度

观察:鸟体尺寸较大,框 IoU=0.874,但枝干切割轮廓、叶片遮挡和逆光让置信度停在 0.301。

对应动作:收集真实枝叶遮挡正样本并标 visible_fraction;不要把拍虚或被挡鸟改成无鸟。

强逆光产生多组低置信重叠框
case-033

强逆光产生多组低置信重叠框

观察:大鸟被高光、雾化耀斑和叶片切割;最高候选 0.293,其余重叠框更低。

对应动作:补晨昏逆光、镜头耀斑和过曝目标域样本;部署层合并包含关系强的重叠候选。

纹理与低信息目标:单类检测也会学错尺度

人工复核
孔雀眼状羽斑触发 144 个框
case-039

孔雀眼状羽斑触发 144 个框

观察:模型把重复眼状羽斑当作大量微型鸟,最高置信度接近 0.79,却没有形成完整鸟体框。

对应动作:加入孔雀、火鸡等完整体态与羽纹 hard cases;限制 max_det 并增加包含关系抑制,但根治仍靠数据。

草地低像素小鸟
case-043

草地低像素小鸟

观察:候选 IoU=0.808、置信度 0.229。目标信息量很低,模型已定位但不敢确认。

对应动作:提高小目标采样权重,按短边分桶报告召回;在目标域验证集上单独校准 tiny-bird 阈值。

实例分离:遮挡和群鸟让一个框代替多只鸟

人工复核
枝条后只剩碎片化鸟体
case-045

枝条后只剩碎片化鸟体

观察:严重遮挡样本的最佳候选仅 0.018;这是接近真正的特征失败,而非阈值问题。

对应动作:增加真实枝条/芦苇遮挡鸟;若可辨认部分太少,使用 ignore,不用合成 CutOut 粗暴覆盖。

三只鸟被合并成一个群框
case-055

三只鸟被合并成一个群框

观察:模型给整组一个 0.63 大框,三个实例候选分别只有 0.278、0.014 和 0.002。

对应动作:增加相互重叠和相邻个体样本;降低会制造拥挤拼图的 Mosaic,比单纯放大模型更直接。

Big Bird:尺度与密度同时超出常规照片域

人工复核
同一切片一只检出、一只消失
case-052

同一切片一只检出、一只消失

观察:边缘处一只鸟以 0.62 检出,另一只极小目标没有任何重叠候选,说明最小尺度已跌出稳定表征范围。

对应动作:对短边 <32 px 目标做 oversampling;比较固定 1280、重叠 tiles 与 P2 检测头。

70 只密集群落仅匹配 26 只
case-058

70 只密集群落仅匹配 26 只

观察:该切片 70 个 GT,固定阈值下 26 TP、44 FN、7 FP;大量候选几何正确但置信度低,且个体互相遮挡。

对应动作:按原始航次和密度分层采样;保留高 max_det,做密集场景专门验证,并避免把群落与普通单鸟无权混合。

Chapter 05

怎样继续提升 PR 与 mAP

优先级按“能解释当前错误、改动可回滚、可做受控对照”排序;不要同时换数据、模型、分辨率和阈值。

P0

先修标签与 ignore 协议

人工复核高置信低 IoU、每图多框、GT 空框和 0.1–0.3 临界候选;统一可见鸟体紧框、群鸟逐实例、倒影/雕塑/照片中的鸟、极端遮挡与边缘截断规则。目标是先消除“好预测被坏 GT 判错”。

P0

做两轮 hard-negative mining

从现代无反空景和未标图库中收集水面高光、树洞、枝叶、石块、飞机、飞虫、倒影、羽毛眼斑和传感器污点。每轮优先标 300–800 个最高置信 FP;以空图误报率和 FP/千图验收 Precision。

P1

把尺度和密度显式放进采样器

按 GT 短边 <32、32–64、64–160、>160 px 分桶;Big Bird 另按 1、2–10、>10 实例分层。提高 tiny/dense 抽样但保留真实空图。先比较固定 1280 或重叠 tiles,再决定 P2。

P1

目标域阈值与后处理校准

在现代无反独立 val 上画 PR 与 FP/千图曲线;召回优先可测试 0.15–0.25,精度优先测试 0.35–0.55。对包含关系强的一鸟多框和群框增加可解释的合并/抑制规则。

P1

用清洁数据短程精修 YOLO26s

从当前 best.pt 开始,960、batch 8、20–30 epoch、lr0 1e-4–2e-4;Mosaic 0.10–0.20 并在最后 5 epoch 关闭,MixUp 设 0。只有在标签统一后,才受控测试更高 box loss 权重。

P2

最后才做容量对照

保持清洁数据、拆分、增强、阈值选择和墙钟预算一致,比较 YOLO26s、YOLO26m 与 s-P2。成功标准不是总 mAP 单点,而是 Big Bird tiny/dense recall、目标域 FP/千图和 mAP50–95 同时改善。

建议验收面板 = 分域 AP50 / AP50–95 + 目标短边分桶 Recall + 空图 FP/1000 + 每事件漏检率 + IoU P10/P50 + 推理延迟
Capacity forecast

YOLO26m 可能怎样,但现在仍是估算

官方 COCO 规格可用来约束方向,不能直接映射到本项目。以下区间由官方 s→m 缩放、本机 s 实测和当前错误结构共同推断。

项目YOLO26sYOLO26m差异 / 对本项目的含义
融合参数9.5M20.4M2.15×;更强特征容量,但也更容易记住标签噪声
FLOPs @64020.7B68.2B3.29×;960 成本同样按像素平方放大
官方 COCO mAP50–9548.653.1+4.5 pp;这是 COCO,不是四鸟域保证
本项目同数据估算实测 P/R/mAP50/mAP95 = 94.9/90.2/96.3/69.9P +0.5–1.5 pp;R +1.5–3.5 pp;mAP50 +0.3–1.5 pp;mAP50–95 +1.5–3.5 ppBig Bird 可能获得更大收益;GBDD/IBER/NAB mAP50 已接近饱和
Big Bird mAP50–95 估算42.4(实测)45–49(同数据)
47–52(先修数据)
容量主要帮助密集/小目标;语义 FP 和错 GT 不会自动消失
M5 同课程墙钟训练约 19.5 h(实测)约 45–65 h,batch 2–4(估算)需要先做 100–500 batch 内存烟雾测试;不能按 T4 比例直接承诺
960 MPS 推理13.23 ms/张(实测)约 22–35 ms/张(估算)实际受 MPS 图优化、batch 与后处理影响
我对 m 的判断:

它最可能改善 Big Bird 的低置信小鸟、密集群落和严格 IoU;对倒影、树洞、孔雀眼斑、群框协议和偏移 GT,容量越大反而可能更自信地犯错。

推荐实验顺序:

A0 当前 s → A1 清洁数据 s → A2 A1 + 1280/tiles 或 P2 → A3 同一 A1 数据训练 m。只有 A3 相对 A1 的增益才是“模型容量收益”。

Chapter 06

当前数据集还有哪些提升空间

四套公开集已经提供很强的外观覆盖,但没有建立一个完整的现代无反部署分布。

空图严重不足

GBDD、IBERBIRDS、NABirds test 均为 0 空图;Big Bird test 只有 150 张空切片。需要至少 1,000–2,000 张项目相机真实空景和困难负样本,才能可信衡量 Precision。

框协议跨源不统一

头部框、全鸟框、整群框、倒影、遮挡和边缘鸟口径混杂。应记录 bbox_protocolignorevisible_fractiontruncated 和审计状态。

缺少失败属性

给 val/test 增加目标短边、密度、逆光、曝光、离焦、运动模糊、遮挡、飞行/停栖和背景类型,才能判断每轮训练究竟修好了什么。

现代无反仍未进入闭环

优先补 2,000–5,000 张项目机身/镜头原图与工作 JPEG,覆盖连拍、RAW 转换、背景虚化、羽毛高频、逆光、远鸟与空景;按拍摄事件隔离 train/val/test。

采样比例应由错误驱动

覆盖阶段 112k GBDD 大量主导特征;下一轮不应继续按下载量混合。建议让目标域与 hard negatives 占 40%–60%,Big Bird tiny/dense 约 20%,其余公开域做保底覆盖。

测试集需要扩容和冻结

IBERBIRDS test 仅 292 张且无空图。建立 ≥1,000 张现代无反固定 test,按事件、机身/镜头、场景、尺度和质量分层;合成增强永不进入黄金 test。

最有价值的新数据不是随机再下 50,000 张鸟图:

而是当前模型最自信的假阳性、最接近阈值的真鸟、完全无候选的遮挡鸟,以及同一连拍中清晰/虚焦/运动模糊的真实配对。它们直接对应 PR 与 mAP 的剩余误差。

Evidence

来源、方法与不确定性

指标、逐图错误与案例来自本机可复核产物;模型规模和 COCO 结果引用官方资料;m 的项目区间明确为估算。

  1. 四套鸟类数据集训练 YOLO26s:既有训练与分域报告
  2. Ultralytics YOLO26 官方模型与性能表
  3. YOLO26 官方训练配方
  4. GBDD1433-2023 官方仓库
  5. IBERBIRDS Zenodo 数据记录
  6. NABirds 官方页
  7. Big Bird · LILA BC
  8. 本地严格基线:原始 YOLO26s 仅保留 COCO bird 类;标签映射为 class 14,single_cls=false。
  9. 本地误差审计:18,605 张四域 test;960 px;conf≥0.304;IoU≥0.5;低置信候选保留至 0.001。
  10. 案例由 70 张自动排序候选中人工复核选出 14 组;“原因”是基于图像与预测关系的工程判断,不是因果实验。
重要边界:

本报告没有实际训练 YOLO26m,也没有现代无反目标域黄金测试集。YOLO26m 的指标、墙钟和延迟区间只能用于排期和实验设计,不能作为交付承诺。