主线:YOLO26s Detect
用一类 bird 框训练。存在至少一个框即可得到“有鸟”;同时保留位置、多鸟和小目标能力。先 640 建立基线,再用 960 / 分块解决远处小鸟。
Technical plan · 2026-07-19
目标拆成两件事:判定画面是否有鸟,以及把每只鸟的位置框出来。前者可以用轻量二分类器;后者必须使用有几何监督的检测器。综合当前 M5、七月照片和后续质量评分需求,首选不是从零训练大模型,而是 YOLO26s Detect 鸟类单类微调 + EfficientNet-B0 框后复核。
“能认出是什么鸟”和“能在一张复杂长焦照片中找到每只鸟”是两个不同训练目标。物种模型可以做强大的复核器,但没有 bbox 损失的模型不会凭空得到可靠的框。
用一类 bird 框训练。存在至少一个框即可得到“有鸟”;同时保留位置、多鸟和小目标能力。先 640 建立基线,再用 960 / 分块解决远处小鸟。
将整图或 YOLO 候选框判为 bird / no-bird。它便宜、适合困难负样本复核,但整图缩到 224 后可能把小鸟压成几个像素,因此不能单独承担定位。
只在“已经有框”的鸟裁切上使用,做鸟种语义、伪标签或蒸馏。OSEA 的前端框同样来自通用 COCO 检测器;BioCLIP 2.5 原生完全不出框。
bird_present = 1。它可以同时是“质量失败”,但不能被改成“无鸟”。否则检测器会学会主动漏掉最需要抢救的照片。
截至基准日,Ultralytics 最新正式模型族是 YOLO26。YOLOv3 以后已经不是单一团队连续编号的血缘;YOLO26 采用年份命名,也不代表其间存在连续发布的 v12–v25。
一手来源:Ultralytics 模型总览、架构演进、v1、v2、v3、v4 论文。
| 版本 | 官方融合参数 | 完整训练图参数 | 融合 FLOPs@640 | 训练图 FLOPs@640 | COCO mAP50–95 | 官方 .pt 体积 |
|---|---|---|---|---|---|---|
| YOLO26n · Nano | 2.4M | 2.572M | 5.4B | 6.12B | 40.9 | 5.54 MB / 5.29 MiB |
| YOLO26s · Small | 9.5M | 10.010M | 20.7B | 22.84B | 48.6 | 20.42 MB / 19.48 MiB |
| YOLO26m · Medium | 20.4M | 21.896M | 68.2B | 75.40B | 53.1 | 44.26 MB / 42.21 MiB |
| YOLO26l · Large | 24.8M | 26.300M | 86.4B | 93.80B | 55.0 | 53.21 MB / 50.75 MiB |
| YOLO26x · XLarge | 55.7M | 58.993M | 193.9B | 209.53B | 57.5 | 118.67 MB / 113.17 MiB |
官方表是 model.fuse() 后的部署图:BN 已融合,训练期辅助的一对多检测头已移除。本机用 Ultralytics 8.4.100 从官方 YAML 实例化的“完整训练图”更适合估算训练负载。
官方文件是剥离优化器后的 FP16 checkpoint。训练还要保存激活、梯度和优化器状态,显著大于文件本身。X 在 32 GB M5 上通常只能 batch 1–2。
| 版本 | Fine-tune · 50 epoch | 随机初始化 · 200 epoch | MPS 建议起始 batch | 本项目判断 |
|---|---|---|---|---|
| YOLO26n | 2.5–5 小时 | 10–20 小时 | 16–32 | 很快,但小鸟上限偏低;适合作移动端对照。 |
| YOLO26s | 5–10 小时 | 20–40 小时 | 8–16 | 推荐 迭代速度与容量最均衡。 |
| YOLO26m | 16–26 小时 | 64–104 小时 | 4–8 | 可作为第二阶段容量对照。 |
| YOLO26l | 22–35 小时 | 88–140 小时 | 3–6 | 本机可跑,但每次数据迭代已接近 1–2 天。 |
| YOLO26x | 50–85 小时 | 200–340 小时(约 8–14 天) | 1–2 | 高精度实验 建议云端 NVIDIA。 |
本机已有 YOLO11l-seg、640、batch 4、MPS 实测:132.9 GFLOPs,约 1.46 train images/s,单轮 128 图约 77–98 秒,MPS 6.6–7.6 GB。按 YOLO26 完整训练图 FLOPs 缩放后,再加入固定开销和余量。
新时间 ≈ 表中时间 × 实际训练图片数 / 3,000 × 实际 epochs / 表中 epochs × (实际分辨率 / 640)²
像素量近似按边长平方增长,batch 还可能下降。规划时按 640 时间的 2–3 倍 更安全。先在 640 调通标签和负样本,避免在高分辨率上浪费数天验证一个标签问题。
以上均为条件化估算,不是五个模型重新实跑的墙钟时间。
若“从零”指复现一个通用 COCO checkpoint,数据是 118,287 张 COCO train,而不是 3,000 张本地鸟片。官方披露的最终训练配方仍从中间预训练权重初始化并经过进化搜索,并非一次随机初始化即可完整复现。只按其最后阶段 epoch 粗算,这台 M5 已需要:
| 版本 | 官方最终阶段 epoch | 当前 M5 粗估 | 结论 |
|---|---|---|---|
| YOLO26n | 245 | 17–32 天 | 不建议本机复现通用预训练。 尚未计入中间预训练、超参进化、失败实验与多次重复。 |
| YOLO26s | 70 | 12–20 天 | |
| YOLO26m | 80 | 42–65 天 | |
| YOLO26l | 60 | 41–63 天 | |
| YOLO26x | 40 | 63–102 天 |
yolo26-p2.yaml 高分辨率 P2 检测头,对远处小鸟有理论价值,但官方没有发布各尺度 P2 预训练权重。首轮顺序应为:YOLO26s Detect → 640/960 → 分块推理 → 仍有系统性小鸟漏检时再实验 P2。分类器将一张输入压缩为类别 logits。做 bird / no-bird 很便宜,但池化会主动丢掉位置;Grad-CAM 或 attention 只能说明“哪些区域影响了判断”,没有 bbox 几何约束、实例分离和召回标定,不能冒充检测器。
用 MBConv + SE,并联合缩放深度、宽度和输入分辨率。B0 仅 5.29M 参数,迁移学习成熟,是本项目最稳的二分类起点;B3 容量更高,但 384 输入显著增加成本。
深度可分离卷积、倒残差和线性瓶颈;V3 再加入 SE、h-swish 与硬件感知 NAS。Small 追求端侧极致,Large 更适合作精度 / 速度平衡。
“ConvNet”是卷积网络泛称,ConvNeXt 才是具体型号。它用大核和现代训练策略重构纯 CNN;Tiny 已有 28.59M 参数,适合做高容量上限或教师,不算小模型。
| 典型模型 | 参数 | 官方权重 | GFLOPs | ImageNet top-1 | 在本项目中的位置 |
|---|---|---|---|---|---|
| ShuffleNetV2 x0.5 | 1.37M | 5.28 MiB | 0.040 | 60.55 | 极致轻量;上限和模糊鲁棒性较低。 |
| MobileNetV3 Small | 2.54M | 9.83 MiB | 0.057 | 67.67 | Core ML / 移动端优先;依赖良好预训练。 |
| MobileNetV3 Large | 5.48M | 21.11 MiB | 0.217 | 75.27 | 部署对照 比 Small 更均衡。 |
| RegNetY-400MF | 4.34M | 16.81 MiB | 0.402 | 75.80 | 规则化设计空间得到的稳定小 CNN 基线。 |
| EfficientNet-B0 | 5.29M | 20.45 MiB | 0.386 | 77.69 | 主二分类基线 小、成熟、迁移稳定。 |
| EfficientNet-B3 | 12.23M | 47.18 MiB | 1.827 | 82.01 | 更高容量;也是慧眼 SuperFlier 所用家族。 |
| ResNet18 | 11.69M | 44.66 MiB | 1.814 | 69.76 | 训练稳定、易排错;参数效率落后新模型。 |
| ResNet34 | 21.80M | 83.28 MiB | 3.664 | 73.31 | OSEA 骨干;换 11k 头后 26.93M / 约 103 MiB。 |
| ConvNeXt-Tiny | 28.59M | 109.12 MiB | 4.456 | 82.52 | 高容量上限 / teacher 已不轻。 |
| EfficientNetV2-S | 21.46M | 82.70 MiB | 8.366 | 84.23 | 通用精度高,对简单二分类常属过量。 |
| Swin-T | 28.29M | 108.19 MiB | 4.491 | 81.47 | 层次窗口 Transformer;分类头仍不出框。 |
| ViT-B/16 | 86.57M | 330.29 MiB | 17.564 | 81.07 | 依赖大规模预训练,不是本任务轻量首选。 |
ImageNet top-1 只反映不同预训练权重在通用分类上的容量,不能当作鸟类存在率、检测 mAP 或模型间直接排名。模型参数、权重与 GFLOPs 来自 TorchVision 官方模型页。
残差连接让深层训练可靠,是极好的排错基线;今天的参数 / 算力效率不占优。
RegNet 强调规则化设计空间;ShuffleNet 用 channel split / shuffle 追求极低端算力。
ViT 用全局自注意力换取扩展性;DeiT 改善数据效率;Swin 用移位窗口形成适合检测的层次特征。
Apple 的 CNN–Transformer 混合:MobileViTv2 约 1.4M–4.9M 参数。适合端侧,但现成 MPS 配方与排错成熟度不如 torchvision 基线。
两者都是优秀的鸟类语义模型,但它们并不是同一种东西。OSEA 是“通用检测器 + 闭集鸟种分类器”的流水线;BioCLIP 2.5 是大型图文双编码器。两者都没有提供一个已经针对本地长焦鸟片优化的前端框选器。
| OSEA 组件 | 网络与规模 | 权重 / 输入 | 公开训练信息 | 能力边界 |
|---|---|---|---|---|
| 桌面检测器 | Faster R-CNN ResNet50-FPN v2 43,712,278 参数 · 280.371 GFLOPs | 167.104 MiB 整图、多尺度 | torchvision COCO 预训练;OSEA 直接调用通用 bird 类 | 框来自外置通用检测器,不是 OSEA 自训的鸟类定位能力。 |
| 桌面分类器 | ResNet34 + 512→11,000 26,927,672 参数 | 约 103 MiB 224×224 crop | DIB-10K:论文清洗版约 4.71M / 10,916 种;32 epoch、batch 256;RTX 4090D 等硬件已披露,时间 / 费用未披露 | 强项是闭集细粒度鸟种;输入非鸟也会被迫选一个物种。 |
| 桌面合计 | 约 70.64M 参数 | 约 270 MiB | 两阶段推理,检测算力占主导 | 并不是“小框选网络”。 |
| OSEA Mobile | 量化 SSD-MobileNet + 量化 ResNet34 | 9.16 + 25.98 ≈ 35.14 MiB | 官方移动仓库发布 ONNX 权重 | 更轻,但前端仍是通用 SSD 检测思路。 |
源码:OSEA CLI;模型规模:TorchVision Faster R-CNN;移动版:OSEA Mobile;训练论文:OSEA 项目页。
OpenCLIP ViT-H/14 图像编码器 + 24 层 masked self-attention 文本编码器。输入 224×224、patch 14;视觉塔 32 层、width 1280;图像与文本投影到 1024 维 embedding,通过相似度做 zero-shot / few-shot 分类。
开放词表生命科学先验没有 detector head
986,109,441 参数,其中视觉塔约 632,076,800;官方 safetensors 3,944,517,804 bytes,约 3.94 GB / 3.67 GiB。
官方披露训练:更新版 TreeOfLife-200M + 26M LAION replay,25 epoch,32× H100 80GB,11 天,约 8,448 GPU-hours。这个量级不适合在当前 M5 上完整复训。
| 方案 | 原生输出 | 定位能力 | 规模 / 上限 | 对本项目的结论 |
|---|---|---|---|---|
| YOLO26 Detect / Seg | 0…N 个鸟框、置信度;Seg 另有 mask | 原生可靠 多尺度、多鸟、几何监督 | 2.4M–55.7M 融合参数;随 n/s/m/l/x 扩展 | 唯一直接同时满足“有无鸟 + 鸟框”的候选。目标域微调最合理。 |
| EfficientNet / MobileNet / ConvNeXt | 整图二类或多类 logits | 无 Grad-CAM 不是 bbox | 约 1M–100M+ 可选 | 适合便宜预筛或 YOLO 框后二次复核;小鸟整图缩放是主要风险。 |
| OSEA 完整 CLI | Faster R-CNN 框 + 约 11k 鸟种 | 有,但来自外置 COCO detector | 约 70.64M / 270 MiB | 鸟种分类强,不证明其前端比自训 YOLO 更会找本地鸟。 |
| OSEA 分类器单体 | 约 11k 物种 logits | 无 | 26.93M / 约 103 MiB | 最大 softmax 不是校准过的“有鸟概率”,非鸟会被迫归类。 |
| BioCLIP 2.5 Huge | 1024 维图 / 文 embedding 与相似度 | 无 | 986.11M / 3.94 GB | 开放词表与生物语义上限最高;适合作框后分类、teacher 或伪标签,不适合当前小模型前端。 |
先把监督信号分开:presence / bbox 负责“有没有鸟、鸟在哪里”;quality 负责“是否失焦、运动模糊、曝光失败、是否值得保留”。一个样本可以同时是“有鸟”与“质量差”。
| 字段 | 取值 | 用途 | 最容易犯的错 |
|---|---|---|---|
bird_present | 0 / 1 / ignore | 图像级 presence;至少一个可辨认鸟框即为 1 | 把严重模糊鸟标成 0,训练出系统性漏检。 |
bbox | [x, y, w, h] | 每只可见鸟一个框;框住当前画面内可见部分 | 只框“主鸟”而漏标其他鸟,未标鸟会被当背景。 |
visible_fraction / truncated | 0–1 / 0–1 | 边缘半鸟、遮挡与裁切压力测试 | 框被增强过滤后,自动把图改成可靠负样本。 |
defocus | 0 / 1 / 2 / 3 | 焦点落错、镜头离焦等级 | 与运动模糊、像素不足混成一个 blur 标签。 |
motion_blur | 0 / 1 / 2 / 3 | 主体运动 / 相机抖动;可再细分来源 | 用高斯模糊代表全部运动轨迹。 |
noise / exposure / occlusion | 分级或枚举 | 质量模型与困难分片评测 | 增强了图像却没有同步更新质量标签。 |
burst_id / source_id | 稳定 ID | 按连拍、日期、视频和来源拆分,防止泄漏 | 同一连拍随机落入 train 与 test,指标虚高。 |
augmentation_recipe | 类型、强度、seed | 合成缺陷可追踪、可复现 | 把合成图与真实失败片混在一起报告。 |
适用:追求极限召回,愿意用云端 GPU 或接受本机数天训练;保留为最终容量上限,不作为第一轮。
yolo26x.pt COCO 权重;类别仅 bird。适用:兼顾小鸟召回、速度、内存和快速迭代;是当前 M5 最合理的第一生产模型。
yolo26s.pt;9.5M 融合参数,19.48 MiB 权重。适用:只需整图 presence,或作为 YOLO 候选框复核器。它不提供鸟框,不能单独完成本项目两个目标。
ignore,不能强行判负。流程:YOLO 以偏低阈值追求召回 → 框外扩 10%–20% → B0 判 bird / no-bird → 合并重复框 → 图像级 presence = 至少一个通过复核的框。
from ultralytics import YOLO
model = YOLO("yolo26s.pt")
model.train(
data="bird.yaml", device="mps", imgsz=640,
epochs=60, batch=8, workers=4,
lr0=1e-3, patience=15,
mosaic=0.35, mixup=0.03, copy_paste=0.10,
close_mosaic=10, seed=42
)
这是规划起点而不是神奇配方。batch 与 workers 应先做 50–100 张 smoke test;若 MPS 或解码不稳,优先降 batch / workers,不要在全量训练中排错。
检测集的每个框都能派生正样本,但“没有标 Bird”不等于没有鸟。只有官方明确 negative / empty,或人工复核过的图,才可作为 no-bird。许可也必须按数据源、甚至按单张图片核验。
| 数据集 | 规模与标注 | 明确空图 / 负样本 | 本项目价值 | 主要限制 |
|---|---|---|---|---|
| Open Images V7 | 约 900 万图;600 个框类别,含 Bird;图像级正 / 负标签 | 有 人工确认 Bird-negative | 普通摄影域最接近;鸟框 + 正图 + 明确无鸟图;适合 hard-negative mining | 未标 Bird 不能自动当负图;图片许可逐文件核验。 |
| iNaturalist 2017 · Aves | 964 类;214,295 train + 21,226 val;283,931 + 17,314 鸟框 | 鸟子集无明确空图 | 大规模自然环境、物种与背景多样;优秀 detector 预训练源 | 非商业研究 / 教育;物种标签不一定逐框精确。 |
| Big Bird | 4,284 UAV 图;49,990 标注:41,337 框 + 8,653 多边形;102 种 | 3,209 空图 约 75% | 正 / 空同采集域,适合低误报与 bird / no-bird | 俯拍群鸟与地面长焦有域差异。 |
| FBD-SV-2024 | 483 视频、28,694 帧、28,366 鸟实例;bbox + 0–3 难度 | 4,861 空帧 | 小飞鸟、复杂监控背景、低信息量实例;困难正样本 | 按视频拆分;许可说明存在表述差异,按更严格条件处理并联系作者。 |
| Distant Bird Detection | 47,260 张 4K 图、60,971 框;hawk / crow / wild bird | 未明确 | 远距离小鸟、多地点和背景;MIT 代码 / 数据说明 | UAV 域;大部分正图,不能独立构建 no-bird。 |
| SOD4SB / MVA2023 | Train1 47,260 图 / 60,971;Train2 9,759 / 29,037;单类 bird、COCO 格式 | 未明确 | 专攻 noisy、blurred、less-informative 小鸟 | 没有逐图模糊类型标签;数据条款需核验。 |
| AirBirds | 118,312 连续图、409,967 飞鸟框;平均目标小于 10 px;约 165 GB | 官网未公布 | 极小飞鸟、四季、天气与光照变化 | 机场固定监控域;CC BY-NC-SA 4.0。 |
| CUB-200-2011 | 11,788 图、200 种;每图框、15 部位点、312 属性 | 无 | 清晰主体、框与关键点快速实验 | 偏干净正样本;非商业研究 / 教育。 |
| NABirds | 约 48,000 图、约 400 种 / 550+ 视觉类;框与部位标注 | 无 | 专家策展,补性别、年龄与羽态 | 正样本偏干净;Cornell 非商业研究条款。 |
| USGS 航拍鸟类 | 80MP 航拍切成 720 / 1440 patch,COCO 鸟框;代码支持 any-bird 过滤 | 含候选空 patch,数量未披露 | patch 级 bird / no-bird 与高分辨率分块检测 | 航拍域差异大。 |
| Skagen / Klim | 丹麦风场固定相机帧、鸟框,约 3.43 GiB | 未公布精确数 | 天空、海岸、风场与飞鸟;CC BY 4.0 | 固定监控域,不等于相机长焦。 |
| Caltech Camera Traps | 243,100 图、约 66,000 框;21 动物类 + empty | 约 70% empty | 林地、树枝、夜景和动物 hard negatives | 不是鸟类专集;empty 仍需抽查极小漏标鸟。 |
| 本地七月照片 | 4,794 张:4,698 JPG + 96 ARW,约 35.6 GB | 需要人工确认 | 最高价值 与相机、镜头、背景、工作流完全同域 | 需要补 presence、全框与质量标签;按连拍拆分。 |
存在至少一个有效鸟框 → bird_present = 1 人工确认无任何鸟 → bird_present = 0 只有可疑黑点、无法确认 → ignore
| 可迁移数据 | 规模 / 标注 | 可提供什么 | 不能替代什么 |
|---|---|---|---|
| CUHK Blur Detection | 1,000 图;10 人标模糊区域;704 离焦、296 局部运动模糊 | 模糊区域与类型分支预训练 | 这些都是通用模糊 / IQA 先验。最终阈值仍必须在鸟框、鸟头、鸟眼和本地真实失败片上微调与校准;不能把其 MOS 直接映射成鸟片星级。 |
| KonIQ++ | 10,073 图;质量分与 blur、artifact、color、contrast 缺陷频率 | 多标签技术缺陷预训练 | |
| SPAQ | 11,125 真实手机照;MOS、亮度、色彩、对比、噪声、清晰度 | 真实拍摄质量 / 清晰度回归 | |
| VizWiz Quality Issues | 39,181 图;blur、过 / 欠曝、构图失败、遮挡、旋转、不可识别 | 最接近“拍摄失败”的多标签定义 | |
| LIVE-Meta VI-UGC | 39,660 图 + 39,660 patch;约 270 万质量与失真判断 | 大规模真实混合失真和局部质量 | |
| GoPro Blur | 3,214 组动态清晰 / 模糊配对 | 运动模糊预训练、轨迹与强度校准 | |
| RealBlur | 真实拍摄清晰 / 模糊配对,RealBlur-J / R | 真实相机运动模糊,优于纯高斯 | |
| DPDD | 500 场景、2,000 图;双像素子孔径、离焦与全清晰配对 | 真实镜头离焦 / bokeh PSF | |
| KADID-10k | 81 参考图 × 25 失真 × 5 级 = 10,125 图 + DMOS | 可控失真等级的课程训练 |
增强的目标不是制造越多越怪的图,而是覆盖真实相机、镜头、鸟运动和构图失败的分布。检测增强必须同步更新 bbox;质量增强还要记录类型、强度与随机种子。
| 增强类型 | 拍鸟场景实现 | 标签如何更新 | 边际概率 |
|---|---|---|---|
| 水平翻转 | 改变鸟朝向;通常符合自然摄影 | 框、mask、关键点同步翻转 | 0.50 |
| 轻旋转 / 平移 | 旋转约 ±8°–12°,平移不超过画面 10% | 框同步变换并裁到边界 | 0.15–0.25 |
| 多尺度 / 小鸟 | 让鸟框面积按对数分布变化,重点补画幅 0.02%–2% 的鸟 | 同步缩放;短边低于约 4–6 px 的目标不作普通强监督 | 0.25–0.40 |
| 离焦模糊 | disk / bokeh PSF;半径按鸟框短边约 0.5%–3%;生成轻 / 中 / 重 | presence 保持 1;bbox 保持;增加 defocus | 0.07–0.12 |
| 运动模糊 | 随机方向线性 / 非线性轨迹;长度约鸟框宽 2%–15%;区分鸟动与相机抖动 | presence 保持 1;增加 motion_blur | 0.06–0.10 |
| 焦点落到背景 | 有 mask 时只模糊鸟,树枝 / 背景保持清晰,边缘羽化 | 框不变;标 defocus | 0.05–0.08 |
| 下采样再放大 | 先缩至 15%–60%,再双线性 / area 放大,模拟远距离像素不足 | 框保持;记录 low_resolution,不要当作离焦 | 0.05–0.10 |
| 半鸟 / 边缘鸟 | 主动把鸟中心推到四边,保留 20%–80% 身体;不是盲目中心裁切 | 框裁到边界;更新 visible_fraction / truncated | 0.08–0.15 |
| 真实遮挡 | 枝叶、芦苇、草、水花 alpha 遮挡,覆盖约 10%–50% | 框通常保留;不可辨认时改 ignore | 0.08–0.15 |
| ISO / 传感器噪声 | Poisson shot + Gaussian read noise;彩噪弱于亮噪;少量热像素 | 框不变;更新 noise | 0.08–0.15 |
| 曝光失败 | 在线性光空间约 −1.5…+1.5 EV;少量高光剪切、黑位堵塞 | 框不变;更新 exposure | 0.10–0.20 |
| 色温 / 白平衡 | 轻微冷暖、绿 / 洋红偏移,覆盖晨昏、林荫、阴天 | 框不变;避免生成不自然羽色 | 0.10–0.20 |
| 低对比 / 薄雾 | 逆光、水汽、远距离空气透视;低频加入雨雪和耀斑 | 框不变;必要时更新遮挡 / 对比标签 | 0.05–0.10 |
| JPEG / 工作图退化 | JPEG quality 35–95,少量多次转码;匹配 RAW→工作 JPEG 流程 | 框不变;更新 artifact | 0.05–0.12 |
| Copy-Paste | 用真实鸟 mask 粘到本地无鸟树枝 / 水面 / 天空;匹配尺度、色温、噪声、景深 | 新增框;检查背景原图是否还有漏标鸟 | 0.10–0.20 |
| Mosaic | 四图组合,增加多鸟、小鸟和边缘目标;只用于 detector | 框自动同步;最后 10%–20% epoch 关闭 | 0.20–0.50 |
| MixUp / CutMix | 低频正则;ghost bird 会破坏真实感 | 保留对应框和软标签;质量模型一般不用 | MixUp 0–0.05 CutMix 0–0.10 |
框同步可使用 Albumentations bbox-aware transforms;Mosaic、MixUp、CutMix、Copy-Paste 参数参见 Ultralytics 官方增强指南。
visible_fraction ≥ 0.20 且可人工识别:
bird_present = 1
bbox = clipped_bbox
0 < visible_fraction < 0.20:
bird_present = ignore
不参与普通 presence / bbox loss
visible_fraction = 0:
bird_present = 0
仅当确认画面没有其他鸟min_visibility 过滤掉一个框,不代表该图片自动变成可靠负样本。
方法参考 Simple Copy-Paste。
bird_present=1。模型架构不是当前最大不确定性,标签定义和困难负样本才是。用小模型快速闭环,等错误类型稳定后再决定是否上 m / x,可大幅减少无效训练。
从 4,794 张七月照片中按日期 / 连拍组抽固定 test ≥800–1,000 张;覆盖无鸟、普通鸟、小鸟、模糊、半鸟、多鸟与 hard negatives。测试集不做合成增强。
确认全部 presence;对有鸟图标全所有鸟框;额外给至少 800–1,500 张真实失焦、运动模糊、遮挡和半鸟加质量标签。二分类标签约需数小时;2,000 张全框按每图 15–45 秒规划约 8–25 小时,复杂多鸟另加余量。
YOLO26s 640 / 60 epoch 与 EfficientNet-B0 224。保留 COCO 原始 YOLO、现有慧眼入口作为对照;同一测试集报告 recall、FP/image、模糊鸟和小鸟分片。
在剩余本地照片及公开负样本上跑低阈值推理;优先补标高置信假阳性与人眼确认的漏检。每轮新增 300–800 个“模型最不懂”的样本,通常比随机再加 5,000 张更值钱。
小鸟漏检:960 / tiles → P2;普通鸟漏检:数据 / 标签 / threshold;树枝误报:hard negatives + B0 复核;容量仍饱和:再比 YOLO26m / x。不要一开始同时更换模型、分辨率和数据。
存在 / 框模型稳定后,再把框送入鸟头锐度、失焦 / 运动模糊和连拍排序模型。先以旁路报告验证,不立即覆盖星级;通过固定回归集后再写回。
| 数据组成 | 建议规模 | 优先级 | 说明 |
|---|---|---|---|
| 本地真实有鸟图并标全所有鸟框 | 2,000–3,000 张 | P0 | 目标域最重要;多鸟必须全标。 |
| 本地真实无鸟 / 误报困难负样本 | 1,000–2,000 张 | P0 | 优先树枝、叶片、飞机、飞虫、反光和小黑点。 |
| 本地真实模糊、失焦、遮挡、半鸟 | 800–1,500 张 | P0 | 同时保留 presence=1 与质量失败标签。 |
| Open Images 明确 Bird 正 / 负 | 各 5,000–15,000 | P1 | 先抽样,按本地误差再扩充。 |
| iNaturalist / CUB 等公开鸟框 | 10,000–30,000 抽样 | P1 | 预训练或分阶段混入,不必每轮全量。 |
| FBD-SV / Big Bird 空图和小鸟 | 5,000–15,000 抽样 | P1 | 强调 explicit empty 与小目标。 |
| 固定真实 test | ≥1,000 张 | P0 | 只放原图;按场景 / 连拍隔离。 |
规模来自官方模型页、模型卡、作者仓库或论文;本机时长是由已有实测条件化外推。数据许可只作技术筛选提示,不构成法律意见,实际使用前应复核当期条款。