慧眼识鸟审计

Technical audit · 2026-07-19

慧眼识鸟:模型、训练与素材审计报告

当前本地实现是 SuperPicky / 慧眼选鸟 4.3.0 LTS。它不是一个端到端的“照片好坏模型”,而是把鸟检测、眼喙关键点、通用美学、飞行二分类、传统锐度/曝光算法和固定阈值串在一起,再选择性调用 OSEA 识别物种。

审计版本 4.3.0 LTS 提交 5177def 当前设备 Apple M5 / 32 GB 研究截止 2026-07-19
5个学习模型:YOLO、SuperEyes、SuperFlier、TOPIQ、OSEA
4,794张 7 月本地照片,约 35.6 GB;是最重要的目标域素材
160 GiB当前可用磁盘;不足以同时容纳多个大型公开数据集
2 个应优先修复的代码级风险:掩码路径与 TOPIQ 配置
Executive summary

先说结论

现有系统适合作为“候选片粗筛器”,但还不适合把单一星级当作摄影质量的可靠真值。改进的最佳路径不是立刻重训所有大模型,而是先修实现问题,再用本地连拍偏好和高价值公开标注做针对性微调。

01

多数模型并非慧眼从零训练

YOLO11l-seg、TOPIQ、OSEA 使用上游权重;SuperEyes 与 SuperFlier 是作者基于 ImageNet 预训练网络做迁移学习。作者没有披露任何一项定制模型的硬件与墙钟训练时间。

02

高分误报是级联误差

通用 COCO 鸟检测一旦把背景误认成鸟,后续规则没有独立的“鸟存在性复核”;通用 AVA 美学还可能奖励漂亮背景。分割掩码的本地实现风险会进一步放大背景边缘的锐度。

03

低分好片多来自任务错位

系统只评多鸟图中的一只;眼喙点不可见会提前降级;没有专门的运动模糊、姿态质量或物种情境模型。飞鸟、背身、遮挡和小主体容易被粗糙规则惩罚。

最划算的升级组合:修复掩码与 TOPIQ 头数 → 对 7 月误报/漏报建立回归集 → 用 iNaturalist 2017 + Open Images 做鸟检测微调 → 用 BirdGaze/CUB/NABirds 做关键点预训练并补标本地鸟片 → 用同一连拍的 A/B 偏好训练最终排序器。完整重训 OSEA 或 TOPIQ 并不是当前优先级。
公开披露:论文、仓库、官方数据页 本机审计:当前代码与权重 本机实测:当前 M5 运行 本机估算:由实测外推,非作者承诺
版本边界:本报告审计的是当前机器上的 4.3.0 LTS(提交 5177def)。GitHub 在 2026-07-13 已出现 4.5.0-rc5,但 RC 的代码变化不混入本报告的“当前行为”。
01 · Current system

当前流程与评分逻辑

星级是多模型输出经过一组固定阈值和乘法权重后的结果。OSEA 只负责物种候选,不参与照片质量星级。

Step 1解码与缩放RAW/JPEG → 工作图;应用先把最长边缩到 1024。
Step 2YOLO11l-seg只取 COCO bird=14;输出框、置信度与实例掩码。
Step 3选一只鸟优先相机对焦点所在鸟,否则取最高置信度;框外扩 15%。
Step 4 · parallel眼喙 + 飞行SuperEyes 定位双眼/喙及可见度;SuperFlier 判飞/不飞。
Step 5 · parallel质量特征头部 Tenengrad 锐度、TOPIQ 全图美学、直方图曝光、ISO/对焦点权重。
Step 6规则评分与写回输出 -1/0/1/2/3;可选 OSEA 仅处理 ≥2;写 XMP/EXIF/Lightroom。

真正参与星级的信号

检测是否有鸟 / conf
锐度头部 Sobel
美学TOPIQ 全图
可见度眼喙点
规则曝光/ISO/飞行/焦点

没有独立的运动模糊分类器;“运动模糊”只被头部梯度与通用 IQA 间接感知。

固定阈值的主要路径

无鸟 → -1conf < 0.5 → 0;关键点全隐藏 → 1;锐度 <100 或 TOPIQ <3.5 → 0;锐度 ≥400 且 TOPIQ ≥5 → 3;满足其一 → 2;均不满足 → 1。

实际顺序并非所有权重在末尾统一相乘:ISO 先修正原始锐度并参与最低锐度门槛;通过门槛后,对焦位置与飞行状态再调整锐度/TOPIQ;眼睛可见度最后作用于基础星级并取整,曝光异常再减 1。阈值不是从本地 Lightroom 选择行为中学习得到的。

当前模型与算法清单

参数量由本机实际结构核算
模块来源与用途规模输入 / 计算是否影响星级
YOLO11l-segUltralytics 官方 COCO 实例分割;筛 bird=1427,678,368 参数
约 132.2 GFLOPs
权重 53 MB
应用预缩最长边 1024;调用未显式传 imgsz 时,内部通常按默认 640入口 有鸟、框、置信度
SuperEyesResNet50 + MLP;左右眼、鸟喙坐标与可见度24,692,297 参数
权重 95 MB
鸟裁切 416×416直接 定头部 ROI 与可见度
SuperFlierEfficientNet-B3 二分类;飞行/非飞行10,697,769 参数
权重 41 MB
鸟裁切 384×384直接 飞行加权
TOPIQ / CFANet通用 AVA 美学质量分布,映射 1–10 MOS73,383,567 参数
权重 280 MB
完整照片 384×384;仅在眼点足够可见时运行直接 美学阈值
OSEAResNet34;11,000 输出,实际物种表约 10,96426,927,672 参数
权重 103 MB
鸟裁切 224×224;通常只处理星级 ≥2不参与 只写物种候选
传统算法Sobel/Tenengrad、灰度直方图、ExifTool MakerNote、固定规则0 参数头部锐度、曝光、ISO、相机对焦点、评分映射直接

本地 4.3.0 LTS 的关键风险

代码审计 + 小样本诊断
高优先级

分割掩码可能在锐度路径中静默失效

ai_model.py:185–191 先复制 masks 后删除 results;但 ai_model.py:410–434 又引用 results[0].masks,异常被宽泛的 try/except 吞掉。结果很可能令 bird_mask=None,原本设计的“头部圆形 ROI ∩ 鸟轮廓”退化,树枝、羽毛外缘或背景高频纹理可抬高锐度;相机焦点的 mask 判断也可能回退。

行动:改用已经复制的 mask 数组;增加单元测试,强制断言有分割结果时 mask 非空,并用 7 月误报图做回归。

高优先级

TOPIQ 的注意力头数与官方 checkpoint 配置不一致

本地 topiq_model.py:214 默认 num_heads=4,而同一 AVA checkpoint 的官方 YAML 使用 8。参数张量形状兼容,因此 strict=False 不会报警,但注意力计算不同。本机 5 个鸟片裁切的 4-head vs 8-head 差值最大约 0.059 分;总体不大,却足以让阈值附近照片翻级。

行动:对齐 8 heads,并以固定图片集记录变更前后 TOPIQ、最终星级与人工偏好。

结构性

通用美学不等于鸟类摄影质量

TOPIQ 在 AVA 通用摄影上训练,可能给漂亮背景、颜色和构图高分,即便鸟主体虚、太小或不存在;也可能惩罚背景凌乱但鸟眼锐利、行为珍贵的纪实照片。当前全图 TOPIQ 权重大,却没有鸟主体美学的专门校准。

结构性

多鸟只评一只;飞行只有二分类

多鸟图仅选择“焦点所在或置信度最高”的一只,其余主体不参与评分。SuperFlier 实质更接近“翼展开/未展开”的二分类,且训练集飞行样本仅 273 张;游泳、落地、扑食、振翅、背身等姿态被压成一个粗糙布尔值。

结构性

级联模型没有失败复核

一旦 YOLO 把树叶、飞机或远处黑点认成鸟,后续会把该裁切当真鸟继续评分;没有第二个 bird/non-bird 验证器,也没有“无鸟困难负样本”校准头。反过来,YOLO 漏掉真实鸟时整张照片直接被判无鸟。

02 · Public disclosure

模型从哪里来,训练公开到什么程度

“代码公开”不等于“权重可精确复现”,也不等于“可以自由商用”。下表分别记录数据、配方、硬件、时间与许可缺口。

模型权重性质公开训练数据公开训练配方作者披露的成本复现判断
YOLO11l-seg Ultralytics 官方权重;慧眼未 fine-tune COCO 2017:约 118,287 train、5,000 val、80 类 训练框架/接口/格式公开;该 checkpoint 的完整逐项日志未公开 未披露 具体硬件、墙钟时间和实际费用 微调容易
从零逐位复现官方权重不现实
SuperFlier 作者迁移学习;部署权重与公开 top0 一致 1,445 张:Fly 273 / NoFly 1,172;seed 42,80/10/10;测试仅 145 张 EfficientNet-B3,384,batch 32,RMSprop,最多 15 epoch,只解冻最后块+头;最佳 epoch 12。144 组网格搜索,再重跑前 10 未披露 硬件和训练秒数;README 的 lr 5e-5 与结果 CSV 的 5e-4 冲突 技术中高
数据/代码/权重可见,但无 LICENSE
SuperEyes 作者迁移学习 CUB-200-2011 11,788 张 / 200 种;仅取左眼、右眼、喙;重新随机 70/30 ResNet50 全量优化;AdamW、Wing+BCE+空间先验,lr 5e-5,batch 16,最多 50 epoch,patience 10;最佳报告跑 32 epoch 未披露 硬件/时间;训练分辨率资料出现 416 与 640 冲突 中等
方法清楚,精确环境/分辨率欠缺,仓库无 LICENSE
TOPIQ IQA-PyTorch 官方 AVA checkpoint;慧眼未 fine-tune AVA 约 255,530 张;每张为 1–10 分投票分布,平均约 210 次评分 单 GPU,384,batch 16,10 epoch,AdamW 3e-5、wd 1e-5、cosine、EMD、seed 123、16 workers、8 heads 未披露 GPU 型号与墙钟时间 中等
配方完整;AVA 获取/权利和依赖是门槛
OSEA 上游 ResNet34;慧眼直接部署 论文原始 DIB-10K >4.8M / 10,922 种;清洗后 4,706,520 / 10,916,9:1。当前下载页另列 3,411,804 / 10,915,属于版本差异 从 MetaFGNet LBird-31 迁移;32 epoch,batch 256,momentum .9,wd 1e-4,64 workers,里程碑 15/23;冻结预训练部分并换分类头 硬件已披露 RTX 4090D、90 GB RAM、15 核 Xeon 8474C、AutoDL;时间/费用未披露 低—中
数据快照与规模是主要障碍
传统规则 慧眼代码中的 OpenCV/ExifTool/阈值 不训练实现公开无训练成本可精确复现

YOLO:可微调,不必从零训练

库存 COCO 模型只见过通用“bird”类。用本地误报、远鸟、小鸟和空镜进行 YOLO11s/l-seg 微调,收益远高于复现官方 COCO 预训练。

Ultralytics Train 文档 · YOLO11 模型表

SuperEyes / Flier:公开但不够严谨

两者能重跑,却缺少锁定依赖、训练硬件、稳定 MPS 分支和清晰许可。SuperFlier 的 98.6% 测试准确率来自仅 145 张同来源测试图,不应当作跨摄影师泛化保证。

SuperBirdEye · SuperFlier

OSEA:方法公开,数据工程最难

数百万张、多源、万物种数据的下载、去重、坏图清理、非鸟剔除、版权追溯和长尾均衡,往往比 32 个 epoch 本身更昂贵。当前 Mac 适合部署和小规模适配,不适合完整重训。

OSEA 论文 · 代码

许可不是附注:SuperPicky 仓库元数据为 AGPL-3.0,但 README 中存在 GPL/AGPL 表述不一致;Ultralytics 为 AGPL-3.0 或商业 Enterprise 许可;SuperFlier / SuperBirdEye 未见 LICENSE;IQA-PyTorch 的相关版本含 PolyForm Noncommercial 条款。若模型要进入商业产品,必须在训练前做一次逐项法律审查。
03 · Local training budget

当前这台 Mac 能训练到什么程度

下述“实测”来自当前 Apple M5;“估算”以实测吞吐和公开配方外推,包含合理余量,但不是作者披露,也不是精确交付承诺。

设备

MacBook Pro Mac17,2
Apple M5,10 核 CPU / 10 核 GPU

统一内存

32 GB
官方带宽 153 GB/s

训练栈

PyTorch 2.13.0
MPS 可用,Ultralytics 8.4.100

存储

160 GiB 可用
总盘 926 GiB,已使用约 83%

本机微基准

已在当前机器运行
任务设置实测结果如何解读
YOLO11l-seg 训练COCO128-seg,640,batch 4,workers 0,MPS,2 epoch单轮约 77–98 秒
全流程 266.7 秒
约 1.46 train images/s
MPS 6.6–7.6 GB
最接近实际 YOLO 预算;包含验证但小数据开销偏高
SuperFlierEfficientNet-B3,384,batch 32,仅最后块+头,合成张量0.604 s/step
约 53.0 images/s
约 191 MB MPS allocated
不含 JPEG 解码、增强和验证;只作为吞吐下界
SuperEyesResNet50 全训练,416,batch 16,合成张量0.915 s/step
约 17.5 images/s
约 926 MB MPS allocated
实际数据增强和关键点损失会更慢
OSEA 适配ResNet34 冻结骨干 + 11k 新头,224,batch 128,合成张量0.501 s/step
约 255.6 images/s
driver 约 2.67 GB
这不是完整数据管线;数百万张图片的 I/O 和验证会主导

可执行训练场景

本机估算
目标建议数据 / 设置当前 M5 预计资源与结论
复现 SuperFlier1,445 图,15 epoch,384约 10–20 分钟轻松 先修类别定义和分组划分
改良姿态分类5,000 图,30 epoch,多姿态而非二分类约 1–2 小时适合本机
复现 SuperEyesCUB 11,788 图,最多 50 epoch,416约 8–14 小时可过夜 最佳公开运行 32 轮通常更短
YOLO11s-seg 微调2,000 图,50 epoch,640约 5–9 小时首选 比 l 快,适合迭代数据闭环
YOLO11l-seg 微调2,000 图,50 epoch,640约 18–26 小时可做 batch 小,需梯度累积
YOLO11l-seg 中型训练5,000 图,80 epoch,640约 3–5 天勉强 960/1024 输入约再慢 2–3×
TOPIQ 全 AVA约 255k 图,10 epoch,384数天至 1 周以上
低置信估算
不推荐 数据权利/存储和长时间热负载更关键
OSEA 全规模重训3.41–4.71M 图,32 epoch,224理论纯算约 5–7 天;最好情形约 7–12 天,现实可能数周
低置信估算
不推荐 未实测解码/增强/验证/长时间热负载;数据可能数百 GB–TB
存储是眼前的第一瓶颈。AirBirds 单集约 165 GB,iNaturalist 2021 完整训练包约 224 GB,Distant Bird 约 67 GB;当前仅余 160 GiB。建议至少增加 2 TB 外置 NVMe,若要聚合视频/UAV/3D 数据则用 4 TB,并把原图、缓存、切片和 checkpoint 分卷管理。
云 GPU 的使用边界。本机适合 YOLO 2k–5k、关键点、姿态与最终排序器迭代;完整 AVA/OSEA 或多轮大规模超参搜索更适合 RTX 4090/5090、A6000/A100 等 NVIDIA 环境。对本项目而言,购买标注质量通常比购买更多算力更值钱。

现有 7 月素材盘点

本地文件清点
日期照片数日期照片数总体
07-0342707-076784,794 张
4,698 JPG + 96 ARW
约 35.6 GB

现有分析索引 4,696 行;预测记录 43,830 行。
07-0419407-08965
07-0542107-09975
07-0643907-10695

建议把这 4,794 张按“拍摄日期 + 连拍组 + 场景”分组,而不是随机按单张分训练/验证。否则同一连拍会同时落入两边,验证分数虚高。

04 · Public datasets

公开且有标注的训练素材

目录优先收录官方数据页、论文项目页或原始存储记录。标注许可证与图片版权经常不是同一件事;“能下载”不能自动推导为“可商用训练”。

第一优先:关键点

BirdGaze → CUB → NABirds → 本地校正

BirdGaze 的眼、喙、头/身中心与尺度最贴近 SuperEyes;再补标 3,000–8,000 个本地实例。

第一优先:检测

iNat 2017 → Open Images → 本地困难负样本

先学大量鸟框,再专门加入树枝、叶片、飞机、水面反光、空镜和极小黑点。

第一优先:评分

通用 IQA 预训练 → 本地连拍偏好

最终目标应是“这一连拍哪张更值得保留”,不是跨场景硬凑一个绝对星级。

数据集目录

A+/A/B/C 只表示与当前任务的匹配度,不代表许可已经通过,也不代表可商用。正式采用仍以同一行的许可/获取限制和实际下载版本为准。

数据集规模与标注最适合许可 / 获取 / 局限建议
iNaturalist 2017 Aves鸟类 964 类;214,295 train + 21,226 val;约 301,245 鸟框,COCO JSON检测物种 通用鸟框和长尾场景非商业研究/教育,不得再分发;同图多鸟可能继承观察级物种名A+ YOLO 首选
BirdGaze约 104,705 train + 1,705 val + 1,811 test;另 3,254 手标视频帧;头/身体中心尺度、头顶、喙尖、双眼点关键点姿态 SuperEyes 替代/预训练Dryad 注释约 692 MB;底层图片来自多源,权利继承各原集A+ 最贴任务
CUB-200-201111,788 图 / 200 类;bbox、15 部位点、312 属性、分割关键点 眼、喙、翼、尾、身体仅非商业研究/教育;Caltech 不拥有图片版权;规模小、北美偏置A 已用于 SuperEyes
NABirds48,562 图 / 555 视觉类(约 400 物种);bbox、11 部位点、性别/年龄/羽色关键点物种 更大鸟体定位Cornell 条款严格、按非商业研究处理;北美域A
Birdsnap49,829 图 / 500 北美物种;框、17 部位、部分性别/年龄/羽色关键点物种Flickr 来源;当前正式获取和逐图许可不稳定,谨慎使用镜像B 先做权利核验
CHIRP西伯利亚松鸦;关键点子集 879 图 / 1,176 实例 / 13 点;另有框、实例分割、行为和重识别关键点行为分割单物种、固定环境;代码许可不自动覆盖媒体A− 动作/点位优质
3D-POP约 300k 帧、约 4M 实例;1–10 鸽、4 视角、身份/轨迹/bbox/2D+3D 点3D姿态追踪CC BY 4.0;实验室鸽域;压缩后仍 >1 TBB+ 研究价值高
Avian Mesh / Penn Aviary>6,300 mask、约 1,000 关键点实例;受控社交鸟分割关键点 鸟体网格受控场景,与野外摄影有域差B+
Animal Kingdom50h 视频;30,100 动作片段 / 140 动作;33,099 姿态帧 / 23 点;850 物种姿态行为 可抽鸟类子集跨动物;需核对媒体许可和鸟类覆盖B+
PigeonSuperModel>3,000 手标多视角鸽子帧;姿态点姿态 受控多视角单物种、实验室域B
Visual WetlandBirds178 视频 / 13 物种 / 7 行为;框、物种、个体、行为;约 9.4 GB飞行/姿态追踪CC BY 4.0;湿地鸟域较窄A 替代二分类
AirBirds118,312 张 1080p 时序帧;409,967 手标飞鸟框;平均鸟体 <10px;约 165 GB极小飞鸟检测CC BY-NC-SA 4.0;需申请;机场固定机位与近摄差异大B+
FBD-SV-2024483 clips / 28,694 帧 / 28,366 飞鸟;bbox + track;约 1.67 GB飞鸟检测追踪Figshare 标 CC BY 4.0,仓库文字偏研究用途;按更严格口径或联系作者B+
SOD4SB / MVA 2023两训练集约 57,019 图 / 90,008 实例;COCO 框;远距离小鸟与无人机域小目标检测比赛条款;公共/私有测试划分复杂B+
Distant Bird Detection47,260 张 4K / 60,971 框;hawk/crow/wild bird;约 67 GB远鸟小目标无人机域;代码 MIT 不等于图片许可,需再核对B
Big Bird 20264,284 张 UAV RGB;3,209 空图;49,990 标注(框 41,337 + polygon 8,653);102 物种检测负样本物种UQ reuse-with-acknowledgment;大量空图很有价值A
IBERBIRDS4,000 图;10 种伊比利亚大型飞鸟;YOLO bbox + species飞行检测CC BY 4.0;物种与地域窄A−
PartImageNet24,095 图 / 158 类;鸟 14 类;头/身/翼/脚/尾像素级 part mask部件分割 主体/头部/翼注释仓库 Apache;底层 ImageNet 图片权利另算B+
Open Images V7约 9M 图、16M 框 / 600 类、2.686M masks / 350 类;含 verified positive / negative Bird 标签检测负样本 场景多样性标注 CC BY 4.0;图片通常标 CC BY 2.0,仍须逐图核验A
COCO 2017约 118k train / 5k val;80 类,Bird bbox + instance mask检测分割 当前 YOLO 预训练域图片按各 Flickr 许可;鸟类标签粗B+
LVIS164k 图,1,200+ 类,>2M 高质量实例 mask;基于 COCO 图长尾分割 可抽鸟类底图沿用 COCO/Flickr 权利;类极长尾B
iNaturalist 2021 Aves1,486 物种;414,847 train、74,300 mini、14,860 val;最大边 500;无框物种表征 长尾预训练非商业研究/教育,不得再分发;完整总训练包约 224 GB,mini 总包约 42 GBB+
DIB-10K当前页列 3,411,804 图 / 10,915 类;论文清洗版 4,706,520 / 10,916;物种分类,无 bbox/点物种 OSEA 规模复现巨大、版本不一致;下载可用性与图片许可需逐项确认C 不适合当前本机
USGS Aerial Avian航拍鸟类影像与 COCO bbox 标注航拍小鸟检测美国政府数据页;摄影域与常规鸟片差异大B
Caltech Camera Traps243,100 图、约 66k 框;约 70% 空图/非鸟负样本 空镜与动物干扰许可较宽松;相机陷阱域偏差明显A− 困难负样本
AVA约 255,530 图;1–10 分投票分布,平均约 210 票/图通用美学 TOPIQ 原训练DPChallenge 来源;获取和商用权利有门槛;非鸟专用B 只作预训练
KonIQ-10k10,073 真实失真图;约 120 万评分 / 1,459 人;MOS 与质量统计IQA 真实失真预训练研究使用;保留 YFCC 来源许可;非鸟专用A−
KonIQ++ / Image Defects沿用 KonIQ 图;模糊、伪影、颜色、对比度等缺陷标签模糊缺陷研究用途;需回溯原图许可A 缺陷辅助头
SPAQ11,125 手机图、66 款设备;MOS + 亮度/色彩/对比/噪声/锐度/场景/EXIF技术画质锐度仓库未清晰声明媒体商用许可;手机域A−
LIVE In the Wild1,162 真实手机图;>350k 主观评分,>8,100 人IQA 真实混合失真官方页按研究/公共数据口径;规模较小、非鸟B+
LIVE-Meta VI-UGC39,660 图及 patches;约 270 万质量判断 + 270 万失真标签IQA失真类型UGC 域;需遵守官方研究条款A−
VizWiz Quality Issues39,181 图;模糊、过曝/欠曝、构图差、遮挡、旋转、不可识别等多人投票缺陷分类负样本无障碍拍摄域;媒体许可需另核A−
CUHK Blur Detection1,000 自然图;10 人标注的像素级模糊区域局部模糊 判断眼/头是否在模糊区小型研究集;非鸟专用A 直接补当前空白
GoPro Blur3,214 对 sharp/blur 图运动模糊 表征预训练由高帧率平均合成模糊,与长焦鸟片仍有差别B+
RealBlur4,738 对真实 blur/sharp 图真实相机模糊场景非鸟;按官方研究条款使用A−
AADB10,000 Flickr CC 图;整体美学 + 11 个属性分数美学属性 构图/颜色辅助作者限定研究用途;非鸟专用B

当前显示全部数据集。

05 · Acquisition channels

还可以从哪里持续收集鸟片

最好的训练库不是一次性“下载大全”,而是把素材、授权、标注、版本和删除请求一起管理。下面按实际价值排序。

渠道能获得什么获取方式权利与风险推荐用途
本地 Lightroom / RAW原片、失败片、连拍、EXIF、当前星级、相机/镜头域直接读取原片、XMP 和 Catalog;导出代理图用于标注权利最清楚 注意敏感地点和备份最高优先级:目标域校准、误报/漏报、连拍排序
摄影伙伴、鸟会、保护区、高校跨摄影师、器材、地区和失败模式;可要求保留整段连拍统一上传模板 + 数据授权书;约定训练/展示/商用/撤回/衍生模型“允许展示”不等于“允许训练”;需明确著作权与地点隐私补充真实失焦、遮挡、背身、远鸟、空镜和淘汰片
eBird / Macaulay Library数千万鸟类媒体;物种、地点、日期、年龄/性别/行为;1–5 星技术质量;可筛 Flying检索可导出至多 10,000 条元数据;研究项目提交 catalog number 向 Cornell 申请媒体。大请求通常需个案审核版权归上传者;禁止自行抓取。研究可能免费,商业需单独许可/费用最接近现成鸟片质量监督:星级、飞行、物种分层抽样
Oriental Bird Club Image Database约 177,129 张亚洲鸟图、3,040 物种;中国条目约 5,733并入 Macaulay;沿用 Cornell 的申请与许可流程同 Macaulay,不可把网页可见误当批量训练授权补亚洲/中国物种与摄影域
iNaturalist 当前数据巨量观察照片、物种层级、时间地点、逐图作者与许可小规模 API;大规模用 AWS 月度开放数据或每周 DwCA,不要扫 API逐图许可混杂;大量 CC BY-NC。按 2026-07-19 当前条款,商业 AI/ML 训练限制严格;不可抓取非商业物种/表征研究与长尾发现;按观察/摄影者分组
GBIF全球 occurrence + 原始媒体 URL、作者、许可、机构、物种、时空元数据小查询 API;大规模用异步下载,读取 DwCA multimedia.txtGBIF 多数只托管元数据;媒体许可可能不同于记录许可;重复 iNat 等来源检索/溯源稀有物种,不应直接当无权利风险训练包
Wikimedia Commons原图、尺寸、EXIF、作者、SHA1、逐文件许可;飞鸟/Quality/Featured 类别MediaWiki API 遍历 categorymembers,用 imageinfo 取原图与许可常见 CC BY/BY-SA/PD,但必须逐文件核验、保留署名与相同方式共享要求优质正样本、飞鸟和代表物种;需自行标框/点
Flickr标签、描述、EXIF、位置、许可;可发现大量鸟类摄影师API 按日期/物种/地区拆分;更建议联系作者取得直接许可默认 All Rights Reserved;API 对长期缓存、删除响应有限制;即使 CC 也要留作者/许可摄影师发现与定向授权,不建议做核心持久语料
Encyclopedia of Life物种页面、代表媒体、作者与逐对象许可Pages API / 开放数据清单,回溯原提供者聚合 Wikimedia/Flickr 等;每个媒体对象单独授权分类体系和代表样本,不适合质量评分
LILA BC / 政府开放数据野生动物相机、航拍和保护项目数据;标准化云端分发按数据集页面和云桶下载每个数据集许可不同;不能用 LILA 平台名替代逐集核验空镜、困难负样本、小目标与生态场景
Zenodo / Dryad / Figshare论文配套图像、视频、标注、DOI 和版本通过论文/DOI 找原始记录,保存版本和文件 checksum平台不是统一许可;逐记录甚至逐文件核查BirdGaze、Visual WetlandBirds 等高价值专用集
Kaggle / Hugging Face / Roboflow镜像、转换版、社区标注和快速预览只用于发现,回到原始出处确认数据卡与图片权利镜像的 license 字段不能覆盖原图版权;常有重复、错标与来源断链原型验证,不建议直接进入正式训练主库
受控合成退化在自有/已许可鸟片上合成运动模糊、离焦、噪声、曝光、遮挡、缩小保留原图与退化参数,建立成对监督只在已有训练权的图上生成;合成不等同真实镜头/追焦失败画质辅助头的预训练与压力测试,不能替代真实人工偏好
必须维护一份素材权利账本。建议每张图至少保存下面字段;CC0/CC BY、CC BY-SA、CC BY-NC/研究专用、直接授权应物理或逻辑分库,防止后续用途变化时无法回溯。
source, source_asset_id, original_url, photographer, license, license_url, retrieved_at, observation_id, taxon, capture_group, rating, behavior, bbox, keypoints, split, sha256, perceptual_hash
06 · Recommended plan

从“能打分”升级到“可信地选片”

建议把训练拆成可验证的小步:每一步都必须用固定的 7 月错误案例和连拍偏好验证,避免模型离线指标上涨、实际 Lightroom 选片反而变差。

P0

先修实现与建立金标准

  • 修复 mask 生命周期;TOPIQ 改为官方 8 heads。
  • 从 7 月照片抽取:全部高分误报、全部低分好片、随机正常片、典型连拍。
  • 建立约 500–1,000 张不可随训练移动的回归集,记录鸟存在、框/点、锐度缺陷、姿态与人工偏好。
P1

把“鸟存在”做可靠

  • 检测训练:iNaturalist 2017 + Open Images Bird + 本地目标域场景;累计目标 8k–15k 张(当前 4,794 张,需后续拍摄/合作补充),并形成 15k–30k 个鸟框。
  • 加入 20k–50k 困难负样本;特别标空镜、树枝、飞机、反光、小黑点。
  • 先 YOLO11s-seg 快速迭代;数据闭环稳定后再比较 l。
P2

提升头眼定位与姿态表达

  • BirdGaze + CUB + NABirds 预训练;人工校正 3k–8k 本地鸟实例。
  • 点位至少包含头顶、喙尖、左右眼、身体中心/尺度和可见度;必要时加翼尖/尾。
  • 把 fly/nofly 改成 flying、perched、swimming、walking、feeding、preening、landing/takeoff、unknown 等多类或层级标签。
P3

单独学习主体画质,而不是只看全图

  • 三路输入:完整画面、鸟主体 ROI、头/眼 patch。
  • 多任务输出:眼部锐度、主体运动模糊、相机抖动、噪声、曝光、遮挡、背景干扰、主体大小。
  • 通用 IQA 数据只做预训练;最终用真实长焦鸟片微调和校准。
P4

用连拍偏好训练最终排序

  • 收集 2k–10k 个同一连拍的 A>B 选择,配合已有 Lightroom 星级。
  • 用 pairwise ranking / preference loss 学“哪张更值得保留”,再将排序分数校准成 Lightroom 0–5 星。
  • 按摄影者、观察、连拍、日期/地点和视频源分组切分;感知哈希去重,禁止相邻帧泄漏。

建议的输出,不再只给一个黑箱星级

Bird confidence

真鸟概率、每只鸟的框/掩码;多鸟分别评分。

Technical quality

眼锐度、主体模糊、曝光、噪声、遮挡,分别给分与原因。

Pose & moment

行为、翼形、头向、眼可见、动作稀有度;允许用户偏好。

Final preference

在同一连拍内排序,再映射 Lightroom 星级;附置信度。

验收指标应贴近实际使用:无鸟图高分率、好鸟图低分率、同一连拍 Top-1 / Top-3 命中率、每种姿态/主体大小/ISO 桶的分组表现,以及人工二次筛选节省时间。单看分类 accuracy 或 COCO mAP 不足以说明“选片更好”。
References

主要来源与审计说明

优先链接到官方仓库、论文、数据集项目页和原始存储。数据集规模与条款可能更新,正式下载前须再次核对。

本机审计范围

代码基线:本地 SuperPicky 4.3.0 LTS,提交 5177def4644c5c0e8449a5ee5681c950f44327a6

重点文件:ai_model.pycore/photo_processor.pycore/rating_engine.pycore/keypoint_detector.pycore/flight_detector.pycore/exposure_detector.pycore/focus_point_detector.pytopiq_model.pybirdid/osea_classifier.py

参数量由实际实例化结构核算;权重来源与本地文件哈希交叉核对。训练时间表明确区分作者未披露、本机实测与本机估算。

报告定位:这是一份工程与资料审计,不是法律意见,也不是对所有数据许可的最终授权判断。任何面向商业发布的训练,都应对实际下载的每个数据版本、每张媒体许可和上游模型许可做可追溯审核。