多数模型并非慧眼从零训练
YOLO11l-seg、TOPIQ、OSEA 使用上游权重;SuperEyes 与 SuperFlier 是作者基于 ImageNet 预训练网络做迁移学习。作者没有披露任何一项定制模型的硬件与墙钟训练时间。
Technical audit · 2026-07-19
当前本地实现是 SuperPicky / 慧眼选鸟 4.3.0 LTS。它不是一个端到端的“照片好坏模型”,而是把鸟检测、眼喙关键点、通用美学、飞行二分类、传统锐度/曝光算法和固定阈值串在一起,再选择性调用 OSEA 识别物种。
现有系统适合作为“候选片粗筛器”,但还不适合把单一星级当作摄影质量的可靠真值。改进的最佳路径不是立刻重训所有大模型,而是先修实现问题,再用本地连拍偏好和高价值公开标注做针对性微调。
YOLO11l-seg、TOPIQ、OSEA 使用上游权重;SuperEyes 与 SuperFlier 是作者基于 ImageNet 预训练网络做迁移学习。作者没有披露任何一项定制模型的硬件与墙钟训练时间。
通用 COCO 鸟检测一旦把背景误认成鸟,后续规则没有独立的“鸟存在性复核”;通用 AVA 美学还可能奖励漂亮背景。分割掩码的本地实现风险会进一步放大背景边缘的锐度。
系统只评多鸟图中的一只;眼喙点不可见会提前降级;没有专门的运动模糊、姿态质量或物种情境模型。飞鸟、背身、遮挡和小主体容易被粗糙规则惩罚。
5177def)。GitHub 在 2026-07-13 已出现 4.5.0-rc5,但 RC 的代码变化不混入本报告的“当前行为”。
星级是多模型输出经过一组固定阈值和乘法权重后的结果。OSEA 只负责物种候选,不参与照片质量星级。
没有独立的运动模糊分类器;“运动模糊”只被头部梯度与通用 IQA 间接感知。
无鸟 → -1;conf < 0.5 → 0;关键点全隐藏 → 1;锐度 <100 或 TOPIQ <3.5 → 0;锐度 ≥400 且 TOPIQ ≥5 → 3;满足其一 → 2;均不满足 → 1。
实际顺序并非所有权重在末尾统一相乘:ISO 先修正原始锐度并参与最低锐度门槛;通过门槛后,对焦位置与飞行状态再调整锐度/TOPIQ;眼睛可见度最后作用于基础星级并取整,曝光异常再减 1。阈值不是从本地 Lightroom 选择行为中学习得到的。
| 模块 | 来源与用途 | 规模 | 输入 / 计算 | 是否影响星级 |
|---|---|---|---|---|
| YOLO11l-seg | Ultralytics 官方 COCO 实例分割;筛 bird=14 | 27,678,368 参数 约 132.2 GFLOPs 权重 53 MB | 应用预缩最长边 1024;调用未显式传 imgsz 时,内部通常按默认 640 | 入口 有鸟、框、置信度 |
| SuperEyes | ResNet50 + MLP;左右眼、鸟喙坐标与可见度 | 24,692,297 参数 权重 95 MB | 鸟裁切 416×416 | 直接 定头部 ROI 与可见度 |
| SuperFlier | EfficientNet-B3 二分类;飞行/非飞行 | 10,697,769 参数 权重 41 MB | 鸟裁切 384×384 | 直接 飞行加权 |
| TOPIQ / CFANet | 通用 AVA 美学质量分布,映射 1–10 MOS | 73,383,567 参数 权重 280 MB | 完整照片 384×384;仅在眼点足够可见时运行 | 直接 美学阈值 |
| OSEA | ResNet34;11,000 输出,实际物种表约 10,964 | 26,927,672 参数 权重 103 MB | 鸟裁切 224×224;通常只处理星级 ≥2 | 不参与 只写物种候选 |
| 传统算法 | Sobel/Tenengrad、灰度直方图、ExifTool MakerNote、固定规则 | 0 参数 | 头部锐度、曝光、ISO、相机对焦点、评分映射 | 直接 |
ai_model.py:185–191 先复制 masks 后删除 results;但 ai_model.py:410–434 又引用 results[0].masks,异常被宽泛的 try/except 吞掉。结果很可能令 bird_mask=None,原本设计的“头部圆形 ROI ∩ 鸟轮廓”退化,树枝、羽毛外缘或背景高频纹理可抬高锐度;相机焦点的 mask 判断也可能回退。
行动:改用已经复制的 mask 数组;增加单元测试,强制断言有分割结果时 mask 非空,并用 7 月误报图做回归。
本地 topiq_model.py:214 默认 num_heads=4,而同一 AVA checkpoint 的官方 YAML 使用 8。参数张量形状兼容,因此 strict=False 不会报警,但注意力计算不同。本机 5 个鸟片裁切的 4-head vs 8-head 差值最大约 0.059 分;总体不大,却足以让阈值附近照片翻级。
行动:对齐 8 heads,并以固定图片集记录变更前后 TOPIQ、最终星级与人工偏好。
TOPIQ 在 AVA 通用摄影上训练,可能给漂亮背景、颜色和构图高分,即便鸟主体虚、太小或不存在;也可能惩罚背景凌乱但鸟眼锐利、行为珍贵的纪实照片。当前全图 TOPIQ 权重大,却没有鸟主体美学的专门校准。
多鸟图仅选择“焦点所在或置信度最高”的一只,其余主体不参与评分。SuperFlier 实质更接近“翼展开/未展开”的二分类,且训练集飞行样本仅 273 张;游泳、落地、扑食、振翅、背身等姿态被压成一个粗糙布尔值。
一旦 YOLO 把树叶、飞机或远处黑点认成鸟,后续会把该裁切当真鸟继续评分;没有第二个 bird/non-bird 验证器,也没有“无鸟困难负样本”校准头。反过来,YOLO 漏掉真实鸟时整张照片直接被判无鸟。
“代码公开”不等于“权重可精确复现”,也不等于“可以自由商用”。下表分别记录数据、配方、硬件、时间与许可缺口。
| 模型 | 权重性质 | 公开训练数据 | 公开训练配方 | 作者披露的成本 | 复现判断 |
|---|---|---|---|---|---|
| YOLO11l-seg | Ultralytics 官方权重;慧眼未 fine-tune | COCO 2017:约 118,287 train、5,000 val、80 类 | 训练框架/接口/格式公开;该 checkpoint 的完整逐项日志未公开 | 未披露 具体硬件、墙钟时间和实际费用 | 微调容易 从零逐位复现官方权重不现实 |
| SuperFlier | 作者迁移学习;部署权重与公开 top0 一致 | 1,445 张:Fly 273 / NoFly 1,172;seed 42,80/10/10;测试仅 145 张 | EfficientNet-B3,384,batch 32,RMSprop,最多 15 epoch,只解冻最后块+头;最佳 epoch 12。144 组网格搜索,再重跑前 10 | 未披露 硬件和训练秒数;README 的 lr 5e-5 与结果 CSV 的 5e-4 冲突 | 技术中高 数据/代码/权重可见,但无 LICENSE |
| SuperEyes | 作者迁移学习 | CUB-200-2011 11,788 张 / 200 种;仅取左眼、右眼、喙;重新随机 70/30 | ResNet50 全量优化;AdamW、Wing+BCE+空间先验,lr 5e-5,batch 16,最多 50 epoch,patience 10;最佳报告跑 32 epoch | 未披露 硬件/时间;训练分辨率资料出现 416 与 640 冲突 | 中等 方法清楚,精确环境/分辨率欠缺,仓库无 LICENSE |
| TOPIQ | IQA-PyTorch 官方 AVA checkpoint;慧眼未 fine-tune | AVA 约 255,530 张;每张为 1–10 分投票分布,平均约 210 次评分 | 单 GPU,384,batch 16,10 epoch,AdamW 3e-5、wd 1e-5、cosine、EMD、seed 123、16 workers、8 heads | 未披露 GPU 型号与墙钟时间 | 中等 配方完整;AVA 获取/权利和依赖是门槛 |
| OSEA | 上游 ResNet34;慧眼直接部署 | 论文原始 DIB-10K >4.8M / 10,922 种;清洗后 4,706,520 / 10,916,9:1。当前下载页另列 3,411,804 / 10,915,属于版本差异 | 从 MetaFGNet LBird-31 迁移;32 epoch,batch 256,momentum .9,wd 1e-4,64 workers,里程碑 15/23;冻结预训练部分并换分类头 | 硬件已披露 RTX 4090D、90 GB RAM、15 核 Xeon 8474C、AutoDL;时间/费用未披露 | 低—中 数据快照与规模是主要障碍 |
| 传统规则 | 慧眼代码中的 OpenCV/ExifTool/阈值 | 不训练 | 实现公开 | 无训练成本 | 可精确复现 |
库存 COCO 模型只见过通用“bird”类。用本地误报、远鸟、小鸟和空镜进行 YOLO11s/l-seg 微调,收益远高于复现官方 COCO 预训练。
两者能重跑,却缺少锁定依赖、训练硬件、稳定 MPS 分支和清晰许可。SuperFlier 的 98.6% 测试准确率来自仅 145 张同来源测试图,不应当作跨摄影师泛化保证。
下述“实测”来自当前 Apple M5;“估算”以实测吞吐和公开配方外推,包含合理余量,但不是作者披露,也不是精确交付承诺。
MacBook Pro Mac17,2
Apple M5,10 核 CPU / 10 核 GPU
32 GB
官方带宽 153 GB/s
PyTorch 2.13.0
MPS 可用,Ultralytics 8.4.100
160 GiB 可用
总盘 926 GiB,已使用约 83%
| 任务 | 设置 | 实测结果 | 如何解读 |
|---|---|---|---|
| YOLO11l-seg 训练 | COCO128-seg,640,batch 4,workers 0,MPS,2 epoch | 单轮约 77–98 秒 全流程 266.7 秒 约 1.46 train images/s MPS 6.6–7.6 GB | 最接近实际 YOLO 预算;包含验证但小数据开销偏高 |
| SuperFlier | EfficientNet-B3,384,batch 32,仅最后块+头,合成张量 | 0.604 s/step 约 53.0 images/s 约 191 MB MPS allocated | 不含 JPEG 解码、增强和验证;只作为吞吐下界 |
| SuperEyes | ResNet50 全训练,416,batch 16,合成张量 | 0.915 s/step 约 17.5 images/s 约 926 MB MPS allocated | 实际数据增强和关键点损失会更慢 |
| OSEA 适配 | ResNet34 冻结骨干 + 11k 新头,224,batch 128,合成张量 | 0.501 s/step 约 255.6 images/s driver 约 2.67 GB | 这不是完整数据管线;数百万张图片的 I/O 和验证会主导 |
| 目标 | 建议数据 / 设置 | 当前 M5 预计 | 资源与结论 |
|---|---|---|---|
| 复现 SuperFlier | 1,445 图,15 epoch,384 | 约 10–20 分钟 | 轻松 先修类别定义和分组划分 |
| 改良姿态分类 | 5,000 图,30 epoch,多姿态而非二分类 | 约 1–2 小时 | 适合本机 |
| 复现 SuperEyes | CUB 11,788 图,最多 50 epoch,416 | 约 8–14 小时 | 可过夜 最佳公开运行 32 轮通常更短 |
| YOLO11s-seg 微调 | 2,000 图,50 epoch,640 | 约 5–9 小时 | 首选 比 l 快,适合迭代数据闭环 |
| YOLO11l-seg 微调 | 2,000 图,50 epoch,640 | 约 18–26 小时 | 可做 batch 小,需梯度累积 |
| YOLO11l-seg 中型训练 | 5,000 图,80 epoch,640 | 约 3–5 天 | 勉强 960/1024 输入约再慢 2–3× |
| TOPIQ 全 AVA | 约 255k 图,10 epoch,384 | 数天至 1 周以上 低置信估算 | 不推荐 数据权利/存储和长时间热负载更关键 |
| OSEA 全规模重训 | 3.41–4.71M 图,32 epoch,224 | 理论纯算约 5–7 天;最好情形约 7–12 天,现实可能数周 低置信估算 | 不推荐 未实测解码/增强/验证/长时间热负载;数据可能数百 GB–TB |
| 日期 | 照片数 | 日期 | 照片数 | 总体 |
|---|---|---|---|---|
| 07-03 | 427 | 07-07 | 678 | 4,794 张 4,698 JPG + 96 ARW 约 35.6 GB 现有分析索引 4,696 行;预测记录 43,830 行。 |
| 07-04 | 194 | 07-08 | 965 | |
| 07-05 | 421 | 07-09 | 975 | |
| 07-06 | 439 | 07-10 | 695 |
建议把这 4,794 张按“拍摄日期 + 连拍组 + 场景”分组,而不是随机按单张分训练/验证。否则同一连拍会同时落入两边,验证分数虚高。
目录优先收录官方数据页、论文项目页或原始存储记录。标注许可证与图片版权经常不是同一件事;“能下载”不能自动推导为“可商用训练”。
BirdGaze → CUB → NABirds → 本地校正
BirdGaze 的眼、喙、头/身中心与尺度最贴近 SuperEyes;再补标 3,000–8,000 个本地实例。
iNat 2017 → Open Images → 本地困难负样本
先学大量鸟框,再专门加入树枝、叶片、飞机、水面反光、空镜和极小黑点。
通用 IQA 预训练 → 本地连拍偏好
最终目标应是“这一连拍哪张更值得保留”,不是跨场景硬凑一个绝对星级。
A+/A/B/C 只表示与当前任务的匹配度,不代表许可已经通过,也不代表可商用。正式采用仍以同一行的许可/获取限制和实际下载版本为准。
| 数据集 | 规模与标注 | 最适合 | 许可 / 获取 / 局限 | 建议 |
|---|---|---|---|---|
| iNaturalist 2017 Aves | 鸟类 964 类;214,295 train + 21,226 val;约 301,245 鸟框,COCO JSON | 检测物种 通用鸟框和长尾场景 | 非商业研究/教育,不得再分发;同图多鸟可能继承观察级物种名 | A+ YOLO 首选 |
| BirdGaze | 约 104,705 train + 1,705 val + 1,811 test;另 3,254 手标视频帧;头/身体中心尺度、头顶、喙尖、双眼点 | 关键点姿态 SuperEyes 替代/预训练 | Dryad 注释约 692 MB;底层图片来自多源,权利继承各原集 | A+ 最贴任务 |
| CUB-200-2011 | 11,788 图 / 200 类;bbox、15 部位点、312 属性、分割 | 关键点 眼、喙、翼、尾、身体 | 仅非商业研究/教育;Caltech 不拥有图片版权;规模小、北美偏置 | A 已用于 SuperEyes |
| NABirds | 48,562 图 / 555 视觉类(约 400 物种);bbox、11 部位点、性别/年龄/羽色 | 关键点物种 更大鸟体定位 | Cornell 条款严格、按非商业研究处理;北美域 | A |
| Birdsnap | 49,829 图 / 500 北美物种;框、17 部位、部分性别/年龄/羽色 | 关键点物种 | Flickr 来源;当前正式获取和逐图许可不稳定,谨慎使用镜像 | B 先做权利核验 |
| CHIRP | 西伯利亚松鸦;关键点子集 879 图 / 1,176 实例 / 13 点;另有框、实例分割、行为和重识别 | 关键点行为分割 | 单物种、固定环境;代码许可不自动覆盖媒体 | A− 动作/点位优质 |
| 3D-POP | 约 300k 帧、约 4M 实例;1–10 鸽、4 视角、身份/轨迹/bbox/2D+3D 点 | 3D姿态追踪 | CC BY 4.0;实验室鸽域;压缩后仍 >1 TB | B+ 研究价值高 |
| Avian Mesh / Penn Aviary | >6,300 mask、约 1,000 关键点实例;受控社交鸟 | 分割关键点 鸟体网格 | 受控场景,与野外摄影有域差 | B+ |
| Animal Kingdom | 50h 视频;30,100 动作片段 / 140 动作;33,099 姿态帧 / 23 点;850 物种 | 姿态行为 可抽鸟类子集 | 跨动物;需核对媒体许可和鸟类覆盖 | B+ |
| PigeonSuperModel | >3,000 手标多视角鸽子帧;姿态点 | 姿态 受控多视角 | 单物种、实验室域 | B |
| Visual WetlandBirds | 178 视频 / 13 物种 / 7 行为;框、物种、个体、行为;约 9.4 GB | 飞行/姿态追踪 | CC BY 4.0;湿地鸟域较窄 | A 替代二分类 |
| AirBirds | 118,312 张 1080p 时序帧;409,967 手标飞鸟框;平均鸟体 <10px;约 165 GB | 极小飞鸟检测 | CC BY-NC-SA 4.0;需申请;机场固定机位与近摄差异大 | B+ |
| FBD-SV-2024 | 483 clips / 28,694 帧 / 28,366 飞鸟;bbox + track;约 1.67 GB | 飞鸟检测追踪 | Figshare 标 CC BY 4.0,仓库文字偏研究用途;按更严格口径或联系作者 | B+ |
| SOD4SB / MVA 2023 | 两训练集约 57,019 图 / 90,008 实例;COCO 框;远距离小鸟与无人机域 | 小目标检测 | 比赛条款;公共/私有测试划分复杂 | B+ |
| Distant Bird Detection | 47,260 张 4K / 60,971 框;hawk/crow/wild bird;约 67 GB | 远鸟小目标 | 无人机域;代码 MIT 不等于图片许可,需再核对 | B |
| Big Bird 2026 | 4,284 张 UAV RGB;3,209 空图;49,990 标注(框 41,337 + polygon 8,653);102 物种 | 检测负样本物种 | UQ reuse-with-acknowledgment;大量空图很有价值 | A |
| IBERBIRDS | 4,000 图;10 种伊比利亚大型飞鸟;YOLO bbox + species | 飞行检测 | CC BY 4.0;物种与地域窄 | A− |
| PartImageNet | 24,095 图 / 158 类;鸟 14 类;头/身/翼/脚/尾像素级 part mask | 部件分割 主体/头部/翼 | 注释仓库 Apache;底层 ImageNet 图片权利另算 | B+ |
| Open Images V7 | 约 9M 图、16M 框 / 600 类、2.686M masks / 350 类;含 verified positive / negative Bird 标签 | 检测负样本 场景多样性 | 标注 CC BY 4.0;图片通常标 CC BY 2.0,仍须逐图核验 | A |
| COCO 2017 | 约 118k train / 5k val;80 类,Bird bbox + instance mask | 检测分割 当前 YOLO 预训练域 | 图片按各 Flickr 许可;鸟类标签粗 | B+ |
| LVIS | 164k 图,1,200+ 类,>2M 高质量实例 mask;基于 COCO 图 | 长尾分割 可抽鸟类 | 底图沿用 COCO/Flickr 权利;类极长尾 | B |
| iNaturalist 2021 Aves | 1,486 物种;414,847 train、74,300 mini、14,860 val;最大边 500;无框 | 物种表征 长尾预训练 | 非商业研究/教育,不得再分发;完整总训练包约 224 GB,mini 总包约 42 GB | B+ |
| DIB-10K | 当前页列 3,411,804 图 / 10,915 类;论文清洗版 4,706,520 / 10,916;物种分类,无 bbox/点 | 物种 OSEA 规模复现 | 巨大、版本不一致;下载可用性与图片许可需逐项确认 | C 不适合当前本机 |
| USGS Aerial Avian | 航拍鸟类影像与 COCO bbox 标注 | 航拍小鸟检测 | 美国政府数据页;摄影域与常规鸟片差异大 | B |
| Caltech Camera Traps | 243,100 图、约 66k 框;约 70% 空图/非鸟 | 负样本 空镜与动物干扰 | 许可较宽松;相机陷阱域偏差明显 | A− 困难负样本 |
| AVA | 约 255,530 图;1–10 分投票分布,平均约 210 票/图 | 通用美学 TOPIQ 原训练 | DPChallenge 来源;获取和商用权利有门槛;非鸟专用 | B 只作预训练 |
| KonIQ-10k | 10,073 真实失真图;约 120 万评分 / 1,459 人;MOS 与质量统计 | IQA 真实失真预训练 | 研究使用;保留 YFCC 来源许可;非鸟专用 | A− |
| KonIQ++ / Image Defects | 沿用 KonIQ 图;模糊、伪影、颜色、对比度等缺陷标签 | 模糊缺陷 | 研究用途;需回溯原图许可 | A 缺陷辅助头 |
| SPAQ | 11,125 手机图、66 款设备;MOS + 亮度/色彩/对比/噪声/锐度/场景/EXIF | 技术画质锐度 | 仓库未清晰声明媒体商用许可;手机域 | A− |
| LIVE In the Wild | 1,162 真实手机图;>350k 主观评分,>8,100 人 | IQA 真实混合失真 | 官方页按研究/公共数据口径;规模较小、非鸟 | B+ |
| LIVE-Meta VI-UGC | 39,660 图及 patches;约 270 万质量判断 + 270 万失真标签 | IQA失真类型 | UGC 域;需遵守官方研究条款 | A− |
| VizWiz Quality Issues | 39,181 图;模糊、过曝/欠曝、构图差、遮挡、旋转、不可识别等多人投票 | 缺陷分类负样本 | 无障碍拍摄域;媒体许可需另核 | A− |
| CUHK Blur Detection | 1,000 自然图;10 人标注的像素级模糊区域 | 局部模糊 判断眼/头是否在模糊区 | 小型研究集;非鸟专用 | A 直接补当前空白 |
| GoPro Blur | 3,214 对 sharp/blur 图 | 运动模糊 表征预训练 | 由高帧率平均合成模糊,与长焦鸟片仍有差别 | B+ |
| RealBlur | 4,738 对真实 blur/sharp 图 | 真实相机模糊 | 场景非鸟;按官方研究条款使用 | A− |
| AADB | 10,000 Flickr CC 图;整体美学 + 11 个属性分数 | 美学属性 构图/颜色辅助 | 作者限定研究用途;非鸟专用 | B |
当前显示全部数据集。
最好的训练库不是一次性“下载大全”,而是把素材、授权、标注、版本和删除请求一起管理。下面按实际价值排序。
| 渠道 | 能获得什么 | 获取方式 | 权利与风险 | 推荐用途 |
|---|---|---|---|---|
| 本地 Lightroom / RAW | 原片、失败片、连拍、EXIF、当前星级、相机/镜头域 | 直接读取原片、XMP 和 Catalog;导出代理图用于标注 | 权利最清楚 注意敏感地点和备份 | 最高优先级:目标域校准、误报/漏报、连拍排序 |
| 摄影伙伴、鸟会、保护区、高校 | 跨摄影师、器材、地区和失败模式;可要求保留整段连拍 | 统一上传模板 + 数据授权书;约定训练/展示/商用/撤回/衍生模型 | “允许展示”不等于“允许训练”;需明确著作权与地点隐私 | 补充真实失焦、遮挡、背身、远鸟、空镜和淘汰片 |
| eBird / Macaulay Library | 数千万鸟类媒体;物种、地点、日期、年龄/性别/行为;1–5 星技术质量;可筛 Flying | 检索可导出至多 10,000 条元数据;研究项目提交 catalog number 向 Cornell 申请媒体。大请求通常需个案审核 | 版权归上传者;禁止自行抓取。研究可能免费,商业需单独许可/费用 | 最接近现成鸟片质量监督:星级、飞行、物种分层抽样 |
| Oriental Bird Club Image Database | 约 177,129 张亚洲鸟图、3,040 物种;中国条目约 5,733 | 并入 Macaulay;沿用 Cornell 的申请与许可流程 | 同 Macaulay,不可把网页可见误当批量训练授权 | 补亚洲/中国物种与摄影域 |
| iNaturalist 当前数据 | 巨量观察照片、物种层级、时间地点、逐图作者与许可 | 小规模 API;大规模用 AWS 月度开放数据或每周 DwCA,不要扫 API | 逐图许可混杂;大量 CC BY-NC。按 2026-07-19 当前条款,商业 AI/ML 训练限制严格;不可抓取 | 非商业物种/表征研究与长尾发现;按观察/摄影者分组 |
| GBIF | 全球 occurrence + 原始媒体 URL、作者、许可、机构、物种、时空元数据 | 小查询 API;大规模用异步下载,读取 DwCA multimedia.txt | GBIF 多数只托管元数据;媒体许可可能不同于记录许可;重复 iNat 等来源 | 检索/溯源稀有物种,不应直接当无权利风险训练包 |
| Wikimedia Commons | 原图、尺寸、EXIF、作者、SHA1、逐文件许可;飞鸟/Quality/Featured 类别 | MediaWiki API 遍历 categorymembers,用 imageinfo 取原图与许可 | 常见 CC BY/BY-SA/PD,但必须逐文件核验、保留署名与相同方式共享要求 | 优质正样本、飞鸟和代表物种;需自行标框/点 |
| Flickr | 标签、描述、EXIF、位置、许可;可发现大量鸟类摄影师 | API 按日期/物种/地区拆分;更建议联系作者取得直接许可 | 默认 All Rights Reserved;API 对长期缓存、删除响应有限制;即使 CC 也要留作者/许可 | 摄影师发现与定向授权,不建议做核心持久语料 |
| Encyclopedia of Life | 物种页面、代表媒体、作者与逐对象许可 | Pages API / 开放数据清单,回溯原提供者 | 聚合 Wikimedia/Flickr 等;每个媒体对象单独授权 | 分类体系和代表样本,不适合质量评分 |
| LILA BC / 政府开放数据 | 野生动物相机、航拍和保护项目数据;标准化云端分发 | 按数据集页面和云桶下载 | 每个数据集许可不同;不能用 LILA 平台名替代逐集核验 | 空镜、困难负样本、小目标与生态场景 |
| Zenodo / Dryad / Figshare | 论文配套图像、视频、标注、DOI 和版本 | 通过论文/DOI 找原始记录,保存版本和文件 checksum | 平台不是统一许可;逐记录甚至逐文件核查 | BirdGaze、Visual WetlandBirds 等高价值专用集 |
| Kaggle / Hugging Face / Roboflow | 镜像、转换版、社区标注和快速预览 | 只用于发现,回到原始出处确认数据卡与图片权利 | 镜像的 license 字段不能覆盖原图版权;常有重复、错标与来源断链 | 原型验证,不建议直接进入正式训练主库 |
| 受控合成退化 | 在自有/已许可鸟片上合成运动模糊、离焦、噪声、曝光、遮挡、缩小 | 保留原图与退化参数,建立成对监督 | 只在已有训练权的图上生成;合成不等同真实镜头/追焦失败 | 画质辅助头的预训练与压力测试,不能替代真实人工偏好 |
建议把训练拆成可验证的小步:每一步都必须用固定的 7 月错误案例和连拍偏好验证,避免模型离线指标上涨、实际 Lightroom 选片反而变差。
真鸟概率、每只鸟的框/掩码;多鸟分别评分。
眼锐度、主体模糊、曝光、噪声、遮挡,分别给分与原因。
行为、翼形、头向、眼可见、动作稀有度;允许用户偏好。
在同一连拍内排序,再映射 Lightroom 星级;附置信度。
优先链接到官方仓库、论文、数据集项目页和原始存储。数据集规模与条款可能更新,正式下载前须再次核对。
代码基线:本地 SuperPicky 4.3.0 LTS,提交 5177def4644c5c0e8449a5ee5681c950f44327a6。
重点文件:ai_model.py、core/photo_processor.py、core/rating_engine.py、core/keypoint_detector.py、core/flight_detector.py、core/exposure_detector.py、core/focus_point_detector.py、topiq_model.py、birdid/osea_classifier.py。
参数量由实际实例化结构核算;权重来源与本地文件哈希交叉核对。训练时间表明确区分作者未披露、本机实测与本机估算。