1. 从零开始:理解YOLOv5的超参数与数据增强
如果你刚接触YOLOv5,看到那一堆超参数文件,是不是感觉头都大了?别急,我刚开始用的时候也是一样,感觉每个参数都像天书。但后来我发现,这些参数其实就像炒菜的调料,放对了量,菜才香。YOLOv5的成功,很大程度上就归功于它这套精心设计的超参数和数据增强组合拳。
简单来说,超参数就是你在训练模型之前需要手动设定的那些“开关”和“旋钮”,比如学习率调多大、数据增强的强度设多少。而数据增强,则是通过一些技巧(比如旋转、裁剪、变色)来“制造”出更多样的训练图片,让模型见多识广,不容易在没见过的新场景里“翻车”。这篇文章,就是带你亲手把这些“开关”拧到最佳位置,让你的模型从“能用”变成“好用”。
YOLOv5把超参数都放在了 data/hyps/ 目录下的YAML文件里,主要分三类:hyp.scratch-low.yaml(低强度增强)、hyp.scratch-med.yaml(中强度增强)和 hyp.scratch-high.yaml(高强度增强)。名字里的“scratch”意思是“从头训练”。如果你是用自己的数据集在预训练模型上微调,官方还推荐用 hyp.finetune.yaml,它的数据增强强度会更温和一些,防止把预训练模型已经学好的知识给“冲掉”了。
为什么要有不同强度?这得看你的数据“底子”怎么样。如果你的数据集像COCO那样,有几十万张图片,覆盖各种场景,那数据本身已经足够丰富了,用低强度增强甚至不用增强(hyp.no-augmentation.yaml)可能效果更好,避免画蛇添足。但咱们大多数人手里的都是些小数据集,可能就几千张图,这时候高强度增强就是救命稻草了,它能极大地增加数据的多样性,是防止模型过拟合、提升泛化能力的核心手段。我自己的经验是,在数据量不足的项目里,把增强调对,效果提升比换个大模型还明显。
2. 庖丁解牛:超参数文件逐行精讲
光知道文件在哪可不行,咱们得搞清楚每个参数是干嘛的。打开一个典型的 hyp.scratch-med.yaml 文件,里面的参数可以分成四大类:优化器相关、损失函数权重、训练阈值和数据增强。咱们一类一类拆开看。
2.1 优化器与学习率调度
这部分参数决定了模型“学习”的步伐和节奏,是最关键的一组。
lr0: 0.01 # 初始学习率 (SGD=1E-2, Adam=1E-3)
lrf: 0.1 # 最终学习率因子 (lr0 * lrf)
momentum: 0.937 # SGD动量/Adam的beta1
weight_decay: 0.0005 # 权重衰减 (L2正则化)
warmup_epochs: 3.0 # 学习率预热epoch数
warmup_momentum: 0.8 # 预热阶段的初始动量
warmup_bias_lr: 0.1 # 预热阶段偏置参数的学习率
lr0(初始学习率):这是模型学习的“步长”。步子太大(学习率太高)容易“扯着蛋”,在最优解附近震荡甚至跑飞;步子太小(学习率太低)则学得慢,容易陷入局部最优点。YOLOv5默认使用SGD优化器,所以设0.01;如果用Adam,通常要设小一个数量级,比如0.001。我一般会先用默认值跑一遍,如果训练损失下降得很慢或者震荡剧烈,再考虑调整它。lrf(最终学习率因子):YOLOv5使用OneCycleLR策略,学习率会先上升再下降。lrf决定了训练结束时学习率会降到多少。比如lr0=0.01,lrf=0.1,那么最终学习率就是0.01 * 0.1 = 0.001。这个策略能让模型在初期快速探索,后期精细收敛,实测下来非常有效。warmup_epochs(学习率预热):这是个非常实用的技巧。想象一下,模型参数一开始是随机初始化的,就像刚睡醒的人,直接让他百米冲刺肯定不行。预热就是在训练最开始的三五个epoch里,让学习率从一个小值(比如warmup_bias_lr)慢慢线性增加到lr0,让模型“热热身”,稳定下来。这能有效避免训练初期的不稳定。我试过关掉预热,训练损失曲线开头总会有一个难看的尖峰,所以这个参数我强烈建议保持开启。
2.2 损失函数权重与训练阈值
这组参数决定了模型在“定位准”和“分类对”之间如何权衡。
box: 0.05 # 边界框回归损失权重
cls: 0.3 # 分类损失权重
obj: 0.7 # 物体置信度损失权重 (与像素尺度相关)
iou_t: 0.20 # IoU训练阈值
anchor_t: 4.0 # 锚框宽高比阈值
box,cls,obj:这三个是损失函数的权重系数。总损失 =box_loss * box + cls_loss * cls + obj_loss * obj。box负责让预测框和真实框重合得更好;cls负责让模型认对类别;obj负责判断网格里有没有物体。默认值(0.05, 0.3, 0.7)是作者在COCO数据集上调出来的一个平衡点。如果你的任务里物体都很容易定位,但类别特别难分(比如区分不同品种的狗),可以适当提高cls的权重。反过来,如果物体经常被漏检(特别是小物体),可以尝试微调obj的权重。iou_t:这是正负样本匹配时的IoU阈值。高于这个阈值的锚框才被认为是正样本(有物体),参与box和cls损失的计算。默认0.2是一个比较宽松的值,能保证有足够多的正样本来学习。如果提高这个值(比如到


2万+

被折叠的 条评论
为什么被折叠?



