训练计算机视觉模型(无论是基于 transformer 的 RF-DETR、实时 YOLOv12 还是 Faster R-CNN 等经典模型)需要的不仅仅是原始数据。实际部署会带来不可预测的挑战:光线移动、角度奇特、传感器嘈杂和杂乱的场景,从而导致漏检。
所以大部分情形我们都需要通过图像增强来扩充样本数据量,本文就来介绍下常用的图像增强方法。
翻转 (水平或垂直)
镜像图像以增加数据集的多样性,帮助模型泛化到不同的方向。
水平翻转非常适合对象方向自然变化的数据集,例如翻转汽车图像以进行交通检测,因为可以从任一方向查看道路。然而,垂直翻转通常是不合适的,例如在道路永远不会倒置的自动驾驶数据集中,因为这可能会引入不切实际的场景,从而使模型感到困惑。
使用案例:
移动应用程序 (RF-DETR):在手机应用程序中检测棋子,其中用户不可预测地翻转其设备方向。请参阅 Roboflow Universe 上的“棋子检测”。
交通监控 (YOLOv12):在高速公路上为向任一方向行驶的车辆提供列车,将实时检测的数据种类增加一倍。请参阅 Roboflow Universe 上的“车辆检测”。
零售扫描:识别条形码或货架上被玻璃展示中的镜面反射翻转的产品。
医学成像:识别 X 射线骨折,无论扫描过程中图像的方向如何。请参阅 Roboflow Universe 上的“骨折检测”。
旋转
旋转增强按指定角度(例如,90°、180° 或随机度)平移图像,以创建新的训练样本,使模型能够从不同的角度和方向学习特征。
这种增强有助于模型识别对象,而不管其方向如何。例如,在无人机导航的航拍图像中,由于无人机的视角,道路或建筑物等物体可以以任何角度出现,旋转可确保模型能够一致地检测到它们。同样,在医学成像(如 X 射线)中,患者体位可能会有所不同,旋转有助于模型从不同角度识别异常。
但是,旋转不适用于方向固定或关键的场景,例如在道路和交通标志始终直立的自动驾驶汽车数据集中,旋转这些图像可能会引入不切实际的场景,从而使模型感到困惑。
此外,在文档上的文本识别等任务中,旋转可能会扭曲文本的可读性,使模型更难学习有意义的模式。因此,当现实世界中预期方向可变时,应应用旋转,但当它与任务的自然约束相矛盾时应避免旋转。
使用案例:
航测 (RF-DETR):从无人机的不同角度检测太阳能电池板以进行能源审计。请参阅 Roboflow Universe 上的“太阳能电池板检测”。
工业质量控制 (YOLOv12):发现传送带上未对准的螺钉或零件,其中旋转模拟工人的搬运。请参阅 Roboflow Universe 上的“螺丝检测”。
天文学:在因地球运动而旋转的望远镜图像中识别天体。
游戏:训练模型以在 VR 中检测玩家头像,其中头戴式设备捕获旋转的视角。
亮度变换
亮度增强会调整图像像素的强度,使其更亮或更暗,以模拟不同的照明条件,这有助于模型学习识别不同照明水平下的物体。
亮度增强为模型准备处理光线变化的真实场景,例如在室外监控系统中,摄像机可能会在黎明、中午或黄昏捕获图像,从而确保对行人或车辆等物体的一致检测。
这在医学成像中也很有用,因为 X 射线亮度可能会因设备设置而异,从而帮助模型识别异常,而不管暴露情况如何。
但是,亮度增强不太适合照明一致性至关重要的任务,例如在工业质量控制中检测电路板上的微缺陷,其中特定的照明会突出显示缺陷 - 改变亮度可能会掩盖这些细节并降低准确性。同样,在颜色强度是关键特征的数据集中,过多的亮度变化可能会掩盖这些区别,从而使模型感到困惑。因此,当预计光线会发生变化时,应使用亮度增强,但当精确照明对任务至关重要时应避免使用。
使用案例:
户外安全 (YOLOv12):实时检测昼夜循环中的车辆或入侵者。请参阅 Roboflow Universe 上的“CCTV 对象检测”。
室内机器人 (RF-DETR):在荧光灯不一致的仓库中导航。
农业:在不同的阳光或云层覆盖下确定田地中的作物健康状况。请参阅 Roboflow Universe 上的“作物病害检测”。
水下探索:在探测海洋生物时,针对阴暗或明亮的海洋条件进行调整。请参阅 Roboflow Universe 上的“鱼类检测”。
对比度调节
对比度增强可调整图像最亮部分和最暗部分之间的强度差异,要么增加强度差异以使特征更清晰,要么减小强度差异以模拟低对比度条件。该技术可帮助模型在不同的照明条件下保持稳健性,确保它们能够在光线充足和光线不足的环境中检测对象。
对比度增强在室外监控等场景中特别有用,其中光线全天都在变化(例如,明亮的阳光与黄昏),或者在医学成像中,X 射线对比度可能会因设备差异而有所不同,从而允许模型在不同条件下进行泛化。
但是,对比度增强不太适合精确颜色或强度值至关重要的任务,例如在制造的质量控制中,检测产品表面的细微缺陷可能取决于一致的对比度水平,更改它们可能会掩盖这些细节。同样,在具有低对比度对象的数据集中,例如褪色文档上的模糊文本,增加对比度可能会放大噪声而不是提高清晰度,从而可能使模型感到困惑。因此,当预计光线会发生变化时,应应用对比度增强,但当精细强度细节对任务至关重要时,应避免使用对比度增强。
使用案例:
医疗诊断 (RF-DETR):在具有不同机器设置或患者状况的 X 射线中检测肿瘤。请参阅 Roboflow Universe 上的“肿瘤检测”。
自动驾驶 (YOLOv12):在雾或眩光中识别路标,其中对比度会发生巨大变化。请参阅 Roboflow Universe 上的“交通标志检测”。
时尚零售:识别工作室照明不均匀的照片中的服装图案。
考古学:在低对比度的挖掘现场图像中发现微弱的文物轮廓。
灰度变换
灰度增强通过对红色、绿色和蓝色通道进行平均或加权,将彩色图像 (RGB) 转换为单通道灰度图像,从而有效地删除颜色信息,同时保留强度和结构细节。此技术可以使模型对颜色变化更加可靠,从而将它们集中在形状和纹理上。
对于颜色不是关键因素的任务来说,这是一个不错的选择,例如在自动驾驶中检测路标,其中停车标志的形状比其红色色调更重要,或者在 X 射线等自然灰度的医学成像中。
但是,对于颜色至关重要的数据集,例如对水果进行分类(例如,区分红苹果和青柠)或识别交通信号灯,灰度是一个糟糕的选择,其中颜色传达重要信息。在这些情况下应用灰度会剥夺重要特征,从而降低性能,因此当颜色无关紧要或成为噪声源时,应使用灰度,但当它是主要信号时应避免使用灰度。
使用案例:
交通标志 (YOLOv12):将重点放在形状(例如,停车标志八边形)而不是颜色上,以便进行实时检测。请参阅 Roboflow Universe 上的“交通标志识别”。
夜视 (RF-DETR):在弱光条件下进行单色安全录像的训练。
历史档案:检测旧灰度照片或胶片中的对象以进行数字化。
热成像:模拟基于热量的检测,其中颜色不是一个因素。请参阅 Roboflow Universe 上的“热对象检测”。
随机裁剪
随机裁剪增强涉及提取图像的随机子部分(通常是较小的矩形块),并将其用作新的训练样本,这有助于模型专注于对象的部分视图,并学习在不完全可见时也能检测到它们。
此技术允许您生成数据来模拟对象被部分遮挡或仅捕获场景的一部分的场景,例如在监控录像等实际应用程序中,人员可能部分超出画面。它在包含多个对象的大图像数据集中特别有效,例如人群检测或卫星图像,其中专注于较小的区域可以帮助模型学习精细的细节。但是,随机裁剪不太适用于整个对象上下文至关重要的数据集,例如在医学成像中。
对于高分辨率图像中的小对象(如制造中的微小缺陷),它也不理想,因为裁剪可能会完全错过对象,从而降低模型学习相关特征的能力。因此,当部分可见性是一个现实的挑战时,应应用随机裁剪,但当完整的对象上下文对于准确检测至关重要时,应避免随机裁剪。
使用案例:
拥挤场景 (YOLOv12):检测繁忙城市街道中被遮挡的行人。请参阅 Roboflow Universe 上的“行人检测”。
航空测绘 (RF-DETR):使用放大视图从高空发现汽车等小物体。请参阅 Roboflow Universe 上的“飞行器检测”。
野生动物监测:识别被树叶遮挡的部分可见动物。请参阅 Roboflow Universe 上的“野生动物检测”。
零售分析:跟踪拥挤货架上的产品,其中只能看到部分。
随机噪声
随机噪声增强是图像中像素值的微小随机变化,可模拟传感器噪声或照明波动等缺陷,这有助于模型对实际数据不一致更具弹性。
该技术对于提高模型稳健性至关重要,因为它可以确保它能够处理嘈杂的输入而不会显着降低性能。这在图像质量变化的情况下特别有用,例如在颗粒感很常见的低光监控镜头中,或者在受大气干扰影响的卫星图像中,使模型能够在不同条件下更好地泛化。
但是,随机噪声增强不太适合需要高精度精细细节的任务,例如医学成像。对于具有干净、高质量图像的数据集(如工作室产品摄影),它也不理想,因为引入噪点可能会不必要地使模型的学习过程复杂化。因此,当噪声在部署中是一个现实的挑战时,应应用随机噪声,但在必须保留精细细节时应避免使用随机噪声。
使用案例:
自动驾驶汽车 (YOLOv12):实时处理来自低质量摄像头的传感器噪声。请参阅 Roboflow Universe 上的“自动驾驶数据集”。
面部识别 (RF-DETR):提高对轻微图像损坏或对抗性攻击的鲁棒性。请参阅 Roboflow Universe 上的“人脸检测”。
太空探索:在火星尘土飞扬的表面的嘈杂图像中检测漫游车障碍物。
旧媒体修复:训练识别颗粒状老式素材中的对象。
图像模糊
Roboflow 模糊增强将高斯模糊效果应用于图像,模拟现实世界的缺陷(如摄像机聚焦问题),并且对于使模型对降低的图像质量具有鲁棒性,例如在镜头可能模糊的监控系统中。亚利桑那州立大学的研究强调了模糊对分类的重大影响,使其成为一种有价值的弹性增强方法。
这种增强对于需要高细节的任务并不理想,例如识别车牌上的精细文本,在这些情况下,模糊会掩盖基本特征并损害准确性。查看博客文章 The Importance of Blur as an Image Augmentation Technique。
使用案例:
Sports Analytics (YOLOv12):跟踪快速移动的球员,尽管视频帧中存在运动模糊。请参阅 Roboflow Universe 上的“运动球检测”。
工业检测 (RF-DETR):使用低分辨率工厂相机检测缺陷。请参阅 Roboflow Universe 上的“钢管缺陷”。
Weather Resilience:在雨天或有雾的情况下进行对象检测训练。
监控:在模糊、远距离的闭路电视录像中识别嫌疑人。
边界框级别增强
边界框级别增强转换(例如调整亮度、对比度或杂色),特别是针对边界框内的区域,同时保持图像的其余部分不变,从而有效地改变单个对象的外观,而不会影响背景。
该技术可帮助模型在不同条件下专注于特定于对象的特征,从而提高稳健性并减少对特定照明或纹理模式的过度拟合。它在自动驾驶等场景中特别有用,在自动驾驶等场景中,调整边界框内的汽车亮度可以模拟不同的照明条件(例如,黄昏时分的大灯),确保模型可靠地检测车辆。
同样,在零售产品检测中,改变边界框内的对比度可以帮助模型识别不同商店照明下的商品。
但是,这种方法不太适用于背景上下文至关重要的数据集,例如在场景理解任务中(例如,识别厨房与卧室),其中仅修改对象可能会产生不自然的不一致,例如在光线昏暗的房间里有一把灯火通明的椅子,从而使模型感到困惑。
当重点关注特定于对象的稳健性时,最好应用边界框级别增强,但当场景的整体上下文至关重要时,应避免使用边界框级别增强。
使用案例:
零售展示 (RF-DETR):检测货架上聚光灯或阴影下的产品。请参阅 Roboflow Universe 上的“货架产品检测”。
包装 (YOLOv12):实时识别传送带上翻转或旋转的物品。
增强现实:在固定场景中训练具有动态照明的对象。
博物馆展品:在无背景干扰的情况下识别各种展品照明下的伪影。
Mosaic
马赛克增强将四个完整图像组合成一个合成图像,通常排列在 2x2 网格中,同时保持对象的相对比例,以创建具有不同对象交互的多样化场景。此技术非常重要,因为它增强了模型处理转换和复杂类组合的能力,从而提高了其在多对象环境中的健壮性。
马赛克增强在零售环境等情况下特别有效,在这种情况下,尽管数据集包含单个物品的图像,但模型需要识别货架上的多个产品,或者在动物成群出现的野生动物检测中。
但是,Mosaic 不太适用于场景具有一致对象计数或布局的情况,例如使用单个居中项目(如电路板)进行工业质量控制,因为它可能会引入不切实际的组合,使模型感到困惑。
此外,在需要精确空间关系的任务中,例如车道位置固定的自动驾驶,Mosaic 可能会破坏关键上下文,从而导致性能不佳。因此,Mosaic 最适合用于复杂、可变场景的训练,但应避免在结构化、可预测的环境中使用。
使用案例:
城市监控 (YOLOv12):在密集的实时源中检测多个对象(人、车辆)。请参阅 Roboflow Universe 上的“城市监控”。
野生动物追踪 (RF-DETR):在一个框架中处理不同比例的动物,就像森林生态系统一样。请参阅 Roboflow Universe 上的“动物检测”。
搜索和救援:在混乱的灾区发现幸存者、碎片和车辆。
游戏流:识别分屏多人游戏素材中的多个头像或项目。
181