英文原标题:Enhancing industrial safety AI with synthetic data on Amazon SageMaker AI

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 工业安全AI面临高风险场景训练图像稀缺的难题:将人员(包括儿童)置于重型机械附近拍摄既不安全也不道德,且此类事件在真实数据集中极为罕见,导致严重类别不平衡。
  • 文章提出基于Amazon SageMaker AI和Amazon Rekognition的合成数据增强流水线,分两阶段:先用扩散模型Qwen-Image-Edit-2509在真实场景图中插入合成人物,再用Rekognition DetectLabels API自动生成边界框标注。
  • 该方法选择编辑真实图像而非从头生成全合成场景,以保留背景保真度、避免域差距,并使原有设备标注保持有效。
  • 实验显示,在无需人工标注或危险拍摄的情况下,人员检测mAP50最高提升160%。
  • 模型部署在ml.g5.12xlarge实例(4×NVIDIA A10G GPU,96 GB显存),生成每张图像约需166秒;文章建议改用单张H100或量化技术,预计推理成本可降低约10倍,但尚未验证。

关键数据

  • 人员检测mAP50最高提升160%
  • 人工数据采集和标注成本估计为每张图像3–5美元,标注团队通常每天处理约2000张图像
  • Qwen-Image-Edit-2509模型约60 GB未量化权重,分布在4块GPU上
  • 推理步数25,CFG scale 4.0,最小图像尺寸512像素
  • 生成时间约166秒/张
  • Rekognition DetectLabels API使用最低80%置信度阈值,NMS IoU阈值>0.5

为什么值得看:该方案为工业安全AI中高风险场景训练数据稀缺问题提供了一条无需人工标注和危险拍摄的合成数据增强路径,并报告了最高160%的检测精度提升。

站内导航