关键要点
要了解基于 AI 的分类器的性能,您需跟踪以下 5 个关键指标:
- 准确率和错误率: 衡量整体预测成功率,并识别改进领域。
- 逃逸率:跟踪被误判为合格品的缺陷产品,防止代价高昂的召回。
- 误报率: 识别被错误剔除的合格品,减少浪费和返工。
- 精确度:衡量正向预测的准确性,尽量减少误报。
- F1 分数: 平衡精确度和召回率,以体现综合检测能力。
产品质量是企业成功的关键。切实做好质量保障能够赢得客户信任,带来更多正面口碑,减少高成本召回,并提升企业经营业绩。为了保持高标准,制造商在整个生产过程中依赖机器视觉系统发挥作用。
分类器等深度学习工具不仅可以检测缺陷,还能对其进行分类,以增强质量控制。这种独特优势(例如辨别划痕与凹陷)能帮助制造商发现潜在规律,主动解决问题,并减少浪费。通过改进缺陷分类,生产过程更加高效,能够确保只有高质量产品才能进入市场。准确率、精确度和召回率等分类指标(我们这里讨论的内容)侧重于模型在对数据进行分类时的表现,评估指标则能更全面地反映模型在各类任务中的整体性能,有助于获得超越分类本身的深入见解。
那么,制造商如何知道其深度学习模型是否有效? 这里的挑战在于:准确的分类可确保只有缺陷产品被剔除,但错误的预测则可能把完好的产品误判为次品,从而拖慢操作进度并增加成本。
机器学习模型的成功始于选用合适的指标
在工业 4.0 时代,大数据成为推动流程与质量控制的核心动力。选择正确的指标,能够帮助企业评估其深度学习分类检测是否达到了理想效果。混淆性矩阵是其中最重要的工具之一,它可以帮助评估分类模型识别缺陷的准确性。
- 命中 – 模型正确地识别出一处缺陷。
- 误报 – 模型将一个不含缺陷的物品标记为缺陷。
- 正判 – 模型正确地识别出合格品。
- 漏检 – 模型漏检了缺陷。
虽然实际应用中可能涉及更复杂的分类与高级评估指标,但这些核心指标为跟踪成效以及优化自动化系统奠定了基础。
1. 准确率:模型做出正确预测的百分比。
这是制造业中应用最广泛的指标,因为它简单直观,能够全面反映系统对有缺陷及无缺陷产品的识别准确性。虽然准确率可以作为基本的衡量标准,但它并不能全面反映特定应用场景中的细微差别。
实际场景:想象一下,您是一名生产线上的检查员,负责检查 100 个产品的缺陷。如果您正确识别并标记了 95 个缺陷产品,则准确率是 95%。
2. 错误率:产品或零部件有缺陷或不符合质量标准的百分比。
该指标是对准确率的补充,能够突出反映模型出错的数量。错误率越低,表示模型性能越好;而较高的错误率则可能带来成本上升、材料浪费以及客户不满。
实际场景:想象一位仓库工人正在通过扫描条码来跟踪库存。如果这位工人扫描了 1,000 件商品,其中有 20 次出现了错误(如贴错标签或漏扫),那么错误率就是 2%。
3. 逃逸率:被误判为合格品的缺陷元件所占比例(即漏检)。
将逃逸率降到最低,确保只有高质量产品进入市场,有助于维护公司的声誉,避免代价高昂的产品召回。
实际场景:如果一块有裂纹的手机屏幕在检测时未被发现,并进入了发货流程,就被视为一次“逃逸”。逃逸率用来统计这些有缺陷产品在检测环节被漏检、最终可能流入客户手中的频率。
4. 误报率:被误判为有缺陷的合格零件所占比例(即误报)。
实际场景:机器人误将合格产品判为需要返工——这一指标可量化此类错误发生的频率,凸显因无谓返工导致的额外成本及资源浪费。
5. 精确度:模型判定为正的结果中,实际正确的比例。
这一指标能有效反映模型在做出预测时避免出现过多误报的能力,是衡量其正确分类能力的关键参数。精确度值为 1 表示模型对正例的预测完全正确且没有多报,精确率为 0 则说明模型预测失败。
实际场景:在医药包装线上,视觉系统负责检测标签上的印刷错误。如果系统能以高精确度检测出标签错误,就能确保仅标记出真正有印刷问题的标签,从而充分减少误报。这样可以避免将印刷正常的标签误判为不良品,有助于在保障产品质量的同时减少浪费。
其他指标
F1 分数:精确率与召回率的调和平均值,两者兼顾。
F1 分数适用于需要在精确率和召回率之间权衡兼顾的应用场景。分数为 1 表示精确率和召回率都完全正确,分数为 0 则说明模型表现不佳。
实际场景:在隐形眼镜生产过程中,自动化系统会检测划痕或撕裂等缺陷。如果系统在正确识别缺陷方面表现出色,漏检较少(精确度高而召回率低),则 F1 分数能够平衡这两个指标,使系统既能检测大部分缺陷,同时又能减少误报。
ROC 曲线(受试者工作特征曲线):一种图表,用于展示在不同分类阈值下,真实检出率(召回率)与误报率的关系。
实际场景:在医疗注射器生产中,机器视觉系统会检测如针头偏位等缺陷。通过应用 ROC 曲线,系统可以调节检测灵敏度,既保证所有重要的针头偏位都能被发现(高召回率),又尽量减少误报,确保只有有缺陷的注射器被剔除,从而保持生产效率。
曲线下面积 (AUC):用一个数值概括整个 ROC 曲线,表示模型区分类别的能力;AUC 值越高,表示性能越好。
实际场景: 对于训练用于检测产品缺陷(如塑料瓶裂纹)的深度学习模块,AUC 可以评估其将裂纹瓶(正类)和非裂纹瓶(负类)区分开的能力。AUC 值越高,表示模型在识别裂纹瓶方面的效果越好。
对数损失:用于衡量分类模型性能的指标,模型预测结果以概率值(介于 0 和 1 之间)呈现,对数损失值越低,表示模型性能越好。
实际场景:在食品包装生产线上,传感器用于检测密封包装袋是否存在漏气等缺陷。如果模型预测某包装袋有 85% 的漏气风险,但实际袋子完好无损,则对数损失会对这种错误的高置信度预测进行惩罚。对数损失值越低,说明模型能够可靠地预测缺陷,从而减少不必要的检查,仅将有缺陷的包装袋标记为需返工。
交叉熵损失:用于衡量两个概率分布之间的差异,通常是指真实标签分布与模型预测概率分布之间的差距。
实际场景:在一条智能手机装配线上,某模型能够预测屏幕上是划痕还是裂缝。如果模型预测到划痕而实际上是裂缝,交叉熵损失会因错误的严重性而对这个错误预测进行惩罚。这会促使模型不断提升预测准确率和缺陷检测精确度,并尽量减少因装配错误带来的高额损失。