Wichtige Erkenntnisse
Es gibt fünf wichtige Metriken, die Sie verfolgen müssen, um die Leistung eines KI-basierten Classifiers zu verstehen:
- Genauigkeits- & Fehlerraten: Messung des Gesamterfolgs der Vorhersage und Identifikation von Verbesserungsbereichen.
- Escape-Rate: Verfolgt fehlerhafte Produkte, die fälschlicherweise als gut eingestuft wurden, und verhindert kostspielige Rückrufaktionen.
- Overkill-Rate: Identifiziert gute Produkte, die fälschlicherweise entfernt wurden, wodurch Ausschuss und Nacharbeit reduziert werden.
- Genauigkeit: Gewährleistet korrekte positive Vorhersagen, minimiert falsch-positive Ergebnisse.
- F1-Score: Bringt Präzision und Abruf für eine umfassende Leistungsmetrik ins Gleichgewicht.
Produktqualität ist der Schlüssel zum Erfolg von Unternehmen. Zuverlässig eine hohe Produktqualität zu liefern führt zu Kundenvertrauen, mehr positiver Mundpropaganda, einer geringeren Zahl kostspieliger Rückrufe und zu besseren Geschäftsergebnissen. Um hohe Standards aufrechtzuerhalten, verlassen sich Hersteller während der gesamten Produktion auf Bildverarbeitungssysteme.
Deep-Learning-Tools wie Klassifikatoren verbessern die Qualitätskontrolle, indem sie Fehler nicht nur erkennen, sondern auch kategorisieren. Diese Unterscheidung, beispielsweise zwischen Kratzern und Druckstellen, hilft Herstellern dabei, Muster zu erkennen, Probleme proaktiv anzugehen und Ausschuss zu reduzieren. Durch die Verfeinerung der Fehlerklassifizierung bleibt die Produktion effizient und es kommen nur hochwertige Produkte auf den Markt. Während Klassifizierungsmetriken (die wir hier diskutieren) wie Genauigkeit, Präzision und Rückruf sich darauf konzentrieren, wie gut ein Modell Daten kategorisiert, bieten Bewertungsmetriken einen breiteren Überblick über die Leistung eines Modells bei verschiedenen Aufgaben und liefern Erkenntnisse, die über die Klassifizierung hinausgehen.
Woher wissen Hersteller, dass ihre Deep-Learning-Modelle funktionieren? Das ist die Herausforderung: Eine genaue Klassifizierung stellt sicher, dass nur fehlerhafte Produkte aussortiert werden. Aber falsche Vorhersagen können irrtümlicherweise einwandfreie Artikel aus der Produktion nehmen, den Betrieb verlangsamen und die Kosten erhöhen.
Der Erfolg des Modells für maschinelles Lernen beginnt mit den richtigen Metriken
In Industrie 4.0 treibt Big Data die Prozess- und Qualitätskontrolle an. Mit den richtigen Metriken können Unternehmen verstehen, ob ihre Klassifizierungsprüfungen mit Deep Learning optimal funktionieren. Eines der wichtigsten Tools dafür ist die Confusion Matrix, die hilft zu beurteilen, wie gut ein Klassifizierungsmodell Defekte identifiziert.
- True Positive – Das Modell identifiziert einen Defekt korrekt.
- False Positive – Das Modell kennzeichnet einen nicht defekten Artikel als defekt.
- True Negative – Das Modell klassifiziert einen guten Artikel korrekt.
- False Negative – Das Modell verpasst einen Fehler.
Während reale Anwendungen komplexe Klassifizierungen und erweiterte Metriken beinhalten können, bilden diese Kernkennzahlen die Grundlage für die Erfolgsmessung und die Optimierung der Automatisierung.
1. Genauigkeit: der Prozentsatz der korrekten Vorhersagen durch das Modell.
Das ist die am häufigsten verwendete Metrik in der Fertigung, da sie einfach ist und einen klaren Überblick darüber gibt, wie gut Ihr System sowohl defekte als auch nicht defekte Produkte korrekt identifiziert. Obwohl Genauigkeit ein grundlegendes Maß darstellt, spiegelt sie nicht immer die Nuancen bestimmter Anwendungsfälle wider.
Szenario aus der realen Welt: Stellen Sie sich vor, Sie sind Prüfer an der Produktionslinie und überprüfen 100 Produkte auf Defekte. Wenn Sie 95 fehlerhafte Artikel richtig identifizieren und markieren, beträgt Ihre Genauigkeitsquote 95 %.
2. Fehlerquote: Prozentsatz der Produkte oder Komponenten, die defekt sind bzw. die Qualitätsstandards nicht erfüllen.
Diese Metrik ergänzt die Genauigkeit und hilft dabei, die Anzahl der Fehler des Modells hervorzuheben. Eine niedrigere Fehlerquote deutet auf eine bessere Modellleistung hin. Eine hohe Fehlerquote kann zu erhöhten Kosten, Materialverschwendung und Unzufriedenheit bei den Kunden führen.
Szenario aus der realen Welt: Denken Sie an einen Lagerarbeiter, der Barcodes scannt, um den Bestand nachzuverfolgen. Wenn der Mitarbeiter 1.000 Artikel scannt und 20 dieser Scans falsch sind (Fehlbeschriftung oder fehlende Artikel), würde die Fehlerquote 2 % betragen.
3. Escape-Rate: der Prozentsatz defekter Teile, die fälschlicherweise als gut eingestuft werden (False negatives).
Die Minimierung der Escape-Raten führt dazu, dass nur qualitativ hochwertige Produkte auf den Markt kommen, den Ruf eines Unternehmens bewahren und kostspielige Rückrufe vermeiden.
Szenario aus der realen Welt: Wenn ein gesprungenes Telefondisplay in der Prüfung nicht erkannt wird und für den Versand verpackt wird, gilt dies als „Escape“. Die Escape-Rate verfolgt, wie oft diese defekten Produkte die Prüfung durchlaufen und möglicherweise in der Tasche eines Kunden landen.
4. Overkill-Rate: der Prozentsatz der nicht defekten Teile, die falsch als defekt eingestuft werden (False positives).
Szenario aus der realen Welt: Wenn ein Roboter fälschlicherweise einwandfreie Produkte zur Nacharbeit markiert, quantifiziert diese Kennzahl die Häufigkeit solcher Fehler und verdeutlicht die unnötigen Kosten, die durch das Entfernen und Nacharbeit für einwandfreie Teile sowie durch die Verschwendung von Ressourcen entstehen.
5. Genauigkeit: positive Vorhersagen des Modells, die tatsächlich korrekt waren.
Diese Metrik ist entscheidend, um die Fähigkeit des Modells zu verstehen, die richtige Klasse vorherzusagen, ohne zu viele False Positives zu generieren. Ein Präzisionswert von 1 bedeutet eine perfekte Vorhersage von positiven Ergebnissen ohne Übervorhersage, während 0 für Fehler steht.
Szenario aus der realen Welt: In einer pharmazeutischen Verpackungslinie zielt ein Bildverarbeitungssystem auf Fehldrucke auf Etiketten ab. Wenn das System Etikettenfehler mit hoher Präzision vorhersagt, stellt es sicher, dass nur tatsächlich fehlerhaft gedruckte Etiketten markiert werden, wodurch Fehlalarme minimiert werden. Dies verhindert unnötigen Ausschuss korrekt gedruckter Etiketten, wodurch die Produktqualität erhalten bleibt und Abfall reduziert wird.
Sonstige Metriken
F1-Wert: der harmonische Mittelwert von Präzision und Erinnerung, der ein Gleichgewicht zwischen den beiden bietet.
Der F1-Score wird verwendet, wenn Sie den Kompromiss zwischen Präzision und Rückruf ausgleichen müssen. Ein Wert von 1 zeigt die perfekte Genauigkeit für beide Metriken an; 0 bedeutet, dass das Modell schlecht abschneidet.
Szenario aus der realen Welt: Bei der Herstellung von Kontaktlinsen identifiziert ein automatisiertes System Defekte wie Kratzer oder Risse. Wenn das System Defekte mit wenigen Fehlern (gute Präzision, aber geringe Trefferquote) richtig identifiziert, hilft der F1-Score, Präzision und Trefferquote auszugleichen, sodass die meisten Defekte erkannt und Fehlalarme gemindert werden können.
ROC-Kurve (Receiver Operating Characteristic Curve): ein Diagramm, das die Trefferquote (Recall) gegen die Falsch-Positiv-Rate bei verschiedenen Klassifizierungsschwellenwerten darstellt.
Szenario aus der realen Welt: Bei der Herstellung medizinischer Spritzen untersuchen maschinelle Sichtsysteme auf Defekte wie Nadelfehlausrichtung. Durch die Verwendung der ROC-Kurve kann das System seine Empfindlichkeit anpassen, um sicherzustellen, dass es alle signifikanten Fehlausrichtungen (hohe Trefferquote) erkennt, während Fehlalarme minimiert werden, um sicherzustellen, dass nur defekte Spritzen gezogen werden und die Produktionseffizienz erhalten bleibt.
Area Under Curve (AUC): ein einzelner Wert, der die ROC-Kurve zusammenfasst und darstellt, wie gut das Modell zwischen Klassen unterscheidet; eine höhere AUC zeigt eine bessere Leistung an.
Szenario aus der realen Welt: Für ein Deep-Learning-Modell, das zur Erkennung von Produktdefekten (wie Risse in Plastikflaschen) trainiert wurde, bewertete die AUC, wie gut es zwischen gerissenen (positive Klasse) und nicht gerissenen Flaschen (negative Klasse) unterscheiden kann. Eine höhere AUC zeigt an, dass das Modell bei der Identifizierung von gerissenen Flaschen effektiver ist.
Log Loss (Logarithmischer Verlust): die Leistung eines Klassifizierungsmodells, bei dem die Vorhersage ein Wahrscheinlichkeitswert zwischen 0 und 1 ist, wobei niedrigere Log-Verlustwerte eine bessere Modellleistung anzeigen.
Szenario aus der realen Welt: Auf einer Lebensmittelverpackungslinie prognostizieren Sensoren Defekte wie Leckagen in versiegelten Beuteln. Wenn das Modell eine Wahrscheinlichkeit von 85 % für ein Leck vorhersagt, der Beutel jedoch intakt ist, bestraft der Log-Verlust diese falsche Vorhersage mit hohem Vertrauen. Niedrigere Log-Verlustwerte würden darauf hinweisen, dass das Modell zuverlässig Defekte vorhersagt, unnötige Prüfungen minimiert und sicherstellt, dass nur defekte Beutel für Nacharbeiten gekennzeichnet werden.
Cross-Entropy Loss: quantifiziert die Differenz zwischen zwei Wahrscheinlichkeitsverteilungen, typischerweise zwischen den wahren Bezeichnungen und vorhergesagten Wahrscheinlichkeiten.
Szenario aus der realen Welt: Auf einer Smartphone-Montagelinie sagt ein Modell voraus, ob ein Bildschirm einen Kratzer oder einen Sprung aufweist. Wenn es einen Kratzer vorhersagt, obwohl es sich tatsächlich um einen Sprung handelt, bestraft der Kreuzentropieverlust diese falsche Vorhersage aufgrund der Schwere des Fehlers. Das bringt das Modell dazu, seine Genauigkeit zu verfeinern, die Fehlererkennungspräzision zu verbessern und kostspielige Montagefehler zu minimieren.