Indicazioni chiave
Ci sono 5 metriche chiave da dover tracciare per comprendere le prestazioni di un classificatore basato sull’IA:
- Precisione & tassi di errore: Misurare il successo complessivo della previsione e identificare le aree di miglioramento.
- Escape rate: Traccia i prodotti difettosi erroneamente classificati come buoni, prevenendo costosi richiami.
- Overkill rate: Identifica i prodotti buoni rimossi in modo errato, riducendo i rifiuti e la rielaborazione.
- Precisione: Garantisce previsioni positive corrette, riducendo al minimo i falsi positivi.
- Punteggio F1: Bilancia precisione e richiamo per una metrica completa delle prestazioni.
La qualità del prodotto è la chiave del successo di un’azienda. Raggiungerla in modo consistente contribuisce a sviluppare la fiducia dei clienti, il passaparola più positivo, un minor numero di costosi richiami e a migliori risultati aziendali. Per mantenere standard elevati, i produttori si affidano a sistemi di visione artificiale durante tutta la produzione.
Gli strumenti di deep learning, come i classificatori, migliorano il controllo qualità non solo rilevando i difetti, ma anche categorizzandoli. Questa distinzione, come differenziare un graffio da un’ammaccatura, aiuta i produttori a identificare i modelli, affrontare i problemi in modo proattivo e ridurre i rifiuti. Raffinando la classificazione dei difetti, la produzione rimane efficiente e solo i prodotti di alta qualità raggiungono il mercato. Mentre le metriche di classificazione (quelle di cui stiamo discutendo qui) come l’accuratezza, la precisione e il richiamo si concentrano su come un modello classifica i dati, le metriche di valutazione forniscono una visione più ampia delle prestazioni di un modello tra le attività, offrendo approfondimenti oltre la classificazione.
Quindi, come fanno i produttori a sapere che i loro modelli di deep learning stanno funzionando? Ecco la sfida: Una classificazione accurata garantisce che vengano rimossi solo i prodotti difettosi, ma previsioni errate possono erroneamente estrarre articoli perfettamente buoni dalla produzione, rallentando le operazioni e aumentando i costi.
Il successo del modello di machine learning inizia con le metriche giuste
Nell’Industria 4.0, i big data guidano il processo e il controllo qualità. L’utilizzo delle metriche giuste consente alle organizzazioni di capire se le loro ispezioni di classificazione del deep learning stanno funzionando in modo ottimale. Uno degli strumenti più importanti per questo è la matrice di confusione, che aiuta a valutare quanto bene un modello di classificazione sta identificando i difetti.
- Vero positivo – Il modello identifica correttamente un difetto.
- Falso positivo – Il modello contrassegna un articolo non difettoso come difettoso.
- Vero negativo – Il modello classifica correttamente un articolo valido.
- Falso negativo – Il modello non nota un difetto.
Mentre le applicazioni del mondo reale possono comportare classificazioni complesse e metriche avanzate, queste misure fondamentali gettano le basi per il monitoraggio del successo e l’ottimizzazione dell’automazione.
1. Accuratezza: la percentuale di previsioni corrette fatte dal modello.
Questa è la metrica più utilizzata nella produzione, perché è semplice e fornisce una chiara panoramica di come il sistema identifica correttamente sia i prodotti difettosi che quelli non difettosi. Mentre l’accuratezza fornisce una misura di base, non sempre riflette le sfumature di casi d’uso specifici.
Scenario del mondo reale: Immagina di essere un ispettore sulla linea di produzione, controllando 100 prodotti per difetti. Se identifichi e contrassegni correttamente 95 articoli difettosi, il tasso di precisione è del 95%.
2. Tasso di errore: percentuale di prodotti o componenti difettosi o che non soddisfano gli standard di qualità.
Questa metrica è complementare alla precisione, contribuendo a evidenziare il numero di errori commessi dal modello. Un tasso di errore più basso indica prestazioni migliori del modello; un tasso di errore elevato può portare a un aumento dei costi, spreco di materiali e insoddisfazione del cliente.
Scenario del mondo reale: Pensa a un addetto al magazzino che esegue la scansione dei codici a barre per tracciare l’inventario. Se l’addetto esegue la scansione di 1.000 articoli e 20 di tali scansioni non sono corrette (etichettatura errata o articoli mancanti), il tasso di errore sarebbe del 2%.
3. Escape Rate: percentuale di parti difettose classificate erroneamente come buone (falsi negativi).
La riduzione al minimo degli escape rate si traduce solo in prodotti di alta qualità che raggiungono il mercato, preservando la reputazione di un’azienda ed evitando costosi richiami.
Scenario del mondo reale: Se uno schermo del telefono rotto sfugge all’ispezione e viene imballato per la spedizione, è considerato un “escape”. L’escape rate traccia la frequenza con cui questi prodotti difettosi superano l’ispezione e possono apparire nella tasca di un cliente.
4. Overkill Rate: percentuale di parti non difettose classificate erroneamente come difettose (falsi positivi).
Scenario del mondo reale: Quando un robot segnala erroneamente i buoni prodotti per la rielaborazione, questa metrica quantifica la frequenza di tali errori, evidenziando i costi inutili associati alla rimozione e alla rielaborazione di parti perfettamente buone e sprecando risorse.
5. Precisione: previsioni positive fatte dal modello che erano effettivamente corrette.
Questa metrica è fondamentale per comprendere la capacità del modello di prevedere la classe corretta senza generare troppi falsi positivi. Un valore di precisione pari a 1 indica una previsione perfetta dei positivi senza una previsione eccessiva, mentre 0 indica un insuccesso.
Scenario del mondo reale: In una linea di confezionamento farmaceutico, un sistema di visione mira agli errori di stampa sulle etichette. Se il sistema prevede errori di etichettatura con alta precisione, si assicura che vengano segnalate solo le etichette effettivamente errate, riducendo al minimo i falsi positivi. In questo modo si evita lo scarto inutile delle etichette stampate correttamente, mantenendo la qualità del prodotto e riducendo gli sprechi.
Altre metriche
Punteggio F1: la media armonica di Precisione e Richiamo, fornendo un equilibrio tra i due.
Il Punteggio F1 viene utilizzato quando è necessario bilanciare il compromesso tra Precisione e Richiamo. Un valore pari a 1 indica una precisione perfetta per entrambe le metriche; 0 indica che il modello ha prestazioni scarse.
Scenario del mondo reale: Nella produzione di lenti a contatto, un sistema automatizzato identifica difetti come graffi o lacerazioni. Se il sistema eccelle nell’identificare correttamente i difetti con pochi errori (buona precisione ma basso richiamo), il Punteggio F1 aiuta a bilanciare precisione e richiamo, consentendo di rilevare la maggior parte dei difetti mitigando i falsi allarmi.
Curva ROC (Curva caratteristica operativa del ricevitore): un grafico che traccia il tasso di vero positivo (richiamo) rispetto al tasso di falso positivo a varie soglie di classificazione.
Scenario del mondo reale: Nella produzione di siringhe mediche, i sistemi di visione artificiale ispezionano eventuali difetti come il disallineamento dell’ago. Utilizzando la curva ROC, il sistema può regolare la sua sensibilità per garantire che rilevi tutti i disallineamenti significativi (richiamo elevato) riducendo al minimo i falsi allarmi, assicurando che vengano tirate solo le siringhe difettose, mantenendo l’efficienza di produzione.
Area Under Curve (AUC): un singolo valore che sintetizza la curva ROC, che rappresenta il grado di distinzione del modello tra le classi; un’AUC più elevata indica prestazioni migliori.
Scenario del mondo reale: Per un modello di deep learning addestrato per rilevare i difetti del prodotto (come le crepe nelle bottiglie di plastica), l’AUC ha valutato quanto sia in grado di distinguere tra bottiglie incrinate (classe positiva) e bottiglie non incrinate (classe negativa). Un’AUC più elevata indica che il modello è più efficace nell’identificare le bottiglie incrinate.
Perdita logaritmica (Logarithmic Loss): le prestazioni di un modello di classificazione in cui la previsione è un valore di probabilità compreso tra 0 e 1, con valori di perdita logaritmica inferiori che indicano prestazioni del modello migliori.
Scenario del mondo reale: Su una linea di imballaggi di alimenti, i sensori predicono difetti come perdite in sacchetti sigillati. Se il modello prevede una probabilità dell’85% di una perdita, ma la sacca è intatta, la perdita logaritmica penalizza questa previsione errata di alta affidabilità. Valori di perdita logaritmica inferiori indicano che il modello prevede in modo affidabile i difetti, riducendo al minimo i controlli non necessari e garantendo che solo le buste difettose siano contrassegnate per la rielaborazione.
Cross-Entropy Loss: quantifica la differenza tra due distribuzioni di probabilità, tipicamente tra le vere etichette e le probabilità previste.
Scenario del mondo reale: In una linea di assemblaggio di smartphone, un modello prevede se uno schermo ha un graffio o una crepa. Se prevede un graffio quando si tratta in realtà di una crepa, la perdita di entropia incrociata penalizza questa previsione errata a causa della severità dell’errore. Ciò incoraggia il modello a perfezionare la sua precisione, migliorando la precisione di rilevamento dei difetti e riducendo al minimo costosi errori di assemblaggio.