要点
AIベースの分類ツールのパフォーマンスを理解するために追跡する必要がある5つの主要な指標を以下に示します。
- 精度&とエラー率: 全体的な予測の成功を測定し、改善のための領域を識別する。
- エスケープ率:良品と誤って分類された不良品を追跡し、費用のかかるリコールを防止する。
- オーバーキル率: 誤って取り除かれた良品を識別し、無駄やリワークを削減する。
- 適合率 : 偽陽性を最小限に抑え、正しい陽性の予測を保証する。
- F1スコア: 包括的なパフォーマンス指標として、適合率と再現率のバランスをとる。
製品の品質は企業の成功の鍵です。それを適切に確保することにより、顧客の信頼、肯定的な口コミ、代償が大きいリコールの減少、より良いビジネス成果につながります。高水準を維持するために、製造業者は生産全体を通してマシンビジョンシステムを使用しています。
分類器などのディープラーニングツールは、欠陥を検出するだけでなく分類することで、品質管理を強化します。傷とくぼみなどの区別は、メーカーがパターンを特定し、問題に積極的に対処し、無駄を省くのに役立ちます。欠陥分類を最適化することで、生産は効率的になり、高品質の製品だけが市場に出回ります。精度、適合率、再現率などの分類指標(ここで議論している内容)は、モデルがどれだけうまくデータを分類するかに焦点を当てますが、評価指標は、タスク全体にわたるモデルの性能に関するより広範な視野を提供し、分類を超えた洞察を提供します。
メーカーは、ディープラーニングモデルが機能していることをどのように確認するのでしょうか。課題には次のようなものがあります。正確な分類は不良品のみを除去することを保証しますが、間違った予測は、完全な良品を誤って生産ラインから引き上げ、運用を遅らせ、コストを増加させる可能性があります。
機械学習モデルの成功は、正しい測定基準から始まる
インダストリー4.0では、ビッグデータがプロセスと品質管理を推進します。適切な指標を引き出すことで、組織は、ディープラーニング分類検査が最適に実行されているかどうかを理解することができます。このための最も重要なツールの1つが、Confusion Matrixであり、分類モデルがどの程度欠陥を識別できているかを評価するのに役立ちます。
- 真陽性 - モデルが欠陥を正しく識別。
- 偽陽性 - 欠陥のないものを欠陥として検出。
- 真陰性 - モデルが良品を分類。
- 偽陰性 - モデルが欠陥を見逃す。
実際のアプリケーションには、複雑な分類や高度な測定基準が含まれる場合がありますが、これらの中核となる測定基準は、成功事例を追跡し、自動化を最適化するための基礎になります。
1. 精度:モデルが行った予測の正答率。
これは製造業で最も広く使われている指標です。その理由は、シンプルであり、システムが不良品と良品の両方をどれだけ正しく識別しているかを明確に概観できるからです。精度は基本的な指標にはなりますが、特定の使用例のニュアンスを反映しているとは限りません。
実際のシナリオ:あなたが生産ラインの検査員で、100個の製品の欠陥を検出しているとしましょう。95個の不良品を正しく特定し、フラグを立てた場合は、欠陥検出精度は95%になります。
2. エラー率(Error Rate):不良品または品質基準を満たさない製品または部品の割合。
この指標は精度を補完するもので、モデルが犯した失敗数を強調するのに役立ちます。エラー率が低ければ低いほど、モデルの性能が良いことを示します。エラー率が高いと、コスト増、材料の無駄、顧客の不満につながります。
実際のシナリオ:倉庫作業員が在庫を追跡するためにバーコードをスキャンすることについて考えてみましょう。作業員が1,000個の商品をスキャンし、そのうちの20個が不正確(ラベルの貼り間違いや商品の紛失)であった場合、エラー率は2%になります。
3. エスケープ率:良品と誤って分類された欠陥部品の割合(偽陰性)。
エスケープ率を最小限に抑えることで、高品質の製品のみが市場に出回り、企業の評判が保たれ、費用のかかるリコールを回避することができます。
実際のシナリオ:割れた携帯電話の画面が検査をすり抜け、出荷のために梱包された場合、それは「エスケープ(脱出)」とみなされます。エスケープ率は、これらの不良品がどれくらいの頻度で検査を通過し、顧客のポケットに入るかを追跡します。
4. オーバーキル率:欠陥のない部品が誤って欠陥部品と分類される割合(偽陽性)。
実際のシナリオ:ロボットが誤って良品にリワークのフラグを立ててしまった場合、この指標はそのようなエラーの頻度を数値化し、完全に良品の部品を取り除きリワークすることに伴う不必要なコストや、資源の浪費を浮き彫りにします。
5. 適合率:モデルが行った予測のうち、実際に正しかったもの。
この指標は、多くの偽陽性の生成を回避し、正しいクラスを予測するモデルの能力を理解するための鍵になります。適合率の値が1であれば、過剰予測なしに陽性を完全に予測することを意味し、0であれば失敗を意味します。
実際のシナリオ:医薬品包装ラインでは、ビジョンシステムがラベルの誤植をターゲットにしています。システムが高精度でラベルの誤りを予測した場合、実際に誤印刷されたラベルだけにフラグを立て、偽陽性を最小限に抑えることができます。これにより、正しく印刷されたラベルが不必要に廃棄されることがなくなり、製品の品質が維持され、廃棄物が削減されます。
その他の指標
F1-スコア:適合率と再現率の調和平均で、両者のバランスをとります。
F1-スコアは、適合率と再現率のトレードオフのバランスをとる必要がある場合に使用されます。1の値は、両方の測定基準で完璧な精度を示し、0はモデルの性能が低いことを意味します。
実際のシナリオ:コンタクトレンズの製造では、自動化システムで傷や裂け目などの欠陥を識別します。システムが欠陥を正しく識別することに優れ、見逃しが少ない場合(適合率は高いが再現率が低い)、F1-スコアは適合率と再現率のバランスをとるのに役立ち、誤報を軽減しながらほとんどの欠陥を検出することができます。
ROC曲線(Receiver Operating Characteristic Curve):様々な分類しきい値における偽陽性率に対する真陽性率(再現率)をプロットしたグラフ。
実際のシナリオ:医療用注射器の製造では、マシンビジョンシステムで注射針の位置ずれなどの欠陥を検査します。ROC曲線を使用することで、システムは感度を調整し、誤報を最小限に抑えながら、重大な調整不良をすべて検出し(高い再現率)、欠陥のある注射器のみを確実に抜き取り、生産効率を維持することができます。
曲線下面積(AUC):ROC曲線を要約した単一の値で、モデルがクラス間をどの程度区別するかを表します。AUCが高いほど、性能が優れていることを示します。
実際のシナリオ: 製品の欠陥(ペットボトルのひび割れなど)を検出するためにトレーニングされたディープラーニングモデルの場合、AUCは、ひび割れしたボトル(ポジティブクラス)とひび割れしていないボトル(ネガティブクラス)をどれだけ区別できるかを評価します。AUCが高いほど、ひび割れたボトルを識別するのに有効なモデルであることを示します。
対数損失(Logarithmic Loss):予測値が0から1の間の確率値である分類モデルの性能で、対数損失の値が低いほどモデルの性能が高いことを示します。
実際のシナリオ:食品包装ラインでは、センサで密封されたパウチの漏れなどの欠陥を予測します。モデルが漏れの可能性を85%と予測しましたが、パウチが無傷であった場合、対数損失はこの誤った高信頼性予測にペナルティを課します。対数損失の値が低いほど、モデルが確実に欠陥を予測していることを示し、不必要なチェックを最小限に抑え、欠陥のあるパウチだけにリワークのフラグを立てることができます。
交差エントロピー誤差:2つの確率分布の差を定量化したもので、一般的には真のラベルと予測確率の差です。
実際のシナリオ:スマートフォンの組み立て製造ラインでは、スクリーンに傷があるか、ひびが入っているかをモデルが予測します。傷と予測したものが実際には亀裂であった場合、交差エントロピー誤差はこの間違った予測にエラーの重大さによってペナルティを与えます。これにより、モデルの精度が向上し、欠陥検出の精度が高まり、コストのかかる組み立てミスを最小限に抑えることができます。