「あなたの分類モデルにとって有害な特徴はどれですか?」

有害な特徴は何ですか?

分類器の特徴量のエラー寄与を計算し、モデルの理解と改善を目指す方法

[著者によるイメージ]

特徴重要度は、機械学習モデルの説明に最も一般的に使用されるツールです。それほど人気がありますので、多くのデータサイエンティストが特徴重要度と特徴の良さを同義と考えるようになります。

しかし、それは正しくありません。

特徴が重要であるとは、単にモデルがトレーニングセットで有用と判断したことを意味します。しかし、これは新しいデータで一般化する能力について何も言っていません!

この点を考慮するために、2つの概念の区別が必要です:

  • 予測寄与:変数がモデルによって行われる予測において持つ重み。これはモデルがトレーニングセットで見つけたパターンによって決まります。これは特徴重要度と同等です。
  • エラー寄与:モデルがホールドアウトデータセットで犯すエラーにおいて変数が持つ重み。これは新しいデータにおける特徴の性能のより良い代理となります。

この記事では、分類モデルにおけるこれら2つの量の計算の背後にあるロジックを説明します。また、予測寄与を使用するよりもエラー寄与を使用した場合に、特徴選択においてはるかに良い結果が得られる例も示します。

分類ではなく回帰に興味がある場合は、「あなたの特徴は重要ですか?それは彼らが良いことを意味するわけではありません」という私の以前の記事を読んでください。

目次

  1. おもちゃの例から始める
  2. 分類モデルにどの「エラー」を使用すべきか?
  3. 分類モデルでSHAP値をどのように管理すべきか?
  4. 「予測寄与」の計算
  5. 「エラー寄与」の計算
  6. 実際のデータセットの例
  7. それが機能することを証明する:「エラー寄与」を使用した再帰的特徴削除
  8. 結論

1. おもちゃの例から始める

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

データサイエンス

「David Smith、TheVentureCityの最高データオフィサー- インタビューシリーズ」

デビッド・スミス(別名「デビッド・データ」)は、TheVentureCityのチーフデータオフィサーであり、ソフトウェア駆動型のス...

人工知能

Aaron Lee、Smith.aiの共同設立者兼CEO - インタビューシリーズ

アーロン・リーさんは、Smith.aiの共同創業者兼CEOであり、AIと人間の知性を組み合わせて、24時間365日の顧客エンゲージメン...

人工知能

ジョナサン・ダムブロット、Cranium AIのCEO兼共同創設者- インタビューシリーズ

ジョナサン・ダムブロットは、Cranium AIのCEO兼共同創業者ですCranium AIは、サイバーセキュリティおよびデータサイエンスチ...

機械学習

もし芸術が私たちの人間性を表現する方法であるなら、人工知能はどこに適合するのでしょうか?

MITのポストドクターであるジヴ・エプスタイン氏(SM '19、PhD '23)は、芸術やその他のメディアを作成するために生成的AIを...

人工知能

「コーネリスネットワークスのソフトウェアエンジニアリング担当副社長、ダグ・フラーラー氏 - インタビューシリーズ」

ソフトウェアエンジニアリングの副社長として、DougはCornelis Networksのソフトウェアスタック全体、Omni-Path Architecture...

AIテクノロジー

「LXTのテクノロジーバイスプレジデント、アムル・ヌール・エルディン - インタビューシリーズ」

アムル・ヌール・エルディンは、LXTのテクノロジー担当副社長ですアムルは、自動音声認識(ASR)の文脈での音声/音響処理と機...