「あなたの分類モデルにとって有害な特徴はどれですか?」

有害な特徴は何ですか?

分類器の特徴量のエラー寄与を計算し、モデルの理解と改善を目指す方法

[著者によるイメージ]

特徴重要度は、機械学習モデルの説明に最も一般的に使用されるツールです。それほど人気がありますので、多くのデータサイエンティストが特徴重要度と特徴の良さを同義と考えるようになります。

しかし、それは正しくありません。

特徴が重要であるとは、単にモデルがトレーニングセットで有用と判断したことを意味します。しかし、これは新しいデータで一般化する能力について何も言っていません!

この点を考慮するために、2つの概念の区別が必要です:

  • 予測寄与:変数がモデルによって行われる予測において持つ重み。これはモデルがトレーニングセットで見つけたパターンによって決まります。これは特徴重要度と同等です。
  • エラー寄与:モデルがホールドアウトデータセットで犯すエラーにおいて変数が持つ重み。これは新しいデータにおける特徴の性能のより良い代理となります。

この記事では、分類モデルにおけるこれら2つの量の計算の背後にあるロジックを説明します。また、予測寄与を使用するよりもエラー寄与を使用した場合に、特徴選択においてはるかに良い結果が得られる例も示します。

分類ではなく回帰に興味がある場合は、「あなたの特徴は重要ですか?それは彼らが良いことを意味するわけではありません」という私の以前の記事を読んでください。

目次

  1. おもちゃの例から始める
  2. 分類モデルにどの「エラー」を使用すべきか?
  3. 分類モデルでSHAP値をどのように管理すべきか?
  4. 「予測寄与」の計算
  5. 「エラー寄与」の計算
  6. 実際のデータセットの例
  7. それが機能することを証明する:「エラー寄与」を使用した再帰的特徴削除
  8. 結論

1. おもちゃの例から始める

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

「ジャスティン・マクギル、Content at Scaleの創設者兼CEO - インタビューシリーズ」

ジャスティンは2008年以来、起業家、イノベーター、マーケターとして活動しています彼は15年以上にわたりSEOマーケティングを...

人工知能

エンテラソリューションズの創設者兼CEO、スティーブン・デアンジェリス- インタビューシリーズ

スティーブン・デアンジェリスは、エンタラソリューションズの創設者兼CEOであり、自律的な意思決定科学(ADS®)技術を用いて...

人工知能

Diginiのスマートセンスの社長、ガイ・イエヒアブによるインタビューシリーズ

ガイ・イハイアヴ氏は、ビジネスの成功に最も重要な資産を保護するためにインターネット・オブ・シングス(IoT)の力を活用す...

人工知能

「Ntropyの共同創設者兼CEO、ナレ・ヴァルダニアンについて - インタビューシリーズ」

「Ntropyの共同創設者兼CEOであるナレ・ヴァルダニアンは、超人的な精度で100ミリ秒以下で金融取引を解析することを可能にす...

人工知能

「マーシャンの共同創設者であるイータン・ギンスバーグについてのインタビューシリーズ」

エタン・ギンズバーグは、マーシャンの共同創業者であり、すべてのプロンプトを最適なLLMに動的にルーティングするプラットフ...

人工知能

キャルレールの最高製品責任者、ライアン・ジョンソンへのインタビューシリーズ

ライアンは、初期のスタートアップからフォーチュン100の組織まで、多様なテクノロジーと製品開発のリーダーシップ経験を15年...