Sklearnの交差検証の可視化:K-Fold、シャッフル&スプリット、および時系列スプリット

Sklearnの交差検証の可視化

Sklearn K-Fold、Shuffle & Split、およびTime Series Splitのクロスバリデーションのプロセスを可視化し、Pythonを使用して検証結果を表示する

写真:Ryoji Iwata氏撮影、Unsplashより引用

クロスバリデーションとは?

基本的に、クロスバリデーションは学習アルゴリズムを評価するための統計的手法です。分析を実行するために、固定数のフォールド(データのグループ)が設定されます。これらのフォールドは、トレーニングセットとテスト(検証)セットにデータをグループ化し、ラウンドごとに交差します。これにより、各データポイントを検証することができます。

主な目的は、モデルが作成に使用されなかった独立したデータを予測する能力をテストすることです。また、オーバーフィッティングや選択バイアスなどの問題に対処するのにも役立ちます。

この記事のクロスバリデーションの結果の例。画像:著者撮影

この記事では、Scikit Learnライブラリの3つのクロスバリデーションのプロセスを可視化するためにPythonを適用します:

  • K-Foldクロスバリデーション
  • Shuffle & Splitクロスバリデーション
  • Time Series Splitクロスバリデーション

さらに、検証結果もプロットして洞察力のある情報を表現することができます。

さあ、始めましょう

1. K-Foldクロスバリデーション

K-Foldはクロスバリデーションの一般的な方法です。まず、すべてのデータをフォールドに分割します。次に、トレーニングセット(k-1フォールド)から学習モデルを作成し、テストセット(残りのフォールド)を検証に使用します。

通常、K-Foldクロスバリデーションから得られるフォールドはできるだけ均等に分割されます。次に、K-Foldクロスバリデーションのプロセスを見ていきます。

ライブラリのインポートとデータの読み込み

例えば、この記事ではSklearnライブラリからダウンロードできるワインデータセットを使用します。このデータセットは、CC BY 4.0ライセンスの下でのUCI MLワインデータのコピーです。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

AIテクノロジー

アンソニー・グーネティレケ氏は、Amdocsのグループ社長であり、テクノロジー部門および戦略部門の責任者です- インタビューシリーズ

アンソニー・グーネティレーケは、Amdocsでグループ社長、テクノロジーと戦略担当です彼と企業戦略チームは、会社の戦略を策...

AIニュース

OpenAIのCEOであるSam Altman氏:AIの力が証明されるにつれて、仕事に関するリスクが生じる

OpenAIのCEOであるSam Altmanは、特に彼の作品であるChatGPTに関するAIの潜在的な危険性について公言してきました。最近のイ...

人工知能

「コマンドバーの創設者兼CEO、ジェームズ・エバンスによるインタビューシリーズ」

ジェームズ・エバンズは、CommandBarの創設者兼CEOであり、製品、マーケティング、顧客チームを支援するために設計されたAIパ...

人工知能

「ジンディのCEO兼共同創設者、セリーナ・リー― インタビューシリーズ」

「Celina Leeは、ZindiのCEO兼共同創設者であり、アフリカのデータサイエンティスト向けの最大の専門ネットワークです Celina...

データサイエンス

「Adam Ross Nelsonによる自信のあるデータサイエンスについて」

データサイエンスの中で新たな分野が現れ、研究内容が理解しにくい場合は、専門家や先駆者と話すのが最善です最近、私たちは...

人工知能

「ジャスティン・マクギル、Content at Scaleの創設者兼CEO - インタビューシリーズ」

ジャスティンは2008年以来、起業家、イノベーター、マーケターとして活動しています彼は15年以上にわたりSEOマーケティングを...