Sklearnの交差検証の可視化:K-Fold、シャッフル&スプリット、および時系列スプリット

Sklearnの交差検証の可視化

Sklearn K-Fold、Shuffle & Split、およびTime Series Splitのクロスバリデーションのプロセスを可視化し、Pythonを使用して検証結果を表示する

写真:Ryoji Iwata氏撮影、Unsplashより引用

クロスバリデーションとは?

基本的に、クロスバリデーションは学習アルゴリズムを評価するための統計的手法です。分析を実行するために、固定数のフォールド(データのグループ)が設定されます。これらのフォールドは、トレーニングセットとテスト(検証)セットにデータをグループ化し、ラウンドごとに交差します。これにより、各データポイントを検証することができます。

主な目的は、モデルが作成に使用されなかった独立したデータを予測する能力をテストすることです。また、オーバーフィッティングや選択バイアスなどの問題に対処するのにも役立ちます。

この記事のクロスバリデーションの結果の例。画像:著者撮影

この記事では、Scikit Learnライブラリの3つのクロスバリデーションのプロセスを可視化するためにPythonを適用します:

  • K-Foldクロスバリデーション
  • Shuffle & Splitクロスバリデーション
  • Time Series Splitクロスバリデーション

さらに、検証結果もプロットして洞察力のある情報を表現することができます。

さあ、始めましょう

1. K-Foldクロスバリデーション

K-Foldはクロスバリデーションの一般的な方法です。まず、すべてのデータをフォールドに分割します。次に、トレーニングセット(k-1フォールド)から学習モデルを作成し、テストセット(残りのフォールド)を検証に使用します。

通常、K-Foldクロスバリデーションから得られるフォールドはできるだけ均等に分割されます。次に、K-Foldクロスバリデーションのプロセスを見ていきます。

ライブラリのインポートとデータの読み込み

例えば、この記事ではSklearnライブラリからダウンロードできるワインデータセットを使用します。このデータセットは、CC BY 4.0ライセンスの下でのUCI MLワインデータのコピーです。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

3つの質問:大規模言語モデルについて、Jacob Andreasに聞く

CSAILの科学者は、最新の機械学習モデルを通じた自然言語処理の研究と、言語が他の種類の人工知能をどのように高めるかの調査...

人工知能

「ジャスティン・マクギル、Content at Scaleの創設者兼CEO - インタビューシリーズ」

ジャスティンは2008年以来、起業家、イノベーター、マーケターとして活動しています彼は15年以上にわたりSEOマーケティングを...

人工知能

「マーシャンの共同創設者であるイータン・ギンスバーグについてのインタビューシリーズ」

エタン・ギンズバーグは、マーシャンの共同創業者であり、すべてのプロンプトを最適なLLMに動的にルーティングするプラットフ...

人工知能

「aiOlaのCEO兼共同創設者、アミール・ハラマティによるインタビューシリーズ」

アミール・ハラマティは、aiOlaのCEO兼共同創業者であり、スピーチを作業可能にし、どこでも完全な正確さで業界固有のプロセ...

人工知能

「マーク・A・レムリー教授による生成AIと法律について」

データサイエンス内で新しい分野が現れ、研究内容が理解しにくい場合は、専門家やパイオニアと話すことが最善です最近、私た...

人工知能

『DeepHowのCEO兼共同創業者、サム・ジェン氏によるインタビューシリーズ』

ディープハウのCEO兼共同創設者であるサム・ジェンは、著名な投資家から支持される急速に進化するスタートアップを率いていま...