強化学習:マルコフ決定過程ー第1部

強化学習:マルコフ決定過程ー第1部' -> '強化学習:マルコフ決定過程ー第1部

強化学習のバックボーンであるマルコフ決定過程を紹介します

Image by Ricardo Gomez Angel on Unsplash

私の以前の記事では、主に教師あり学習について説明し、教師なし学習の要素も少し取り上げました。しかし、この記事と次のいくつかの記事では、強化学習の問題に取り組み、読者の皆さんにそれについて明確で直感的なアイデアを提供します。

まず、機械学習の概要を説明しましょう。機械学習には3つの主要なサブフィールドがあります。教師なし学習、教師あり学習、および強化学習です。まず、それぞれの違いを理解しましょう:

  1. 教師なし学習:ラベルのないすべてのデータポイントに対して、パターンを自動的に見つけたりラベルを付けたりします。各ポイントはすべての特徴のベクトルであり、通常はクラスタリングによって行われます。新しい部屋に移動すると想像してください。クローゼットと戸棚があり、あなたの持ち物がすべてあります。部屋と持ち物を注意深く調べ、どのアイテムが互いに似ているかを見て、持ち物をそれぞれのカテゴリーにパッキングして部屋を整理します。要するに、教師なし学習を実践しています。これは単一のステップのプロセスです。
  2. 教師あり学習:ラベルが付けられたデータポイントがあります。各データポイントがどのラベルに属するかを学びます。そして、これらのデータポイントを正しいラベルにフィットさせる関数を見つけます。つまり、y≈f(x)を見つけます。強化学習を学んでいると想像してください。最初にいくつかの先入観があります。したがって、f(x)はランダムに初期化されます。学習教材を繰り返し学習すると、徐々に概念が強くなります。要するに、yは学習教材で、f(x)は理解です。教師あり学習は単一のステップのプロセスです。
  3. 強化学習:強化学習は教師あり学習とは異なり、学習にラベルを頼らずに報酬を利用します。さらに、強化学習は通常、複数のステップで行われます。各ステップには、各ステートに対してデータポイントがあります。そして、各ステートでは、エージェントは長期的に報酬を最大化するために行動を選択します。教師あり学習では、ラベルy

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

このAI論文では、リーマン幾何学を通じて拡散モデルの潜在空間の理解に深入りします

人工知能や機械学習の人気が高まる中で、自然言語処理や自然言語生成などの主要なサブフィールドも高速に進化しています。最...

データサイエンス

「Apache CassandraとApache Pulsarを使用した製品推薦エンジンの構築」

仮説上の請負業者がApache PulsarとApache Cassandraを使用してAIの加速化を行った方法この記事ではAI/MLへの道のりの重要な...

人工知能

情報セキュリティ:IoT業界内のAIセキュリティ

この記事では、AIセキュリティについての読者をIoT業界に没入させ、トピックの基盤となるさまざまな種類の「セキュリティ」に...

AIニュース

このAIニュースレターは、あなたが必要とするすべてです#74

今週は、残念ながらOpenAIの連続する出来事に注目が集まり、いくつかの興味深い新しいモデルの発表が overshadow されてしま...

データサイエンス

エッジMLのタイプとエンタープライズのユースケース

エッジマシンラーニングにより、デバイスはAIのタスクをローカルで実行することができ、結果的に待ち時間が短縮され、データ...

機械学習

「2024年のソフトウェア開発のトレンドと予測18」

2024年のソフトウェア開発の世界は、急速な技術の進歩と同時に進化するセキュリティの課題に備えています