強化学習:マルコフ決定過程ー第1部

強化学習:マルコフ決定過程ー第1部' -> '強化学習:マルコフ決定過程ー第1部

強化学習のバックボーンであるマルコフ決定過程を紹介します

Image by Ricardo Gomez Angel on Unsplash

私の以前の記事では、主に教師あり学習について説明し、教師なし学習の要素も少し取り上げました。しかし、この記事と次のいくつかの記事では、強化学習の問題に取り組み、読者の皆さんにそれについて明確で直感的なアイデアを提供します。

まず、機械学習の概要を説明しましょう。機械学習には3つの主要なサブフィールドがあります。教師なし学習、教師あり学習、および強化学習です。まず、それぞれの違いを理解しましょう:

  1. 教師なし学習:ラベルのないすべてのデータポイントに対して、パターンを自動的に見つけたりラベルを付けたりします。各ポイントはすべての特徴のベクトルであり、通常はクラスタリングによって行われます。新しい部屋に移動すると想像してください。クローゼットと戸棚があり、あなたの持ち物がすべてあります。部屋と持ち物を注意深く調べ、どのアイテムが互いに似ているかを見て、持ち物をそれぞれのカテゴリーにパッキングして部屋を整理します。要するに、教師なし学習を実践しています。これは単一のステップのプロセスです。
  2. 教師あり学習:ラベルが付けられたデータポイントがあります。各データポイントがどのラベルに属するかを学びます。そして、これらのデータポイントを正しいラベルにフィットさせる関数を見つけます。つまり、y≈f(x)を見つけます。強化学習を学んでいると想像してください。最初にいくつかの先入観があります。したがって、f(x)はランダムに初期化されます。学習教材を繰り返し学習すると、徐々に概念が強くなります。要するに、yは学習教材で、f(x)は理解です。教師あり学習は単一のステップのプロセスです。
  3. 強化学習:強化学習は教師あり学習とは異なり、学習にラベルを頼らずに報酬を利用します。さらに、強化学習は通常、複数のステップで行われます。各ステップには、各ステートに対してデータポイントがあります。そして、各ステートでは、エージェントは長期的に報酬を最大化するために行動を選択します。教師あり学習では、ラベルy

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

このAI論文は、イメージとテキストのアラインメントモデルにおける詳細なテキストとビジュアルの説明のための高度な技術を紹介しています

“`html 画像テキストの整列モデルは、視覚的コンテンツとテキスト情報の意味のある関連を確立し、イメージキャプショニ...

人工知能

「ゲーミングからAIへ:NvidiaのAI革命における重要な役割」

Nvidiaは現在、Facebook、Tesla、Netflixよりも価値が高いですロイターによると、株価は過去8ヶ月で3倍になりましたしかし、...

人工知能

なぜ包括的な画像セットが私たちにより良い製品作りを助けるのか

「私たちは、より包括的な製品を構築するために、株式画像会社であるTONLと協力して、より代表的なデータセットを作成しました」

AIニュース

「AIがバービーの画像を作成し、人種差別の批判を受ける」

近日、バービーの映画に関する話題の中で、異なる国を表すAI生成のバービーの画像がインターネット上で話題となっています。...

機械学習

あなたの製品の開発者学習のためのLLM(大規模言語モデル)

「LLM(Large Language Models)とLLMアプリを活用して、効果的かつ効率的な開発者教育を進め、製品の活用を促進する方法を探...

機械学習

メタがコードラマをリリース:コーディングのための最新のAIツール

メタ社は、驚異的な技術的飛躍を遂げ、最新の作品であるCode Llamaをリリースしました。Code Llamaは、Llama 2言語モデルをベ...