「第一の汎用ビジュアルと言語のAI LLaVA」

AI LLaVA The first general-purpose visual and language AI

LLaVA:GPT-4によるビジュアルと言語AIのギャップを埋める

オリジナルはlouisbouchard.aiに掲載されており、私のブログでも2日前に読んでください!

動画を見る!

GPT-4は強力ですが、それを利用して完全に構築されたAIがいくつか存在することを知っていますか? はい、GPT-4は非常に優れているため、他のAIモデルのトレーニングに十分なデータを生成するために使用できます。そして、それ以上のモデルを生成することができます! Liuらは、GPT-4を使用して言語ビジョンモデルであるLLaVAを作成しました。これは、視覚と言語に基づく指示を理解し、追従する最初の汎用モデルです。つまり、テキストと画像をほぼ完璧に理解できるモデルです。したがって、任意の画像に関して何でも質問できます。GPT-4はまだ画像を見ることができないが、テキスト処理には非常に優れているため、私たちは画像のキャプションを送信し、Q&Aのための質問、画像のより詳細な説明、さらには画像キャプションに関する推論的な質問と回答など、さまざまなタイプの出力を生成するようにお願いすることができます。これが著者が行ったことです。彼らはGPT-4モデルに役割と個性を与え、各画像の初期キャプションに基づいてさまざまなタイプのデータを生成するように求めました。

<img alt="「指示に従うデータの例。上部ブロックにはGPTを促すために使用されるキャプションやボックスなどのコンテキストが表示され、下部ブロックには3つのタイプの応答が表示されます。視覚画像はGPTを促すために使用されていないことに注意してください。ここでは参照のために表示しています。」画像とキャプションは論文から引用されています。

以下は、LLaVAの場合にGPT-4に与えられた指示の例です。これにより、言語モデルが画像をより深く理解できるようにするために、画像を簡潔に説明するように要求し、徹底的な説明や詳細な分析に至るまで進めます。

<img alt="簡潔な画像説明のための指示リスト。画像は論文から引用されています。

これらのユーザー生成のプロンプトとGPT-4が生成する回答は、さまざまな質問や回答、画像の説明で満たされた良質なデータセットを作成し、画像とテキストを処理できるマルチモーダルAIをトレーニングするために使用されます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

「Rodinに会ってください:さまざまな入力ソースから3Dデジタルアバターを生成する革新的な人工知能(AI)フレームワーク」

生成モデルは、コンピュータサイエンスの多くの困難なタスクに対する事実上の解決策となっています。それらは視覚データの分...

機械学習

AIHelperBotとの出会い 秒単位でSQLクエリを構築する人工知能(AI)ベースのSQLエキスパート

現代のデジタルテクノロジーの魅力的な世界では、人工知能(AI)チャットボットが人々のオンライン体験を向上させます。人工...

AIニュース

「世界最大の広告主がAIの力を受け入れる:広告業界におけるパラダイムシフト」

広告業界を再構築する可能性を秘めた動きとして、世界でも有名な広告主の一部が生成型人工知能(AI)の可能性を活用していま...

データサイエンス

「EU AI Actについて今日関心を持つべき理由」

「MLおよびAI業界で働く私たちのほとんどは、新しい規制に関する見出しを見て流し読みするでしょう新しい規制は『法律用語』...

AI研究

OpenAIのChatGPTアプリがBingの統合機能を備えたブラウジング機能を導入しました

OpenAIは、AIに関する最先端の研究機関であり、彼らのAIチャットボットのプレミアムバージョンであるChatGPT Plusのサブスク...

AI研究

「MITの研究者が深層学習と物理学を使用して、動きによって損傷を受けたMRIスキャンを修正する」

MRI(磁気共鳴画像)スキャンは、大型磁石、電波、およびコンピュータを使用して体内の構造を明確に映し出すテストです。医療...