Webスケールトレーニング解放:DeepMindがOWLv2とOWL-STを紹介、未知語彙物体検出の革新的ツール、前例のない自己学習技術によって駆動されます
DeepMindがOWLv2とOWL-STを紹介していますこれらは未知語彙物体検出の革新的なツールであり、前例のない自己学習技術によって駆動されています
オープンボキャブラリーの物体検出は、さまざまな実世界のコンピュータビジョンタスクにおいて重要な要素です。ただし、検出トレーニングデータの入手の制約と、事前学習モデルの脆弱性により、性能が劣り、スケーラビリティの問題が生じることが多いです。
この課題に対処するため、DeepMindの研究チームは最新の論文「Scaling Open-Vocabulary Object Detection」で、最適化されたアーキテクチャであるOWLv2モデルを紹介しています。このモデルはトレーニング効率を改善し、OWL-STセルフトレーニングの手法を組み込んで検出性能を大幅に向上させ、オープンボキャブラリー検出タスクでの最先端の結果を達成します。
この研究の主な目的は、ラベルスペース、注釈フィルタリング、およびオープンボキャブラリー検出セルフトレーニング手法のトレーニング効率を最適化し、限られたラベル付きデータで堅牢でスケーラブルなオープンボキャブラリー性能を実現することです。
- 製造品の品質におけるコンピュータビジョンの欠陥検出を、Amazon SageMaker Canvasを使用したノーコード機械学習で民主化する
- エンタープライズAIとは何ですか?
- DORSalとは 3Dシーンの生成とオブジェクトレベルの編集のための3D構造拡散モデル
提案されたセルフトレーニング手法は、次の3つの主要なステップで構成されています:
- チームは既存のオープンボキャブラリー検出器を使用して、WebLIという大規模なウェブ画像テキストペアのデータセットでオープンボックス検出を行います。
- 彼らはOWL-ViT CLIP-L/14を使用して、すべてのWebLI画像に境界ボックスの疑似注釈を付けます。
- 彼らは、人間による注釈付けされた検出データを使用してトレーニングモデルを微調整し、パフォーマンスをさらに向上させます。
特筆すべきは、研究者がより効果的な検出器を訓練するために、OWL-ViTアーキテクチャのバリアントを使用していることです。このアーキテクチャは、コントラストトレーニングされた画像テキストモデルを利用して画像とテキストのエンコーダを初期化し、検出ヘッドはランダムに初期化されます。
トレーニングの段階では、チームは同じ損失関数を使用し、OWL-ViTアーキテクチャから「疑似ネガティブ」をクエリに追加して、利用可能なラベル付き画像の利用を最大化するためにトレーニング効率を最適化します。
さらに、大規模Transformerトレーニングのために以前に提案された手法を組み込んで、トレーニング効率をさらに向上させます。その結果、OWLv2モデルは、元のOWL-ViTモデルに比べてトレーニングFLOPSを約50%削減し、トレーニングスループットを2倍に加速します。
チームは実証的な研究で、提案手法を以前の最先端のオープンボキャブラリー検出器と比較しています。OWL-ST技術により、LVISの稀なクラスの平均精度(AP)が31.2%から44.6%に向上します。さらに、OWL-STレシピをOWLv2アーキテクチャと組み合わせることで、新たな最先端のパフォーマンスが実現されます。
全体的に、本論文で提案されたOWL-STレシピは、大規模なウェブデータからの弱教師付き学習を活用して検出性能を大幅に向上させ、オープンワールドの位置特定におけるウェブスケールのトレーニングを実現します。この手法は、ラベル付き検出データの希少性による制約に対処し、堅牢なオープンボキャブラリー物体検出のスケーラブルな手法の可能性を示しています。
We will continue to update VoAGI; if you have any questions or suggestions, please contact us!
Was this article helpful?
93 out of 132 found this helpful
Related articles
- Hugging FaceとGradioを使用して、5分でAIチャットボットを構築する
- LOMO(LOw-Memory Optimization)をご紹介します:メモリ使用量を削減するために、勾配計算とパラメータの更新を1つのステップで融合する新しいAIオプティマイザです
- デバイス上での条件付きテキストから画像生成のための拡散プラグイン
- 複雑なタスクの実行におけるロボットの強化:Meta AIが人間の行動のインターネット動画を使用して視覚的な手がかりモデルを開発する
- Google DeepMindは、ChatGPTを超えるアルゴリズムの開発に取り組んでいます
- QLoRAを使用して、Amazon SageMaker StudioノートブックでFalcon-40Bと他のLLMsをインタラクティブにチューニングしてください
- 安定した拡散:生成AIの基本的な直感