「WebAgentに会いましょう:DeepMindの新しいLLM、ウェブサイト上での指示に従ってタスクを完了する」

Meet WebAgent DeepMind's new LLM that completes tasks following instructions on websites.

モデルは言語理解とウェブナビゲーションを組み合わせています。

Midjourneyを使用して作成

最近、AIに焦点を当てた教育ニュースレターを始めました。既に16万人以上の購読者がいます。TheSequenceは、5分で読むことができる、ハイプやニュースなどのない、機械学習に特化したニュースレターです。目標は、機械学習プロジェクト、研究論文、概念について最新情報を提供することです。以下のリンクから購読して試してみてください:

TheSequence | Jesus Rodriguez | Substack

機械学習、人工知能、データの最新情報を得るための最良のソース…

thesequence.substack.com

大規模言語モデル(LLM)とウェブサイトの統合は、LLMを利用した新たなアプリケーションの波を開く可能性のある分野の一つです。LLMは、基本的な算術や論理的な推論から、常識的な理解、質問応答、さらには対話型の意思決定など、さまざまな自然言語タスクで優れた能力を示しています。これらの能力をウェブナビゲーションと組み合わせることで、非常に強力な組み合わせが実現されます。最近、Google DeepMindはWeb Agentという、ユーザーの指示に基づいて実際のウェブサイトをナビゲートするLLM駆動の自律エージェントを発表しました。

ウェブナビゲーションの実装は、以下のような一意な課題を提起しています:

(1)事前に定義されたアクションスペースの不在。

(2)シミュレータと比較してはるかに長いHTML観察の存在。

(3)LLM内でのHTMLに関するドメイン固有の知識の不足。

これらのハードルは、現実のウェブサイトの無制限な性質と指示の複雑さによって引き起こされるものであり、事前に適切なアクションスペースを定義することが困難です。一部の研究では、教示の微調整や人間からのフィードバックによる強化学習などがHTMLの理解とナビゲーションの精度を向上させる可能性を示していますが、LLMの設計は常にHTMLドキュメントの効果的な処理に最適化されているわけではありませんでした。具体的には、ほとんどのLLMは比較的短いコンテキスト長しか持っておらず、実際のウェブサイトにある平均トークン長を処理するのに十分ではなく、構造化ドキュメントの処理に必要な重要な技術を採用していない場合があります。

画像クレジット: DeepMind

WebAgentの登場

WebAgentは、各ステップごとにサブ指示を計画し、これらのサブ指示に基づいて長いHTMLページを関連するスニペットに要約し、サブ指示とHTMLスニペットを実行可能なPythonコードに基づいて接地します。Google DeepMindは、WebAgentを構築するために2つのLLM、「Flan-U-PaLM」(接地コード生成)と「HTML-T5」(タスク計画と条件付きHTML要約を担当する新たに導入されたドメインエキスパートの事前トレーニング言語モデル)を組み合わせています。エンコーダーデコーダーアーキテクチャで設計されたHTML-T5は、ローカルおよびグローバルなアテンションメカニズムを利用して、長いHTMLページの構造をキャプチャすることに優れており、CommonCrawlから合成された広範なHTMLデータコーパスでセルフサプリービスの事前トレーニングを行っています。

既存のLLM駆動エージェントは通常、単一のLLMで決定タスクを処理し、役割ごとに異なる例をプロンプトとして使用します。しかし、より複雑な現実世界のタスクに対しては、このアプローチでは不十分です。Google DeepMindの包括的な評価によると、WebAgentの組み合わせ手法は、プラグイン言語モデルを統合することで、HTMLの理解と接地を大幅に改善し、より良い汎化を実現しています。WebAgentは、実世界のウェブナビゲーションの成功率が50%以上向上し、詳細な分析によってタスク計画とHTML要約を専門の言語モデルを使用して結びつけることが成功したタスク実行における重要な役割を明らかにしています。さらに、WebAgentは静的なウェブサイト理解のタスクでも優れたパフォーマンスを発揮し、QAの精度で単一のLLMを上回り、強力なベースラインに対して競争力を持っています。

Google DeepMindのWebAgentは、HTML-T5とFlan-U-PaLMという2つの異なる言語モデルの革新的な組み合わせであり、ウェブナビゲーションとHTMLドキュメントの処理を可能にする効率的なウェブオートメーションタスクです。

画像クレジット: DeepMind

HTML-T5は、次のステップのプログラムのサブ命令を予測し、長いHTMLドキュメントの要約を条件付きで行うために重要な役割を果たす、ドメインエキスパートエンコーダーデコーダーモデルです。この特殊なモデルは、T5、Flan-T5、Instruct-GPTなどの言語モデルの一般的な機能(強力なHTML理解を持つウェブナビゲーション能力)と、Guoらによって提案されたような、HTML固有の帰納バイアスを備えたプライオントランスフォーマーモデルとのバランスを取ります。HTML-T5は、エンコーダーでローカルとグローバルの注意機構を活用して、HTML入力の階層構造を効果的に処理します。ローカルの注意は、HTMLの各要素(例:、

93 out of 132 found this helpful

Discover more

データサイエンス

ビッグデータの力を解放する:グラフ学習の魅力的な世界

大企業は膨大な量のデータを生成し蓄積しています例えば、このデータの90%は最近の数年間に作成されたものですしかし、このう...

データサイエンス

テキストと画像の検索を行うNodeJS AIアプリを構築する

チュートリアル:stargate-mongooseとJSON APIを使用して、DataStax Astra DB(およびベクトル検索)をサポートするNodeJSア...

人工知能

簡単なアプリの統合に最適な安定した拡散APIのトップ5

イントロダクション APIは人工知能の時代における解決策であり、AIモデルをソフトウェアやアプリケーションに統合する際の高...

機械学習

このAI論文は、柔軟なタスクシステムと手順的生成による強化学習を革新するNeural MMO 2.0を紹介しています

MIT、CarperAI、Parametrix.AIの研究者らは、Neural MMO 2.0を導入しました。これは、多様な目的と報酬信号を定義できる柔軟...

AI研究

「INDIAaiとMetaが連携:AIイノベーションと共同作業の道を開く」

有望な展開として、INDIAaiとMetaが人工知能(AI)と新興技術の領域で強力な協力関係を築いています。両組織は覚書(MoU)に...

人工知能

チャットGPT vs Gemini:AIアリーナでのタイタン同士の激突

はじめに 人工知能の世界では、GoogleのGemini AIとOpenAIのChatGPTの2つの巨人の間で魅惑的な一戦が繰り広げられています。C...