「WebAgentに会いましょう:DeepMindの新しいLLM、ウェブサイト上での指示に従ってタスクを完了する」

Meet WebAgent DeepMind's new LLM that completes tasks following instructions on websites.

モデルは言語理解とウェブナビゲーションを組み合わせています。

Midjourneyを使用して作成

最近、AIに焦点を当てた教育ニュースレターを始めました。既に16万人以上の購読者がいます。TheSequenceは、5分で読むことができる、ハイプやニュースなどのない、機械学習に特化したニュースレターです。目標は、機械学習プロジェクト、研究論文、概念について最新情報を提供することです。以下のリンクから購読して試してみてください:

TheSequence | Jesus Rodriguez | Substack

機械学習、人工知能、データの最新情報を得るための最良のソース…

thesequence.substack.com

大規模言語モデル(LLM)とウェブサイトの統合は、LLMを利用した新たなアプリケーションの波を開く可能性のある分野の一つです。LLMは、基本的な算術や論理的な推論から、常識的な理解、質問応答、さらには対話型の意思決定など、さまざまな自然言語タスクで優れた能力を示しています。これらの能力をウェブナビゲーションと組み合わせることで、非常に強力な組み合わせが実現されます。最近、Google DeepMindはWeb Agentという、ユーザーの指示に基づいて実際のウェブサイトをナビゲートするLLM駆動の自律エージェントを発表しました。

ウェブナビゲーションの実装は、以下のような一意な課題を提起しています:

(1)事前に定義されたアクションスペースの不在。

(2)シミュレータと比較してはるかに長いHTML観察の存在。

(3)LLM内でのHTMLに関するドメイン固有の知識の不足。

これらのハードルは、現実のウェブサイトの無制限な性質と指示の複雑さによって引き起こされるものであり、事前に適切なアクションスペースを定義することが困難です。一部の研究では、教示の微調整や人間からのフィードバックによる強化学習などがHTMLの理解とナビゲーションの精度を向上させる可能性を示していますが、LLMの設計は常にHTMLドキュメントの効果的な処理に最適化されているわけではありませんでした。具体的には、ほとんどのLLMは比較的短いコンテキスト長しか持っておらず、実際のウェブサイトにある平均トークン長を処理するのに十分ではなく、構造化ドキュメントの処理に必要な重要な技術を採用していない場合があります。

画像クレジット: DeepMind

WebAgentの登場

WebAgentは、各ステップごとにサブ指示を計画し、これらのサブ指示に基づいて長いHTMLページを関連するスニペットに要約し、サブ指示とHTMLスニペットを実行可能なPythonコードに基づいて接地します。Google DeepMindは、WebAgentを構築するために2つのLLM、「Flan-U-PaLM」(接地コード生成)と「HTML-T5」(タスク計画と条件付きHTML要約を担当する新たに導入されたドメインエキスパートの事前トレーニング言語モデル)を組み合わせています。エンコーダーデコーダーアーキテクチャで設計されたHTML-T5は、ローカルおよびグローバルなアテンションメカニズムを利用して、長いHTMLページの構造をキャプチャすることに優れており、CommonCrawlから合成された広範なHTMLデータコーパスでセルフサプリービスの事前トレーニングを行っています。

既存のLLM駆動エージェントは通常、単一のLLMで決定タスクを処理し、役割ごとに異なる例をプロンプトとして使用します。しかし、より複雑な現実世界のタスクに対しては、このアプローチでは不十分です。Google DeepMindの包括的な評価によると、WebAgentの組み合わせ手法は、プラグイン言語モデルを統合することで、HTMLの理解と接地を大幅に改善し、より良い汎化を実現しています。WebAgentは、実世界のウェブナビゲーションの成功率が50%以上向上し、詳細な分析によってタスク計画とHTML要約を専門の言語モデルを使用して結びつけることが成功したタスク実行における重要な役割を明らかにしています。さらに、WebAgentは静的なウェブサイト理解のタスクでも優れたパフォーマンスを発揮し、QAの精度で単一のLLMを上回り、強力なベースラインに対して競争力を持っています。

Google DeepMindのWebAgentは、HTML-T5とFlan-U-PaLMという2つの異なる言語モデルの革新的な組み合わせであり、ウェブナビゲーションとHTMLドキュメントの処理を可能にする効率的なウェブオートメーションタスクです。

画像クレジット: DeepMind

HTML-T5は、次のステップのプログラムのサブ命令を予測し、長いHTMLドキュメントの要約を条件付きで行うために重要な役割を果たす、ドメインエキスパートエンコーダーデコーダーモデルです。この特殊なモデルは、T5、Flan-T5、Instruct-GPTなどの言語モデルの一般的な機能(強力なHTML理解を持つウェブナビゲーション能力)と、Guoらによって提案されたような、HTML固有の帰納バイアスを備えたプライオントランスフォーマーモデルとのバランスを取ります。HTML-T5は、エンコーダーでローカルとグローバルの注意機構を活用して、HTML入力の階層構造を効果的に処理します。ローカルの注意は、HTMLの各要素(例:、

93 out of 132 found this helpful

Discover more

機械学習

『トランスフォーマーの位置符号化の解説』

元のトランスフォーマーアーキテクチャでは、位置エンコーディングが入力と出力の埋め込みに追加されました位置エンコーディ...

データサイエンス

デット (物体検出用トランスフォーマー)

注意:この記事は、コンピュータビジョンの複雑な世界について探求し、特にトランスフォーマーとアテンションメカニズムに焦...

AIニュース

ChatGPTでお金を稼ぐ5つの方法

もしChatGPTでお金を稼げるとは信じていないなら、この記事の終わりまでには信じるようになるでしょう

機械学習

『Generative AIがサイバーセキュリティを強化する3つの方法』

人間のアナリストは、サイバーセキュリティ攻撃の速度と複雑さに対して効果的に防御することができなくなっています。データ...

機械学習

高性能意思決定のためのRLHF:戦略と最適化

はじめに 人間の要因/フィードバックからの強化学習(RLHF)は、RLの原則と人間のフィードバックを組み合わせた新興の分野で...

機械学習

「これらの完全自動の深層学習モデルは、スマートフォンの統合を使用して、猫の苦痛指標スケール(FGS)を使用した痛み予測に使用できます」

人工知能(AI)の能力は、医療、金融、教育など、あらゆる業界に広がっています。医学や獣医学の分野では、適切な治療を施す...