「あなたのLLMパイプラインは目標を達成していますか?」

「LLMパイプラインは目標を達成していますか?」

LLMパイプラインで評価するのに最も重要な要素とその測定方法を探索します。

AI Photo by Piret Ilver on Unsplash

LLMパイプラインを効果的に実装するために必要な鍵となる要素の1つは、パイプラインの効果を評価する方法です。つまり、LLM自体やプロンプトだけでなく、LLMとプロンプト、および温度や最小および最大トークンなどの設定の相互作用の結果である最終出力を評価する必要があります。

GPT APIにアクセスするための定型コードを考えてみましょう(自動生成):

import os
import openai

openai.api_key = os.getenv("OPENAI_API_KEY")
response = openai.ChatCompletion.create(
  model="gpt-3.5-turbo",
  messages=[],
  temperature=1,
  max_tokens=256,
  top_p=1,
  frequency_penalty=0,
  presence_penalty=0)

この ‘response’ を作成する関数には7つの引数があり、それぞれが最終出力を変更します。これらの引数の異なる値によって生成される出力を評価し、最適な組み合わせを選択することができる能力は、重要です。

これは、論文やLLMメーカーのウェブサイトで最も一般的に見つかるLLMの評価とは異なる問題です。これらの情報源で宣伝されているようなバー試験などに合格できるLLMを使用しているかもしれませんが、作成したプロンプトと選択した設定によって、必要な形式で法的文書の集合を要約することができるとは限りません。

特に、外部ユーザー向けのパイプラインを構築している場合、プロンプトを即座に調整することはできません。たとえば、カタログの特定のアイテムの説明を生成するために、LLM APIを使用してLLMソリューションを埋め込みたい場合を考えてみましょう。適合性を考慮するためには、2つのレベルがあります:

第一に、生成される回答は目的に適していますか?

第二に、将来のイテレーションでも回答が適していることに依存できますか?

ある意味では、第一のレベルは1つまたは複数の回答を単体で見て評価することで評価できます。適切と判断されれば、問題ありません。ただし、長期的な信頼性を評価するには…

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

「リオール・ハキム、Hour Oneの共同創設者兼CTO - インタビューシリーズ」

「Hour Oneの共同創設者兼最高技術責任者であるリオール・ハキムは、専門的なビデオコミュニケーションのためのバーチャルヒ...

人工知能

「マーシャンの共同創設者であるイータン・ギンスバーグについてのインタビューシリーズ」

エタン・ギンズバーグは、マーシャンの共同創業者であり、すべてのプロンプトを最適なLLMに動的にルーティングするプラットフ...

人工知能

キャルレールの最高製品責任者、ライアン・ジョンソンへのインタビューシリーズ

ライアンは、初期のスタートアップからフォーチュン100の組織まで、多様なテクノロジーと製品開発のリーダーシップ経験を15年...

データサイエンス

「Seerの最高データオフィサーであるDr. Serafim Batzoglouによるインタビューシリーズ」

セラフィム・バツォグルはSeerのチーフデータオフィサーですSeerに加わる前は、セラフィムはInsitroのチーフデータオフィサー...

人工知能

「UVeyeの共同設立者兼CEO、アミール・ヘヴェルについてのインタビューシリーズ」

アミール・ヘヴァーは、UVeyeのCEO兼共同創設者であり、高速かつ正確な異常検出により、自動車およびセキュリティ産業に直面...

データサイエンス

2023年にAmazonのデータサイエンティストになる方法は?

ほとんどのビジネスは現在、膨大な量のデータを生成し、編集し、管理しています。しかし、ほとんどのビジネスは、収集したデ...