「あなたのLLMパイプラインは目標を達成していますか?」

「LLMパイプラインは目標を達成していますか?」

LLMパイプラインで評価するのに最も重要な要素とその測定方法を探索します。

AI Photo by Piret Ilver on Unsplash

LLMパイプラインを効果的に実装するために必要な鍵となる要素の1つは、パイプラインの効果を評価する方法です。つまり、LLM自体やプロンプトだけでなく、LLMとプロンプト、および温度や最小および最大トークンなどの設定の相互作用の結果である最終出力を評価する必要があります。

GPT APIにアクセスするための定型コードを考えてみましょう(自動生成):

import os
import openai

openai.api_key = os.getenv("OPENAI_API_KEY")
response = openai.ChatCompletion.create(
  model="gpt-3.5-turbo",
  messages=[],
  temperature=1,
  max_tokens=256,
  top_p=1,
  frequency_penalty=0,
  presence_penalty=0)

この ‘response’ を作成する関数には7つの引数があり、それぞれが最終出力を変更します。これらの引数の異なる値によって生成される出力を評価し、最適な組み合わせを選択することができる能力は、重要です。

これは、論文やLLMメーカーのウェブサイトで最も一般的に見つかるLLMの評価とは異なる問題です。これらの情報源で宣伝されているようなバー試験などに合格できるLLMを使用しているかもしれませんが、作成したプロンプトと選択した設定によって、必要な形式で法的文書の集合を要約することができるとは限りません。

特に、外部ユーザー向けのパイプラインを構築している場合、プロンプトを即座に調整することはできません。たとえば、カタログの特定のアイテムの説明を生成するために、LLM APIを使用してLLMソリューションを埋め込みたい場合を考えてみましょう。適合性を考慮するためには、2つのレベルがあります:

第一に、生成される回答は目的に適していますか?

第二に、将来のイテレーションでも回答が適していることに依存できますか?

ある意味では、第一のレベルは1つまたは複数の回答を単体で見て評価することで評価できます。適切と判断されれば、問題ありません。ただし、長期的な信頼性を評価するには…

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

もし芸術が私たちの人間性を表現する方法であるなら、人工知能はどこに適合するのでしょうか?

MITのポストドクターであるジヴ・エプスタイン氏(SM '19、PhD '23)は、芸術やその他のメディアを作成するために生成的AIを...

人工知能

「コマンドバーの創設者兼CEO、ジェームズ・エバンスによるインタビューシリーズ」

ジェームズ・エバンズは、CommandBarの創設者兼CEOであり、製品、マーケティング、顧客チームを支援するために設計されたAIパ...

人工知能

「15Rockの共同創業者兼CEO、ガウタム・バクシ氏によるインタビューシリーズ」

「ガウタム・バクシは、気候リスク管理とアドバイザリーサービスのグローバルリーダーである15Rockの共同創設者兼CEOですガウ...

人工知能

「トリントの創設者兼CEO、ジェフ・コフマンへのインタビューシリーズ」

ジェフ・コーフマンは、ABC、CBS、CBCニュースで30年のキャリアを持った後、Trintの創設者兼CEOとなりましたジェフは手作業の...

人工知能

「マーシャンの共同創設者であるイータン・ギンスバーグについてのインタビューシリーズ」

エタン・ギンズバーグは、マーシャンの共同創業者であり、すべてのプロンプトを最適なLLMに動的にルーティングするプラットフ...

人工知能

キャルレールの最高製品責任者、ライアン・ジョンソンへのインタビューシリーズ

ライアンは、初期のスタートアップからフォーチュン100の組織まで、多様なテクノロジーと製品開発のリーダーシップ経験を15年...