「なぜOpenAIのAPIは英語以外の言語に対してより高価なのか」

なぜOpenAIのAPIは英語以外の言語に対して高価なのか

言葉を超えて: バイトペアエンコーディングと Unicode エンコーディングが価格格差にどのように影響するか

英語ではフレーズ「Hello world」が2つのトークンを持ち、ヒンディー語では12個のトークンを持つことができるのはなぜですか？

OpenAIのAPIのコストを推定する方法について最近の記事を公開した後、中国語、日本語、韓国語（CJK文字を使用する言語）など、英語よりもOpenAI APIの価格がはるかに高いことに気づいたという興味深いコメントを受け取りました。

tiktokenライブラリを使用してOpenAIのAPIのコストを推定する方法に関する私の最近の記事に読者からのコメント

私はこの問題については知りませんでしたが、すぐにこれは活発な研究分野であることに気づきました。今年の初めに、Petrovらによる「言語モデルトークナイザーによる言語間の公平性の低下」という論文[2]が、「同じテキストを異なる言語に翻訳すると、トークン化の長さが劇的に異なることがあり、一部の場合には15倍の違いがある」と示しています。

トークン化とは、テキストをトークンのリストに分割するプロセスであり、トークンはテキスト内の一般的な文字の連続です。

トークン化の長さの違いは問題です。なぜなら、OpenAIのAPIは1,000トークンの単位で請求されるからです。したがって、同等のテキストにおいて15倍のトークンがある場合、APIのコストは15倍になります。

実験: 異なる言語でのトークン数

フレーズ「Hello world」を日本語に翻訳（こんにちは世界）し、ヒンディー語に転写（हैलो वर्ल्ड）してみましょう。OpenAIのGPTモデルで使用されるcl100k_baseトークナイザーで新しいフレーズをトークン化すると、次の結果が得られます（これらの実験に使用したコードは記事の最後にあります）。

英語、日本語、ヒンディー語でのフレーズ「Hello world」の文字数とトークン数（cl100k_base） — 英語、日本語、ヒンディー語でのフレーズ「Hello world」の文字数とトークン数（`cl100k_base`）

上記のグラフから、2つの興味深い観察ができます:

文字数は…

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Was this article helpful?

93 out of 132 found this helpful

「なぜOpenAIのAPIは英語以外の言語に対してより高価なのか」

言葉を超えて: バイトペアエンコーディングと Unicode エンコーディングが価格格差にどのように影響するか

実験: 異なる言語でのトークン数

Was this article helpful?

「HaystackパイプラインとAmazon SageMaker JumpStartを使用して、LLMsを用いたエンタープライズ検索のための本番用ジェネレーティブAIアプリケーションを構築する」

「気をつけるべき3つのサイレントなパンダのミス」

機械学習

ビッグデータの力を解放する：グラフ学習の魅力的な世界

プロンプトエンジニアリングへの紹介

OpenAIはGPT-3.5 Turboのファインチューニングによるカスタムパワーを解放します

AIの革新的なイノベーションが開発者を強化する

「創発的AIの倫理的なフロンティア：導入と重要性」

責任あるAI進歩のための政策アジェンダ：機会、責任、セキュリティ