「VampNetと出会う:音楽合成、圧縮、補完、および変動のためのマスクされた音響トークンモデリングアプローチ」

VampNet Masked acoustic token modeling approach for music synthesis, compression, completion, and variation

最近、離散音響トークンモデリングの進展により、音声や音楽の自己回帰的な生成において重要な改善がなされています。効果的な画像生成のためには、非自己回帰的な並列反復デコーディング手法が考案されています。過去と未来のシーケンス成分の両方に依存するような補完タスクは、自己回帰的なアプローチよりも並列反復デコーディングに適しています。本研究では、音響トークンモデリングと同時反復デコーディングを音楽音声合成に利用しています。彼らの知る限り、彼らの手法はニューラルオーディオ音楽合成に並列反復デコーディングを初めて使用しています。

彼らは、VampNetと呼ばれるモデルを広範なアプリケーションに適応するために、トークンベースのプロンプティングを使用しています。彼らは意図的に隠された音楽トークンのシーケンスを使用して、VampNetの生成を指示し、それに欠落部分を埋める能力を示しています。このプロセスの結果は、高品質のオーディオ圧縮手法から、スタイル、ジャンル、ビート、楽器において元の入力音楽に密接に似ているが、いくつかの音色とリズムの微妙な変化を加えたバリエーションまでさまざまです。彼らの手法では、プロンプトをどこにでも配置することができます。これに対し、自己回帰的な音楽モデルは、プレフィックスオーディオをプロンプトとして使用し、それに続く音楽を生成することしかできません。

図1: VampNetの概要。まず、オーディオトークナイザを使用してオーディオを一連の異なるトークンに分割します。トークンはまずマスクされ、マスクされたトークンの値を予測するために、効果的な反復並列デコーディングサンプリング技術を使用するマスク生成モデルに送信されます。出力はその後、オーディオに復号化されます。

彼らは、周期的なプロンプトや圧縮、音楽に触発されたもの(ビート上のマスキングなど)など、さまざまなプロンプトデザインを調査しています。彼らは、ループやバリエーションを作成するよう指示された場合に、彼らのモデルが優れたパフォーマンスを発揮することを発見しました。そのため、VampNetと呼ばれています。彼らはコードのダウンロードを提供し、オーディオサンプルをチェックすることを強く勧めています。Descript Inc.とノースウェスタン大学の研究者たちは、マスクされた音響トークンモデリングを使用して音楽を生成するためのVampNetという手法を紹介しました。入力オーディオファイルは双方向であるため、さまざまな方法でVampNetをプロンプトすることができます。VampNetは、音楽の圧縮から製作まで、さまざまなプロンプトアプローチを通じて連続的に機能するため、音楽のバリエーションを作成するための優れたツールです。

ミュージシャンは、VampNetを使用して短いループを録音し、システムに入力すると、ループ領域が繰り返されるたびにVampNetがアイデアの音楽バリエーションを生み出すことができます。彼らはVampNetとそのプロンプトアプローチの相互作用的な音楽共創の可能性、およびマスクされた音響トークンモデリングの表現学習能力をさらに研究する予定です。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

「GiskardはHuggingFaceにGiskard Botをリリースします:HuggingFace Hubにプッシュした機械学習モデルの問題を自動的に検出するボットです」

2023年11月8日に発表された画期的な開発では、Giskard Botが機械学習(ML)モデルのゲームチェンジャーとして登場し、大規模...

機械学習

このAI論文では、ディープラーニングモデルを用いたAIS(アンドロゲン不感症)のテストに関する研究が紹介されています

AISはAndrogen Insensitivity Syndromeの略です。AISは若い世代に影響を与え、彼らの生活をさらに悪化させる脊髄脳の問題です...

機械学習

3Dボディモデルに音声が付きました:Meta AIが完全な人体に対して正確な3D空間音響を生成できる人工知能モデルを紹介

知識とコンピューテーションヴィジョン、人工知能(AI)の補完分野の進展により、人間の行動を再現し理解するインテリジェン...

機械学習

「Advanced Reasoning Benchmark(ARB)に会いましょう:大規模な言語モデルを評価するための新しいベンチマーク」

自然言語処理は近年、特に洗練された言語モデルの作成によって大きく進化しています。翻訳や推論を含むほとんどの自然言語タ...

機械学習

カスタム分類モデルでの予測の品質を向上させるには、Amazon Comprehendを使用します

この記事では、Amazon Comprehendを使用してカスタム分類モデルを構築し最適化する方法について説明しますAmazon Comprehend...

機械学習

「POCOと出会う:3D人体姿勢と形状推定のための画期的な人工知能フレームワーク」

写真や動画から3D人体のポーズと形状(HPS)を推定することは、現実世界の設定で人間のアクションを再構築するために必要です...