「VampNetと出会う:音楽合成、圧縮、補完、および変動のためのマスクされた音響トークンモデリングアプローチ」

VampNet Masked acoustic token modeling approach for music synthesis, compression, completion, and variation

最近、離散音響トークンモデリングの進展により、音声や音楽の自己回帰的な生成において重要な改善がなされています。効果的な画像生成のためには、非自己回帰的な並列反復デコーディング手法が考案されています。過去と未来のシーケンス成分の両方に依存するような補完タスクは、自己回帰的なアプローチよりも並列反復デコーディングに適しています。本研究では、音響トークンモデリングと同時反復デコーディングを音楽音声合成に利用しています。彼らの知る限り、彼らの手法はニューラルオーディオ音楽合成に並列反復デコーディングを初めて使用しています。

彼らは、VampNetと呼ばれるモデルを広範なアプリケーションに適応するために、トークンベースのプロンプティングを使用しています。彼らは意図的に隠された音楽トークンのシーケンスを使用して、VampNetの生成を指示し、それに欠落部分を埋める能力を示しています。このプロセスの結果は、高品質のオーディオ圧縮手法から、スタイル、ジャンル、ビート、楽器において元の入力音楽に密接に似ているが、いくつかの音色とリズムの微妙な変化を加えたバリエーションまでさまざまです。彼らの手法では、プロンプトをどこにでも配置することができます。これに対し、自己回帰的な音楽モデルは、プレフィックスオーディオをプロンプトとして使用し、それに続く音楽を生成することしかできません。

図1: VampNetの概要。まず、オーディオトークナイザを使用してオーディオを一連の異なるトークンに分割します。トークンはまずマスクされ、マスクされたトークンの値を予測するために、効果的な反復並列デコーディングサンプリング技術を使用するマスク生成モデルに送信されます。出力はその後、オーディオに復号化されます。

彼らは、周期的なプロンプトや圧縮、音楽に触発されたもの(ビート上のマスキングなど)など、さまざまなプロンプトデザインを調査しています。彼らは、ループやバリエーションを作成するよう指示された場合に、彼らのモデルが優れたパフォーマンスを発揮することを発見しました。そのため、VampNetと呼ばれています。彼らはコードのダウンロードを提供し、オーディオサンプルをチェックすることを強く勧めています。Descript Inc.とノースウェスタン大学の研究者たちは、マスクされた音響トークンモデリングを使用して音楽を生成するためのVampNetという手法を紹介しました。入力オーディオファイルは双方向であるため、さまざまな方法でVampNetをプロンプトすることができます。VampNetは、音楽の圧縮から製作まで、さまざまなプロンプトアプローチを通じて連続的に機能するため、音楽のバリエーションを作成するための優れたツールです。

ミュージシャンは、VampNetを使用して短いループを録音し、システムに入力すると、ループ領域が繰り返されるたびにVampNetがアイデアの音楽バリエーションを生み出すことができます。彼らはVampNetとそのプロンプトアプローチの相互作用的な音楽共創の可能性、およびマスクされた音響トークンモデリングの表現学習能力をさらに研究する予定です。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

ユニバーサルシミュレータ(UniSim)をご紹介します:生成モデリングを通じたリアルワールドの対話をインタラクティブにシミュレートするシミュレータ

生成モデルは、テキスト、画像、動画のコンテンツ作成を変革しました。次のフロンティアは、人間とエージェントのアクション...

データサイエンス

「AIと大学フットボールの未来」

大学のスポーツ界は、再びお金とフットボールのおかげで変動しましたSECが最初に動き、テキサスとオクラホマを獲得し、それに...

AIニュース

「ベビーブーマーが引退するにつれ、ドイツ企業はロボットに頼るようになる」

ドイツのベビーブーマー世代が引退し、国の労働力不足を悪化させる中、多くの企業がロボットで求人を補填しています

AIニュース

Amazon SageMakerでTritonを使用してMLモデルをホストする:ONNXモデル

ONNX(Open Neural Network Exchange)は、多くのプロバイダーによって広くサポートされている深層学習モデルを表現するため...

AIニュース

ティーンエイジャーたちはAIのリテラシーを広げることを推進する

一部のティーンエイジャーは、彼らの学校により広範なAI学習経験を提供するよう要望しています

コンピュータサイエンス

ACM(Association for Computing Machinery)は、「ハイリスクなAIには規制が必要」と述べています「まるで無法地帯だ」とも言われています

『ACMの論文では、特定の状況での生成AIの使用を制限するために新しい法律が制定されるべきであると推奨しています』