「VampNetと出会う:音楽合成、圧縮、補完、および変動のためのマスクされた音響トークンモデリングアプローチ」

VampNet Masked acoustic token modeling approach for music synthesis, compression, completion, and variation

最近、離散音響トークンモデリングの進展により、音声や音楽の自己回帰的な生成において重要な改善がなされています。効果的な画像生成のためには、非自己回帰的な並列反復デコーディング手法が考案されています。過去と未来のシーケンス成分の両方に依存するような補完タスクは、自己回帰的なアプローチよりも並列反復デコーディングに適しています。本研究では、音響トークンモデリングと同時反復デコーディングを音楽音声合成に利用しています。彼らの知る限り、彼らの手法はニューラルオーディオ音楽合成に並列反復デコーディングを初めて使用しています。

彼らは、VampNetと呼ばれるモデルを広範なアプリケーションに適応するために、トークンベースのプロンプティングを使用しています。彼らは意図的に隠された音楽トークンのシーケンスを使用して、VampNetの生成を指示し、それに欠落部分を埋める能力を示しています。このプロセスの結果は、高品質のオーディオ圧縮手法から、スタイル、ジャンル、ビート、楽器において元の入力音楽に密接に似ているが、いくつかの音色とリズムの微妙な変化を加えたバリエーションまでさまざまです。彼らの手法では、プロンプトをどこにでも配置することができます。これに対し、自己回帰的な音楽モデルは、プレフィックスオーディオをプロンプトとして使用し、それに続く音楽を生成することしかできません。

図1: VampNetの概要。まず、オーディオトークナイザを使用してオーディオを一連の異なるトークンに分割します。トークンはまずマスクされ、マスクされたトークンの値を予測するために、効果的な反復並列デコーディングサンプリング技術を使用するマスク生成モデルに送信されます。出力はその後、オーディオに復号化されます。

彼らは、周期的なプロンプトや圧縮、音楽に触発されたもの(ビート上のマスキングなど)など、さまざまなプロンプトデザインを調査しています。彼らは、ループやバリエーションを作成するよう指示された場合に、彼らのモデルが優れたパフォーマンスを発揮することを発見しました。そのため、VampNetと呼ばれています。彼らはコードのダウンロードを提供し、オーディオサンプルをチェックすることを強く勧めています。Descript Inc.とノースウェスタン大学の研究者たちは、マスクされた音響トークンモデリングを使用して音楽を生成するためのVampNetという手法を紹介しました。入力オーディオファイルは双方向であるため、さまざまな方法でVampNetをプロンプトすることができます。VampNetは、音楽の圧縮から製作まで、さまざまなプロンプトアプローチを通じて連続的に機能するため、音楽のバリエーションを作成するための優れたツールです。

ミュージシャンは、VampNetを使用して短いループを録音し、システムに入力すると、ループ領域が繰り返されるたびにVampNetがアイデアの音楽バリエーションを生み出すことができます。彼らはVampNetとそのプロンプトアプローチの相互作用的な音楽共創の可能性、およびマスクされた音響トークンモデリングの表現学習能力をさらに研究する予定です。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

データサイエンス

‘LLMがデータアナリストを置き換えることはできるのか? LLMを活用したアナリストの構築’

私たちの中の誰もが、昨年の少なくとも1度は、ChatGPTがあなたの役割を置き換えることができるか(いや、むしろいつか)と考...

機械学習

「AIと産業のデジタル化の時代に、開かれたUSDに開発者が注目」 Note OpenUSD refers to an open-source software library called USD (Universal Scene Description), which is commonly used in computer graphics and animation.

スマートファクトリーから次世代の鉄道システムまで、世界中の開発者と企業は、あらゆるスケールで産業のデジタル化の機会を...

AI研究

「浙江大学の研究者がUrbanGIRAFFEを提案し、難しい都市のシーンに対する制御可能な3D認識画像の生成に取り組む」

“` UrbanGIRAFFEは、浙江大学の研究者が提案した写真のようなイメージ合成の手法であり、操作可能なカメラの位置とシー...

データサイエンス

ジェネラティブAIを通じた感情分析のマスタリング

イントロダクション センチメント分析は、企業が顧客のフィードバックを理解し対応する方法を革新しました。顧客のセンチメン...

AIニュース

「キナラがAra-2プロセッサを発表:パフォーマンス向上のためのオンデバイスAI処理を革命化」

Kinaraは、エネルギー効率の高いエッジAIのパイオニアであるAra-2プロセッサを発表しました。それは、前任者と比べて8倍の高...

機械学習

焼け落ちた炎:スタートアップが生成AI、コンピュータビジョンを融合して山火事と戦う

カリフォルニアの大規模な山火事によって空がオレンジ色に変わったとき、あるスタートアップはコンピュータビジョンと生成AI...