「AUDITに会おう:潜在拡散モデルに基づく指示に従ったオーディオ編集モデル」

Let's meet AUDIT An audio editing model based on instructions following the latent diffusion model.

拡散モデルは急速に進化し、人々の生活をより簡単にしています。自然言語処理や自然言語理解からコンピュータビジョンまで、拡散モデルはほぼすべての領域で有望な結果を示しています。これらのモデルは生成型AIの最新の開発であり、複雑な分布から現実的なサンプルを生成するために使用できるディープジェネレーティブモデルの一種です。

研究者によって最近導入された新しい拡散モデルは、オーディオクリップを簡単に編集できるものです。AUDITと呼ばれるこの潜在的な拡散モデルは、指示に従って音声を編集するモデルです。音声の編集は、入力音声を変更して編集された音声を出力する作業を指し、背景音効の追加、背景音楽の置換、不完全な音声の修復、低品質音声の向上などのタスクを含みます。AUDITは、入力音声と人間の指示を受け入れ、編集された音声を生成します。

研究者は、音声編集の拡散モデルを教師ありの方法でトレーニングするためにトリプレットデータを使用しました。使用されたトリプレットデータは、指示、入力音声、および出力音声です。入力音声は直接条件入力として使用され、編集なしで音声セグメントの一貫性を確保するためです。編集の指示も直接テキストガイダンスとして使用され、モデルをより柔軟かつ現実のシナリオに適したものにします。

AUDITの背後にいる研究チームは、以下のように自分たちの貢献をまとめています。

  1. AUDITは、人間のテキスト指示を条件として使用する音声編集のために拡散モデルがトレーニングされた最初の開発です。
  2. AUDITを教師ありの方法でトレーニングするためにデータ構築フレームワークが設計されました。
  3. AUDITは、編集が不要な音声セグメントを最大限に保存する能力を持っています。
  4. AUDITは、詳細な編集対象の説明を必要とせずに、単純な指示としてのテキストガイダンスでうまく機能します。
  5. AUDITは、多くの音声編集タスクにおいて客観的および主観的なメトリックで注目すべき結果を達成しました。

研究チームは、AUDITが優れた性能を発揮し、正確に音声を編集したいくつかの例を共有しています。これには、オーディオに車のクラクションの音を追加する、笑い声をトランペットの音に置き換える、話す女性の音声を口笛を吹いている人の音声から削除するなどが含まれます。AUDITは音声編集タスクで非常に優れたパフォーマンスを発揮し、以下のタスクにおいて客観的および主観的なメトリックで素晴らしい結果を示しました。

  • オーディオクリップに音を追加する。
  • オーディオクリップから音を削除する。
  • 入力音声の音イベントを別の音に置き換える。
  • オーディオインペインティング:文脈または提供されたテキストプロンプトに基づいて、マスクされた音声セグメントを補完する。
  • スーパーレゾリューションタスク:低サンプリング入力音声を高サンプリング出力音声に変換する。

結論として、AUDITは、人間の指示に従って柔軟で効果的な音声編集を簡素化する将来有望な手法のようです。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

データサイエンス

「限られた訓練データで機械学習モデルは信頼性のある結果を生み出すのか?ケンブリッジ大学とコーネル大学の新しいAI研究がそれを見つけました...」

ディープラーニングは、音声認識から自律システム、コンピュータビジョン、自然言語処理まで、人工知能の中で強力で画期的な...

AI研究

「次世代ニューラルネットワーク:NeurIPSでの多くのAIの技術進歩をNVIDIA Researchが発表」

世界中の学術機関と協力して、NVIDIAの研究者は< a href=”https://www.voagi.com/ai-for-sustainable-banking-reduc...

機械学習

RAGのNLPにおける検索と生成の統一的な革新的アプローチ

イントロダクション AIの急速に進化する領域に、ゲームチェンジングなイノベーションが登場し、機械が人間の言語と関わる方法...

機械学習

「Mozilla Common Voiceにおける音声言語認識 — 音声変換」

これは、Mozilla Common Voiceデータセットに基づく話し言葉認識に関する3番目の記事です第1部では、データの選択とデータの...

機械学習

「Gradio-liteと出会う:Pyodideを使用してブラウザでインタラクティブな機械学習ベースのライブラリ(Gradio)を向上させるJavaScriptライブラリ」

Gradioは、機械学習モデルのユーザーインターフェースの作成を簡略化するオープンソースのPythonライブラリです。開発者やデ...

人工知能

「Cassandra To-Doリスト ChatGPTプラグインの構築」

「Cassandraのステップバイステップガイド:ChatGPTプラグインを実装して、自分のやるべきことリストを管理するための仮想パ...