「AUDITに会おう:潜在拡散モデルに基づく指示に従ったオーディオ編集モデル」

Let's meet AUDIT An audio editing model based on instructions following the latent diffusion model.

拡散モデルは急速に進化し、人々の生活をより簡単にしています。自然言語処理や自然言語理解からコンピュータビジョンまで、拡散モデルはほぼすべての領域で有望な結果を示しています。これらのモデルは生成型AIの最新の開発であり、複雑な分布から現実的なサンプルを生成するために使用できるディープジェネレーティブモデルの一種です。

研究者によって最近導入された新しい拡散モデルは、オーディオクリップを簡単に編集できるものです。AUDITと呼ばれるこの潜在的な拡散モデルは、指示に従って音声を編集するモデルです。音声の編集は、入力音声を変更して編集された音声を出力する作業を指し、背景音効の追加、背景音楽の置換、不完全な音声の修復、低品質音声の向上などのタスクを含みます。AUDITは、入力音声と人間の指示を受け入れ、編集された音声を生成します。

研究者は、音声編集の拡散モデルを教師ありの方法でトレーニングするためにトリプレットデータを使用しました。使用されたトリプレットデータは、指示、入力音声、および出力音声です。入力音声は直接条件入力として使用され、編集なしで音声セグメントの一貫性を確保するためです。編集の指示も直接テキストガイダンスとして使用され、モデルをより柔軟かつ現実のシナリオに適したものにします。

AUDITの背後にいる研究チームは、以下のように自分たちの貢献をまとめています。

  1. AUDITは、人間のテキスト指示を条件として使用する音声編集のために拡散モデルがトレーニングされた最初の開発です。
  2. AUDITを教師ありの方法でトレーニングするためにデータ構築フレームワークが設計されました。
  3. AUDITは、編集が不要な音声セグメントを最大限に保存する能力を持っています。
  4. AUDITは、詳細な編集対象の説明を必要とせずに、単純な指示としてのテキストガイダンスでうまく機能します。
  5. AUDITは、多くの音声編集タスクにおいて客観的および主観的なメトリックで注目すべき結果を達成しました。

研究チームは、AUDITが優れた性能を発揮し、正確に音声を編集したいくつかの例を共有しています。これには、オーディオに車のクラクションの音を追加する、笑い声をトランペットの音に置き換える、話す女性の音声を口笛を吹いている人の音声から削除するなどが含まれます。AUDITは音声編集タスクで非常に優れたパフォーマンスを発揮し、以下のタスクにおいて客観的および主観的なメトリックで素晴らしい結果を示しました。

  • オーディオクリップに音を追加する。
  • オーディオクリップから音を削除する。
  • 入力音声の音イベントを別の音に置き換える。
  • オーディオインペインティング:文脈または提供されたテキストプロンプトに基づいて、マスクされた音声セグメントを補完する。
  • スーパーレゾリューションタスク:低サンプリング入力音声を高サンプリング出力音声に変換する。

結論として、AUDITは、人間の指示に従って柔軟で効果的な音声編集を簡素化する将来有望な手法のようです。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

「DARPAがハッカーを起用し、サイバー脅威から重要なソフトウェアを強化する」

競争は、トップのAIおよびサイバーセキュリティの才能に対して、ソフトウェアの脆弱性を自動的に見つけて修正し、重要なイン...

人工知能

「Unblock Your Software Engineers With Unblocked(アンブロックドでソフトウェアエンジニアを活用しましょう)」

「AIは、私たちのフィールドでますます重要な役割を果たしており、私たち開発者の生産性を大きく向上させる能力を持っていま...

機械学習

BYOL(Bootstrap Your Own Latent)— コントラスティブな自己教示学習の代替手段

『今日の論文分析では、BYOL(Bootstrap Your Own Latent)の背後にある論文に詳しく触れますこれは、対比的な自己教師あり学...

機械学習

2023年にディープラーニングのためのマルチGPUシステムを構築する方法

「これは、予算内でディープラーニングのためのマルチGPUシステムを構築する方法についてのガイドです特に、コンピュータビジ...

AIニュース

INVE 対話型AIマジックでビデオ編集を革新する

画像編集なしの世界を想像できますか?面白いミーム、息をのむような風景、魅力的なインスタグラムの写真はどこに魅力を失い...