人間と同じように聞くAIモデル「SALMONN」

『人間のように聞くAIモデル「SALMONN」』

人間のような感覚に向けた道のりは続きます

人々は、世界で正しく機能するための聴覚の重要性をしばしば過小評価しています。そしてさらに重要なことは、学習の必須ツールとしての聴覚です。

有名なヘレン・ケラーはかつて言った、「盲目は私たちを物事から隔てますが、聾は人々から隔てます」という言葉があります。そして、この女性は盲目でありながら聾であったことを忘れてはいけません。

したがって、AIが求められる優れた「存在」となるためには、聴覚を不可欠な要件と見なすのは当然のことです。

残念ながら、現在のAIシステムは聴覚には苦手です。

はい、OpenAIのWhisperモデルを活用する新しいChatGPTバージョンは、音声を非常にうまく理解するし、他のモデルはオーディオイベントを非常に効率的にキャプチャします。

しかし、聴覚はそれだけではありません。私たちは受け取ったさまざまな音声信号を組み合わせ、それらを周囲で起こっていることの文脈として適用する必要があります。

この特徴が私たち人間を形作っており、私たちは音声を理解し、ランダムなノイズをエンコードし、音楽を楽しむことによって、「一般的な聴覚」をAIが人間から模倣できない最後の特徴の一つにしました。

そして今、TikTokの企業ByteDanceが作成した新しいモデルがこのビジョンに挑戦しています。

SALMONNは、一般的な聴覚のための初のマルチモーダルオーディオ-言語AIシステムであり、音声、オーディオイベント、音楽という3つの主な音響タイプからランダムな音声信号を処理できるモデルです。

さらに、後ほど見るように、オーディオストーリーテリングオーディオ音声の協同推論など、真にユニークでかつ前例のない能力を披露しています。

そして今日、私たちはその働き方を理解します。

この記事は、私の無料週刊ニュースレターTheTechOasisで数日前に初出されました。

AIの忙しい世界に常に最新情報になりながら、行動を起こすためのインスピレーションを感じたり、少なくとも将来に備えて十分な準備をするためには、これが必要です。

🏝以下に購読🏝して、同僚の中でAIのリーダーになり、VoAGIなど他のプラットフォームには存在しないコンテンツを受け取ることができます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

データサイエンス

2023年にAmazonのデータサイエンティストになる方法は?

ほとんどのビジネスは現在、膨大な量のデータを生成し、編集し、管理しています。しかし、ほとんどのビジネスは、収集したデ...

人工知能

Diginiのスマートセンスの社長、ガイ・イエヒアブによるインタビューシリーズ

ガイ・イハイアヴ氏は、ビジネスの成功に最も重要な資産を保護するためにインターネット・オブ・シングス(IoT)の力を活用す...

人工知能

ジョシュ・フィースト、CogitoのCEO兼共同創業者 - インタビューシリーズ

ジョシュ・フィーストは、CogitoのCEO兼共同創業者であり、感情と会話AIを組み合わせた革新的なプラットフォームを提供するエ...

人工知能

「ジンディのCEO兼共同創設者、セリーナ・リー― インタビューシリーズ」

「Celina Leeは、ZindiのCEO兼共同創設者であり、アフリカのデータサイエンティスト向けの最大の専門ネットワークです Celina...

人工知能

「Kognitosの創設者兼CEO、ビニー・ギル- インタビューシリーズ」

ビニー・ギルは、複数の役職と企業を横断する多様で幅広い業務経験を持っていますビニーは現在、Kognitosの創設者兼CEOであり...

データサイエンス

「Seerの最高データオフィサーであるDr. Serafim Batzoglouによるインタビューシリーズ」

セラフィム・バツォグルはSeerのチーフデータオフィサーですSeerに加わる前は、セラフィムはInsitroのチーフデータオフィサー...