複数の画像やテキストの解釈 AI研究 - Section 13

AI 研究とイノベーションの最前線に留まります

このAI研究では、ドライブ可能な3Dガウスアバター（D3GA）を提案します：ガウススプラットでレンダリングされた人体のための最初の3Dコントローラブルモデルです

印象派は匿名の画家、彫刻家、版画家などからなる協会によって19世紀に創設された芸術運動であり、「かろうじて形を伝えるこ...

マイクロソフトリサーチと清華大学の研究者たちは、「思考の骨格（SoT）：LLMの生成を加速するための新しい人工知能の手法」という提案を行いました

大型言語モデル（LLM）であるGPT-4やLLaMAなどは、技術的な風景を確実に変えました。しかし、処理速度の遅さは、広範な応用性...

複雑なAIモデルの解読：パデュー大学の研究者が、ディープラーニングの予測を位相マップに変換

複雑な予測モデルの高度なパラメータ化の性質により、予測戦略の説明と解釈が困難です。研究者たちは、この問題を解決するた...

NVIDIA AI研究者が提案するTied-Lora 低ランクアダプテーション（LoRA）メソッドのパラメータ効率を向上させるための画期的な人工知能アプローチ

Nvidiaの研究者グループが、Tied-LoRAと呼ばれる新しい技術を開発しました。この技術は、Low-rank Adaptation（LoRA）手法の...

マイクロソフトリサーチは、Florence-2という新しいビジョン基盤モデルを導入しましたこれは、さまざまなコンピュータビジョンやビジョン言語のタスクに対応する統一されたプロンプトベースの表現を持っています

人工一般知能（AGI）システムでは、タスクに関係なく利点を提供する事前トレーニング可能な適応的表現の使用に向けた noticea...

アリババの研究者らがQwen-Audioシリーズを発表ユニバーサルな音声理解能力を備えた大規模な音声言語モデルのセット

アリババグループの研究チームは、さまざまなタスクに対する事前学習済みオーディオモデルの限定的な課題に対処するQwen-Audi...

ペンシルバニア大学の研究者たちは、OpenAIのChatGPT-Visionに対して、一連のテストを実施することで、ビジョンベースのAI機能の有効性を評価するための機械学習フレームワークを開発しました

GPT-Visionモデルは、多くの人の注目を集めています。人々は、テキストや画像に関連するコンテンツを理解し生成する能力に興...

UCバークレーとSJTU中国の研究者が、言語モデルのベンチマークと汚染を再考するための「再表現サンプル」の概念を紹介しました

大型言語モデルはますます複雑になり、評価が困難になっています。コミュニティは比較的短期間で多くのベンチマークを作成し...

南開大学と字節跳動の研究者らが『ChatAnything』を導入：LLM強化された人物像生成に特化した革新的なAIフレームワーク

南開大学と字節跳動の研究者チームが、オンラインで大規模な言語モデル（LLM）ベースのキャラクターのための人間らしさのある...

NVIDIAのAI研究者は、オブジェクト周囲の狭いバンドにボリューメトリックレンダリングを制限することで、効率的にNeRFレンダリングを行うための人工知能アプローチを提案しています

ナビディアの研究者たちは、体積ベースと表面ベースのレンダリング間で効率的に移行するためのニューラル放射輝度場の定式化...

Find your business way

Globalization of Business, We can all achieve our own Success.

Advertising with us

Web Analytics