アップルとブリティッシュコロンビア大学のAI研究者が提案する「FaceLit：ニューラル3D再点灯可能な顔のための革新的なAIフレームワーク」

Appleとブリティッシュコロンビア大学のAI研究者による「FaceLit：ニューラル3D再点灯可能な顔のためのAIフレームワーク」の提案

近年、2D画像から3D生成モデルを獲得するタスクに対する関心が高まっています。Neural Radiance Fields（NeRF）の登場により、3Dモデルから生成される画像の品質が大幅に向上し、2Dモデルによって達成される写真のようなリアリズムと競合しています。特定のアプローチは、第3次元での一貫性を確保するために3D表現にのみ焦点を当てていますが、これはしばしばリアリズムの低下を伴います。しかしながら、より最近の研究では、ハイブリッドなアプローチがこの制限を克服し、強化されたリアリズムをもたらすことが示されています。しかし、これらのモデルの顕著な欠点は、ジオメトリ、外観、照明などのシーン要素が絡み合っており、ユーザーによる制御が困難であることです。

この複雑さを解明するためにさまざまなアプローチが提案されています。しかし、効果的な実装のためには、対象シーンの複数の視点画像の収集が必要です。残念ながら、現実の条件下で撮影された画像を扱う際には困難が伴います。一部の取り組みでは、異なるシーンからの画像を含めることでこの条件を緩和していますが、同じオブジェクトの複数の視点が必要となる点は変わりません。さらに、これらの方法は生成能力に欠け、各異なるオブジェクトごとに個別のトレーニングが必要であり、新しいオブジェクトを作成することができません。生成方法を考慮する際には、ジオメトリと照明の絡み合った性質が依然として難しい問題です。

提案されたフレームワークであるFaceLitは、画像から顔の3D表現を獲得する方法を紹介しています。

アーキテクチャの概要は以下の図に示されています。

この手法の核心は、物理的な照明モデルを確立された物理モデルに従うように強制するレンダリングパイプラインの構築にあります。また、フレームワークは既存の照明と姿勢推定ツールを活用しています。

物理ベースの照明モデルは、最近開発されたNeural Volume RenderingパイプラインであるEG3Dに統合されており、2D画像からボリュームレンダリングのための深い特徴を生成するためにトライプレーンのコンポーネントを使用しています。この統合には球面調和関数が利用されています。その後のトレーニングは、リアリズムに焦点を当て、フレームワークの物理的な原則への固有の遵守を利用して写実的な画像を生成します。この物理的な原則との整合性は、解体された3D生成モデルの獲得を自然に容易にします。

この方法を可能にする鍵となる要素は、物理ベースのレンダリング原則をニューラルボリュームレンダリングに統合することです。先に述べたように、この戦略は、球面調和関数を活用して既存の利用可能な照明推定器とシームレスに統合するために設計されています。このフレームワークでは、シーンの拡散反射率、物質の鏡面反射率、法線ベクトルを表す球面調和関数の係数が表面に関連付けられます。これらの係数は、ニューラルネットワークを介して生成されます。しかしながら、このようなシンプルな設定でも、照明をレンダリングプロセスから分離する効果的な手法です。

提案された手法は、FFHQ、CelebA-HQ、MetFacesの3つのデータセットで実装およびテストされました。著者によれば、これにより最先端のFIDスコアが得られ、この手法が3D意識のある生成モデルの最先端に位置しているとされています。以下に、この手法によって生成された一部の結果が報告されています。

これはFaceLitの概要であり、画像から顔の非分離な3D表現を獲得するための新しいAIフレームワークです。興味がある場合は、以下に引用されているリンクを参照して詳細を学ぶことができます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

AI Paper SummaryAI ShortsApplicationsArtificial IntelligenceComputer VisionEditors PickMachine learningStaffTech NewsTechnologyUncategorized

Was this article helpful?

93 out of 132 found this helpful

アップルとブリティッシュコロンビア大学のAI研究者が提案する「FaceLit：ニューラル3D再点灯可能な顔のための革新的なAIフレームワーク」

Was this article helpful?

「Mozilla Common Voiceにおける音声言語認識 — 音声変換」

「ステレオタイプやディスインフォメーションに対抗するAIヘイトスピーチ検出」

AI研究

‘未知に挑む検索強化生成 (RAG) | AIが人間の知識と出会う場所’

研究：AIモデルはルール違反に関する人間の判断を再現できない

上位10のLLM脆弱性

マイクロソフトが「オルカ2」をリリース：特製のトレーニング戦略で小さな言語モデルに高度な推論を導入

Salesforce AIは、既存の拡散モデルを与えられた場合に、テキストから画像への拡散生成を行う新しい編集アルゴリズム「EDICT」を開発しました

「簡単な英語プロンプトでLLMをトレーニング！gpt-llm-trainerと出会って、タスク固有のLLMをトレーニングする最も簡単な方法」