アップルとブリティッシュコロンビア大学のAI研究者が提案する「FaceLit:ニューラル3D再点灯可能な顔のための革新的なAIフレームワーク」

Appleとブリティッシュコロンビア大学のAI研究者による「FaceLit:ニューラル3D再点灯可能な顔のためのAIフレームワーク」の提案

近年、2D画像から3D生成モデルを獲得するタスクに対する関心が高まっています。Neural Radiance Fields(NeRF)の登場により、3Dモデルから生成される画像の品質が大幅に向上し、2Dモデルによって達成される写真のようなリアリズムと競合しています。特定のアプローチは、第3次元での一貫性を確保するために3D表現にのみ焦点を当てていますが、これはしばしばリアリズムの低下を伴います。しかしながら、より最近の研究では、ハイブリッドなアプローチがこの制限を克服し、強化されたリアリズムをもたらすことが示されています。しかし、これらのモデルの顕著な欠点は、ジオメトリ、外観、照明などのシーン要素が絡み合っており、ユーザーによる制御が困難であることです。

この複雑さを解明するためにさまざまなアプローチが提案されています。しかし、効果的な実装のためには、対象シーンの複数の視点画像の収集が必要です。残念ながら、現実の条件下で撮影された画像を扱う際には困難が伴います。一部の取り組みでは、異なるシーンからの画像を含めることでこの条件を緩和していますが、同じオブジェクトの複数の視点が必要となる点は変わりません。さらに、これらの方法は生成能力に欠け、各異なるオブジェクトごとに個別のトレーニングが必要であり、新しいオブジェクトを作成することができません。生成方法を考慮する際には、ジオメトリと照明の絡み合った性質が依然として難しい問題です。

提案されたフレームワークであるFaceLitは、画像から顔の3D表現を獲得する方法を紹介しています。

アーキテクチャの概要は以下の図に示されています。

この手法の核心は、物理的な照明モデルを確立された物理モデルに従うように強制するレンダリングパイプラインの構築にあります。また、フレームワークは既存の照明と姿勢推定ツールを活用しています。

物理ベースの照明モデルは、最近開発されたNeural Volume RenderingパイプラインであるEG3Dに統合されており、2D画像からボリュームレンダリングのための深い特徴を生成するためにトライプレーンのコンポーネントを使用しています。この統合には球面調和関数が利用されています。その後のトレーニングは、リアリズムに焦点を当て、フレームワークの物理的な原則への固有の遵守を利用して写実的な画像を生成します。この物理的な原則との整合性は、解体された3D生成モデルの獲得を自然に容易にします。

この方法を可能にする鍵となる要素は、物理ベースのレンダリング原則をニューラルボリュームレンダリングに統合することです。先に述べたように、この戦略は、球面調和関数を活用して既存の利用可能な照明推定器とシームレスに統合するために設計されています。このフレームワークでは、シーンの拡散反射率、物質の鏡面反射率、法線ベクトルを表す球面調和関数の係数が表面に関連付けられます。これらの係数は、ニューラルネットワークを介して生成されます。しかしながら、このようなシンプルな設定でも、照明をレンダリングプロセスから分離する効果的な手法です。

提案された手法は、FFHQ、CelebA-HQ、MetFacesの3つのデータセットで実装およびテストされました。著者によれば、これにより最先端のFIDスコアが得られ、この手法が3D意識のある生成モデルの最先端に位置しているとされています。以下に、この手法によって生成された一部の結果が報告されています。

これはFaceLitの概要であり、画像から顔の非分離な3D表現を獲得するための新しいAIフレームワークです。興味がある場合は、以下に引用されているリンクを参照して詳細を学ぶことができます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

広州からロサンゼルスまで、自動車メーカーはAI技術を搭載した車両で驚きと感動を与えています

車好きには朗報です:現在から来週まで開催される2つの著名な自動車ショーが、AIによってパワードされた次世代の自動車デザイ...

機械学習

「Amazon SageMaker Studioを使用してBMWグループのAI/MLの開発を加速」

この記事は、BMWグループのマルク・ノイマン、アモール・シュタインベルク、マリヌス・クロメンフックと共同で執筆されました...

機械学習

百度Ernie 3.5が中国語AIのチャンピオンとして登場:しかし、ChatGPTより本当に優れているのか?

中国語AI市場における興奮すべきブレークスルーとして、有名な検索エンジンプロバイダであるBaiduが最新モデルであるErnie 3....

機械学習

NLPの探索 - NLPのキックスタート(ステップ#1)

今学期、私はカリキュラムの一部としてNLPを受講していますやったー!さて、この科目の今後の評価の一環として、与えられた教...

AIニュース

「GPT-4とXGBoost 2.0の詳細な情報:AIの新たなフロンティア」

イントロダクション AIは、GPT-4などのLLMの出現により、人間の言語の理解と生成を革新し、大きな変化を経験しています。同時...

機械学習

大規模言語モデル(LLM)の微調整

この投稿では、事前学習されたLLMをファインチューニング(FT)する方法について説明しますまず、FTの重要な概念を紹介し、具...