アップルとブリティッシュコロンビア大学のAI研究者が提案する「FaceLit:ニューラル3D再点灯可能な顔のための革新的なAIフレームワーク」

Appleとブリティッシュコロンビア大学のAI研究者による「FaceLit:ニューラル3D再点灯可能な顔のためのAIフレームワーク」の提案

近年、2D画像から3D生成モデルを獲得するタスクに対する関心が高まっています。Neural Radiance Fields(NeRF)の登場により、3Dモデルから生成される画像の品質が大幅に向上し、2Dモデルによって達成される写真のようなリアリズムと競合しています。特定のアプローチは、第3次元での一貫性を確保するために3D表現にのみ焦点を当てていますが、これはしばしばリアリズムの低下を伴います。しかしながら、より最近の研究では、ハイブリッドなアプローチがこの制限を克服し、強化されたリアリズムをもたらすことが示されています。しかし、これらのモデルの顕著な欠点は、ジオメトリ、外観、照明などのシーン要素が絡み合っており、ユーザーによる制御が困難であることです。

この複雑さを解明するためにさまざまなアプローチが提案されています。しかし、効果的な実装のためには、対象シーンの複数の視点画像の収集が必要です。残念ながら、現実の条件下で撮影された画像を扱う際には困難が伴います。一部の取り組みでは、異なるシーンからの画像を含めることでこの条件を緩和していますが、同じオブジェクトの複数の視点が必要となる点は変わりません。さらに、これらの方法は生成能力に欠け、各異なるオブジェクトごとに個別のトレーニングが必要であり、新しいオブジェクトを作成することができません。生成方法を考慮する際には、ジオメトリと照明の絡み合った性質が依然として難しい問題です。

提案されたフレームワークであるFaceLitは、画像から顔の3D表現を獲得する方法を紹介しています。

アーキテクチャの概要は以下の図に示されています。

この手法の核心は、物理的な照明モデルを確立された物理モデルに従うように強制するレンダリングパイプラインの構築にあります。また、フレームワークは既存の照明と姿勢推定ツールを活用しています。

物理ベースの照明モデルは、最近開発されたNeural Volume RenderingパイプラインであるEG3Dに統合されており、2D画像からボリュームレンダリングのための深い特徴を生成するためにトライプレーンのコンポーネントを使用しています。この統合には球面調和関数が利用されています。その後のトレーニングは、リアリズムに焦点を当て、フレームワークの物理的な原則への固有の遵守を利用して写実的な画像を生成します。この物理的な原則との整合性は、解体された3D生成モデルの獲得を自然に容易にします。

この方法を可能にする鍵となる要素は、物理ベースのレンダリング原則をニューラルボリュームレンダリングに統合することです。先に述べたように、この戦略は、球面調和関数を活用して既存の利用可能な照明推定器とシームレスに統合するために設計されています。このフレームワークでは、シーンの拡散反射率、物質の鏡面反射率、法線ベクトルを表す球面調和関数の係数が表面に関連付けられます。これらの係数は、ニューラルネットワークを介して生成されます。しかしながら、このようなシンプルな設定でも、照明をレンダリングプロセスから分離する効果的な手法です。

提案された手法は、FFHQ、CelebA-HQ、MetFacesの3つのデータセットで実装およびテストされました。著者によれば、これにより最先端のFIDスコアが得られ、この手法が3D意識のある生成モデルの最先端に位置しているとされています。以下に、この手法によって生成された一部の結果が報告されています。

これはFaceLitの概要であり、画像から顔の非分離な3D表現を獲得するための新しいAIフレームワークです。興味がある場合は、以下に引用されているリンクを参照して詳細を学ぶことができます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

AIニュース

「RBIは、Conversational AIとオフライン決済の使用をUPIで採用する」

デジタル決済において新たな地平を切り開くため、インド準備銀行(RBI)は高度な統合支払いインターフェース(UPI)の機能を...

データサイエンス

新しいAI研究がAttrPromptを紹介します:ゼロショット学習における新しいパラダイムのためのLLM-as-Training-Data-Generator

大規模な言語モデル(LLM)のパフォーマンスは、多くの自然言語処理(NLP)アプリケーションで印象的でした。最近の研究では...

機械学習

この人工知能ベースのタンパク質言語モデルは、汎用のシーケンスモデリングを解除します

人々が生命の言語を学ぶ方法は、自然言語の構文意味とタンパク質のシーケンス機能を比較することによって根本的に変わりまし...

AIニュース

「生成AIにおける高度なエンコーダとデコーダの力」

はじめに 人工知能のダイナミックな領域では、技術と創造性の融合が人間の想像力の限界を押し上げる革新的なツールを生み出し...

機械学習

「メーカーに会う:開発者がAI搭載ピットドロイドの背後にNVIDIA Jetsonを使う」

ゴラン・ヴクシッチは、スター・ウォーズの映画シリーズに登場するポッドレーサーを修理・保守するタイプの実世界のピットド...

機械学習

AWS Inferentiaでのディープラーニングトレーニング

この投稿のトピックは、AWSの自社開発AIチップ、AWS Inferentia、より具体的には第2世代のAWS Inferentia2ですこれは、昨年の...