アップルとブリティッシュコロンビア大学のAI研究者が提案する「FaceLit:ニューラル3D再点灯可能な顔のための革新的なAIフレームワーク」

Appleとブリティッシュコロンビア大学のAI研究者による「FaceLit:ニューラル3D再点灯可能な顔のためのAIフレームワーク」の提案

近年、2D画像から3D生成モデルを獲得するタスクに対する関心が高まっています。Neural Radiance Fields(NeRF)の登場により、3Dモデルから生成される画像の品質が大幅に向上し、2Dモデルによって達成される写真のようなリアリズムと競合しています。特定のアプローチは、第3次元での一貫性を確保するために3D表現にのみ焦点を当てていますが、これはしばしばリアリズムの低下を伴います。しかしながら、より最近の研究では、ハイブリッドなアプローチがこの制限を克服し、強化されたリアリズムをもたらすことが示されています。しかし、これらのモデルの顕著な欠点は、ジオメトリ、外観、照明などのシーン要素が絡み合っており、ユーザーによる制御が困難であることです。

この複雑さを解明するためにさまざまなアプローチが提案されています。しかし、効果的な実装のためには、対象シーンの複数の視点画像の収集が必要です。残念ながら、現実の条件下で撮影された画像を扱う際には困難が伴います。一部の取り組みでは、異なるシーンからの画像を含めることでこの条件を緩和していますが、同じオブジェクトの複数の視点が必要となる点は変わりません。さらに、これらの方法は生成能力に欠け、各異なるオブジェクトごとに個別のトレーニングが必要であり、新しいオブジェクトを作成することができません。生成方法を考慮する際には、ジオメトリと照明の絡み合った性質が依然として難しい問題です。

提案されたフレームワークであるFaceLitは、画像から顔の3D表現を獲得する方法を紹介しています。

アーキテクチャの概要は以下の図に示されています。

この手法の核心は、物理的な照明モデルを確立された物理モデルに従うように強制するレンダリングパイプラインの構築にあります。また、フレームワークは既存の照明と姿勢推定ツールを活用しています。

物理ベースの照明モデルは、最近開発されたNeural Volume RenderingパイプラインであるEG3Dに統合されており、2D画像からボリュームレンダリングのための深い特徴を生成するためにトライプレーンのコンポーネントを使用しています。この統合には球面調和関数が利用されています。その後のトレーニングは、リアリズムに焦点を当て、フレームワークの物理的な原則への固有の遵守を利用して写実的な画像を生成します。この物理的な原則との整合性は、解体された3D生成モデルの獲得を自然に容易にします。

この方法を可能にする鍵となる要素は、物理ベースのレンダリング原則をニューラルボリュームレンダリングに統合することです。先に述べたように、この戦略は、球面調和関数を活用して既存の利用可能な照明推定器とシームレスに統合するために設計されています。このフレームワークでは、シーンの拡散反射率、物質の鏡面反射率、法線ベクトルを表す球面調和関数の係数が表面に関連付けられます。これらの係数は、ニューラルネットワークを介して生成されます。しかしながら、このようなシンプルな設定でも、照明をレンダリングプロセスから分離する効果的な手法です。

提案された手法は、FFHQ、CelebA-HQ、MetFacesの3つのデータセットで実装およびテストされました。著者によれば、これにより最先端のFIDスコアが得られ、この手法が3D意識のある生成モデルの最先端に位置しているとされています。以下に、この手法によって生成された一部の結果が報告されています。

これはFaceLitの概要であり、画像から顔の非分離な3D表現を獲得するための新しいAIフレームワークです。興味がある場合は、以下に引用されているリンクを参照して詳細を学ぶことができます。

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

機械学習

「Amazon SageMaker Studioを使用してBMWグループのAI/MLの開発を加速」

この記事は、BMWグループのマルク・ノイマン、アモール・シュタインベルク、マリヌス・クロメンフックと共同で執筆されました...

人工知能

「モノのインターネット」から「すべてのインターネット」へ:AIと6Gの融合によるつながる知性

「人工知能や6Gなどの最先端技術が、すべてがインターネットに接続される新しい時代を招く方法を学びましょう」

機械学習

AI幻覚とは何ですか?AIチャットボットで何が間違っているのですか?幻覚を起こしている人工知能を見つける方法は?

AI幻覚は、新しい問題ではありません。人間が行ってきたことを以前はAIが行うようになり、過去数年間で人工知能(AI)はかな...

機械学習

「機械学習をマスターするための5つの無料の本」

機械学習は、現在コンピュータ科学の中でも最もエキサイティングな分野の一つですこの記事では、2023年に機械学習を学ぶため...

機械学習

「ジェネラティブAIおよびMLモデルを使用したメールおよびモバイル件名の最適化」

「ジェネレーティブAIとMLモデルを併用して、最大のエンゲージメントを得るために、トーンと対象読者に合わせた魅力的な件名...

データサイエンス

「AGIに向かって:LLMと基礎モデルが人生の学びの革命で果たす役割」

過去10年間、特にディープラーニングの成功を受けて、人工汎用知能(AGI)の構築の可能性について議論が続いています最終目標...