
コスモネス・ソルジャー 3DGS/NeRF+ヴァーチャルスタジオ実現の詳細
① 3DGS/NeRFの説明:実写を写し取る2つの次世代技術
バーチャルWall(LEDウォール)の背景を作る際、これまではUnreal Engineなどの3Dソフトを使い、ポリゴン(多角形のメッシュ)やテクスチャを組み合わせて一からデジタル空間を構築するのが主流でした。
しかし近年、カメラで撮影した2D写真や動画から、実写クオリティの3D空間を自動で再構成する革新的なアプローチが登場しました。それが「NeRF」と「3DGS」です。これらは従来の3DCGとは全く異なる原理で動いています。それぞれの仕組みと、なぜこれほど世界を騒がせているのかを詳しく解説します。
1. NeRF(Neural Radiance Fields:ニューラル・ラディアンス・フィールド)とは?
NeRFは、2020年に発表された「AI(ニューラルネットワーク)の中に空間を丸ごと記憶させる」技術です。
仕組み(数式としての空間):
空間内に「ポリゴン(3Dモデルの殻)」は存在しません。代わりにAIに対して、「この位置(X, Y, Z)から、この角度(θ, φ)で見たら、どんな色(RGB)と密度(不透明度)が見えるか」を大量の周囲の写真から学習させます。つまり、空間が「数式」としてデータ化されています。
最大の強み(異次元の質感表現):
光の跳ね返りや、視点によって変わる複雑な輝き(金属の反射、ガラスの透過、水面のきらめき、大気のモヤなど)を完全に再現できます。従来の3DCGでは職人が何日もかけて設定していた「複雑な光の物理現象」を、AIが自動で完璧に計算して出力します。
2. 3DGS(3D Gaussian Splatting)とは?
3DGSは、NeRFの最大の弱点(後述する計算の重さ)を克服するために、2023年にフランスの研究機関(INRIA)などが発表した現在の主流技術です。
仕組み(半透明の霧の集合体):
AIの中にデータを隠すNeRFとは違い、3DGSは空間に数百万〜数千万個の「ガウス粒子(中心が濃く、外側に向かってフワッとボケる半透明の楕円体)」を物理的に配置して3D空間を構築します。
イメージとしては、形状や色、透明度が異なる無数の「小さな霧のシミ」を空間にスプレーで吹き付け、それを重ね合わせることで1枚の実写絵を完成させているような構造です。最大の強み(圧倒的な描画速度):
空間に「実体(粒子データ)」が存在するため、現代のパソコンのグラフィックボード(GPU)が最も得意とする高速描画処理(ラスタライズ)がそのまま適用できます。クオリティはNeRFと同等でありながら、計算負荷は100倍以上も軽くなりました。
従来の「フォトグラメトリ」との決定的な違い
写真から3Dを作る技術としては、以前から「フォトグラメトリ(Photogrammetry)」が存在していました。しかし、映画の背景美術において、NeRF/3DGSはフォトグラメトリを完全に凌駕する以下の強みを持っています。
比較項目従来のフォトグラメトリNeRF / 3DGS (次世代技術)表現の対象「物体の形状(点群・ポリゴン)」を捉える「空間の光そのもの(質感や空気)」を捉える苦手な質感透過(ガラス)、半透明、金属の反射、髪の毛などの細かい毛全て完璧に再現可能(実写と見分けがつかない)形状の破綻複雑な形の植物や金網は、ポリゴンがグチャグチャに崩れる楕円の霧で表現するため、見た目が綺麗に維持される
一言で言えば、フォトグラメトリが「現実の形をデジタルな粘土細工にする技術」であるのに対し、NeRFや3DGSは「現実の光と空気をそのまま標本のように閉じ込める技術」です。この実写と寸分違わぬクオリティこそが、バーチャルWallの背景として切望される最大の理由です。
② 現場で直面する問題点:リアルタイム性と演出の反映
撮影時間を劇的に短縮し、実写クオリティの背景を提供するNeRFや3DGSですが、いざ「バーチャルWall(LEDウォール)」を用いた商業映画の撮影現場に持ち込もうとすると、制作陣は2つの致命的な「技術の壁」にぶつかることになります。
それが、「リアルタイム描画の壁」と「演出(ディレクション)反映の壁」です。
1. リアルタイム描画の壁(特にNeRFにおける限界)
バーチャルWallを用いたインカメラVFX(スタジオ撮影)では、現実のカメラの動き(位置、高さ、レンズの角度)をセンサーで追従し、その動きに合わせて背景の3D映像も「1フレームの遅延(ラグ)もなく」リアルタイムに同期して描き続ける必要があります。
NeRFが現場で使えなかった理由(ボリュームレンダリングの重さ):
NeRFは空間を「AIの数式」として保持しています。カメラの視点が動くたびに、画面に映るすべてのピクセル(数百万画素)に対して、「この光の線上にどんな色があるか」をAIが裏側で何兆回も計算し直します。この処理(ボリュームレンダリング)は膨大な計算パワーを消費するため、4Kや8Kといった巨大なLEDウォールに秒間24〜60フレームでリアルタイム投影することは、現代の最先端モンスターマシンを用いても不可能でした。これが、初期のNeRFが映像業界で「プレビズ(事前シミュレーション)」に留まり、本番撮影に使えなかった最大の原因です。
2. 演出(ディレクション)の反映ができない壁(3DGS/NeRF共通の弱点)
描画の軽さをクリアした3DGSであっても、映画監督や美術監督を最も悩ませるのが「後から手を加えられない」という点です。
従来の3DCG背景(Unreal Engineなどで作ったポリゴン)であれば、現場で監督から指示があれば、数秒〜数分で以下のような修正が可能でした。
「アングルが悪いから、背景にあるビルを2メートル左に動かして」
「役者の顔が暗いから、背景の太陽の向きを夕方に変えて、影を長くして」
「世界観に合わないから、映り込んでいる現代の電柱や看板を消して」
しかし、3DGSやNeRFでは、これが極めて困難です。理由はデータの構造にあります。
空間が「1つの塊」として固まっている:
3DGS/NeRFは、撮影した空間全体の光や霧(ガウス粒子)を「1つのデータ」として学習・配置しています。そのため、空間の中に「ビル」「電柱」「道路」という個別の3Dアセットとしての概念がありません。特定のオブジェクトだけを狙って「移動する」「消去する」ことが直感的にできないのです。光と影がデータに「焼き付いて(ベイクされて)」いる:
スキャンした瞬間の「その場所の空気、太陽光の向き、元からある影」がデータそのものに直接記録されています。そのため、仮想のライト(照明)を当てて影の向きを変えようとしても、元々の影が地面に黒く残ったままになり、非常に不自然な映像になってしまいます。「背景の夕日」と「スタジオで役者に当てる実際の照明」の辻褄が合わなくなると、バーチャルWall最大の強みである「実写とCGのなじみ」が完全に崩壊してしまいます。
まとめ:なぜ「相性が悪い」と言われたのか
一言で言えば、3DGSやNeRFは「写真のように美しいが、撮影した後は粘土細工のように自由に変形させたり、照明を当て直したりすることができない」という頑固な性質を持っています。
時間が一刻を争う映画の撮影現場(オンセット)において、「現場での急な演出変更に一切応えられない背景データ」はリスキーすぎて使えない——これが、この技術がバーチャルWallに完全導入されるまでの大きな課題でした。
③ 解決策(リアルタイム編):3DGSの導入とゲームエンジン連携
NeRFが抱えていた「描画が重すぎて巨大なLEDウォールにリアルタイム投影できない」という致命的な課題。これを劇的に解決し、バーチャルプロダクションの実用化へと一気に押し進めたのが、2023年に登場した3DGS(3D Gaussian Splatting)です。
3DGSの導入と、映画制作のデファクトスタンダードであるゲームエンジンとの連携によって、リアルタイム描画の壁はどのように崩されたのでしょうか。
1. 「AIの計算」から「グラフィックボード(GPU)の処理」への転換
NeRFの重さは、カメラの視点ごとに「AI(ニューラルネットワーク)が1画素ずつ光の計算をやり直す」という構造に起因していました。
対する3DGSは、空間に配置された数千万個の「半透明のガウス粒子(楕円の霧)」のデータをそのまま保持しています。
タイルベース・ラスタライゼーション(Tile-based Rasterization):
3DGSの描画プロセスは、現代のパソコンのグラフィックボード(GPU)が最も得意とする「ラスタライズ(3Dデータを2Dのピクセル画面に超高速で並べる処理)」に最適化されています。画面を細かなタイル状に分割し、手前にある粒子から順に重ね合わせて塗る(Splatting)という極めてシンプルな引き算の計算を行うため、NeRFの100倍〜数百倍という圧倒的な高速レンダリング(秒間100フレーム以上)を実現しました。これにより、4Kや8KのLEDウォールに映像を出力しても、カメラの動きに対して遅延(ラグ)が一切発生しなくなりました。
2. Unreal Engineとのネイティブ連携(プラグインの進化)
3DGSの描画がどれだけ軽くても、映画の撮影現場で使うためには、カメラトラッキングや照明システムを統括する「ゲームエンジン」の中で動かなければ意味がありません。現在では、以下のような専用プラグインの登場によって、完璧な連携パイプラインが構築されています。
Volinga.ai などの専用インポーター:
スキャンして生成した3DGSのデータ(.plyファイル)を、品質を落とさずにUnreal Engine(UE)内に直接インポートできる環境が整いました。インカメラVFX(ICVFX)への完全対応:
Unreal Engine内に配置された3DGS空間の中に、現実の撮影カメラと同期した「仮想カメラ(シネカメラ)」を配置します。現実のカメラが動くと、そのトラッキングデータが1フレームの遅延もなくUEに伝わり、背景の3DGS映像も完全に同期してLEDウォールへ描画されます。
3. バーチャルWallの「メディアサーバー」との統合
商業映画の現場では、Unreal Engineの映像をそのままLEDに出力するのではなく、「disguise(ディスガイズ)」などの専用メディアサーバー(ステージ全体の映像やLEDの解像度、色域を統括するシステム)を経由します。
現在の3DGSパイプラインは、このdisguiseなどのシステムとも完全に統合されています。Unreal Engine内で動く軽量な3DGS背景は、複数枚の巨大LEDウォール(メインの背景壁、天井の環境光用LED、サイドの反射用LEDなど)に対して適切に分配・出力され、スタジオ全体の映像環境を支える強固なバックボーンとなっています。
まとめ:リアルタイム性の獲得がもたらしたもの
3DGSの登場とゲームエンジンへの適応により、「実写と見分けがつかない3D空間の中を、本物のカメラを持って自由に歩き回り、それを遅延なくLEDウォールに表示する」という、かつてのSFのような撮影環境が現実のものとなりました。
しかし、リアルタイムに描画できるようになった一方で、まだもう一つの大きな課題である「監督の急な演出変更(ビルを消す、光を変える)に対応できない」という問題が残っています。次章では、この演出の壁を破る「映画業界ならではの解決策」について解説します。
④ 解決策(演出編):OpenEXR出力とハイブリッドパイプライン
3DGSの登場によってバーチャルWallへのリアルタイム投影は可能になりましたが、「空間が1つの塊になっていて、後から特定のオブジェクトを消したり、ライティング(照明)を変更したりできない」という演出面での弱点は残されたままでした。
映画制作の現場はこの致命的な問題を、新しい技術で無理にその場で直そうとするのではなく、映画業界が長年培ってきた「OpenEXR」という超高画質フォーマットと、ポストプロダクション(後編集)のパイプラインを融合させることでスマートに解決しました。
1. マルチレイヤーOpenEXR(.exr)による「映像の分解」
3DGSの弱点を克服する最大の鍵が、映画・VFX業界の標準画像フォーマットであるOpenEXRです。
3DGS背景をバーチャルWallに映し出す、あるいは後から最終映像としてレンダリングする際、ただの「1枚の背景動画」として書き出すのではなく、カメラの動きに同期した以下の情報を1つのOpenEXRファイルの中に別々の階層(レイヤー)として同時に出力します。
Z深度(Depthパス): カメラから背景のあらゆる物体までの「正確な距離(奥行き)」の情報。
オブジェクト別マスク(Cryptomatteなど): AIセグメンテーション(領域分割)技術を組み合わせ、3DGS空間の中にある「ビル」「車」「特定の木」などを自動で見分け、個別に選択できるようにした切り抜きマスク情報。
これらを16/32bitのハイダイナミックレンジ(HDR)かつ、人間の目やカメラの特性に縛られない「リニアな光の情報」のまま保持して書き出します。
2. ポストプロでの完全な「演出のリカバリー」
このマルチレイヤーOpenEXRがあることで、撮影現場で対応できなかった監督の「あそこを直して」に、後編集(コンポジット)の段階で100%応えることができるようになります。
「あのビルを消して」への対応:
VFXアーティストは、OpenEXRに含まれるオブジェクトマスク(Cryptomatte)を使って、3DGS背景に映り込んでいる特定のビルだけをワンクリックで選択し、綺麗に消去したり別のCGに差し替えたりできます。「キャラクターをビルの後ろに回り込ませて」への対応:
Z深度(奥行き情報)があるため、3DGS背景の前に後から「CGのモンスター」や「実写の別素材」を合成する場合でも、手前にあるビルや壁の裏側に自動で正確に回り込ませる(オクルージョン処理)ことが数秒で可能になります。
3. 「ライティング(照明)の矛盾」のコントロール
3DGS背景に元々太陽光や影が焼き付いて(ベイクされて)いる問題も、32bitリニアのOpenEXRと、LEDウォールのカラー制御によって解決します。
輝度情報の破綻がない調整:
OpenEXRは莫大な光の階調(HDR情報)を保持しているため、DaVinci ResolveやNukeなどのカラーグレーディングソフトを使うことで、「昼間にスキャンした3DGS背景」の明るさを不自然さなく強引に落とし、暗部を持ち上げて「夜のシーン(擬似夜景)」に見せるような高度な光の演出調整が可能になります。スタジオ照明との高精度な同期:
3DGS背景が持つHDRの光情報を、スタジオの照明コントロールシステム(DMXなど)と連動させることで、「背景の3DGSの夕日の輝度や色温度に合わせて、手前の役者を照らす実際のLED照明の明るさを自動で変化させる」といったリアルタイムの光の同期が行われ、手前の役者と背景のなじみが極限まで高められます。
4. 触るものはCG、遠景は3DGSの「ハイブリッド運用」
現在のスマートな現場では、すべてを3DGSで済ませるのではなく、以下のように役割を明確に分ける手法が主流です。
背景の大部分(動かさないビルや大自然): 質感のリアルな「3DGS」を配置。
役者が触るもの・破壊されるもの・色を変えたいもの: 従来通り自由に編集できる「ポリゴンCG」で制作し、Unreal Engine上で3DGSと重ね合わせる。
まとめ:最悪の相性を“最強”に変えるパイプライン
一言で言えば、「撮影現場の一発録りで全てを完璧にしようとするのを諦め、映画業界の標準であるOpenEXRをハブにすることで、後からプロのVFXチームがいくらでも手を加えられる状態を作った」ということです。
⓹ ハリウッドでの実例:映画『スーパーマン』最新作など
理論や実験の段階を終え、3DGSやNeRFを用いたバーチャルプロダクション(ICVFX)は、すでにハリウッドの大作映画や最先端の映像制作現場において「標準的なワークフロー」として定着し始めています。
実際の映画制作において、この技術がどのように機能し、クリエイターたちの表現を支えているのか、具体的な実例とともに紹介します。
1. 映画『スーパーマン』最新作での本格採用(動的3DGSの衝撃)
VFX・映画業界において最も大きな話題となったのが、大作映画『スーパーマン(原題:Superman)』の制作プロセスにおける3DGSの本格採用です [1]。
4DGS(Dynamic 3DGS)によるキャラクターと空間の融合:
この作品では、静止した背景だけでなく、時間の経過とともに変形・移動する「動的3DGS(4DGS)」の技術が約40カットの最終映像(ファイナルピクセル)に採用されました。実写のロケ地を高精度にスキャンした3DGS空間の中で、スーパーマンが超高速で飛び回るような、現実のドローンやカメラクレーンでは物理的に不可能なカメラワークをシミュレーション・肉付けすることに成功しています。ポストプロ(VFX)へのスムーズな引き渡し:
前述したOpenEXRを用いたパイプラインにより、バーチャルWall(LEDウォール)での撮影用背景として3DGSを使用しつつ、そのデータをそのまま高解像度なVFX用アセットとしてポストプロダクションチームにシミュレーション通りに受け渡すことで、クオリティの妥協を一切排除した効率的な制作が行われました。
2. インディーズ映画やSF作品での「モバイル3DGSプロダクション」
ハリウッドの巨額予算がついた作品だけでなく、数人規模のインディーズ映画や低予算のSF映画の現場でも、この技術は革命を起こしています。それを牽引しているのが、「Jetset」をはじめとするiOS向けのバーチャルプロダクション(VP)アプリの台頭です。
iPhone1台でロケ地を即座にアセット化:
映画のロケーションハンティング(下見)の際、iPhoneのLiDAR機能や動画撮影を使ってその場所を数分間撮影するだけで、クラウド上で自動的に超高精細な3DGS背景データが生成されます。オンセット(現場)でのリアルタイムプレビュー:
スタジオ内のグリーンバックや小規模なLEDウォールの前に立つ役者を、iPhoneのカメラで撮影します。アプリ内では、現実のカメラの動き(トラッキング)と、事前にスキャンした3DGSの映画クオリティの背景がリアルタイムに合成されます。監督やVFXアーティストは、「仕上がりの映像」をその場(オンセット)の画面で正確に確認しながら、役者の視線(アイライン)や構図のディレクションを行えるようになりました。
3. バーチャル Wall の常識を変えた「実写背景アセット」の商業化
これまでは、バーチャルWallに映し出すアセット(背景データ)といえば、Unreal Engineのマーケットプレイスなどにある「デジタルで作られた3DCG」が中心でした。しかし現在では、映画用の実写VFX素材を提供する最大手の「ActionVFX」などが、映画制作者向けに公式に3DGSアセットの提供を開始しています [2]。
スキャンされた「本物の街並み・大自然」:
映画の背景として需要の高い「ニューヨークの裏路地」「荒廃した工場」「広大な森林」などが、プロの手によって3DGSとして完璧にスキャンされ、商用パッケージとして販売されています [2]。映像制作会社は、一から背景のCGを作るコストを支払うことなく、最初から「写真クオリティで、なおかつカメラワークに合わせて動かせるリアルな実写背景」をダウンロードして、自社のバーチャルWallに即座に投影できるようになりました [2]。
まとめ:映像制作の「時間」と「コスト」の概念が変わる
ハリウッドやインディーズでの実例が示しているのは、3DGSの導入によって「ロケ地をそのままスタジオに持って帰ってくることができるようになった」ということです。
天候の急変や移動のコストに悩まされることなく、世界中のあらゆる場所(あるいは崩壊した建物などの危険な場所)で、監督の思い通りのカメラワークで役者を演技させられる環境が、実例として完全に証明されています。
⑥ 【学術的インデックス】生成AIを用いた「言葉による演出反映」の未来
本作『コスモネス・ソルジャー』の「設計図」が、固定された仕様でありながら、現場での即興的な演出変更を受け入れられるのは、最先端の生成AIと3DGS(3D Gaussian Splatting)の融合によるものです。最新の生成AIと融合した3DGSは、単なる「現実のスキャンデータ」を超え、監督の演出意図を言葉で吹き込むだけで、天候、時代、オブジェクトの配置までもリアルタイムに書き換えることができる「魔法のデジタルキャンバス」へと進化を遂げました。
1. 言葉で空間を再構築する:GaussianEditor
論文: 『GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting』 (CVPR発表)
技術的突破: これまでの3DGS/NeRFの最大の弱点は、空間が「1つの塊」として固まっているため、特定のオブジェクトだけを狙って消去したり動かしたりすることが直感的にできない点にありました。
演出への恩恵: 本論文が提唱する手法では、監督が画面に向かって「この街並みをサイバーパンク風の夜に変えて」「背景にある古いセダン車を、最新の赤いスポーツカーに差し替えて」と言葉(テキストプロンプト)で指示を出すだけで、AIが特定のガウス粒子を自動で識別・編集します。これにより、周囲の背景を一切壊すことなく、指示された物体の形状や質感だけをピンポイントで自然に描き替えることが可能となりました。
2. 視点の矛盾を排した動的演出:VcEdit
論文: 『VcEdit: View-Consistent 3D Editing with Gaussian Splatting』 (ECCV発表)
技術的突破: 2Dの画像生成AIを3D編集に応用しようとすると、視点によってAIの解釈がブレる「マルチビュー不整合」という致命的な問題が生じ、映像がチラつく原因となっていました。
演出への恩恵: 本研究では、2D生成AIの処理を3DGSのレンダリングループの深層に完全に同期させました。これにより、第1話の成層圏からの急降下ショットのような激しいカメラワークにおいても、AIが変更したオブジェクトの見た目や質感が1コマもチラつくことなく、完全に一貫性を保ったまま描画されます。この「視点の矛盾の解消」こそが、AIによる演出を実写クオリティの映画に耐えうるものにした技術的担保です
本作の設計図を実写映画としての完成度へ引き上げているのが、光の物理現象を制御する「ライティングの同期」と、空間全体を貫く「スタイルの統一」に関する技術群です。
3. ベイクされた光と影の分離と再構築:Relightable Gaussian Splatting
論文: 『Relightable Gaussian Splatting for Virtual Production Using Image-Based Light Source』
技術的突破: 3DGSやNeRFのデータは、スキャンした瞬間の太陽光や影が「ベイク(焼き付け)」されています。これがバーチャルスタジオの照明と喧嘩し、実写とCGの馴染みを阻害する最大の要因でした。
演出への恩恵: 本研究は、ガウス粒子一つ一つに物理的反射特性(BRDF)を学習させることで、「焼き付いた光と影を完全に消去(デベイク)」することに成功しました。これにより、背景の3DGS空間がスタジオの実際の照明(LEDウォールからの環境光)とリアルタイムに相互作用します。照明の向きを変えれば、背景のビルの影や壁の照り返しも自動で追従し、物理的に正しい「光の空間」を再構築できるようになったのです。
4. 空間全体のスタイル一貫性を守る:FlowScene
論文: 『FlowScene: 理想の部屋を丸ごとデザイン:スタイル一貫性を実現するAI』
技術的突破: 個別のオブジェクトの編集だけでなく、空間全体のトーン&マナーを一定の美学に基づいて管理する技術です。
演出への恩恵: 日本のアニメ美術が持つ独特の色彩感覚やライティングのセンスを、フォトリアルな3D空間へと翻訳する際、視点が変わってもその「美学」が崩れないように一貫性を担保します。これにより、どのカットを切り取っても「設計図」が意図した通りのスタイルが維持される、極めて強固なビジュアル管理が可能となりました。
5. 設計の根幹をなす光の数理:拡散レイトレーシング
出典: Masao Takakuwa『拡散レイトレーシング(Diffusion Ray Tracing)』
技術的意義: 本作の設計者自身が長年研究してきた、光の物理的な拡散現象をシミュレーションするための数学的アプローチです。
演出への恩恵: 3DGSやNeRFという最新の「器」に対し、どのような光を流し込めば人間の瞳に「真実」として映るのか。その理論的支柱がこの数理モデルにあります。本作の映像が単なる高精細なCGを超え、砂漠の熱気や夜の湿り気までを感じさせるのは、この深層にある光の計算ロジックに裏打ちされているからです。
総括:計算された「英雄碑」の完成
これらの論文インデックスが証明しているのは、本作『コスモネス・ソルジャー』が「偶然や感性に頼らない、再現可能な工学の結晶」であるという事実です。
GaussianEditorが「言葉による即興演出」を可能にし、
VcEditが「激しいアクションの一貫性」を保証し、
Relightable 3DGSが「実写と背景の物理的融合」を果たし、
FlowSceneと拡散レイトレーシングが「美学と物理の調和」を司る。
この多層的な技術の積み上げがあるからこそ、本作は特定の個人に依存することなく、「誰が作っても同じ高みに到達できる」精密な設計図として成立しています。この「英雄碑」は、2026年という時代が到達した、映像表現の新たなスタンダードとなるでしょう。
関連記事:
関連マガジン: