画像を作るAIから「世界を編集するAI」へ World Labs、Atlasを映画・建築に展開
空間知能AIを開発する米World Labsの3人の共同創業者が、米ベンチャーキャピタルa16zのYouTubeインタビュー番組に登壇し、同社の新しい世界モデル「Atlas」の特徴を解説した。それによるとAtlasは、これまで別々の研究分野だった、実在する空間を復元する「3D再構築」と、新しい映像を作る「生成」を一つのモデルに統合したことが特徴。単発の画像を生成するのではなく、物体の位置関係を保った一つの空間を作り、その中でカメラを動かしたり、シーンを編集したりできるようになったという。
この新しい機能によって映画やゲームなどの製作に利用できるほか、建築、建設、展示会設計など、現実の空間を作る仕事にも応用できるという。
視点を変えても「同じ世界」を維持
World Labsは、『AIのゴッドマザー』とも呼ばれるStanford大学教授のFei-Fei Li氏が共同創業した。2024年の始動時に2億3000万ドルを調達し、2026年2月にはさらに10億ドルを調達した。最新ラウンドの評価額は非公表だが、Bloombergは直前の資金調達協議で約50億ドルと報じている。
Li氏などによると、従来の画像・動画生成AIでは、「同じ部屋を別の角度から見せて」と指示すると、家具の位置や形が変わったり、窓や小物が増減したりすることがあった。生成するたびに画像を新しく作り直すためだ。
Atlasは異なるデータの種類を合わせて学習した、いわゆるマルチモーダルモデル。ただこれまでのマルチモーダルモデルのテキストや画像、動画といったデータに加え、「カメラが3次元空間のどこにあり、どの方向を向いているか」という情報や、物体までの距離を示す深度情報を事前学習の段階から扱っている。
そのうえで、複数の画像から確認できる部分は3D空間として「再構築」し、写っていない部分は「生成」能力を使って補う。
例えば部屋を複数方向から撮影すれば、Atlasはそれぞれの写真を3次元空間上の位置と結び付ける。そのため、新しい位置に仮想カメラを置いても、机や椅子の位置関係を維持したまま、その場所から見える映像を生成できる。
World Labsはこの基本機能を「new view prediction(新しい視点の予測)」と呼んでいる。
前世代の「Marble」との違いもここにある。Marbleは画像などを入力すると、Gaussian Splattingと呼ばれる方式で3D空間そのものを生成するモデルだった。
ところが共同創業者のBen Mildenhall氏によると、一部のユーザーはMarbleで3D空間を作った後、欲しい角度までカメラを移動し、数枚のスクリーンショットを撮るだけで利用を終えていたという。
Mildenhall氏はそれを見て、「それなら最初から、その画像を直接作ればいい」と気付いたという。
Atlasでは3Dモデルを作ること自体を基本機能にせず、「指定した視点から世界がどう見えるか」を直接予測する設計に変えた。必要に応じて画像や3D表現を出力できるようにしたという。
映画やゲームから建築・建設へ
この「同じ世界を維持できる」という特徴は、クリエイティブ制作と相性がいい。
現在の映像制作では、画像生成AIで絵コンテやムードボードを作り、別の動画生成AIで動かし、さらに編集ソフトで仕上げるなど、複数のツールを組み合わせることが多い。
問題は、ツールや生成を切り替えるたびに、人物、物体、背景などの一貫性が崩れやすいことだ。
Atlasなら、同じ空間を維持したままカメラ位置を変えられる。映画やCMなら同じセットを別の角度から撮影し、ゲームなら同じ世界の中を移動するといった使い方が考えられる。
Mildenhall氏は、用途はさらに現実世界の設計へ広がるとみている。
同氏が例に挙げたのが建築、建設、展示会ブースの設計だ。
こうした仕事では、まだ存在しない空間をまず3Dソフト上で作り、顧客や設計責任者から意見を受け、その内容を反映して再び3Dモデルを修正する。
Mildenhall氏によると、打ち合わせで修正指示を受けた後、実際の3Dデータへ反映する作業に1週間かかるような場合もある。現在の3Dソフトは操作が複雑で、この工程が大きな負担になっているという。
Atlasのような世界モデルなら、建物や展示空間の状態を維持したまま、「入口をこちらへ移す」「家具を変える」「別の位置から確認する」といった修正を、より直接的に行える可能性がある。
Mildenhall氏は、現実に存在する空間の「virtual replication(仮想的な再現)」だけでなく、これから作る空間を事前に形にする「pre-imagination」にも用途を広げられると説明している。
次の焦点は「生成品質」より「操作できること」
World Labsが今後重視するのが、世界モデルの「control(制御性)」と「editability(編集可能性)」だ。
Mildenhall氏は、研究分野ではこの重要性がまだ十分に評価されていないと指摘する。
実際の仕事では、きれいな映像を生成できるだけでは足りない。
同じ人物や物体を維持したまま、特定の物だけを動かす。レイアウトだけを変更する。カメラ位置や時間を指定する。こうした操作をしても、それ以外の部分が勝手に変わらないことが重要になる。
同氏は今後、シーン内の物体の配置や同一性、時間などをより細かく制御できるようにしたいと説明している。一方で、制御機能を増やすために生成品質が落ちれば、実用には耐えず、単なるデモ技術に終わってしまうとして、現在の出力品質を保ったまま操作性を高めることが課題だとした。
World Labsが目指しているのは、画像や動画をその都度生成して使い捨てるAIではない。
一つの世界を保持し、その中で視点を変え、物体を編集し、時間を操作する。Atlasは生成AIを「画像を作る道具」から、「世界そのものを作り、編集する道具」へ広げようとしている。
Li氏らは、今後は用途ごとに特化した世界モデルを作りたいと語っている。