新世代ワールドモデル『Atlas』が切り開く、ロボティクス、3Dクリエイティブ、そして空間知能の未来
人工知能(AI)の進化は、私たちの世界の捉え方、そして創造と生産のプロセスに絶え間ない変革をもたらしています。大規模言語モデル(LLM)が「次トークン予測」という概念で言語理解と生成に革命を起こしたように、視覚世界における同様のブレイクスルーが長らく期待されてきました。そして今、WorldLabsが発表した次世代ワールドモデル『Atlas』は、その期待を現実のものとし、「新視点予測」という新たなパラダイムを提示することで、私たちの視覚と空間に対する理解を根底から覆そうとしています。
従来の動画モデルが「次フレーム予測」に基づいて構築されてきたのに対し、Atlasは空間的に真に文脈化され、接地(グラウンディング)された画素を生成することで、まったく新しい次元の能力を実現します。その画期的な能力を端的に示す例として、映画『マトリックス』の有名な「バレットタイム」のショットが挙げられます。あの伝説的なシーンの撮影には、何百台ものカメラとグリーンバック、そして高価なキャリブレーションが必要でした。しかし、Atlasを使えば、わずか3台のiPhoneで同様の、あるいはそれ以上の驚くべき映像を、スタジオ撮影もグリーンバックも不要で作り出すことが可能になります。これは、単なる技術的な進歩に留まらず、映画制作、3Dデザイン、ゲーム開発、さらにはロボティクスといった多岐にわたる分野に、文字通り「新しい視点」をもたらし、未来を再定義する可能性を秘めているのです。
本記事では、この革新的なワールドモデル『Atlas』が一体何であり、どのような機能と重要性を持つのかを深く掘り下げます。その技術的な核心から、クリエイティブ産業やロボット工学への具体的な影響、そして「空間知能」と「AI完全性」という壮大なビジョンに至るまで、Atlasが私たちの世界をどう変えるのかを詳細に解説していきます。
Atlasとは何か?その核心機能と革新性
Atlasは、単なる画像や動画を生成するツールではありません。それは、世界を生成し、再構築し、そしてシミュレーションする、次世代のワールドモデルです。その根底にあるのは、「新しい視点の予測」という極めて根本的でエキサイティングな試みであり、これはこれまでのどの基盤モデルも成し遂げてこなかった偉業であると言えます。
3つの基本機能:生成、再構築、シミュレーション
Atlasの能力は、大きく分けて以下の3つの基本機能に集約されます。
世界の生成(Generation) Atlasは、画像とカメラの軌跡を入力として受け取り、その情報を基に、あらゆる視点からの動画フレームを生成する能力に優れています。これは単に既存の画像を補間したり、次のフレームを予測したりするのとは異なります。モデルは空間的なコンテキストを深く理解し、その知識に基づいて、入力された情報からは見えない新しい視点からの世界を創造します。例えば、あるシーンのいくつかの視点、あるいはそのシーンの説明を入力するだけで、それが「空間コンテキスト」という形で世界を暗黙的に記述し、仮想カメラを任意の場所に設定すれば、Atlasがその位置から世界がどう見えるかを理解し、映像として生成してくれるのです。これにより、クリエイターは、テキストプロンプトの試行錯誤に依存するのではなく、カメラの位置や移動、コンテンツの配置を正確に制御し、意図通りのフライスルー映像などを生成できるようになります。
世界の再構築(Reconstruction) Atlasは、疎な3D再構築にも非常に優れています。現実世界の視点であるフレームを1枚、あるいは最大100枚まで入力するだけで、それを使って現実世界を再構築することができます。この再構築は、空間を通り抜ける新しい動画として出力することも、空間の明示的な3Dモデルとして出力することも可能です。従来の再構築技術が膨大な数の画像やLiDARスキャンを必要としたのに対し、Atlasはごく少ない入力からでも高精度な3Dモデルを生成できるため、現実世界のデジタルツイン作成や、既存の映像素材からの3D化といったタスクを劇的に効率化します。
世界のシミュレーション(Simulation) 生成および再構築された世界の中で、Atlasは物理法則に基づいたシミュレーションを実行できます。例えば、ネットで大きな注目を集めた「バレットタイム」動画は、Atlasのシミュレーション能力の一例です。さらに、このシミュレーション能力はロボット工学の分野でも極めて重要であり、仮想環境でのロボットの行動計画や、さまざまなシナリオでの試行錯誤を可能にします。これは、単に静的な世界を表現するだけでなく、動的な要素や相互作用をモデル化する上で不可欠な機能です。
「新視点予測」の深掘り:LLMとの比較
WorldLabsの共同創設者は、Atlasの核心を「新規視点予測」と説明しています。これは、AIの分野における既存の基盤モデルのパラダイムと対比することで、その革新性がより明確になります。
- LLMの「次トークン予測」: 大規模言語モデル(LLM)は、与えられた文脈から次にくるトークン(単語や文字の単位)を予測することで、自然言語の理解、生成、翻訳、要約など、驚くべき能力を発揮します。
- 従来の動画モデルの「次フレーム予測」: 多くの動画モデルは、動画シーケンスの現在のフレームから次にくるフレームを予測することで、動画の生成や補間を行ってきました。しかし、これは主に二次元的な連続性を扱うものであり、三次元空間の理解や新しい視点の生成能力には限界がありました。
- Atlasの「新視点予測」: Atlasは、これらのモデルとは根本的に異なり、あるシーンの複数の視点や説明を入力として、それが「空間コンテキスト」に変換されます。そして、時空間の任意の場所に仮想カメラを向けるだけで、Atlasがその位置から世界がどう見えるかを理解し、映像として生成します。これは、単なる二次元的な補間や予測ではなく、世界の三次元構造と物理法則、そして意味を理解した上での「知的な予測」である点が、これまでのモデルとは一線を画します。
この「新視点予測」の概念は、空間的な文脈が極めて重要であることを示しています。従来の多くのビデオモデルが、一枚の画像入力や開始フレームから終了フレームへの補間によって評価されてきたのに対し、Atlasの重要な点は、入力したすべてのフレームに対して「空間的に根拠のある意味づけ」がなされていることです。これは、モデルが勝手に解釈したり、テキストプロンプトで無理やり指示を出そうとしたりするような、ただの画像ではありません。Atlasでは、すべての画像にそれぞれ対応する三次元のカメラポーズが結びついています。これにより、非常に高い精度で再構築タスクを実行できるわけです。例えば、部屋の四隅から撮影した4つの視点があれば、それをモデルに入れることで、その部屋のすべての様子を完全に再現できます。他の隅に何があるか、物同士の関係性はどうかといったことを推測するのではなく、入力したものをそのまま正確に再現できるのです。
アーキテクチャの革新性:生成と再構築の統合
Atlasが従来のモデルと大きく異なる点の一つは、そのアーキテクチャにあります。いくつかの点で、Atlasは「かなり新しいもの」だと言えるでしょう。
- 生成と再構築の統合: 歴史的に見て、3D復元(リコンストラクション)はコンピュータビジョンの独立したサブフィールドであり、独自の専門的なタスクとモデルを持っていました。一方、生成は、近年の大規模な拡散モデルなど、テキストからビデオを生成するあらゆるモデルが得意とするところです。こうしたモデルはクリエイティブな用途に最適で、これまで存在しなかったものを想像したいというニーズに応えるものです。しかし、Atlasによって、これら2つの異なる視覚的知能の側面が初めて1つのモデルに統合されました。つまり、3D復元と生成の両方を1つのアーキテクチャで実行できるのです。
- ネイティブなマルチモーダル設計: この統合を実現するために、WorldLabsはいくつかのアーキテクチャ上の変更を加えました。まず、Atlasは最初からマルチモーダルになるように設計されています。このモデルは、テキスト、画像、ビデオをネイティブに処理します。
- カメラポーズと3Dのネイティブな活用: さらに、カメラポーズをネイティブな入力として扱います。これは事前学習の段階でこれまで誰も成し遂げてこなかった点だと言われています。そして、3Dをネイティブなモダリティとして活用しています。具体的には、これまで採用されてきた手法は「深度マップ」であり、3D空間内での位置情報を持つ仮想カメラのフレームがある場合、そのカメラの位置とパラメータをモデルへのネイティブな入力として扱えます。そのカメラ位置に付随して、空間の見た目を表すRGB情報と、その位置の空間構造を示す深度マップの両方を持たせることで、テキスト、画像、ビデオ、3Dカメラといったこれらのモダリティを、このシステムはマルチモーダルな方法で共同的に処理するのです。
この画素生成と画素復元の統合は、コンピュータビジョンの世界において、半世紀以上も存在してきた分野の伝統的な境界線を打ち破るものです。これまでコンピュータビジョンの学会では、画素生成のトラック、認識のトラック、そして3D再構成のトラックがそれぞれ独立して存在していました。Atlasは、視点や視点推定を基点として、再構成と生成という問題を統合したエレガントなモデルであり、この分野における極めて強力なブレイクスルーと言えるでしょう。
空間知能への決定的な一歩:Atlasのビジョン
WorldLabsが創業以来掲げてきたビジョンは、「空間知能(Spatial Intelligence)に取り組みたい」というものでした。Atlasは、まさにこの空間知能の実現に向けた、決定的な一歩を踏み出したモデルです。
空間知能の定義とAtlasの役割
「空間知能」とは、最終的に空間そのものを生成し、その中で推論を行い、さらに編集や相互作用ができるようにする能力のことです。これは3Dだけでなく、究極的には時間軸を含む4Dの概念に拡張されますが、いずれにせよ、空間の幾何学、構造、そして物理法則を深く理解することがその実現のための根本的な課題となります。
Atlasは、この課題を解決する上で大きな前進をもたらしました。なぜなら、すべてのフレームにおいて、視点やカメラポーズといった重要な推定情報を生成できるようになったからです。これは、空間の幾何学を理解する上で最も不可欠な情報であり、その理解が、ブログで紹介されたモデルのダウンストリームに見られるような、あらゆる創発的挙動につながるのです。
つまり、空間知能への道のりにおいて、単に画素を生成することは初期段階に過ぎません。それは数え切れないほどのモデルで既に見てきましたが、空間的に文脈化され、接地された画素を生成することは、決定的に重要な別のステップです。Atlasは、まさにその非常に困難な一歩を踏み出したのです。時間という第4の次元があり、それがダイナミクスをもたらし、空間のより高精度なシミュレーションと描写を可能にします。Atlasは、まさに空間インテリジェンスのロードマップの一部として位置づけられています。
スケーリング仮説と成功への確信
Atlasの開発チームは、この困難な挑戦に着手した当初から、その成功にかなりの確信を持っていました。その確信の根拠は、モデルを大きくし、学習時間を延ばし、より多くのチップを使うたびに、劇的に性能が向上していったという経験です。これは、LLMの分野で「スケーリング則」として知られる現象と同様であり、モデルの規模を拡大することで、創発的な能力や性能の飛躍的な向上が見られるという仮説に基づいています。
WorldLabsの創業チームは、このスケーリング則に絶対の自信を持っていました。もちろん、正確なアーキテクチャの選択とデータ混合は成否を分ける詳細な要素ですが、「次の視点の予測」という核となる仮説と、それがスケールアップすれば機能するという確信が初期段階から存在しました。
そして、その確信は裏切られることはありませんでした。新しいアーキテクチャと新しいパラダイムでモデルを事前学習する最初のサイクルが、機能することは稀であるにもかかわらず、Atlasは最初のサイクルで驚異的な結果を示しました。これは、WorldLabsが空間知能に対する正しいアプローチを見つけたことを強く示唆しています。
現在、Atlasの開発はまだ始まったばかりであり、現時点での性能は計算リソースによって制限されている状態です。モデルを大きくし、学習時間を長くし、より多くのチップを使うたびに、劇的に改善していくことが確認されています。つまり、Atlasの潜在能力はまだ初期段階にあり、さらなるスケールアップによって、私たちは想像もできないような新しい能力を目の当たりにすることになるでしょう。
WorldLabsの進化の軌跡:MarbleからAtlasへ
Atlasの誕生は、WorldLabsが2年半にわたって積み重ねてきた空間知能への探求の結晶です。その道のりには、先行するワールドモデル『Marble』での学びと、それを乗り越えるための設計思想の転換がありました。
先行モデル『Marble』とその制約
WorldLabsが初めて発表した大きなワールドモデルが、昨年リリースされた『Marble』でした。Marbleは画像、動画、テキストプロンプトを受け取り、それを使って3D世界を生成できる素晴らしいモデルであり、現在のMarble製品の基盤となっています。
Marbleの最大の特徴の一つは、その出力表現に「ガウシアンスプラット(Gaussian Splatting)」という技術に重点を置いていた点です。ガウシアンスプラットは、3Dシーンを多数のガウス分布(小さな点)の集合として表現することで、非常に高品質なレンダリングを高速に実行できるという利点があります。レンダリングが容易であり、モバイルデバイスやVRデバイスでも効率的にレンダリングでき、ゲームエンジンやシミュレーションエンジンとも連携可能であるため、多くのメリットがあります。
しかし、このガウシアンスプラットという特定の出力表現が、Marbleではボトルネックになっていました。ユーザーはMarbleに画像を入力してガウシアンスプラットとして3Dシーン全体を生成し、異なる視点からスクリーンショットを数枚撮って終えるという利用方法が多かったのです。これは、ユーザーが求めているのが「特定の視点からの画像」であり、必ずしもガウシアンスプラットそのものではないことを示唆していました。
Atlasでの設計思想の転換
Marbleでの経験から、WorldLabsはAtlasの設計において大きな見直しを行いました。ガウシアンスプラットという単一の出力モダリティにボトルネックを抱えるのではなく、これらのモダリティをより早い段階で分岐させ、モデル内でそれらを統合的に機能させる必要があると気づいたのです。
Atlasでは、基本的なプリミティブ(基本要素)は「ガウシアンスプラット世界を生成すること」ではありません。基本的なプリミティブは、私たちが話した「新しい視点の予測」です。これによって、RGBフレームや3Dを生成でき、必要に応じてそれらを使って美しいガウシアンスプラットの世界を構築できるのです。しかし、必要がないときにまで出力をガウシアンスプラットでボトルネックにする必要はありません。このように、さまざまな表現の長所と短所を理解するには、本当に血のにじむような努力が必要でした。
この設計変更は、Atlasの汎用性と柔軟性を飛躍的に高めました。ユーザーは、目的に応じて最適な出力形式を選択できるようになり、Atlasの核となる「新視点予測」能力を最大限に活用できるようになったのです。
スケーリングの階段を登る
WorldLabsの道のりは、いきなりAtlasのような画期的なモデルにたどり着いたわけではありません。彼らは「スケーリングの階段を一段ずつ登る」という着実なアプローチを取ってきました。小さな実験や小さなモデルを繰り返し作り、何が機能し、何がスケールするのかという確信を積み重ねていったのです。
創業当時、空間知能の分野にはまだ明確なスケーリング則が存在しませんでした。これは、LLMの分野で確立されたスケーリング則とは対照的です。WorldLabsは、手探りの中で多くの試行錯誤を繰り返し、何度も方向転換を経験しながら、最終的に「これこそがスケールできる方法だ」と確信できる手法にたどり着きました。
この着実なステップアップが、Atlasの確固たる基盤を築き、その驚異的な性能を実現するための不可欠なプロセスでした。それは、ただ力技でモデルを大きくするだけでなく、適切なアーキテクチャ、データ混合、そして計算資源の最適化を同時に追求する、洗練されたアプローチの結果なのです。
疎なデータから豊かな3D世界へ:再構築の革命
従来の3D再構築技術は、長年にわたりコンピュータビジョンの重要な研究テーマでしたが、その実用化には常に「データの密度」という大きな課題が立ちはだかっていました。Atlasは、この根本的な課題に対して、生成能力と再構築能力を統合することで、劇的なブレイクスルーをもたらしました。
従来の「高密度再構築」の限界
これまでの3D再構築技術、特に「高密度再構築」と呼ばれる手法では、非常に多くの入力画像が必要とされていました。例えば、ある物体や部屋を3Dモデルとして正確に再構築するためには、再構成に映し出したいすべてのものに対して、少なくとも3〜4方向からの視点が必要とされていました。これを部屋全体に適用しようとすると、マイクの下、テーブルの下、あらゆる隙間や割れ目、植物の葉の間など、すべてを網羅する写真を撮るには、部屋中を歩き回るという非常に退屈で徹底した努力が必要でした。
熟練者であれば数分で済むかもしれませんが、一般の消費者や初めて挑戦する専門家が、普通のスマートフォンのカメラや撮影機器を使ってやろうとすると、おそらく1時間以上かかるでしょう。初めての人が複数の部屋をスキャンしようとして、十分なデータを撮るために2時間も歩き回っているのを見たという話もあるほど、これは徹底的で退屈な作業の繰り返しでした。私たちが「高密度」と言うとき、本当に高密度であることを意味しているのです。例えば、この部屋なら、100枚から300枚もの写真を撮って、部屋全体を記録したいと考えるのが一般的でした。
さらに、従来の技術では、複数の視点から同じ点を「三角測量」して3D空間上の位置を特定する必要があるため、多くの画像が不可欠でした。このメカニズムの特性上、入力画像に映っていないものはすべて、3D再構築において欠損部分となってしまうという限界もありました。
Atlasが実現する「50倍から100倍の削減」
Atlasは、この従来の高密度再構築のパラダイムを根本から覆します。WorldLabsが目指しているのは、数百枚、あるいはそれ以上の写真が必要だった再構築を、わずか3枚程度のカメラ入力で実現することです。これは、実に「50倍から100倍」ものデータ削減を意味します。
この劇的な効率化が意味することは多大です。例えば、三脚にiPhoneを3台立てて、誰かがバスケットボールをシュートしたり、ミルクにイチゴを落としたりする様子を撮影するだけで、その3台のiPhone動画からショットを再構成し、時間を止めた状態でミルクが飛び散る中をカメラが飛び回るような、驚くべき映像を作り出すことができるのです。スタジオ撮影も、グリーンバックも、高価な機材調整も必要ありません。
ウェブサイトで紹介されているスタンフォード大学の広場のデモは、Atlasのこの能力を象徴するものです。わずか3枚から25枚の地上からの画像があれば、広大なスタンフォードの広場全体を再構築できます。そして、すべての入力画像は地上から撮影されたものですが、モデルはそれを俯瞰の視点で見せる映像を生成できるのです。これは本当に「魔法のよう」であり、再構築の法則に従いつつも、未知の視点を生成するAtlasの能力を示しています。
生成と再構築の相互作用の不可欠性
なぜAtlasは、これほど少ない入力から高精度な3D世界を再構築できるのでしょうか?その鍵は、生成と再構築の根本的なレベルでの相互作用にあります。
人間がどんなに注意深く撮影しても、部屋の中のすべての部分を完璧に捉えることは不可能です。マイクの裏側やテーブルの下、あるいは椅子の脚の間など、どれだけ多くの視点で撮影しても、必ずどこか撮り逃しが出てしまいます。従来の再構築技術では、これらの「見えない部分」は欠損として処理されるか、何らかのヒューリスティックな推測で埋め合わせるしかありませんでした。
Atlasは、この問題を生成能力によって解決します。モデルは、まず見えている情報に基づいて視覚情報を三角測量し、空間構造を把握します。その上で、どうしても捉えきれなかった部分については、その空間コンテキストと物理法則の理解に基づいて、欠損部分を生成的に補完するのです。つまり、Atlasは「見えているものに基づいて」再構築を行い、さらに「見えていない部分を想像して穴を埋める」という生成的なプロセスを同時に実行することで、完全で整合性の取れた3D世界を構築できるのです。
拡張可能なコンテキストウィンドウ
このAtlasの能力は、LLMの分野で「コンテキストウィンドウ」の概念が重要視されてきたことと共通の原理に基づいています。LLMでは、文脈の長さ(コンテキストウィンドウ)を大きくすることで、より複雑な推論や整合性の取れた文章生成が可能になることが示されてきました。
画像や動画モデルの分野では、これまで同じような原理に基づいたアプローチで突き詰めた人はいませんでした。しかし、Atlasは「非常に長いコンテキストを持ち、大量の情報を詰め込んだ生成そのものが再構築である」という考え方で、この二つの領域の架け橋となる連続性を構築しました。
WorldLabsの以前のモデルであるMarbleには、数枚の画像しか読み込ませることができないという根本的な限界がありました。しかしAtlasは、例えば64枚の画像キャプチャを使って家全体を飛び回るような映像を作ることも可能です。すべては実際に見たもの、あるいは見たものに近い情報、そして捉えきれなかった部分からのわずかな外挿に基づいて、しっかりと根拠のある形で再現されるのです。さらに驚くべきことに、例えば2,000枚の画像で撮影した複数部屋の家を、30枚や40枚の入力にまで減らしても、フライスルー映像はほとんど同じに見えることが確認されています。これは、情報を放り込める、拡張性に優れたコンテキストウィンドウを構築したことで実現した、以前なら全く考えられなかったことです。
つまり、Atlasは物理的な写真がスパース(疎)なデータであっても、残りの視点を生成し、密なフライスルー映像を生み出すことができます。自己回帰モデルであるため、ユーザーは「ここに画像が欲しい、あそこ、そこ、あそこにも画像が欲しい」と指定し、生成しながらコンテキストに追加するものをインタラクティブに選ぶことも可能です。これは、3Dの整合性を保ちながら、人間の想像力と制御を融合させる、まったく新しいコンテンツ制作の形を提示しています。
クリエイティブ産業への影響:想像力を解き放つ
Atlasがクリエイティブ産業に与える影響は計り知れません。映画制作、ゲーム開発、プロダクトデザイン、建築設計など、視覚的コンテンツを扱うあらゆる分野において、そのワークフローと可能性を根本から変革する潜在力を秘めています。
既存ワークフローの劇的な効率化と品質向上
WorldLabsが以前提供していたMarbleモデルのユーザーの多くは、生成された3Dシーンから異なる視点のスクリーンショットを撮って利用していました。これはまさに、Atlasの「新視点予測」能力がターゲットとするユースケースと合致しています。従来の多段階のクリエイティブワークフローでは、画像モデルでムードボードやストーリーボードを作成し、別の動画ツールでそれらをキーフレームとして組み合わせ、さらに編集ツールで加工するといった複雑なプロセスが一般的でした。
Atlasは、このようなワークフローに「生成されたものを3D的に整合性のある世界に定着させる健全な基盤」を提供します。従来の画像モデルでは、テキストプロンプトで「廃墟の異なる視点からの画像を見せてくれ」と依頼しても、生成される画像の「位置が微妙にずれる」など、空間的な一貫性の問題が頻繁に発生しました。Atlasは、このような「安定性の欠如」を解決し、クリエイターが意図した通りの、空間的に整合性の取れた世界を構築することを可能にします。
これにより、クリエイターはテキスト制御だけで何度も生成をやり直す「スロットマシンのような感覚」から解放され、カメラがどこを向き、どう移動するか、コンテンツを配置する場所を正確に制御できるようになります。これは、創造的なプロセスにおける試行錯誤の効率を劇的に高め、より高品質で一貫性のあるコンテンツ制作を可能にするでしょう。
永続的な3D状態と空間的推論の進化
何十年もの間、映画や番組、宣伝用のカット、あるいはゲーム環境の構築において、人々は「永続的な3D状態」に慣れ親しんできました。仮想空間にステージや小道具、要素を配置し、時間をかけて環境を発展させるという考え方です。人々は「何かを作っては捨て、テキストプロンプトだけを残す」といった一時的な考え方ではなく、資産のコレクションを構築し、そうした方法で世界をモデル化したいと望んでいます。
Atlasは、この「空間コンテキストの仕組み」や他の要素を通じて、そのレベルのコントロールと精度を提供しようとしています。クリエイターは、生成された3D世界を一時的なものとして扱うのではなく、編集可能な「アセット」として蓄積し、再利用し、発展させることができます。これは、空間的な推論を行い、時間をかけて環境を構築する上で極めて重要です。将来的には、画像から始めてさまざまな入力形式を取り込み、シーン内の要素をより細かく操作・編集・対話できるようになることが目指されています。
労働集約的な3D設計プロセスの劇的削減
クリエイティブ産業だけでなく、建築や建設、工業デザイン、さらには展示ブースの設計など、現実世界で製造が必要なあらゆるものの仮想設計フェーズは、極めて労働集約的です。クリエイティブ・ディレクターやデザイン・ディレクター、あるいは建築家などから口頭のコメントやスケッチ、あるいは非常に素早い指示でフィードバックをもらい、それを3D表現に落とし込む作業が、仕事の95%を占めているような現状があります。会議でフィードバックを受けて、そこから1週間かけて修正作業を行うといった非効率なプロセスが常態化しています。
これは、既存の3Dソフトウェアが何十年も前の技術に依存していて、レゴや陶芸のように手を使ったり、鉛筆でスケッチしたりするような直感的な操作感には決してならなかったからです。まさにこの部分こそ、AIが人々のプロセスに莫大な価値をもたらす可能性を秘めた場所であり、クリエイティブな用途であれ、工業デザインやその他の分野であれ、同様です。
Atlasのような技術は、この最も困難で労働集約的な作業を劇的に削減する潜在能力を持っています。例えば、『マトリックス』のバレットタイムの例で示されたように、数百台のカメラを3台のiPhoneに削減できるような「50倍、100倍の削減」が、この3D設計プロセスにも適用されるかもしれません。これにより、デザイナーや建築家は、技術的な制約から解放され、より多くの時間を創造的な思考と問題解決に費やすことができるようになります。
WorldLabsは、こうした人々のニーズに応えるために、モデルに多様なバリエーションを構築したいと強く思っています。それは、現在見られる分野だけでなく、現実世界の空間を構築する前に、その仮想的な複製や事前イメージを作成したいと考えるあらゆる場面での可能性を広げるものとなるでしょう。
ロボット工学への影響:現実とシミュレーションの橋渡し
WorldLabsのワールドモデル『Atlas』は、クリエイティブ分野での華々しい応用だけでなく、ロボット工学という、より物理的な世界との相互作用を伴う分野においても、革命的な影響をもたらす可能性を秘めています。WorldLabsがロボット工学の会社Synapseを買収した背景には、Atlasのようなワールドモデルとロボット工学の統合によって、この分野の根本的な課題を解決するという明確なビジョンがあります。
ロボット工学における「データ問題」
現在のロボット工学における最大のボトルネックの一つは、実は「データ」にあります。いつかはチップが問題になるでしょうが、今はデータが重要です。なぜなら、ロボットが動作する現実世界のデータを収集するのは非常に困難だからです。
例えば、工業環境でロボットアームに配線作業の方法を学習させたいとしましょう。その場合、まず配線作業を行うロボットのポリシー(行動戦略)を学習させるために、膨大なデータが必要になります。次に、そのロボットのポリシーがうまく機能しているかを評価する必要があり、最終的に、ロボットを実際の配線環境へと導入するのです。
学習のために、この会社や現在のWorldLabsのロボットチームが行っていたのは、まさに前述した「高密度再構成」という手法です。つまり、ロボットが動作する状況を大量の写真に撮り、その環境を再構成しようとするわけです。これは非常に苦痛で時間がかかり、労力も大きく、ロボットシミュレーションにおける「リアル・トゥ・シム(Real-to-Sim)」のスピードを大きく阻害していました。
さらに、単に配線作業や皿洗いといった状況のデータを集めるだけでは不十分です。「ランダム化」という非常に重要なステップもあります。同じ環境を使いながら、条件をランダムに変える必要があるのです。ケーブルがこの方向にしか曲がらないのではなく、別の方向に曲がるようにしたり、箱のサイズや色、蓋を変えたり、シーン内の配置を変えたりします。このような多様なシナリオをシミュレーションすることで、ロボットのポリシーは現実世界の予期せぬ状況にも対応できるよう、より堅牢にトレーニングされます。しかし、このランダム化に必要なデータを現実世界で収集することは、さらに困難です。
Atlasによる「リアル・トゥ・シム」の革新
そこで、Atlasがまさにそのための次世代技術となるわけです。Atlasの優れた再構築能力と生成能力は、この「リアル・トゥ・シム」のプロセスを劇的に加速させ、効率化します。わずか数枚の疎な入力画像から、現実世界の複雑な環境を高精度な3Dモデルとして再構築し、それをシミュレーション環境に移行させることができます。これにより、ロボットが学習するための高品質なデータ生成が、これまでにないスピードとコスト効率で実現できるようになります。
ロボットポリシー学習の本質とシミュレーションの重要性
ロボットのポリシーをトレーニングすることには、これまで見てきた他のAIアプリケーションとは根本的に異なる点があります。例えば、コードや画像、動画を生成する場合、モデルは基本的に一つの「成果物」を作り出しています。そして、そのような成果物であれば、ウェブ上やどこかから多くのサンプルを収集することができます。画像を生成したいなら画像が、動画を生成したいなら動画が、コードベースを生成したいならコードベースが世の中にたくさん存在します。
しかし、ロボット工学のポリシーは根本的に異なるものです。それは静的なものを生成するのではなく、世界に出て行動を起こし、目標を達成しようとするポリシーなのです。そして、世界は常に期待通りに反応するとは限りません。予期せぬ出来事が起こるものです。つまり、ロボットのポリシーとは根本的に、現実世界に出て現実世界とやり取りし、様々な事象を経験する「エージェント」なのです。
そのため、トレーニング中のポリシーは、デプロイ中に起こり得るあらゆる問題にさらされる必要があります。そして、そこでロボット工学にとってシミュレーションが極めて重要になるのです。
データ駆動型ニューラルシミュレーターの未来
現在、シミュレーションには2つの視点があります。1つは、人間である設計者が創造力を働かせ、お気に入りの物理エンジンを使って、このタスクを達成する際に起こり得るあらゆるシナリオを想像し、それらすべてをモデル化するコードを明示的に書く従来のシミュレーションです。
しかし、もう1つの視点として、よりデータ駆動型のシミュレーションがあります。環境や世界が行動にどう反応するか、あるいは時には予期せぬ反応をするかもしれないことを理解できる、学習モデルを持てるのではないでしょうか。Atlasは、この学習済みニューラルシミュレーターの構築を可能にします。Atlasによって生成された豊富なシミュレーションデータでトレーニングされたニューラルシミュレーターは、ロボットのポリシーをトレーニングするためのシミュレーション環境として使用できるのです。これは、非常に興味深い将来の方向性です。
さらに、この学習済みシミュレーターを手に入れれば、そのシミュレーターはすでに脳内に世界を理解し、世界が行動にどう反応するかを理解しているわけですから、シミュレーターそのものがプレイヤーになればいいという考え方も生まれてきます。
これが、WorldLabsがワールドモデルとその汎用性に関して持っている核となるテーゼです。モデルが理解すべき中核となる要素として、世界の生成、シミュレーション、さまざまな状況下での見え方の理解があります。そして、世界が行動に対してどう反応するかを理解することは、特定の反応を引き出すためにどのような行動をとるべきかを想像することと密接に関連しているのです。Atlasは、まさにこのロボットの「知的なエージェント」への道を開く、重要なパズルのピースとなるでしょう。
将来の展望:AI完全性とその先へ
『Atlas』の発表は、AIの新たなフロンティアを開拓するものであり、その将来の展望は計り知れません。現在もまだ始まったばかりの技術でありながら、WorldLabsはすでにその次の進化のステップを見据えています。
ダイナミクスのさらなる強化
『Atlas』のローンチ後、専門家からは「もっとダイナミクス(動的な要素)が必要だ」というフィードバックも寄せられました。世界が実際に動くことが理想的であり、ロボット工学のケースではそれが特に重要です。
しかし、WorldLabsは、実はAtlasが既に初歩的なダイナミクスを備えていると説明しています。前回のMarbleワールドモデルは根本的に静的なもので、モデルがダイナミクスをまったく扱えませんでした。これはモデルのアーキテクチャや学習に深く組み込まれており、全体が根本的に静的でした。Marbleの後にそれが大きな問題だと分かっていたので、Atlasで修正されました。
Atlasのアーキテクチャは、既に根本的にダイナミクスをサポートしています。Atlasの学習データにも、根本的にダイナミクスが含まれています。公開された動画を注意深く見れば、水面の波や、生成された空撮映像で小さな車が動き回っている様子など、動的な要素が確認できます。
3D再構築においてダイナミクスは厄介な問題になるという側面もありますが、WorldLabsの論点の一つは、基本的な3D再構築を行うのであれば動的な要素を排除したいものの、最終的に静的な出力が欲しい場合でも、モデルに動的なデータを学習させるのが最善の方法だというものです。動的なデータも静的なデータも可能な限り多くモデルに見せて、動的な要素をどう排除するかをモデル自身に学習させるのです。特にAtlasの事前学習段階では、すでに膨大な量の動的なデータを取り込んでいます。今後は、このダイナミクスをさらに大きく改善し、4Dビデオの実現、つまり歩き回ったり、時間の流れの中での変化を完全に捉えたりできるような、より豊かな世界モデルへと進化させていくことが期待されます。
マルチモーダルな制御と編集可能性の飛躍
Atlasの将来の方向性として、マルチモーダルな側面を強化することが非常に重要視されています。様々な制御モードがここでの鍵となると考えられています。学術界では過小評価されがちですが、モデルの内側にあるものを引き出すためには、制御条件を付加することが非常に重要だからです。
この「動的」対「静的」という議論は、究極的には「編集可能性」の問題であると言えます。これは単一画像モデルで見られてきたことであり、今年からビデオモデルでも解禁されつつあります。マルチターンでのやり取りや、ユーザーが「この人物とこのオブジェクトで、こういうことが起こってほしい」と直感的に指示した内容を、システム側での煩雑な手作業なしに、一つの作品として統合的に表現できるようになりつつあります。
しかし、それがビデオ、そして世界モデルへと、同じレベルで浸透しているとはまだ言えません。最先端の画像モデルでは、編集という点でそれが実現されつつありますが、それを産業レベルの強度にまで引き上げることが目標です。ここでの肝は、モデルの品質を損なわずに制御性を高めることであり、それができなければ単なる一発芸に終わってしまうからです。余分な設定項目を追加したせいで品質が低下するようでは、誰もが今の最先端のビデオモデルから、わざわざ乗り換えようとは思いません。
したがって、現在のモデルで達成した高い水準の出力を維持しつつ、ユーザーが求めるような「シーンの操作」や「レイアウトの制御」、「オブジェクトの同一性の保持」、あるいは「時間の制御」といった興味深い機能をどう追加していくか、というゲームなのだと考えられます。そこが極めて面白いプロダクトやインターフェースの可能性を広げる領域であり、複雑さと豊かさを増すことで、コンピュータ上の状態を保持する3D世界との関わり方を、ゼロから再設計できるようになるのです。それこそが、そのようなシステムを構築するために必要なすべての機能を手に入れるという、最終的なゴールなのです。
知能の第一原理と「AI完全性」
WorldLabsは、単にモデルを大きくしたり高性能にしたりするだけでなく、知能の第一原理に立ち返るという、より根源的なビジョンを持っています。知能とは、空間や物理的空間に関わる際に、ただそこに留まって何かを見たり解釈したりすることではありません。それは、見ること、体験すること、そして相互作用することのループを閉じることなのです。
ここで興味深い概念が「AI完全性(AI-completeness)」という考え方です。LLMの文脈では、「次トークン予測」がAI完全であると言われています。これは、ある基本的なAIタスクが存在し、もしそのAIタスクを最大限の一般性で解くことができれば、あらゆる知能の問題を解決できる、という「緩やかな定義」に基づいています。イリヤが挙げた古典的な例のように、ミステリー小説をすべて読み終えた後の最後の文「そして犯人は……」を予測するというタスクは、基本的にあらゆる種類の知的なタスクをその枠組みで表現できるため、次トークン予測がAI完全であると信じられています。
しかし、WorldLabsが気づきつつあること、そして主張していることは、「新視点予測」、つまりAtlasが持つこのプリミティブ、特に生成的な新視点予測もまた、AI完全であるということです。なぜなら、例えば、映画のすべてのフレームを見て、犯人が歩き出てくる場面で、正確に誰が出てくるかを予測できる能力は、世界を深く理解し、その中で推論できる知能を必要とするからです。さらに壮大なビジョンとして、「マルティーヌが黒板にリーマン予想の証明を書いてるような世界を見たい」という例が挙げられました。これは、単なる視覚情報の生成を超え、抽象的な思考や知識までを空間内で表現・理解できるレベルの知能を示唆しています。
この主張の根拠を、WorldLabsは進化論的な視点からも説明しています。その新しい視点の予測こそが、動物を動かすことで進化が解決せざるを得なかった課題なのです。自然は動物に目を与えましたが、木に目を与えませんでした。なぜでしょう?動けば、新しい視点が得られるからです。それこそが、AI完全、あるいは知能完全と呼ばれるものです。WorldLabsは、「次の視点の予測」が「次のトークンの予測」と同等であると強く信じているのです。
結び
WorldLabsが発表した新世代ワールドモデル『Atlas』は、AIの進化における記念碑的な一歩です。LLMが言語の世界を再定義したように、Atlasは「新視点予測」という画期的なアプローチを通じて、視覚と空間の理解に革命をもたらそうとしています。
『マトリックス』のバレットタイム撮影の例が象徴するように、Atlasは従来の技術では想像もできなかった効率と精度で、現実世界をデジタルに再現し、操作することを可能にします。疎なデータから豊かな3D世界を再構築する能力は、クリエイティブ産業のワークフローを劇的に効率化し、デザイナーやアーティストに前例のない制御と表現の自由を与えます。
さらに、ロボット工学の分野では、Atlasが「リアル・トゥ・シム」のプロセスを革新し、データ問題の解決と堅牢なロボットポリシーの学習を加速させることで、より自律的で知的なロボットの実現に不可欠な基盤を築きます。
そして何よりも、「空間知能」と「AI完全性」というWorldLabsの壮大なビジョンは、Atlasが単なるツールではなく、知能の本質に迫る研究の成果であることを示唆しています。「次の視点の予測」が、言語における「次のトークン予測」と同様に、あらゆる知能の問題を解く鍵となりうるという考え方は、私たちのAIに対する認識を根底から変える可能性を秘めています。
Atlasの進化はまだ始まったばかりであり、その潜在能力は計り知れません。今後、このモデルがさらにスケールアップし、ダイナミクスと編集可能性を深めていく中で、私たちはロボティクス、3Dクリエイティブ、そして空間知能の分野で、想像をはるかに超える未来を目の当たりにすることになるでしょう。WorldLabsのAtlasは、間違いなく次世代AIの中心を担う存在として、私たちの世界に新たな視点と可能性をもたらしてくれるはずです。