李飛飛 World Labs 推出 Atlas:3 支 iPhone 就能做《駭客任務》子彈時間
World Labs 近日推出新一代世界模型 Atlas。團隊表示,Atlas 不只是生成影片,而是能同時進行「生成(Generate)、重建(Reconstruct)與模擬(Simulate)」,並透過相機位置、影像與 3D 空間資訊理解一個場景。
(AI 教母李飛飛是誰?新創獨角獸 World Labs 融資獲輝達、AMD 支持)
最直觀的展示之一,是經典電影《駭客任務》(The Matrix)的「子彈時間」。
過去拍攝 Neo 向後閃躲子彈、攝影機環繞人物旋轉的畫面,需要在綠幕攝影棚架設數百台相機,同時從不同角度捕捉畫面。但 World Labs 表示,Atlas 最少只需要 3 台相機,甚至可以只是把 3 支 iPhone 架在腳架上拍攝,就能重新生成攝影機環繞場景的不同視角。
團隊舉例,無論是人物投籃,或草莓掉進牛奶濺起液體,只要從數個角度拍攝,Atlas 就能讓虛擬攝影機進入原本沒有實際拍攝的位置,重新生成「時間凍結後攝影機穿梭其中」的畫面。
Atlas 不只是影片生成,還能理解空間
Atlas 與目前主流 AI 影片模型最大的差別,在於 World Labs 強調其輸入影像具有明確的「空間意義」。
一般生成式影片模型收到一張圖片後,模型可以根據自身理解推測場景,再透過文字 Prompt 控制結果;Atlas 則會把每張影像與其對應的 3D 相機姿態(camera pose) 綁定。
也就是說,模型不只是知道「這是一張房間的照片」,還知道:這張照片是從房間哪一個位置、哪一個角度拍攝的。
如此一來,多張影像便能共同形成 World Labs 所稱的 Spatial Context(空間脈絡)。
使用者接著可以把一台「虛擬攝影機」放進場景中的任意位置與時間點,要求 Atlas 預測從該位置看出去,世界應該呈現什麼模樣。World Labs 將這套機制稱為 New View Prediction。團隊甚至認為,這可能成為空間智慧(Spatial Intelligence)的基礎能力之一。
把「3D 重建」與「生成式 AI」放進同一個模型
Atlas 另一項重要改變,是 World Labs 試圖把長期分離的兩個電腦視覺領域整合起來:3D Reconstruction 與 Generative AI。
傳統 3D 重建必須忠實還原現實世界,因此通常需要大量照片,從不同角度對同一個物體進行三角測量;生成式 AI 則恰好相反,它最擅長的是「不存在的東西」。
World Labs 認為,真正理解空間的 AI 必須同時具備兩者。
Atlas 因此從預訓練階段,就原生支援文字、圖片、影片、相機姿態以及 3D 資訊。目前 3D 資訊主要透過 Depth Map(深度圖)表示,讓模型同時知道某個畫面的 RGB 像素內容,以及畫面背後的空間結構。
李飛飛認為,這代表電腦視覺長期分開發展的「像素生成」與「3D 重建」開始被統一。對 World Labs 而言,關鍵在於產生真正具有空間脈絡、並且被幾何結構約束的 Pixel。這也是公司走向 Spatial Intelligence 的重要一步。
3D 掃描從數百張照片,降低到幾張照片
這項技術也可能改變 3D 內容製作的成本結構。
傳統 NeRF、Gaussian Splatting 等 3D Reconstruction 工作流程,最大的問題之一就是需要「Dense Capture」。
World Labs 共同創辦人、NeRF 作者之一 Ben Mildenhall 舉例,要完整掃描一個房間,可能需要拍攝 100、200 甚至 300 張照片,因為桌底、椅腳之間、植物葉片後方等區域都必須有足夠影像覆蓋。
對沒有經驗的使用者而言,掃描多房間空間甚至可能花上一、兩個小時。
Atlas 想把這件事從數百張照片降到幾張照片。
Mildenhall 表示,團隊正在嘗試把需要的拍攝量降低到約 **3 張影像**,形容這可能相當於 **50 至 100 倍的資料量下降**。
原因在於,Atlas 可以先用實際影像重建能確定的部分,再利用生成能力補足從未被相機拍到的空間。
World Labs 展示的史丹佛校園案例中,模型僅利用地面拍攝的 3 至 25 張照片,就能生成從空中觀看校園的視角;而一些原本需要約 2,000 張照片重建的多房間場景,團隊表示目前可縮減至約 30 至 40 張輸入影像。
這正是生成式 AI 與 3D Reconstruction 結合的意義:
如果某個地方從來沒有被鏡頭拍到,傳統 Reconstruction 原則上只能留下「洞」;生成模型則可以根據空間上下文推測缺失內容。
從電影、遊戲一路進入建築與工業設計
Atlas 第一批最直接的應用仍然是內容產業。
World Labs 前一代產品 Marble 已經可以把圖片、影片或文字轉換為 Gaussian Splat 3D 世界,但團隊觀察到,不少創作者其實只是:輸入一張圖片 → 生成完整 3D 場景 → 從不同角度截圖 → 離開 Marble。
這讓團隊意識到,創作者真正需要的未必是一個完整的 3D 資產,Atlas 因此直接把 New View Prediction 做成模型核心能力。
這對電影、廣告、遊戲與視覺設計尤其重要。現在許多 AI 圖片與影片模型雖然可以生成不同視角,但場景中的家具、人物與物件位置往往會隨生成結果漂移。
World Labs 希望建立的是一個「Persistent 3D State」——物件的位置與身份能持續存在,創作者只是移動攝影機,而不是每次重新抽一次生成結果。
更進一步,World Labs 認為這套能力可以進入建築、施工、展場設計甚至工業設計。
李飛飛下一站瞄準機器人
但 Atlas 更大的野心並不是好萊塢,而是 Robotics。
World Labs 此前收購機器人公司 Cinex,核心技術之一便是 Real-to-Sim、Sim-to-Real。
(World Labs 收購美國機器人新創 SceniX!空間智慧走向實體世界)
例如企業想訓練一支機器手臂進行線材組裝,必須先把真實工廠環境重建成模擬環境,再讓機器人大量訓練。
問題在於建立這些模擬環境非常昂貴。李飛飛直言,目前機器人產業最大的問題其實是數據。真實世界的機器人操作資料難以取得,而且模型不能只學會一種標準情況。
一條電線可能朝不同方向彎曲、箱子可能有不同尺寸與顏色、物體可能位於場景不同位置,因此模擬環境還必須大量進行 Domain Randomization,產生各式各樣的變化。
Atlas 的 Sparse Reconstruction 能力,正好可以降低把真實世界轉換為模擬環境的成本。
更長期而言,World Labs 希望 Atlas 不只是「建立模擬環境」,而是本身成為 Neural Simulator。
模型如果可以理解「對世界採取某個 Action 後,世界接下來會變成什麼樣子」,就能模擬機器人在真實環境中可能遇到的異常狀況。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



