創新功能
● 輸入靈活性顯著提升,正式版支持多圖像和短視頻輸入,付費版本(月費20美元)新增多張圖片、短視頻及基礎3D結構輸入方式
● 新增實驗性3D編輯器Chisel,支持用戶通過簡單幾何體搭建場景框架後,使用文本提示自動填充細節內容
● 支持直接操控3D物體,實現真正的互動式編輯
● 支持多圖像提示拼接功能,可為世界不同部分提供不同提示圖像並融合成統一3D環境
● 生成場景支持通過VR設備在
WebXR中瀏覽,付費版本可導出高質量3D格線模型
● 擴展套用場景:作為機器人訓練的模擬環境,生成海量且多樣化的訓練數據(目前尚處於早期階段,類似於‘飛行模擬器’)
● 套用於精神病學研究,以極低成本改變環境維度,幫助研究人員對患有強迫症等心理障礙的人群進行觸發因素和治療方法的研究
● 服務於教育領域,幫助教師構建沉浸式學習體驗,為學生提供多樣化體驗
基本介紹
Marble是
World Labs於2025年11月13日正式推出的首款多模態世界模型產品,用戶可通過圖片、視頻、文本提示或3D布局創建高保真、可持久化的3D世界。該產品專注於創建持久化、可下載的3D環境,而非實時生成虛擬世界,並支持通過AI原生的互動式工具(如Chisel模式)進行局部或全局疊代編輯。這種技術路徑不僅能有效減少場景形變或不一致現象,還支持用戶將生成的世界以格線等多種格式導出。付費版本支持多張圖片、短視頻或基礎3D結構輸入,提供每月20美元的訂閱服務。其技術底座實時幀模型(
RTFM)可在單張H100 GPU上實現高效的3D空間推理,生成世界的物體具有恆常性,確保轉身後物體保持原狀。
Marble是業內首個同時提供AI原生編輯工具和混合3D編輯器的產品。用戶可先用簡單幾何體搭建場景框架,再藉助文本描述自動填充視覺細節,生成場景可通過VR設備在
WebXR中瀏覽。免費用戶所創場景將公開可見,訂閱後支持私有化存儲與管理。與注重隱式表征的模型不同,Marble刻意輸出顯式3D表征以滿足遊戲開發、
視覺特效等領域創作者的可視化需求,其內部仍包含隱式表征,形成混合架構。
如何使用Marble
Marble現在可以從多種輸入類型創建3D世界,並允許用戶疊代地編輯或擴展世界。用戶既可以從簡單的圖像或文本提示快速創建完整的3D世界,也可以在2D和3D中進行互動式編輯,精確地實現腦海中的世界構想。
用戶可在桌面端或手機端打開頁面,桌面端功能更多,會更有趣。
文本與圖像生成世界
最簡單的方式是通過單張圖片或簡短的文本提示創建3D世界。Marble能夠生成各種場景類型和藝術風格的世界。
圖像提示功能使得Marble可以輕鬆地與其他AI工具結合。用戶可以使用自己喜歡的圖像生成模型生成圖片,然後將其導入Marble,提升為一個完整的3D世界。
生成時間約為幾分鐘。
雖然文本和單圖提示直觀而強大,但在創作控制上有限,因為Marble必須自行創造輸入中未包含的所有細節。
多圖像與視頻生成世界
為了實現更強的創作控制,Marble支持多圖像提示。用戶可以為世界的不同部分提供不同的提示圖像,Marble會將它們拼接成一個統一的3D世界。付費版本支持更多輸入方式,包括多張圖片、短視頻或基礎3D結構,並可使用名為"Chisel"的場景編輯工具。
這種方式帶來了一種全新的工作流:用戶可以使用圖像生成工具分別疊代輸入視圖,然後由Marble將它們提升為完整的3D世界,並添加視圖間的無縫過渡。
此外,多圖像提示也可用於創建受現實世界啟發的空間。通過輸入幾張從不同角度拍攝的真實地點照片或一段短視頻,Marble會將其組合,生成一個包含現實空間元素的3D世界。
創作過程通常是高度疊代的。生成一個世界往往只是創作旅程的開始。Marble內置了AI原生的世界編輯工具。編輯可以是局部的,如移除一個物體或修補一個區域;也可以是全局性的,如替換物體、改變視覺風格或重構世界的大部分結構。
用戶可先用簡單幾何體搭建場景框架,再藉助文本描述自動填充細節,還可對生成場景進行擴展、組合,並導出為高質量3D格線模型。免費用戶所創場景將公開可見,訂閱後才支持私有化存儲與管理。
生成的世界可用於電影製作、遊戲開發、視覺特效等工作流程,以及機器人訓練模擬和精神病學研究等套用。
版本與服務
Marble提供免費和付費訂閱兩種服務模式。免費用戶可通過網頁版使用單張圖片或文字描述快速生成VR場景,但所創場景默認公開可見,且無法私有化存儲與管理;付費版本(月費20美元)支持多張圖片、短視頻、基礎3D結構等多種輸入方式,並提供"Chisel"場景編輯工具,允許用戶進行場景擴展、組合及導出高質量3D格線模型(轉換耗時數小時)。
付費用戶可通過簡單幾何體搭建場景框架後,使用文本描述自動填充細節,並享有私有化存儲許可權。免費版若使用單圖生成場景,畫面邊界外的內容將由AI自動補全(可能與實際不符),而多圖輸入可顯著提升場景一致性。
技術架構
基於實時幀模型(RTFM)構建,採用隱式表征與顯式表征混合架構:模型內部同時包含抽象隱式表征,而在輸出層生成可視化3D顯式表征,形成幾何一致的數字容器。支持多模態輸入範式,包括文本、圖像、視頻及粗略3D布局的聯合輸入,通過深度多模態學習構建空間表征。
模型實現
物體恆常性(Object Permanence)核心能力,確保生成空間的物體在視角變換時保持幾何與時間維度的一致性。與
楊立昆的隱式表征研究形成技術路徑差異,但強調兩者在構建通用世界模型中的最終互補性。
World Labs當前採用顯式輸出以滿足遊戲開發、視覺特效等領域創作者對可視化3D結果的需求。
研發方向聚焦於神經空間引擎(Neural Spatial Engine),目標融合
生成式AI的統計創造力與傳統
物理引擎的確定性規則,支撐動態3D互動世界構建。