科技簡介
RTFM可將單張圖像渲染成3D場景,一個模型可處理多種場景類型、視覺風格和效果,包括反射、陰影。該技術基於生成式視頻建模,訓練
神經網路將輸入圖像轉換為隱式的世界表征(KV快取),進而通過
注意力機制生成新視角下的連貫圖像。與後續產品Marble生成可下載的持久化3D環境不同,RTFM專注於實時動態生成場景,適用於需要即時互動的套用場景。該方法將每一幀與其在三維空間中的姿態綁定,使模型能夠在生成新幀時依據目標姿態從已有的空間記憶中檢索鄰近幀,構建局部上下文。該模型曾以預覽版形式開放用戶體驗。截至2025年11月,
World Labs在完成2.3億美元融資並結束隱身模式後,推出了RTFM的後續產品——商用世界模型Marble,標誌著公司從實時動態生成(RTFM)向持久化可編輯3D環境生成的技術路線演進。
產品特點
擴展性方面,傳統3D圖形管線依賴人工設計的顯式三維模型(如三角格線、高斯貼圖)和算法,對幾何、材質、光照等進行精確建模,再渲染為二維圖像。該方法雖成熟,但在處理大規模數據時擴展性受限。
而RTFM採用了一種基於生成式視頻建模的創新方法,其核心是一個經端到端訓練的神經網路。它僅輸入場景的二維圖像,無需構建顯式三維模型,即可從新視角生成對應圖像。
該技術基於生成式視頻建模,訓練一個
神經網路將輸入圖像轉換為一種隱式的世界表征(KV快取),進而通過
注意力機制直接從該表征中讀取信息,來生成新視角下的連貫圖像。這意味著複雜的光照、反射等效果並非由人工規則定義,而是通過從數據中學習自動掌握。
RTFM還有一個重要特性是模糊了重建與生成的傳統界限:當輸入視圖充足時,系統傾向於精確重建;當輸入視圖稀疏時,它則能進行合理的內容推演與生成。
另外,現實世界具有持久性:當視線移開時,場景不會消失或重置,人們可以隨時返回之前的位置。這一特性對自回歸幀模型構成了顯著挑戰。由於此類模型僅通過二維圖像幀序列隱式地表示世界,隨著探索範圍擴大,需要處理的幀數量持續增長,導致每一幀的生成成本不斷累積,模型的“記憶容量”實際上受限於可用的計算資源。
RTFM的上下文切換機制通過動態載入局部上下文幀,在單H100 GPU下實現計算資源線性增長(
World Labs技術白皮書,2025)。
RTFM通過引入“姿態幀”作為空間記憶,有效突破了這一限制。該方法將每一幀與其在三維空間中的姿態綁定,使模型能夠在生成新幀時依據目標姿態從已有的空間記憶中檢索鄰近幀,構建局部上下文。這種設計為模型提供了一個弱空間先驗—即世界處於三維歐氏空間中,而無需顯式進行幾何重建,既降低了建模複雜度,也增強了對場景結構的理解。
為實現高效運行,RTFM採用了上下文調度機制,在不同空間區域生成圖像時動態切換所使用的上下文幀,稱為“上下文切換”。這一策略使模型無需在處理新幀時載入全部歷史數據,從而支持大規模場景的持久維護,實現所謂“無限持久性”。通過將幀組織為具有空間結構的記憶系統,RTFM在長期互動中能夠保持場景一致性,同時顯著提升生成效率和可擴展性。
科技簡介
RTFM(Real-Time Frame Model,實時幀模型)是由
李飛飛團隊
World Labs於2025年10月17日發布的全新實時生成式世界模型。該模型基於生成式視頻建模技術,採用基於大規模視頻數據進行端到端訓練的自回歸擴散Transformer架構,通過輸入單張或多張2D圖像生成同一場景下新視角的2D圖像,無需構建顯式三維表征。其核心設計遵循高效性(單塊H100 GPU實現60幀4K互動視頻流)、可擴展性(通用端到端架構適配算力增長)和持久性(無限持久性場景維護)三大原則。
產品特點
RTFM通過位姿幀空間記憶系統構建隱式世界表征,結合上下文調度技術動態檢索鄰近幀形成定製化上下文,實現大規模場景的3D一致性維護。該模型採用“
上下文切換”策略在不同空間區域生成圖像時動態切換上下文幀,避免載入全部歷史數據。通過全棧推理堆疊最佳化融合架構設計、模型蒸餾與推理最佳化技術,實現在單塊H100 GPU上同步完成高保真3D世界渲染與用戶實時互動,每秒需處理超過10萬個token。
架構演進方向
李飛飛在2025年11月指出,當前Transformer架構存在物理因果推理的局限性。例如,AI生成的物理現象(如重力、碰撞)多源於統計規律的模仿,而非對物理定律的因果理解。現有架構難以產生如"
相對論"般的高級抽象,這需要將隱式表征與顯式表征融合,形成混合架構體系。基於
World Labs提出的"神經空間引擎"(Neural Spatial Engine)構想,實時幀模型的演進將融合傳統物理引擎(如
Unreal)的確定性規則與生成式AI的統計創造力。該技術路線強調顯式3D表征輸出,服務於遊戲開發、建築設計和視覺特效領域的人類創作者需求。
技術路徑
李飛飛預測未來五年(2030年前)行業需要實現架構突破,使AI從統計相關性跨越到因果邏輯。具體技術路徑包括:構建支持線上學習的混合架構;實現多模態輸入與物理法則的深度整合;在單H100 GPU算力約束下保持3D空間推理效率。該預測基於當前RTFM模型中已實現的"
物體恆常性"技術基礎。
混合表征體系
RTFM採用隱式與顯式表征雙重架構。模型內部包含隱式表徵用於物理規律學習,同時顯式輸出可視化3D空間以滿足創作者需求,這體現了
李飛飛提出的"混合表征體系"理論框架。