Open-Sora 2.0

Open-Sora 2.0是由潞晨科技於2025年3月13日發布的開源視頻生成模型,採用11B參數的商業級架構實現視頻生成領域的重大突破。該模型通過3D自編碼器與多模態擴散架構的結合,支持文本到視頻、圖像到視頻的多樣化生成方式,可生成720p/24幀的高清視頻內容。相較於前代版本,其與OpenAI Sora閉源模型的性能差距從4.52%縮小至0.69%,訓練成本僅需20萬美元(224張GPU)且實現90%的成本縮減。作為全棧開源項目,已完整開放模型權重及訓練代碼。

基本介紹

  • 參數規模:11B商業級架構 
  • 訓練成本:20萬美元(224張GPU)
  • 發布時間:2025年3月13日 
  • 視頻規格:720p/24幀生成能力
  • 開源協定:完整開放模型權重  
  • 適用場景:多風格視頻創作
技術架構,性能突破,訓練最佳化,功能特性,開源生態,

技術架構

採用3D自編碼器架構融合全注意力機制,通過MMDiT多模態擴散架構實現時空關聯建模。其中動態解析度最佳化策略分階段處理視頻生成任務,先通過256px低解析度預訓練加速收斂,再擴展至720P高清輸出。物理細節建模誤差率控制在0.3%以內,如水花飛濺互動場景能保持物理合理性。

性能突破

在VBench基準測試中,與OpenAI Sora的性能差距縮小至0.69%,動作流暢度與文本一致性指標超越騰訊混元等30B參數閉源模型。單卡推理時間最佳化至3分鐘內,支持批量生成任務處理。通過ColossalAI框架實現80%顯存占用降低,模型並行效率顯著提升。

訓練最佳化

採用多階段數據篩選機制,構建包含480萬視頻片段的訓練數據集。實施低解析度優先訓練策略,通過圖生視頻任務引導模型學習時空特徵。分散式訓練方案結合梯度累積與混合併行技術,相較傳統方案提升3.2倍訓練效率。

功能特性

  • 支持文本描述(T2V)與靜態圖像(I2V)雙重輸入模式
  • 動作幅度控制系統實現0.1秒級運動軌跡微調
  • 高壓縮比自編碼器將視頻數據壓縮至原尺寸5%
  • 提供風格遷移接口支持多場景風格自定義

開源生態

開源內容包含模型權重、訓練代碼及分散式方案,配套提供Colab運行教程與開發者文檔。截至2025年3月13日,GitHub倉庫已獲得2200星標,形成包括數據預處理工具鏈、推理加速模組的完整技術棧。學術領域半年內產生近百篇相關研究論文引用。

相關詞條

熱門詞條

聯絡我們