Open-Sora 2.0是由潞晨科技於2025年3月13日發布的開源視頻生成模型,採用11B參數的商業級架構實現視頻生成領域的重大突破。該模型通過3D自編碼器與多模態擴散架構的結合,支持文本到視頻、圖像到視頻的多樣化生成方式,可生成720p/24幀的高清視頻內容。相較於前代版本,其與OpenAI Sora閉源模型的性能差距從4.52%縮小至0.69%,訓練成本僅需20萬美元(224張GPU)且實現90%的成本縮減。作為全棧開源項目,已完整開放模型權重及訓練代碼。
基本介紹
- 參數規模:11B商業級架構
- 訓練成本:20萬美元(224張GPU)
- 發布時間:2025年3月13日
- 視頻規格:720p/24幀生成能力
- 開源協定:完整開放模型權重
- 適用場景:多風格視頻創作
技術架構
性能突破
訓練最佳化
功能特性
- 支持文本描述(T2V)與靜態圖像(I2V)雙重輸入模式
- 動作幅度控制系統實現0.1秒級運動軌跡微調
- 高壓縮比自編碼器將視頻數據壓縮至原尺寸5%
- 提供風格遷移接口支持多場景風格自定義
