Emu3

Emu3是由北京智源人工智慧研究院研發的原生多模態世界模型,實現了文本、圖像、視頻三種模態的統一理解與生成能力。該模型採用基於下一個token預測的技術範式,將不同模態數據轉化為離散令牌序列進行自回歸訓練,無需依賴擴散模型或組合式方法。2024年10月21日正式發布後,Emu3在MSCOCO-30K等四大圖像生成基準評測中超越主流開源模型,並在視覺語言理解任務中保持領先地位。

基本介紹

  • 所屬機構:北京智源人工智慧研究院
  • 發布時間:2024年10月21日
  • 技術路徑:下一個token預測
  • 模態支持:文本、圖像、視頻
  • 開源狀態:已開放模型代碼
技術架構,性能表現,套用前景,開源生態,

技術架構

Emu3採用單一Transformer架構,通過視覺tokenizer將圖像和視頻編碼為離散空間令牌,與文本令牌共同構成混合序列進行聯合訓練。模型嵌入層擴展以兼容視覺令牌,使用RMSNorm、分組查詢注意力機制等技術提升處理效率。通過自回歸預測機制實現Any-to-Any模態轉換,構建統一的“新語言”表達體系。
2024年10月發布的版本採用兩階段訓練方案:第一階段整合文本與圖像數據,第二階段引入視頻數據並使用131,072令牌的超長上下文長度,藉助並行技術最佳化處理速度。

性能表現

  • 圖像生成:截至2024年10月,在MSCOCO-30K等數據集評測中,Emu3生成質量優於SDXL等擴散模型,尤其在密集標註任務中表現突出。
  • 視覺語言理解:在多個公共基準數據集上超越LLaVA系列模型,無需CLIP編碼器或大語言模型支持。
  • 視頻生成:性能與多數開源模型相當,支持動態內容生成與語義解析,輸出結果可通過直接偏好最佳化技術調整。

套用前景

Emu3的簡單架構設計可復用現有訓練資源,降低多模態大模型的產業化門檻。北京智源人工智慧研究院院長王仲遠指出,該模型為機器人大腦、自動駕駛等場景提供技術基礎,推動多模態AGI發展。

開源生態

研究團隊開源了模型代碼、訓練數據集及基於ms-swift框架的微調方案,促進多模態領域技術疊代。模型參數和訓練數據已公開,驗證了自回歸框架與DPO技術的兼容性。

相關詞條

熱門詞條

聯絡我們