Emu3是由北京智源人工智慧研究院研發的原生多模態世界模型,實現了文本、圖像、視頻三種模態的統一理解與生成能力。該模型採用基於下一個token預測的技術範式,將不同模態數據轉化為離散令牌序列進行自回歸訓練,無需依賴擴散模型或組合式方法。2024年10月21日正式發布後,Emu3在MSCOCO-30K等四大圖像生成基準評測中超越主流開源模型,並在視覺語言理解任務中保持領先地位。
基本介紹
- 所屬機構:北京智源人工智慧研究院
- 發布時間:2024年10月21日
- 技術路徑:下一個token預測
- 模態支持:文本、圖像、視頻
- 開源狀態:已開放模型代碼
技術架構
性能表現
- 圖像生成:截至2024年10月,在MSCOCO-30K等數據集評測中,Emu3生成質量優於SDXL等擴散模型,尤其在密集標註任務中表現突出。
- 視覺語言理解:在多個公共基準數據集上超越LLaVA系列模型,無需CLIP編碼器或大語言模型支持。
- 視頻生成:性能與多數開源模型相當,支持動態內容生成與語義解析,輸出結果可通過直接偏好最佳化技術調整。
