Qwen-Image

Qwen-Image

Qwen-Image是由阿里通義千問團隊研發的200億參數圖像生成基礎模型,採用MMDiT架構,於2025年8月5日開源。2025年12月2日,阿里巴巴發布Qwen-Image的更新,新模型在圖像編輯的一致性,以及多視角轉換、多圖像融合、多模態推理等方面有所進展。2025年12月31日,阿里開源新一代圖像生成模型Qwen-Image-2512,該模型在人物肌膚質感、自然紋理還原與複雜文字渲染方面實現了提升,並支持生成漫畫風格PPT、數據信息圖等圖像。

Qwen-Image在文字渲染和圖像編輯方面具備能力。該模型支持中英文段落級文本渲染,能夠生成包含排版的海報、PPT頁面等。在GenEval、DPG、OneIG-Bench等基準測試中取得較高性能,在LongText-Bench、ChineseWord和TextCraft等文本渲染基準上,其中文文本渲染能力在測試中表現較好。該系列模型整合了多模態大語言模型Qwen2.5-VL和增強版VAE編碼器,通過多階段數據過濾與課程學習策略提升文本渲染精度,支持圖文混合生成及多種藝術風格切換。其圖像編輯功能包括調整人物姿勢,提取圖像紋理等。2025年8月15日,其最佳化版本Qwen-Image distilled在ComfyUI平台上線,支持在消費級顯示卡上運行。模型開源後曾位列Hugging Face榜單,並提供API接口。

基本介紹

  • 外文名:Qwen-Image
  • 產品類型:圖像生成基礎模型
  • 開發商:阿里通義千問團隊 
  • 發布時間:2025年8月5日  
發展歷史,功能簡介,

發展歷史

2025年8月訊息,通義千問發布了首個開源圖像生成基礎模型Qwen-Image。
2025年8月5日,阿里通義千問團隊宣布開源 Qwen-Image。
2025年8月15日,通義千問宣布,ComfyUI上線Qwen-Image distilled。
2025年12月31日,阿里巴巴發布圖片生成及編輯模型Qwen-Image的更新。新模型在圖像編輯中維持了更高的一致性,並在多視角轉換、多圖像融合、多模態推理等方面取得突破進展。
2025年12月31日,阿里開源了新一代圖像生成模型Qwen-Image-2512,該模型在人物肌膚質感、自然紋理還原和複雜文字渲染方面進行了改進,並支持生成漫畫風格PPT、數據信息圖等複雜圖像。

功能簡介

該模型在文本渲染方面具有較好的效果,支持中英文多行段落級高保真文本渲染,對複雜場景和細粒度細節具備處理能力。其新一代模型Qwen-Image-2512在人物肌膚質感與自然紋理還原方面有所提升。Qwen-Image具備一致性的圖像編輯能力,通過增強的多任務訓練範式,在編輯過程中能保持內容的一致性。
在GenEval、DPG、OneIG-Bench、GEdit、ImgEdit、GSO等多個公開基準測試中,Qwen-Image取得了較好的性能。在LongText-Bench、ChineseWord和TextCraft等文本渲染基準上,Qwen-Image在中文文本渲染方面的表現優於部分現有模型。Qwen-Image能夠渲染海報、PPT頁面等多種包含複雜文本和圖像組合的場景,並生成漫畫風格PPT、數據信息圖等複雜圖像。

相關詞條

熱門詞條

聯絡我們