Qwen-Image是由阿里通義千問團隊研發的200億參數圖像生成基礎模型,採用MMDiT架構,於2025年8月5日開源。2025年12月2日,阿里巴巴發布Qwen-Image的更新,新模型在圖像編輯的一致性,以及多視角轉換、多圖像融合、多模態推理等方面有所進展。2025年12月31日,阿里開源新一代圖像生成模型Qwen-Image-2512,該模型在人物肌膚質感、自然紋理還原與複雜文字渲染方面實現了提升,並支持生成漫畫風格PPT、數據信息圖等圖像。
Qwen-Image在文字渲染和圖像編輯方面具備能力。該模型支持中英文段落級文本渲染,能夠生成包含排版的海報、PPT頁面等。在GenEval、DPG、OneIG-Bench等基準測試中取得較高性能,在LongText-Bench、ChineseWord和TextCraft等文本渲染基準上,其中文文本渲染能力在測試中表現較好。該系列模型整合了多模態大語言模型Qwen2.5-VL和增強版VAE編碼器,通過多階段數據過濾與課程學習策略提升文本渲染精度,支持圖文混合生成及多種藝術風格切換。其圖像編輯功能包括調整人物姿勢,提取圖像紋理等。2025年8月15日,其最佳化版本Qwen-Image distilled在ComfyUI平台上線,支持在消費級顯示卡上運行。模型開源後曾位列Hugging Face榜單,並提供API接口。
基本介紹
- 外文名:Qwen-Image
- 產品類型:圖像生成基礎模型
- 開發商:阿里通義千問團隊
- 發布時間:2025年8月5日

