發展歷史
2026年1月14日,智譜聯合華為開源新一代圖像生成模型GLM-Image。
該模型在國產晶片算力底座(華為昇騰 Atlas800T A2設備與昇思 MindSpore 框架)上完成了從數據預處理到大規模訓練的全流程,採用了“自回歸 + 擴散解碼器”混合架構。在多項複雜視覺文本生成任務中表現較好,並支持多種解析度圖像生成。模型已在GitHub和
Hugging Face平台開源提供。
開源與商用
該模型計畫在未來推出經過最佳化的版本。
國際AI社區關注到中國開源模型使用量的增長,有中國企業正探索
大模型在公共部門的接入。
科技簡介
GLM-Image基於昇騰Atlas 800T A2設備和昇思MindSpore AI框架完成從數據到訓練的全流程,是在國產晶片上完成訓練的多模態模型之一。
該模型採用自回歸與擴散解碼器混合架構,實現了圖像生成與語言模型的融合。在多項榜單中,該開源模型表現較好,支持從1024到2048尺寸的任意比例圖像生成。模型已在GitHub和Hugging Face等平台開源。
技術特點
GLM-Image採用了“自回歸 + 擴散解碼器”混合架構,實現了圖像生成與語言模型的結合。這一架構可套用于海報排版、PPT製作及複雜科普圖生成等生成任務。模型支持在單個模型中同時進行文本到圖像和圖像到圖像的生成。
GLM-Image具備中文理解與渲染能力,在多項複雜視覺文本生成的相關測試中展現了處理漢字生成任務的能力。該模型原生支持從1024到2048尺寸的任意比例圖像生成,無需額外訓練即可自適應多種解析度。
GLM-Image的全流程訓練基於華為昇騰Atlas800T A2設備與昇思MindSpore框架完成。