GLM-Image

GLM-Image是由智譜與華為聯合開發的開源圖像生成模型,於2026年1月14日發布。台北時間1月15日晚,該模型登頂國際AI開源社區HuggingFace的趨勢榜第一。該模型基於華為昇騰Atlas800T A2設備與昇思MindSpore框架完成全流程訓練,是首個在國產晶片算力平台上開發的SOTA多模態模型。

模型採用“自回歸+擴散解碼器”混合架構,可同時進行文本到圖像和圖像到圖像生成,並具備中文理解與渲染能力。在CVTG-2K和LongText-Bench榜單中取得開源模型第一的排名,原生支持1024×1024至2048×2048解析度自適應生成。模型代碼已在GitHub、Hugging Face和魔搭社區開源。

基本介紹

  • 外文名:GLM-Image
  • 類型:圖像生成模型
發展歷史,開源與商用,科技簡介,技術特點,

發展歷史

2026年1月14日,智譜聯合華為開源新一代圖像生成模型GLM-Image。
該模型在國產晶片算力底座(華為昇騰 Atlas800T A2設備與昇思 MindSpore 框架)上完成了從數據預處理到大規模訓練的全流程,採用了“自回歸 + 擴散解碼器”混合架構。在多項複雜視覺文本生成任務中表現較好,並支持多種解析度圖像生成。模型已在GitHub和Hugging Face平台開源提供。
台北時間2026年1月15日晚,GLM-Image在國際AI開源社區HuggingFace的趨勢榜上排名第一。

開源與商用

GLM-Image已在GitHub和Hugging Face等平台開源。
2026年1月15日,GLM-Image在HuggingFace趨勢榜排名第一。
該模型計畫在未來推出經過最佳化的版本。
國際AI社區關注到中國開源模型使用量的增長,有中國企業正探索大模型在公共部門的接入。

科技簡介

GLM-Image基於昇騰Atlas 800T A2設備和昇思MindSpore AI框架完成從數據到訓練的全流程,是在國產晶片上完成訓練的多模態模型之一。
該模型採用自回歸與擴散解碼器混合架構,實現了圖像生成與語言模型的融合。在多項榜單中,該開源模型表現較好,支持從1024到2048尺寸的任意比例圖像生成。模型已在GitHub和Hugging Face等平台開源。

技術特點

GLM-Image採用了“自回歸 + 擴散解碼器”混合架構,實現了圖像生成與語言模型的結合。這一架構可套用于海報排版、PPT製作及複雜科普圖生成等生成任務。模型支持在單個模型中同時進行文本到圖像和圖像到圖像的生成。
GLM-Image具備中文理解與渲染能力,在多項複雜視覺文本生成的相關測試中展現了處理漢字生成任務的能力。該模型原生支持從1024到2048尺寸的任意比例圖像生成,無需額外訓練即可自適應多種解析度。
GLM-Image的全流程訓練基於華為昇騰Atlas800T A2設備與昇思MindSpore框架完成。

相關詞條

熱門詞條

聯絡我們