CogView4是智譜公司於2025年3月4日發布的首個支持生成漢字並遵循Apache 2.0協定的開源文生圖模型。該模型採用GLM-4雙語編碼器替代傳統英文編碼器,實現了對中英雙語提示詞的深度理解,在DPG-Bench基準測試中綜合評分排名第一,達到開源領域最先進水平(SOTA)。其技術突破包括支持1024 Tokens超長提示詞輸入、任意解析度圖像生成(512×512至2048×2048)以及直接在畫面中嵌入漢字的能力。作為智譜2025開源年計畫的首個成果,CogView4已套用於廣告設計、古詩意境還原等創意領域,並計畫推出ControlNet外掛程式和ComfyUI支持。
基本介紹
- 開發者:智譜
- 發布時間:2025年3月4日
- 開源協定:Apache 2.0
- 參數規模:60億
- 支持語言:中英雙語
- 套用領域:廣告設計、教育插圖
技術特性,套用場景,開源生態,
技術特性
- 採用GLM-4雙語編碼器架構,通過中英雙語圖文聯合訓練提升語義對齊能力,解決了傳統英文編碼器處理中文的局限性
- 支持任意解析度圖像生成,用戶在輸入提示詞時可自由設定圖像尺寸參數(512×512至2048×2048),提升創作靈活性
- 套用多階段訓練策略和Variational Auto-Encoder(VAE)技術,結合擴散模型與Transformer架構,生成圖像穩定性顯著提高
- 通過模型CPU卸載和文本編碼器量化技術,顯存占用降低30%以上,推理效率提升至每秒處理5個並發請求
套用場景
- 廣告設計:可直接生成帶有篆體文字、水墨元素等中國文化符號的商業海報,支持廣告文案到成品的一鍵轉換
- 教育出版:還原古詩場景(如“野徑雲俱黑”生成江船夜景插圖),輔助編寫兒童繪本的數字繪畫內容
- 影視創作:將劇本自動轉化為分鏡漫畫,支持導演預演鏡頭構圖與場景布局
- 社交媒體:為短視頻創作者提供定製化背景圖,實現中文標語與視覺元素的自然融合
開源生態
- 遵循Apache 2.0協定開源,允許商業機構免費使用及二次開發,降低中小團隊接入成本
- 計畫推出全套微調工具包,支持用戶通過LoRA技術定製模型風格,適配不同行業需求
- 將於2025年3月13日正式上線智譜清言平台
- 作為智譜多模態開源計畫的首個模型,後續將開源基礎模型、推理框架及Agent模型,構建AI創作工具生態

