Imagen是由谷歌公司開發的基於擴散模型的文本生成圖像人工智慧系統,通過整合大型語言模型與視覺生成技術實現高保真圖像生成。2023年12月發布的Imagen 2首次引入視覺問答能力和複雜概念可視化功能,支持文本精準渲染與局部圖像編輯。2024年5月推出的基礎版本在光線渲染、噪點控制方面取得突破,實現15秒內從草圖生成4K圖像的技術跨越。2024年12月發布的Imagen 3新增多藝術風格適配能力,在構圖平衡與細節表現力上超越同期主流模型。2025年5月疊代的Imagen 4將生成速度提升10倍,新增專業設計支持功能實現複雜排版的海報級輸出。
基本介紹
- 開發者:谷歌公司
- 核心技術:擴散模型架構
- 首發時間:2023年12月
- 最高解析度:4K級別
- 疊代版本:4代
- 套用領域:創意設計
技術架構
核心功能
- 支持自然語言提示轉換為高解析度圖像,可輸出4K級別畫質
- 實現像素級畫面控制,允許通過草圖快速生成完整圖像
- 具備視覺問答能力,可為生成圖像創建長文本標註並回答問題
- 支持圖像修復與擴圖功能,保持原始畫面風格一致性
- 生成含特定文字圖像時確保字元準確性,支持品牌Logo生成
