GLM-4.5V

GLM-4.5V

GLM-4.5V是由智譜於2025年8月11日推出的開源視覺推理模型,總參數規模106B,激活參數12B,在魔搭社區與Hugging Face平台開源。該模型基於智譜新一代旗艦文本模型GLM-4.5-Air開發,延續GLM-4.1V-Thinking技術路線,在41個公開視覺多模態任務中取得同級別開源模型最佳表現,涵蓋圖像、視頻、文檔理解及GUI Agent等套用場景。GLM-4.5V通過混合訓練實現多場景視覺推理能力,新增“思考模式”功能支持快速回響與深度推理切換。智譜將該模型API定價定為輸入2元/M tokens、輸出6元/M tokens。

基本介紹

  • 外文名:GLM-4.5V
  • 所屬公司 :智譜
發展歷史,套用場景,模型簡介,

發展歷史

2025年8月11日,智譜正式推出開源視覺推理模型GLM-4.5V。

套用場景

GLM-4.5V作為智譜推出的視覺推理模型,在AI手機領域實現套用。GLM-4.5V具備強大的螢幕理解與操作執行能力,可穩定應對長達數十步的複雜任務流程,支持微信、淘寶、抖音、美團等超過50個高頻中文套用的核心場景。用戶通過語音指令即可觸發AI自主完成點外賣、訂機票、查房源等操作。通過虛擬手機安全隔離方案確保動作可回放、審計和干預,數據嚴格隔離以保障隱私安全。

模型簡介

GLM-4.5V總參數106B,激活參數12B,在多個多模態榜單達到SOTA性能,並同步在魔搭社區與Hugging Face開源。其API 調用價格為輸入2元/M tokens,輸出6元/M tokens。
GLM-4.5V 基於智譜新一代旗艦文本基座模型 GLM-4.5-Air,延續 GLM-4.1V-Thinking 技術路線,在 41 個公開視覺多模態榜單中綜合效果達到同級別開源模型 SOTA 性能,涵蓋圖像、視頻、文檔理解以及 GUI Agent 等常見任務。
通過高效的混合訓練方式,GLM-4.5V 展現出對多種視覺內容的處理能力,可完成多場景的視覺推理任務,包括:圖像推理(如場景識別、多圖複雜分析、位置判斷);視頻理解(如長視頻鏡頭拆分、事件識別);GUI 操作(如螢幕信息讀取、圖示識別、界面操作輔助);圖表與文檔解析(如研究報告解讀、信息提取);視覺元素定位(實現精準的 grounding 識別)。此外,GLM-4.5V 新增“思考模式”功能,用戶可根據需求在快速回響與深度推理之間自由切換,兼顧效率與準確性。

相關詞條

熱門詞條

聯絡我們