GLM-4.7-Flash是智譜於2026年1月20日發布並開源的混合思考模型,總參數量30B,激活參數量3B,採用MoE架構與MLA技術,定位為“本地編程與智慧型體助手”。該模型通過僅激活3B參數實現輕量化部署,支持200K上下文視窗,在蘋果M5晶片設備上可達43 token/s運行速度,並提供FP16至Q4_K_M量化選項。
該模型在SWE-bench Verified代碼修複測試中獲得59.2分,在τ-Bench等基準測試中超越Qwen3-30B和GPT-OSS-20B等競品。其編程能力覆蓋前後端任務開發、多技術棧整合,支持自主需求理解與方案拆解。通用場景表現涵蓋中文寫作、翻譯、長文本處理及角色扮演,支持多輪對話的上下文保持與約束條件遵循。模型通過智譜開放平台提供免費API調用,並已獲得HuggingFace、vLLM等平台適配支持。
基本介紹
- 外文名:GLM-4.7-Flash
- 開源時間:2026年1月20日
