Qwen2-57B-A14B是阿里雲通義千問團隊於2024年6月7日發布的Qwen2系列大模型之一,採用混合專家架構(MoE)設計。該模型總參數規模達570億,其中激活參數為140億,支持最高128K tokens的長上下文處理能力,並在自然語言理解、代碼生成、數學推理等多項基準測試中超越主流開源模型。作為開源模型,Qwen2-57B-A14B通過Hugging Face和ModelScope平台公開,採用Apache 2.0許可協定支持商業套用。
基本介紹
- 所屬系列:Qwen2大模型系列
- 模型架構:混合專家(MoE)
- 發布時間:2024年6月7日
- 參數規模:57B-A14B(總570億)
- 支持語言:30餘種語言
- 開源平台:Hugging Face/ModelScope
技術架構,訓練與最佳化,性能評估,套用部署,
技術架構
採用改進的Transformer架構,集成SwiGLU激活函式、注意力QKV偏置及組查詢注意力最佳化技術。作為混合專家模型,每個token通過細粒度路由機制選擇激活14個專家中的部分參數,包含共享專家與路由專家的協同工作機制。鍵值記憶體占用較前代降低30%,支持擴展至128K tokens的長上下文處理。
訓練與最佳化
基於覆蓋30餘種語言的7萬億tokens數據集進行預訓練,新增27種語言的高質量數據。通過監督微調(SFT)和直接偏好最佳化(DPO)完成指令對齊,使用超50萬示例數據集覆蓋編碼、數學、安全等場景。採用雙塊注意力機制(DCA)與YARN擴展方法最佳化長文本處理能力。
性能評估
在自然語言理解任務中達到Yi-1.5 34B同等水平,中文理解能力接近Qwen2-72B旗艦模型。編碼和數學任務表現優於同規模基線模型,64K tokens上下文場景下多跳推理準確率提升23%。作為MoE架構模型,前向傳播僅激活140億參數即可達到300億參數密集模型的性能水平。
套用部署
要求Hugging Face transformers庫版本≥4.40.0以保障兼容性,推薦使用Qwen2-57B-A14B-Instruct作為基礎指令微調版本。提供ModelScope平台的快速部署代碼示例,支持FP16/Int4量化版本,但GPTQ量化暫不兼容vLLM推理框架。截止2025年2月,已發布Qwen2-57B-A14B-Instruct-GPTQ-Int4等衍生版本。
