Qwen-7B是阿里雲通義千問系列推出的開源大語言模型,基於Transformer架構研發,使用超過2萬億token的多語言數據進行預訓練。該模型支持中英文文本生成、代碼理解與創作等任務,在MMLU、C-Eval等多項基準測試中超越同規模開源模型表現。2023年8月通過魔搭社區等平台開源後,累計下載量突破100萬次,衍生出50餘款套用。
基本介紹
- 參數規模:70億參數
- 訓練數據:2.4萬億token
- 上下文長度:支持擴展到8K
- 開源時間:2023年8月
- 開源協定:免費可商用
- 模型架構:Transformer
技術特性
性能表現
- MMLU英文綜合測試得分58.8分,超越大部分同規模模型
- C-Eval中文測試得分69.9分,優於同等參數規模開源模型
- HumanEval代碼生成測試得分33.1分,達到商用水平
- 2023年9月性能升級後,數學解題準確率最高提升22.5%
開源生態
套用案例
- 教育領域:浙江大學基於Qwen-7B開發"智海-三樂"教育大模型,在12所高校實現智慧型問答與試題生成功能
- 機器人集成:浙江有鹿機器人公司將模型嵌入清潔機器人系統,實現自然語言互動與任務規劃
- 金融場景:開發者利用公開金融數據集進行微調,構建專業領域的智慧型分析工具
- 消費硬體:通過量化壓縮技術實現在消費級顯示卡部署,支持本地化對話服務
部署要求
- CPU:AMD EPYC 7R32處理器或同級產品
- 記憶體:最低64GB DDR4
- 存儲:至少100GB可用空間
- 作業系統:Alibaba Cloud Linux 3或Ubuntu 20.04開發環境需安裝Python 3.8、PyTorch 2.0及ZenDNN加速庫。
