Qwen-7B

Qwen-7B是阿里雲通義千問系列推出的開源大語言模型,基於Transformer架構研發,使用超過2萬億token的多語言數據進行預訓練。該模型支持中英文文本生成、代碼理解與創作等任務,在MMLU、C-Eval等多項基準測試中超越同規模開源模型表現。2023年8月通過魔搭社區等平台開源後,累計下載量突破100萬次,衍生出50餘款套用。

基本介紹

  • 參數規模:70億參數   
  • 訓練數據:2.4萬億token 
  • 上下文長度:支持擴展到8K 
  • 開源時間:2023年8月 
  • 開源協定:免費可商用  
  • 模型架構:Transformer  
技術特性,性能表現,開源生態,套用案例,部署要求,

技術特性

基於Transformer架構構建,採用RoPE位置編碼和SwiGLU激活函式,支持通過NTK插值方法將上下文處理長度擴展至8K tokens。訓練數據包含網路文本、專業書籍、代碼等超過2.4萬億token的多樣化語料,採用15萬token的詞表設計提升多語言處理效率。
模型支持FP16、Int8、Int4等多種精度量化部署,單卡運行最低需24GB顯存。通過阿里雲PAI平台可進行微調訓練,使用Swift工具實現LoRA微調時需配置約24GB顯存。

性能表現

在主流基準測試中展現卓越能力:
  • MMLU英文綜合測試得分58.8分,超越大部分同規模模型
  • C-Eval中文測試得分69.9分,優於同等參數規模開源模型
  • HumanEval代碼生成測試得分33.1分,達到商用水平
  • 2023年9月性能升級後,數學解題準確率最高提升22.5%

開源生態

2023年8月3日通過魔搭ModelScope平台首發開源,同步在Hugging Face、GitHub等平台發布Qwen-7B-Base基礎模型和Qwen-7B-Chat對話模型,參數規模為70億。開源一個月內下載量突破100萬次,截至2023年9月累計衍生出50餘款套用。
配套提供靈積平台API調用服務,支持開發者通過阿里雲靈駿智算集群進行分散式訓練,訓練效率較常規方案提升10倍。開源社區已形成包含視覺模型Qwen-VL、音頻模型Qwen-Audio的多模態體系。

套用案例

  • 教育領域:浙江大學基於Qwen-7B開發"智海-三樂"教育大模型,在12所高校實現智慧型問答與試題生成功能
  • 機器人集成:浙江有鹿機器人公司將模型嵌入清潔機器人系統,實現自然語言互動與任務規劃
  • 金融場景:開發者利用公開金融數據集進行微調,構建專業領域的智慧型分析工具
  • 消費硬體:通過量化壓縮技術實現在消費級顯示卡部署,支持本地化對話服務

部署要求

硬體環境需滿足以下配置:
  • CPU:AMD EPYC 7R32處理器或同級產品
  • 記憶體:最低64GB DDR4
  • 存儲:至少100GB可用空間
  • 作業系統:Alibaba Cloud Linux 3或Ubuntu 20.04開發環境需安裝Python 3.8、PyTorch 2.0及ZenDNN加速庫。

相關詞條

熱門詞條

聯絡我們