Qwen-1.8B

Qwen-1.8B是阿里雲於2023年12月開源的通義千問大模型系列中18億參數規模的語言模型,採用Transformer架構並基於超大規模多樣化數據進行預訓練。該模型支持2K長度文本推理且僅需3G顯存,適配消費級終端設備套用場景。作為通義千問開源矩陣的重要組成部分,其衍生版本Qwen-1.8B-Chat已實現單機對話功能,並支持全參微調與LoRA輕量化調整。

基本介紹

  • 模型類型:語言模型
  • 參數量:18億
  • 發布時間:2023年12月
  • 開源狀態:Apache 2.0協定
  • 核心架構:Transformer
  • 套用場景:終端設備AI
技術架構,開源矩陣建設,套用場景,實驗驗證方法,

技術架構

基於Transformer神經網路架構構建,預訓練數據涵蓋網路文本、專業書籍、代碼等多樣化語料。模型支持最長2K tokens的文本序列處理能力,通過稀疏注意力機制最佳化顯存占用,最低可在搭載NVIDIA A10顯示卡的設備運行。

開源矩陣建設

在2023年12月的通義千問開源計畫中,阿里雲構建了包含18億(Qwen-1.8B)、70億、140億、720億參數的完整模型體系,形成覆蓋語言、視覺、音頻的多模態開源生態。作為該矩陣最小尺寸的模型,Qwen-1.8B填補了消費級硬體設備部署大模型的技術空白。

套用場景

主要面向智慧型終端設備提供本地化AI能力,典型套用包括:
  • 文本生成與續寫
  • 代碼輔助編寫
  • 領域知識問答
  • 有限資源環境下的對話系統
通過阿里雲PAI-DSW平台,開發者可使用Qwen-1.8B-Chat版本搭建單機對話系統。2023年12月1日,阿里雲開源18億參數模型Qwen-1.8B。

實驗驗證方法

基於阿里雲PAI平台的技術驗證包含四個核心環節:
  1. 配置搭載專用深度學習鏡像的DSW實例(需NVIDIA A10及以上顯示卡)
  2. 通過OSS下載模型檔案及訓練數據集
  3. 執行全參微調(batch_size=16,learning_rate=2e-5)或LoRA輕量化調整(rank=8)
  4. 部署Gradio互動界面進行功能驗證
實驗結果表明,經過微調的Qwen-1.8B在消費級GPU設備上推理回響時間低於600ms,記憶體占用峰值控制在3.2GB以內。

相關詞條

熱門詞條

聯絡我們